· kaynak dev.to (home feed)
Gemini 3.8 Flash TTS modelleri ses tasarımı, klonlama ve cümle bazlı kontrolle genel kullanıma açıldı
Google'ın Gemini 3.8 Flash TTS ve Flash-Lite TTS modelleri artık genel kullanımda; metinle ses tanımlama, onay kontrolü yapılan replikasyon ve cümle bazlı performans kontrolü özellikleriyle geliyor, bir dev.to yazısına göre.

Google iki yeni konuşma modeli yayınladı
Bir dev.to yazısına göre, Google'ın 22 Eylül tarihli Gemini API sürüm notları, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS modellerini genel kullanıma açtı. İkili iş bölümü yapıyor: gemini-3.8-flash-tts, tek tek cümlelerde seslendirme kontrolü sunan, vokal performans ve karakter çalışmaları için hedeflenen amiral gemisi model; gemini-3.8-flash-lite-tts ise yüksek hacimli, ucuz ve hızlı üretim için konumlandırılmış.
Ses tasarımı, klonlama ve satır bazlı yönlendirme
Yazar, pratikte önemli olan üç eklemeyi öne çıkarıyor:
- Voice design, bir konuşmacıyı doğal dille tanımlıyor — yazıdaki örnek, İngiliz aksanlı, sıcak tonlu yaşlı bir gök bilimci — ve yeniden kullanım için kalıcı bir voice_id döndürüyor.
- Voice replication, bir kişiyi 10 ile 30 saniyelik bir kayıttan klonluyor. Sahibi bir onay beyanı kaydetmek zorunda ve üretilen ses, SynthID filigranı ile C2PA köken işaretleri taşıyor.
- Performance control, her metin parçasına bir stil talimatı ekliyor — örneğin tempoyu yavaşlatıp her heceyi net söyletmek — ve gülme ile iç çekiş için satır içi etiketler sunuyor; ayrıca iki kişilik bir diyalogu seslendirebiliyor.
Çağrı yapısı generate_content'ten ilerlemiş. Konuşma artık iki API yüzeyinden yürütülüyor: voices, bir sesi bir kez oluşturup saklıyor; interactions ise metin ve stil üst verisini, o sese referans veren sese dönüştürüyor.
Özellikler, sınırlar ve bilinmeyenler
Geliştirme öncesi kontrol edilmesi değerinde, yazıdaki ayrıntılar:
Çıktı, 24 kHz'de 16-bit mono PCM WAV; streaming destekleniyor.
Basitleştirilmiş Çince, Geleneksel Çince ve Kantonca dahil 100'den fazla dil kapsanıyor; Tayvanca listelenmemiş.
Bir proje, bir yıl boyunca 200'ye kadar özel ses tutabiliyor ya da yedi gün geçerli, kendi yönettiği bir ses anahtarı kullanabiliyor.
Voice replication, Illinois, Teksas, AEA, İngiltere, İsviçre ve Hindistan'da kullanılamıyor.
Duyuruda ya da belgelerde fiyatlandırma yer almıyor.
Tier 1 hesapları günde 100 istekle sınırlı; bu durum yazarın testleri sırasında belirleyici kısıt haline geldi.
Stres testi olarak bir dil öğrenme uygulaması
Yazar, TTS'yi tek başına demo etmek yerine, müzik videolarından Japonca ve Korece öğrenmeye yönelik, Next.js ön yüzü arkasında üç Python betiği barındıran bir web uygulaması kurdu.
transcribe.py, standart gemini-3.8-flash modeline bir YouTube müzik videosu URL'si veriyor ve yapılandırılmış çıktı istiyor: başlangıç ve bitiş zamanları, orijinal metin, hiragana okunuşları ve her satır için bir belirsizlik işareti. prompt'un kilit talimatı, ekrandaki şarkı sözü altyazılarını ses yerine tercih etmek; çünkü eşlik, uzatılmış notalar ve armonilerle şarkı söylemeyi transkribe etmek konuşmadan çok daha zor ve Japonca eşsesli sözcükler belirsizliği artırıyor. Yuuri'nin Betelgeuse ve Christmas Eve ile Take That'in Back for Good parçaları üzerindeki testler temiz bir yapı üretti — boş satır yok, geriye dönük zaman damgası yok, sonsuz tekrarlanan cümle yok — ancak her satır, yalnızca sesden transkribe edildiğinde bile kesin olarak işaretlendi.
annotate.py, yalnızca benzersiz cümleler için modeli çağırarak çeviri, kelime kelime döküm, dilbilgisi notları ve telaffuz ipuçları ekliyor; nakaratlar tekrarlandığı için istekleri yaklaşık yüzde 30-40 azaltıyor. speak.py ise yeni TTS sesleriyle her cümleyi normal ve yavaş hızda seslendiriyor.
Kütüphanelerin modeli geçtiği ve başarısız olduğu yerler
Fonetik hattı, yerleşik araçların zayıflıklarını ortaya çıkardı. pykakasi, Japonca は parçacığını wa okunmasına rağmen ha olarak çeviriyor; çünkü kana tek başına dilbilgisel rolünü göstermiyor. Bir Korece romanizasyon aracı, 감사합니다 için resmi revize standardın gamsahamnida olarak verdiği nazalleşmeyi atlayarak gamsahapnida üretti. Uzlaşma işleri paylaştırıyor: dil modeli segmentasyon ve söz bölümü etiketlemeyi üstlenirken, program okunuşları romaji'ye çeviriyor ve bu etiketlere dayanarak は, へ ve を parçacıklarını düzeltiyor.
Telif hakkı baştan ele alındı
Şarkı sözü akışına bilinçli bir hukuki yaklaşım uygulandı. Yazar, AI ile şarkı sözlerini transkribe etmenin onları korunan metin olma statüsünden çıkarmadığını, çevirileriyle birlikte yayınlamanın ise hukuki olarak türev bir eser sayılacağından ihlal riski taşıdığını savunuyor. Bu nedenle uygulama, şarkı sözü dosyalarını ilk commit'ten itibaren sürüm kontrolünden hariç yerel bir çıktı klasöründe tutuyor; geliştirme sırasında kodlama asistanına yalnızca istatistik yazdırması, sözlerin kendisini asla yazdırmaması söylendi.
Neden önemli
Bu sürüm, metinden sese problemini anlatım değil, yönetmenlik problemi olarak yeniden çerçeveliyor: bir tanımdan ses seç, onay veren bir konuşmacıyı klonla, her satırın tonunu yönet. Zorunlu onay kaydı, filigranlama ve bölgesel istisnalar, Google'ın klonlamayı yalnızca erişilebilir değil, denetlenebilir kılmaya çalıştığını gösteriyor. Geliştiriciler için açık sorular pratik — belgelenmemiş fiyatlandırma ve günde 100 istek sınırı, üretim maliyetlerini belgelerden hesaplanamaz kılıyor. dev.to projesi ayrıca konuşma uygulamalarında tekrarlanması muhtemel bir örüntü gösteriyor: anlamak ve üretmek için dil modellerini kullan, ama hem kütüphanelerin hem de modelin kendinden emin olduğu yerde başarısız kaldığı noktalarda deterministik araçları ve açık düzeltmeleri devrede tut.
- #gemini
- #text-to-speech
- #voice-cloning
- #api