· kaynak Hacker News – Front Page (native)
Google, ses klonlama ve satır satır kontrol sunan Gemini 3.8 metin-okuma modelini duyurdu
Google, Gemini 3.8 Flash ve Flash-Lite TTS modellerini yayınladı; prompt tabanlı ses oluşturma, onay gerektiren klonlama ve AI platformları genelinde satır satır performans kontrolü ekleniyor.

Google, Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS adlı iki yeni metin-okuma modelini piyasaya sürdü ve bunları konuşma yığını için ifadelilik açısından önemli bir adım olarak sunuyor. Hacker News'in ana sayfasında da yer alan Google duyurusuna göre modeller Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook ve Google Vids genelinde kullanılabiliyor.
İki kademe: yaratım ve ölçek
Google, Flash TTS'yi karakter tasarımı ve ayrıntılı yönlendirme için geliştirilmiş yaratıcı kademe olarak konumlandırıyor. Model, 100'den fazla dil ve lehçede doğal dil açıklamalarından — bir rol, aksan ve diğer ses özellikleri belirtilerek — özgün sesler üretebiliyor ve oyunculuk ipuçları, tempo, lehçe değişimleri ve araya giren tepkiler üzerinde satır satır kontrol sağlıyor.
Şirkete göre Flash-Lite TTS ise dublaj, ses içeriği üretimi ve ifadeli ses agent'ları gibi yüksek hacimli, maliyet verimli iş yükleri için ayarlanmış durumda; ton ve tempo üzerindeki ince ayarlı kontrolü ise koruyor.
İkisi de zaten Gemini 3.5 Live Translate, 3.5 Transcribe, 3.8 Live ve 3.8 Live Extended Thinking'i içeren ses yelpazesine katılıyor.
30 hazır sesten vokal stüdyoya
Google, kullanıcıların platformun daha önce sunduğu 30 sesten fiilen sınırsız bir kütüphaneye geçebildiğini söylüyor. Üretken ses tasarımının yanı sıra kullanıcılara Meksika İspanyolcası, Quebec Fransızcası ve İskoç İngilizcesi gibi bölgesel çeşitleri kapsayan 2.000'den fazla üretime hazır ses sunuluyor.
Ses çoğaltma da dahil: 30 saniyelik bir ses örneğinden tutarlı bir vokal profili yeniden oluşturulabiliyor. Google, bu özelliğin onay doğrulamasıyla korunduğunu, ses sahibinden referans konuşmacıyla eşleşen sözlü bir onay kaydı gerektirdiğini ve çıktıların SynthID filigranı ile C2PA kimlik bilgileri taşıdığını belirtiyor. Mevcut bir ses üzerinde tını, perde, tempo ve aksanı ayarlamaya yarayan ses remixleme seçeneğinin yakında geleceği listeleniyor.
Yönlendirme, diyalog ve sözsüz ipuçları
Her iki model de uzun form üretimi destekliyor; Google, modelin saatlerce süren kesintisiz ses boyunca ses kalitesini ve karakter tınısını en az konuşmacı sapmasıyla koruyabildiğini iddia ediyor — podcast'ler ve sesli kitaplara yönelik bir vaat. Yerleşik iki konuşmacı modu, tek bir senaryodan çok turlu diyaloglar sahnelenirken iki sesi belirgin biçimde ayrı tutuyor ve kullanıcılar tepki ritmi ile zamanlamayı şekillendirmek için kahkahalar, iç çekişler ve nefes tutmalar gibi senaryolaştırılmış sözsüz ipuçlarının yanı sıra aktif dinleme aralarına giren sözler ekleyebiliyor.
Benchmark sonuçları
Google, Flash TTS'nin Hume AI'nın Voice Design Benchmark'ında 71,4 puanla ilk sırayı aldığını ve aynı benchmark'ın aksan modelleme kategorisinde de 60,8 ile zirvede yer aldığını bildiriyor. İki model, Hume AI'nın Genel Kalite Endeksi'nde birinci ve ikinci oldu. Google, Voice Arena'daki kör insan tercihi testlerinde Japonca, Brezilya Portekizcesi, Vietnamca, Modern Standart Arapça, Meksika İspanyolcası ve Hintçe dahil olmak üzere dillerde en üst sıralarda yer aldıklarını, önceki Gemini 3.1 Flash TTS'ye göre iyileşmenin özellikle uzun formlu içerik ve iki konuşmacılı senaryolarda gözlendiğini söylüyor. Bu rakamlar bağımsız bir değerlendirmeden değil Google'ın kendi duyurusundan geliyor.
Nerede denenebilir
Google AI Studio'da şu anda kullanılabilen yeni ses oyun alanı, ses tasarımını ve çoğaltmayı, sunuşu satır satır yönetmeye yarayan iki konuşmacılı senaryo editörüyle birleştiriyor. Gemini API üzerinden Agora, LiveKit, Pipecat ve Vercel gibi geliştirici platformları modelleri kendi yollarına entegre ediyor; Google, Figma, HeyGen, Linguana, Wondercraft, 99.co ve Ollang'ı bunları dublaj, yerelleştirme ve konuşmalı ses alanında uygulayan partnerler arasında listeliyor.
Neden önemli
Konuşma, AI ürünleri için hızla varsayılan arayüz haline geliyor ve Google, metin-okumayı sabit hazır seslerden prompt odaklı performansa doğru itiyor. Satır başına yönlendirme, çok konuşmacılı sahneleme ve stabil uzun form çıktı gibi özellikler, mevcut araçların çoğu zaman yetersiz kaldığı üretim iş akışlarını — sesli kitaplar, dublaj, oyunlar, agent'lar — hedefliyor. Onay kontrolleri, SynthID filigranı ve C2PA kimlik bilgileri, teknolojinin çektiği ses klonlama ve dezenformasyon endişelerinin önüne geçme girişimi. Geliştiriciler ve stüdyolar için açık soru, bu modellerin fiyat ve gerçek dünya kalitesinde yerleşik ticari konuşma sağlayıcılarıyla nasıl kıyaslandığı; Google'ın benchmark rakamları kendi bildirimine dayalı, bu yüzden gerçek ölçüt AI Studio'daki uygulamalı testler olacak.
- #gemini
- #text-to-speech
- #ai-audio
- #voice-cloning