· kaynak Hacker News – Front Page (native)
Google, konuşurken akıl yürüten Gemini 3.8 Live ses modellerini kullanıma sundu
Google, konuşurken akıl yürüten ve birkaç ses yapay zekası kıyaslamasında lider konumda olan konuşmadan konuşmaya modeller Gemini 3.8 Live ve 3.8 Live Extended Thinking'i yayımladı; modeller Search, Workspace ve Gemini API genelinde kullanıma sunuluyor.

Google, 15 Eylül'de şirketin blogunda yayımlanan ve Hacker News'in ana sayfasına ulaşan duyuruya göre iki yeni canlı diyalog modeli olan Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking'i tanıttı. Modeller neredeyse gerçek zamanlı akıl yürütme için tasarlandı ve aynı anda iki kitleye yönelik: üretim seviyesinde ses ajanları geliştiren geliştiriciler ile Gemini uygulaması, Google Workspace ve Search'teki ses özelliklerini kullanan tüketiciler.
İki model, iki görev
Google'a göre standart Gemini 3.8 Live, ölçeklenebilirlik ve maliyet verimliliği için tasarlandı; sohbet zekasını akıcı diyalog ve görsel bağlam yönlendirme (visual grounding) ile bir araya getiriyor. Extended Thinking sürümü ise çok adımlı akıl yürütme gerektiren yüksek karmaşıklıklı işlere odaklanıyor; Google bunu kurumsal düzeyde görev tamamlama ve zeka sunmak olarak tanımlıyor.
İmza yeteneği, aynı anda hem akıl yürütmek hem de konuşmak. Extended Thinking, bir yanıtı hesaplarken sessizleşmek yerine bir prompt'u "Hemen kontrol edeyim…" gibi erken sözlü ipuçlarıyla onaylıyor ve çok adımlı görevler arka planda çalışırken ilerlemesini anlatarak sohbet akışını kesintisiz tutuyor.
Standart model, yanıtlara daha fazla bağlam kazandırmak için görsel girdiyi neredeyse gerçek zamanlı işliyor, konuşma sırasında desteklenen 97 dil arasında otomatik olarak algılama ve geçiş yapıyor ve kullanıcı konuşmaya devam ederken arka planda araç ve API çağrıları yürütebiliyor.
Kıyaslama iddiaları
Google'a göre Gemini 3.8 Live Extended Thinking, Artificial Analysis'ın Speech to Speech Quality Index'inde 82,6 puanla genel birinciliği aldı. Şirket, modelin ayrıca ajan tabanlı görev tamamlamada önde olduğunu, τ-Voice'da yüzde 68,6, Sierra'nın τ-Voice-banking kıyaslamasında yüzde 35,1 puan aldığını ve akıl yürütmede Big Bench Audio'da yüzde 97,7'ye ulaştığını, üstelik diğer öncü modellerle fiyat açısından rekabetçi kaldığını belirtiyor.
Temel 3.8 Live modeli, Speech Agent Arena'da ikinci oldu; Google bunu kullanıcı tercihine işaret olarak gösteriyor. Ses ajanlarını değerlendirme kıyaslaması olan ServiceNow'un EVA-Bench'inde modellerin, doğruluk ile sohbet kalitesini dengeleyerek karmaşık iş akışlarında Pareto cephesini ileri taşıdığını söyleyen Google, bu çalıştırımların Gemini Enterprise Agent Platform üzerindeki Live API ile yapıldığını not ediyor.
Nerede kullanıma sunuluyor
Her iki model de duyuru gününden itibaren kullanıma sunulmaya başladı. Geliştiriciler modellere Gemini API ve Google AI Studio üzerinden erişiyor. Kurumsal müşteriler Gemini Enterprise'da özel önizleme ile erişim elde ediyor; Gemini Enterprise for Customer Experience içindeki kullanılabilirliğin ise yakında geleceği belirtiliyor.
Tüketiciler için 3.8 Live, Search Live'da mevcut; Google'a göre model kullanıcılara adım adım, gerçek zamanlı sorun gidermede eşlik edebiliyor. Extended Thinking ise Workspace'te Docs'ta Gemini Live, Google AI Pro ve Ultra abonelerine, Gmail ve Keep'te ise tüm Google AI abonelerine ulaşıyor.
Ekosistem ve güvenlik
Google; Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ve Vision Agents dâhil geliştirici platformlarının Gemini Live API üzerine inşa ettiğini, böylece geliştiricilerin kullanıcı deneyimine odaklanabilmesi için gerçek zamanlı medya akışı altyapısını üstlendiklerini söylüyor. Salesforce, Genspark ve Lumeris erken iş ortakları olarak gösteriliyor; Google modellerin gecikme süresi, akıcılık ve araç çağırma yeteneklerini öne çıkarıyor.
Şirket ayrıca, yapay zeka ürünlerinin ürettiği tüm ses içeriklerinin, sentetik konuşmayı tespit edilebilir kılmaya ve yanlış bilgilendirmeyi önlemeye yönelik olarak çıktının içine işlenmiş bir SynthID filigranı taşıdığını belirtiyor. Duyuru sayfasının kendisinde de içeriğin Google yapay zekası tarafından üretilmiş olduğuna dair bir not yer alıyor.
Neden önemli
Bir sohbet botuna yazmak ile onunla konuşmak arasındaki fark çoğunlukla gecikme süresi ve akıl yürütme derinliğine indirgendi: sesli asistanlar tarihsel olarak ya düşünürken garip bir şekilde durakladı ya da zor sorulara yüzeysel yanıtlar verdi. Konuşurken akıl yürüten, arka plan çalışmalarını anlatan ve sohbet ortasında araç çağrıları yapabilen bir model, sesi yalnızca hızlı sorulardan ibaret olmayan, gerçekten karmaşık görevler için geçerli bir arayüz hâline getiriyor. Bunun üzerine rekabetçi fiyatlandırma, üretim seviyesinde ses ajanları geliştiren ekipler için engeli düşürüyor. Kıyaslama iddiaları bağımsız incelemelerde doğrulanırsa, Gemini 3.8 Live bir konuşmadan konuşmaya modelin sunması gerekenin referans noktasını belirler ve gerçek zamanlı sesin hızla yeni mücadele alanı hâline geldiği bir pazarda rakiplere baskı uygular.
- #gemini
- #voice-ai
- #speech-to-speech
- #ai-models