deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Google'ın Gemini 3.8 Live'ı, Konuşurken Akıl Yürüten Sesli Ajanlar için Extended Thinking Ekledi

Google, Gemini 3.8 Live'ı ve arka planda akıl yürütürken ve araçları çalıştırırken anlatmaya devam eden bir Extended Thinking varyantını duyurdu. İşte bu sürümün gerçek zamanlı sesli ajanlar için değiştirdikleri.

Google'ın Gemini 3.8 Live'ı, Konuşurken Akıl Yürüten Sesli Ajanlar için Extended Thinking Ekledi

Google, 15 Eylül 2026'da Gemini 3.8 Live'ı ve ona eşlik eden Gemini 3.8 Live Extended Thinking modelini duyurdu. dev.to'da yazan iFynx'e göre sürüm, üretim ortamındaki sesli ajanları hedefliyor ve konuşmayı metne çevirip üzerinde akıl yürüterek ardından yanıt sentezleyen kademeli pipeline'lardan, doğal speech-to-speech sistemlerine doğru bir geçişi temsil ediyor.

iFynx'in özetlediği Google'ın geliştirici materyalleri, yeni modelleri asenkron fonksiyon çağrısı, gerçek zamana yakın görsel grounding, doğrulama kodları gibi alfasayısal dizelerin hassas işlenmesi ve 97'den fazla dilde sohbet ortasında dil değiştirme ihtiyacı duyan ajanlar için konumlandırıyor. Yazıda atıf yapılan 9to5Google, modellerin Gemini Live, Gmail Live, Docs Live, Keep Live ve Search Live genelinde kullanıma sunulduğunu bildiriyor.

İki model, iki gecikme profili

Google tek bir ses modeli yerine bilinçli bir ikili çıkardı. Gemini 3.8 Live, akıcı sıra alma, maliyet verimliliği ve görsel grounding için ayarlandı ve büyük ölçek için tasarlandığı belirtiliyor. Gemini 3.8 Live Extended Thinking ise model ilerlemesini yüksek sesle anlatırken devam eden çok adımlı akıl yürütme için ayarlandı. Google, Extended Thinking varyantının Artificial Analysis'ın speech-to-speech liderlik tablosunda birinci sırada olduğunu iddia ediyor; ancak iFynx bunu, kesinleşmiş değil göstergesel olarak ele alınması gereken satıcı tarafından bildirilen bir rakam olarak işaretliyor.

Geliştirici dokümantasyonu bir yapılandırma farkı daha ekliyor: Extended Thinking, düşük, orta ve yüksek seçenekleriyle bir thinking_level ayarı sunarken, standart Live modeli bu kontrol olmadan interaktif bir profil kullanıyor. iFynx'in okumasına göre standart model, yanıtların anında hissettirmesi gereken doğrudan görevlere uygunken, Extended Thinking ajanın planlama yapması, yavaş araçları beklemesi veya karmaşık durum üzerinden akıl yürütmesi gereken akışlara uyuyor.

Araçlar çalışırken konuşma sürüyor

iFynx'in en çok öne çıkardığı yetenek asenkron fonksiyon çağrısı: araçlar arka planda çalışırken ses akışı sürüyor. Extended Thinking, erken konuşma ipuçları ve canlı ilerleme anlatımına dayanıyor, böylece duraklamalar kullanıcıya hiçbir zaman başarısızlık olarak görünmüyor.

iFynx'e göre bu, istemci tarafı mühendisliğini de değiştiriyor. Google'ın Live API kılavuzu, istemcilere turnComplete'e tek başına güvenmek yerine IN_PROGRESS veya IDLE bildiren interactionStatus'u takip etmelerini söylüyor; çünkü ara konuşmalar, akıl yürütme hâlâ sürerken turnComplete true olarak ayarlanmış şekilde gelebiliyor. Arayüzünü çok erken dinleme durumuna geçiren bir istemci, ajanı düşünce ortasında kesecek. Extended Thinking oturumlarındaki fonksiyon tanımları ayrıca "behavior": "NON_BLOCKING" belirtmeli; çünkü engelleyici araçlar mimarinin akış biçimiyle çakışıyor.

Grounding, fiyatlandırma ve dil kapsamı

Live modelleri canlı görsel girdiyi gerçek zamana yakın işleyebiliyor; iFynx bunu kamera destekli destek, belge doğrulama ve uygulama içi yardım için yararlı görüyor. Google'ın Live API için listelediği ses fiyatlandırması, girdi için dakika başına 0,005 $ ve çıktı için dakika başına 0,018 $. iFynx bunu, geniş çaplı ses özelliklerini bütçelenebilir kılacak kadar uygun kabul ediyor; ancak sürekli anlatımlı uzun Extended Thinking çağrılarının maliyeti hızla biriktirdiği için oturum başına değil, tamamlanan görev başına maliyetin izlenmesini öneriyor.

Diller konusunda Google, 97'den fazla dilde sohbet ortasında geçiş iddia ediyor. Arapça öncelikli ve iki dilli ürünler geliştiren iFynx, otomatik algılamayı yararlı ama olgunlaşmamış olarak görüyor; miktarlar ve hesap numaraları gibi kritik verilerin açıkça teyit edilmesini ve ortalama dil puanlarına güvenmek yerine kod geçişi (code-switching) hatalarının ayrıca ölçülmesini öneriyor. İlgili bir Gemini 3.5 Transcribe sürümü, 85'ten fazla dili yaklaşık yüzde 4,0 bildirilen akış kelime hata oranıyla kapsıyor; analitik ve altyazı için bir transkripsiyon katmanı olarak konumlandırılıyor, speech-to-speech ajan tasarımının yerine geçmiyor.

Erişim, AI Studio ve LiveKit, Pipecat, LangChain, Vercel ile Agora dahil ortaklar üzerinden yürüyor. iFynx bu paketlemeyi, modelin tüm sistem olmadığının dürüst bir itirafı olarak okuyor: ekipler hâlâ WebRTC davranışından barge-in politikasına, çevrimdışı kurtarmaya ve mikrofon ile kamera erişimi için onay akışlarına sahip.

Neden önemli

iFynx'in belirttiği gibi bu sürüm sesli ajanları icat etmiyor ama sürekli, araç kullanan konuşmayı varsayılan beklenti haline gelmeye itiyor. İki sonuç öne çıkıyor. Birincisi, model seçimi artık iş akışı başına bir tasarım kararı haline geliyor: doğrudan etkileşimler için hızlı bir diyalog modeli, yüksek değerli çok adımlı etkileşimler için bir akıl yürütme modeli; birim ekonomisi sonuçlara göre ölçülüyor. İkincisi, modelin çevresindeki tesisat, durum takibinden engellemeyen araç tanımlarına, hazır konuşulmuş ilerleme konuşmasına kadar, artık bir ajanın işbirlikçi mi yoksa bozuk mu hissettirdiğini belirliyor. Konuşmayı, araç çalıştırmayı ve durum sinyalleşmesini tek bir deneyim olarak koreografiye eden ekipler, kullanıcıların güveneceği sesli ajanları göndermeye en yatkın olanlar.

  • #gemini
  • #google
  • #voice-agents
  • #speech-to-speech
  • #real-time-api

İlgili yazılar