deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Google, arka planda akıl yürütme yeteneğine sahip Gemini 3.8 Live modellerini gerçek zamanlı sesli yapay zekâ için duyurdu

Google'ın Gemini 3.8 Live ve Extended Thinking modelleri, akıl yürütme ve arka plan görevlerini yürütürken sesli konuşmaları sürdürüyor; modeller geliştiricilere, kurumsal müşterilere ve son kullanıcılara sunuluyor.

Google, arka planda akıl yürütme yeteneğine sahip Gemini 3.8 Live modellerini gerçek zamanlı sesli yapay zekâ için duyurdu

Google, canlı diyalog sırasında akıl yürütebilen ve arka planda görevler yürütebilen gerçek zamanlı sesli konuşmalar için tasarlanmış bir çift model olan Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking'i piyasaya sürdü. Google'ın duyurusuna dayanan bir dev.to haberine göre, standart model canlı diyalog için daha ekonomik ve daha ölçeklenebilir seçenek olarak konumlandırılırken, Extended Thinking sürümü birden fazla adımda derin akıl yürütme gerektiren daha zorlu iş yüklerini hedefliyor.

Konuşmayı duraklatmadan akıl yürütme

Ailenin belirleyici özelliği, işlerin aktif bir konuşmanın arka planında sürdürülebilmesi. dev.to'nun aktardığına göre Google, her iki modelin de gerçek zamanlı olarak akıl yürütebildiğini, görsel bağlamı algılayabildiğini ve diyalogu kesintiye uğratmadan arka plan görevlerini yürütebildiğini söylüyor.

Bu, sesli arayüzler için önemli bir değişim. Günümüzdeki konuşma yapay zekâsının çoğu fiilen sıra tabanlı: kullanıcı konuşur, sistem işlemek için durur, sonra yanıtlar. Bir tartışmanın ipucunu tutarken bilgi kontrol edebilen veya çok adımlı bir eylemi tamamlayabilen bir model, farklı etkileşim kalıplarının önünü açıyor. Örneğin bir müşteri hizmetleri asistanı, hesap bilgilerini getirirken arayan kişiyle konuşmaya devam edebilir; böylece hattın sessiz kalması veya konuşmanın yeniden başlatılması gerekmez.

Rapora göre Google, daha geniş canlı diyalog araç setinin parçası olarak çok dilli dil değiştirme ve araç çağırma (tool calling) özelliklerine de dikkat çekiyor ve geliştirici ekosisteminin yanı sıra Docs Live, Gmail Live ve Keep Live gibi entegrasyonlara değiniyor.

Boşluklarla birlikte gelen kullanılabilirlik

dev.to, yeni modeller için birkaç sunum kanalı sıralıyor:

  • Geliştiriciler modellere Gemini Live API ve Google AI Studio üzerinden erişebiliyor.
  • Gemini Enterprise müşterileri özel önizlemeler elde ediyor; Google, modellerin Gemini Enterprise for Customer Experience'e geleceğini belirtiyor.
  • Genel kullanıcılar modellerle Search Live ve Gemini uygulaması aracılığıyla karşılaşabiliyor.

Rapor henüz netleşmeyen noktaları da vurguluyor. Google, sağlanan materyalde kesin fiyatlandırma veya ayrıntılı bir bölgesel sunum takvimi yayınlamadı ve kurumsal müşteri deneyimi dağıtımı açıkça "yayınlandı" değil "gelecek" olarak tanımlanıyor. Her ürün yüzeyinde özellik eşitliği varsayılmamalı; uygulamayı değerlendiren ekiplerin, seçtikleri erişim yolunun kullanılabilirliğini, ticari koşullarını ve güncel özellik setini teyit etmeleri öneriliyor.

Ses kökeni

dev.to'nun haberine göre, bu yapay zekâ ürünlerinden gelen ses çıktıları, yapay zekâ ile üretilmiş içeriğin tespitine yardımcı olmayı amaçlayan Google teknolojisi SynthID ile filigranlanıyor. Yapay zekâ ile üretilmiş ses yayınlayan veya dağıtan herkes için bu, beyan edilmiş bir köken mekanizması sunuyor; ancak müşteriyle yapılan iletişimde net iç kurallara olan ihtiyacın yerini almıyor.

Aynı hafta genişleyen Dreambeans

Ayrı bir gelişmede Google Labs, günlük kişiselleştirilmiş hikâye deneyi Dreambeans'ı, 18 yaş ve üzeri kullanıcılar için ABD'deki tüm uygun Google hesaplarına, Android ve iOS'ta genişletti. dev.to'ya göre deneyim, Google AI Plus, Google AI Pro ve Google AI Ultra erişim düzeylerini kapsıyor ve Calendar, Gmail, Photos, Search, YouTube ile artık Gemini'den yararlanabiliyor.

Gemini 3.8 Live'ın aksine Dreambeans, raporda belirtilen bir geliştirici veya kurumsal iş akışıyla gelmiyor. Önemi, ABD genelindeki tüketici kullanılabilirliği ve giderek büyüyen Google hizmeti entegrasyonları; ikisi birlikte, Google'ın yapay zekâ etkileşimini aynı anda iki yöne ittiğini gösteriyor: daha yetenekli canlı konuşma ve daha kişiselleştirilmiş tüketici içeriği.

Neden önemli

Buradaki sıçrama işlevsel olduğu kadar mimari de. Gerçek zamanlı sesli yapay zekâ çoğunlukla hızlı soru-cevap anlamına geliyordu; arka planda akıl yürütme, sesi yalnızca sorgular için değil, görevler için de makul bir arayüze dönüştürüyor. Modeller tanımlandığı gibi performans gösterirse, konuşma sistemleri canlı bir diyalog içinde arama, araç çağrıları ve çok adımlı işleri yürütebilir; bu da konuşan bir SSS ile sesi olan bir ajan benzeri bir şey arasındaki fark. API'ler, kurumsal önizlemeler ve tüketici uygulamaları genelindeki geniş sunum, Google'ın bu yeteneğin yüzeylerinde hızla yayılmasını istediğinin sinyali.

Uyarılar gerçek: fiyatlandırma, bölgesel zamanlama ve kurumsal özellik kullanılabilirliği hâlen belirsiz ve kaynak, pratik değerin ses tek başına değil, ürünlerin bu modelleri gerçek iş akışlarına, entegrasyonlara ve eskalasyon yollarına nasıl bağladığına bağlı olacağını not ediyor. Sesli ürünler geliştiren geliştiriciler ve kurumlar için Gemini 3.8 Live, canlı konuşma yapay zekâsından beklenenler için yeni bir taban çizgisi belirliyor.

  • #google-gemini
  • #voice-ai
  • #ai-models
  • #generative-ai
  • #synthid

İlgili yazılar