· kaynak Vercel blog
Vercel AI Gateway, Google'un Gemini 3.8 Live gerçek zamanlı ses modellerini ekledi
Gerçek zamanlı konuşmalı etkileşim için tasarlanmış Google'un Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleri, artık AI SDK'nın realtime API'si üzerinden Vercel'in AI Gateway'ine erişilebiliyor.

Gerçek zamanlı konuşmalı etkileşim için tasarlanmış iki model olan Google'un Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleri artık Vercel'in AI Gateway'i üzerinden kullanılabiliyor. 15 Eylül'de yayımlanan bir changelog gönderisine göre her iki model de sesli asistanlara, konuşma ürünlerine ve sesle yanıt veren her türlü uygulamaya yönelik.
Modeller ne yapıyor
google/gemini-3.8-live olarak sunulan temel model, gerçek zamanlı ses işleme yapıyor ve görsel grounding ekliyor, diyor Vercel. Model 97 dil arasında otomatik olarak geçiş yapabiliyor ve bir konuşma sürerken arka planda tool call çalıştırabiliyor; böylece bir veri sorgusu diyaloğu durdurmuyor.
google/gemini-3.8-live-extended-thinking olan Extended Thinking varyantı ise bunun üzerine çok adımlı akıl yürütme ekliyor. Vercel, bu akıl yürütmeyi konuşmayla paralel çalışan bir süreç olarak tanımlıyor: model bir isteği kabul edebiliyor ve çalışırken sessize gömülmek yerine ilerlemesini sesli olarak aktarabiliyor. Sesli ürünler için bu, duyulabilir geri bildirim ile ölü sessizlik arasındaki fark.
Nasıl bağlanılır
Her iki modele de AI SDK'nın realtime API'si üzerinden ulaşılıyor. Vercel'in belgelediği kurulum üç parçadan oluşuyor: ws gibi bir WebSocket istemcisinin yanına Gateway sağlayıcı paketini (@ai-sdk/gateway) kurun, seçilen model için kısa ömürlü bir token üretin ve model adaptörünün döndürdüğü bağlantı yapılandırmasıyla bir WebSocket açın. Bu adaptör ayrıca giden istemci olaylarını serileştiriyor ve gelen sunucu olaylarını ayrıştırıyor; böylece geliştiriciler ham frame'lerle değil yapılandırılmış olaylarla çalışıyor.
Oturum yapılandırması bir session-update olayı olarak gönderiliyor; burada ses çıktısı ve ses transkripsiyonu talep edebiliyorsunuz. Extended Thinking modelinde akıl yürütme derinliği provider option'lar üzerinden yapılandırılıyor ve Vercel, thinkingLevel veya thinkingBudget seçeneklerinden tam olarak birinin verilmesi gerektiğini — ikisinin birden değil — belirtiyor.
Yanıt tarafında ise akış, artımlı transkript metni için audio-transcript-delta gibi olayların yanı sıra socket'i ne zaman kapatacağınızı veya bir sorunu göstereceğinizi bildiren response-done ve error olaylarını içeriyor. Vercel, geliştiricileri tam olay referansı için realtime quickstart sayfasına yönlendiriyor ve her iki model de herhangi bir kod yazmadan model playground'da denenebiliyor.
Gateway ne ekliyor
AI Gateway, Vercel'in birden çok sağlayıcıdan model çağırmak için kullandığı birleşik katman. Yönlendirmenin ötesinde kullanım ve maliyet takibi, yeniden denemeler, failover ve performans optimizasyonlarını yönetiyor; bu da Vercel'e göre bir sağlayıcıyı doğrudan çağırmaktan daha yüksek uptime sağlıyor.
Neden önemli
Gerçek zamanlı ses, dil modelleri için en zorlu dağıtım hedeflerinden biri. Kullanıcılar hızlı, kesilebilir sıralar ve bir modelin konuşma ortasında düşünmesi ya da veri çekmesi gerektiğinde doğal bir his bekliyor. Vercel'in sıraladığı yetenekler — paralel akıl yürütme, arka plan tool call'ları, otomatik çok dilli geçiş — doğrudan bu beklentilere karşılık geliyor ve özellikle Extended Thinking varyantı, diğer modellerde ses deneyimini bozan o tuhaf sessizlikleri hedefliyor.
Paketleme en az modeller kadar önemli. Halihazırda AI SDK üzerinde çalışan ekipler, ikinci bir sağlayıcı SDK'sı, ayrı bir faturalandırma ilişkisi veya kendi güvenilirlik altyapılarını benimsemeden bir konuşma modu ekleyebiliyor; çünkü failover ve kullanım takibi Gateway ile birlikte geliyor. Sesli asistan ve ses öncelikli arayüz geliştiricileri için entegrasyon çalışması, bir model tanımlayıcısını değiştirmeye ve akış olaylarını işlemeye indirgeniyor.
- #vercel
- #google-gemini
- #voice-ai
- #ai-gateway
- #ai-sdk