deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Vercel blog

Google'ın iki konuşmacılı diyalog destekli Gemini 3.8 TTS modelleri Vercel'in AI Gateway'inde kullanıma sunuldu

Vercel'in AI Gateway'i artık Google'ın Gemini 3.8 Flash-Lite TTS ve Flash TTS modellerini barındırıyor; bu modeller 100'den fazla dilde konuşma üretiyor ve iki konuşmacılı diyalogu destekliyor.

Google'ın iki konuşmacılı diyalog destekli Gemini 3.8 TTS modelleri Vercel'in AI Gateway'inde kullanıma sunuldu

Vercel, AI Gateway'ine Google'ın iki konuşma modelini ekledi: Gemini 3.8 Flash-Lite TTS ve Gemini 3.8 Flash TTS. Vercel bloguna göre her iki model de girdi olarak metin alıyor ve 100'den fazla dilde ses üretiyor; uzun anlatım desteği, sunum üzerinde kontrol ve iki konuşmacılı diyalog sunuyor.

İki varyant, iki farklı iş

Changelog'a göre modeller arasındaki ayrım kullanım senaryosuna dayanıyor. Daha hafif seçenek olan google/gemini-3.8-flash-lite-tts, yüksek hacimli konuşma üretimine yönelik ve ton, tempo ile satır satır sunum için kontroller sunuyor. Bu profil, düzenli olarak büyük metin gruplarını sese dönüştüren ve tutarlı, ayarlanabilir çıktıya ihtiyaç duyan pipeline'lar için uygun.

Daha büyük model olan google/gemini-3.8-flash-tts ise ifade gücüne odaklanıyor. Doğal dil prompt'larıyla ses ve karakter tasarımını destekliyor; yani geliştiriciler sabit ön ayarlardan seçim yapmak yerine oyunculuk talimatlarını, aksanları ve konuşma sırasındaki tepkileri tanımlayabiliyor — bu da etkili bir şekilde düzyazıyla bir performans yönetmek anlamına geliyor.

Her iki model de iki konuşmacılı diyalog gibi öne çıkan bir yeteneği paylaşıyor; yani tek bir üretim, tek bir anlatıcı yerine iki ses arasında ileri geri geçen bir diyalogu oluşturabiliyor. Çok dilli çıktı ve uzun anlatım desteğiyle birleştiğinde bu, sesli kitap üretimi, podcast araçları, dublaj iş akışları ve sesli agent'ların temel gereksinimlerini karşılıyor.

Başlangıç

Vercel'in belgelerindeki örnek, AI SDK'sındaki experimental_generateSpeech fonksiyonunu çağırıyor; gateway model tanımlayıcısını, okunacak metni, bir ses adını — örnekte "Kore" kullanılıyor — ve WAV gibi bir çıktı biçimini iletiyor. Çağrı, doğrudan dosyaya yazılabilen ses verisini döndürüyor.

Kod yazmadan önce modelleri değerlendirmek isteyen ekipler için Vercel, her varyant için konuşmanın üretilip önizlenebileceği bir playground, ayrıca kurulumu ve ek örnekleri kapsayan bir konuşma hızlı başlangıç rehberi ile özel bir metinden sese kılavuzu sunuyor.

Gateway bağlamı

Bu sürüm, Vercel'in AI Gateway'i modality'ler genelinde üretim işleri için tek bir API olarak konumlandırmasıyla da uyumlu. Konuşma istekleri, projenin diğer modelleriyle yan yana çalışıyor; kullanım ve maliyet istek başına takip ediliyor. Ekipler, isteklerin nasıl işleneceğini yönlendirmek için yönlendirme kuralları yapılandırabiliyor ve Vercel tarafından yönetilen erişime bel bağlamak istemiyorlarsa kendi sağlayıcı anahtarlarını ekleyebiliyor.

Neden önemli

Ses, sesli yanıt veren agent'lardan yazılı içeriği sesli sürümlere dönüştüren pipeline'lara kadar yapay zeka ürünleri için varsayılan bir çıktı hâline geliyor. Google'ın Gemini 3.8 TTS modelleri çok dilli kapsamı, iki konuşmacılı diyalogu ve prompt ile yönlendirilen ses tasarımını bir arada sunuyor; Vercel'in gateway'i ise bunları geliştiricilerin diğer modeller için zaten kullandığı aynı arayüz üzerinden erişilebilir kılıyor. Pratik fayda ise birleştirme: tek entegrasyon, istek başına maliyet görünürlüğü ve eldeki işe göre toplu üretime yönelik bir varyant ile ifade gücü yüksek bir varyant arasında seçim imkânı.

  • #text-to-speech
  • #vercel
  • #google
  • #gemini
  • #ai-gateway

İlgili yazılar