deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Google'ın Gemini Güncellemesi Gerçek Zamanlı Transkripsiyon, Video Üretimi ve Ses Öncelikli Bir Uygulamayı Kapsıyor

Google, Ağustos sonunda Gemini 3.5 Transcribe'ı, Omni 1.1 Flash video modelini ve ses öncelikli Gemini Live deneyimini yayınladı; geliştiriciler ise birbirine çok benzeyen iki transkripsiyon modeli arasında şimdiden API limitlerine takılıyor.

Google'ın Gemini Güncellemesi Gerçek Zamanlı Transkripsiyon, Video Üretimi ve Ses Öncelikli Bir Uygulamayı Kapsıyor

Üç parçalı Gemini güncellemesi

Google, Ağustos 2026'nın sonunda tek bir özellik yerine birbiriyle ilgili bir Gemini sürümleri kümesi yayınladı. dev.to'da yayımlanan bir özete göre bu genişleme üç alanı kapsıyor: Konuşmadan metne için Gemini 3.5 Transcribe, video üretimi ve düzenlemesi için Gemini Omni 1.1 Flash ve Gemini uygulamasına gömülü ses öncelikli bir deneyim olan Gemini Live. Google, transkripsiyon modelini şimdiye kadarki en hassas konuşmadan metne çözümü olarak konumlandırırken, Omni 1.1 Flash video iş akışlarına genişletilmiş yaratıcı yetenekler ve kontroller ekliyor.

Neredeyse aynı isimli iki transkripsiyon modeli

Bir macOS toplantı çeviri uygulamasına transkripsiyon ekleyen bir geliştiricinin kaleme aldığı, dev.to'daki ayrı bir deneyim paylaşımı, yeni modeli benimseyecek herkes için bir karmaşaya dikkat çekiyor: Gemini 3.5 Transcribe aslında benzer isimli ama çok farklı yeteneklere sahip iki model olarak geliyor.

İlki olan gemini-3.5-transcribe-live, Live API üzerinden WebSocket akışı ile çalışıyor ve konuşmayı gerçekleşirken yazıya döküyor. İkincisi olan gemini-3.5-transcribe ise Interactions API üzerinde standart bir HTTP isteği olarak çalışıyor ve kayıttan sonra Files API ile yüklenen bir ses dosyasını işliyor.

Farklar önemli. Canlı model on dakikaya kadar oturumları destekliyor ve canlı altyazıya uygun olan, konuşmacı sürdükçe yerini geçici metnin aldığı ara sonuçlar üretiyor. Konuşmacı ayrıştırma (diarization) veya kelime düzeyinde zaman damgalarını desteklemiyor. Toplu iş modeli ise bir saate kadar, konuşmacı ayrıştırma etkinleştirildiğinde otuz dakikaya kadar sesi işliyor, en fazla sekiz konuşmacıyı ayırt ediyor ve kelime düzeyinde zaman damgaları döndürüyor.

Gerçek zamanlı sınırlar ve geliştirici tuzakları

Geliştiricinin aktardığı Google dokümantasyonu bu ayrımı net biçimde ortaya koyuyor: Konuşmacı ayrıştırma canlı akış oturumlarında kullanılamıyor ve kimin ne söylediğini bilmek isteyenler sesi kaydedip akış olmayan uca göndermek zorunda. Bu kısıt, gerçek zamanlı konuşmacı atfı şu anda mümkün olmadığından geliştiricinin tüm mimarisini belirledi.

Ayrıca bir mod tercihi de var. SMART modu dolgu kelimeleri çıkarıp biçimlendirme ekleyerek daha temiz toplantı tutanakları üretirken, VERBATIM her şeyi kelimesi kelimesine koruyor. Konuşmacı ayrıştırma yalnızca VERBATIM ile birlikte çalışıyor; yani konuşmacı etiketi isteyen ekipler SMART'ın temizliğinden vazgeçmek zorunda. Özel kelime dağarcığı seçeneği 1.000 terime kadar kabul ediyor, ancak dokümantasyon en iyi sonuç için 100'ün altında kalmayı öneriyor.

Geliştirici daha fazla uygulama tuzağına da dikkat çekiyor: Toplu iş modeli standart generateContent ucunu kullanmıyor, zaman damgası ayrıntı düzeyi ayarının atlanması kelime düzeyinde zaman damgalarının sessizce başarısız olmasına yol açıyor ve konuşmacı etiketleri isim yerine spk_1 gibi anonim kimlikler olarak dönüyor. Google ayrıca üç veya daha fazla konuşmacıyla atfın deneysel olduğunu belirtiyor.

Video üretimi ve ses öncelikli etkileşim

Diğer iki sürüm Gemini'yi farklı yönlerde genişletiyor. Google'ın duyurularının dev.to özetine göre Gemini Omni 1.1 Flash, video üretimi ve düzenlemesi için yaratıcı yetenekleri ve kontrolleri genişleterek video üretimini Gemini'nin mevcut metin, geliştirici ve kurumsal yüzeylerinin yanına yerleştiriyor. Gemini Live ise Gemini uygulamasında sesle kullanılan bir arayüz olarak, konuşmanın yazmaktan daha pratik olduğu anlara yönelik.

Özete göre duyurulardan hiçbiri fiyatlandırma, ayrıntılı sunum koşulları veya üçüncü taraf entegrasyon ayrıntıları içermiyor; dolayısıyla erişim ve ticari koşullar Google'ın ürün yüzeyleri arasında değişebilir.

Neden önemli

Güncellemeler bir bütün olarak Gemini'nin tüm içerik iş akışına yayıldığını gösteriyor: Konuşmayı kaydetme, video üretme ve yazılarak değil konuşularak kullanılma. Geliştiriciler için transkripsiyon sürümü pratik bir uyarı taşıyor. Benzer isimli iki model farklı API'lerde ve farklı oturum sınırlarıyla duruyor; birçok ekibin istediği ana yetenek olan gerçek zamanlı konuşmacı atfı ise akış modunda açıkça kullanılamıyor. Gemini 3.5 Transcribe üzerinde toplantı araçları geliştiren herkes, mevcut API ikisini aynı anda sunmadığı için baştan itibaren canlı metin ile etiketli konuşmacılar arasında seçim yapmak zorunda.

  • #google-gemini
  • #speech-to-text
  • #video-generation
  • #api
  • #voice-interface

İlgili yazılar