deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Google, gerçek zamanlı konuşmadan yazıya dönüştürme için %2,6 kelime hata oranına sahip Gemini 3.5 Transcribe'ı duyurdu

Google'ın yeni Gemini 3.5 Transcribe modeli, ham konuşmayı gerçek zamanlı olarak cilalı metne dönüştürüyor; iki API, 85'ten fazla dil ve Gboard, Chrome ile Gemini uygulamasında daha derinlemesine ses girişi sunuyor.

Google, gerçek zamanlı konuşmadan yazıya dönüştürme için %2,6 kelime hata oranına sahip Gemini 3.5 Transcribe'ı duyurdu

Google'ın yeni transkripsiyon modeli

Google, canlı sesi kelimesi kelimesine bir döküm yerine cilalı, okunmaya hazır metne dönüştürmek üzere tasarlanmış bir konuşmadan yazıya modeli olan Gemini 3.5 Transcribe'ı duyurdu. 26 Ağustos 2026 tarihli bir şirket blog gönderisinde Google, bunu şimdiye kadarki en doğru transkripsiyon modeli olarak nitelendiriyor ve daha düşük hata oranları ile daha hızlı bitmiş metin teslimi sunması nedeniyle Chirp 3'ün bir üst sürümü olarak konumlandırıyor.

Google'a göre tüketiciler bu modeli halihazırda Android'deki Rambler gibi ses özellikleri ve macOS'taki Gemini uygulaması aracılığıyla kullanıyor. Duyuru, aynı teknolojiyi geliştiricilere Google AI Studio'daki Gemini API ve Gemini Enterprise Agent Platform üzerinde genel önizleme olarak açıyor.

Canlı ve kayıtlı sesi kapsayan iki API

Model iki ayrı arayüzle sunuluyor. İlki olan gemini-3.5-transcribe-live, Live API üzerinde çalışıyor ve sesi her iki yönde bir saniyenin altındaki gecikmeyle aktarıyor; etkileşimli ses uygulamalarına yönelik. İkincisi olan gemini-3.5-transcribe ise Interactions API üzerinden çalışıyor ve toplantılar ile çağrı kayıtları gibi kayıtlı materyali, konuşmacı atıfları ve kelime düzeyinde zaman damgalarıyla işliyor.

Bildirilen doğruluk kazanımları

Google, Artificial Analysis ölçümlerine dayanarak akış kullanımında ortalama %4,0, akış dışı kullanımda %2,6 kelime hata oranı bildiriyor. Şirket ayrıca modelin gürültülü gerçek dünya ortamlarında dayanıklı olduğunu ve posta kodları ile sipariş numaraları gibi alfasayısal ayrıntıları doğru yakaladığını söylüyor.

FLEURS kıyaslamasında, önde gelen diller ve yerel ayarlar kümesinde Google, akış modunda %5,50 ve akış dışı modda %5,04 WER bildiriyor; bunlar Chirp 3'e göre iyileşme sağlıyor. Nihai dökümün teslim edilme süresi, yine Artificial Analysis'e göre eski modele kıyasla %70 iyileşiyor.

Kendi kendine temizlik yapan transkripsiyon

Model, insanların gerçekte nasıl konuştuğunu yorumlamak üzere tasarlandı. Google, modelin cümle ortası düzeltmeleri (örneğin bir toplantıyı salıdan çarşambaya alma) ele aldığını, "şey" ve "ıı" gibi dolgu kelimelerini ayıkladığını ve ortaya çıkan metne otomatik biçimlendirme uyguladığını belirtiyor.

Geliştiriciler, modelin uyarlandığı özel bir kelime dağarcığı — uzman jargon ve belirli yazımlar — sağlayabiliyor. Dil algılama, bölgesel aksanlar ve lehçe varyasyonları dahil 85'ten fazla dilde otomatik yapılıyor. Önceden kaydedilmiş ses için model, üç konuşmacıya kadar konuşmayı zaman damgalarıyla ayrı konuşmacılara atfediyor; üçten fazlası için destek ise deneysel olarak etiketlenmiş durumda.

Model ayrıca görüntü oluşturma veya dosya analizi gibi karmaşık işleri diğer Gemini modellerine devretmek için function call kullanabiliyor. Google, bu özelliğin şu anda macOS'taki Gemini uygulamasında kullanılabilir olduğunu belirtiyor.

Google yüzeylerine yayılıyor

API'lerin ötesinde Google, modeli kendi ürünlerine de yerleştiriyor. Android için Gboard'da Rambler özelliği, söylenen düşünceleri yapılandırılmış metne dönüştürüyor ve yazım düzeltmeleri ile yazım tarzı değişiklikleri dahil sesli düzenlemeleri kabul ediyor. Google AI Studio'nun Build modunda geliştiriciler, uygulamalar oluşturulurken sesle uygulama inşa edebiliyor.

Google Antigravity, kullanıcı izniyle transkripsiyonu ekran bağlamı ve sohbet geçmişiyle eşleştirerek dosya adları ve etkin belgeler gibi öğelerde doğruluğu artırıyor. macOS'taki Gemini uygulamasında sesli komutlar, yerel dosyaları özetleme veya imlecin bulunduğu yerde görüntü oluşturma gibi çok adımlı iş akışlarını çalıştırmak için ekran bağlamıyla birleşebiliyor. Kullanıcıların web'deki herhangi bir metin alanına dikte etmesine olanak tanıyan bir özellik ise Chrome için planlanıyor.

Google ayrıca Live API üzerine inşa edilen — Agora, LangChain, LiveKit, Pipecat ve Vercel dahil — ortak platformları listeliyor ve gecikme, doğruluk ve dil kapsamı ile ilgili vivo, Intellitek Health ve Lingopal'dan gelen erken geri bildirimlere işaret ediyor.

Neden önemli

Konuşmadan yazıya sistemleri, tarihsel olarak kullanışlı olmaları için önce ciddi bir temizlik gerektiren ham dökümler üretti. Biçimlendirmeyi, dolgu kaldırmayı ve düzeltme işlemeyi modelin kendisine taşıyarak — ve takip görevleri için diğer modelleri çağırmasına izin vererek — Google, transkripsiyonu saf bir ses işleme sorunu olarak değil, bir dil anlama sorunu olarak ele alıyor.

Sesli ajanlar, altyazı araçları ve çağrı analitiği hatları yapan ekipler için bildirilen hata oranları ve Chirp 3'e göre gecikme kazanımları gerçek bir engeli düşürüyor; özel kelime dağarcığı ve konuşmacı atfı ise uzun süredir devam eden kurumsal sorunları ele alıyor. Gboard, Chrome ve Gemini uygulamasına entegrasyon, Google'ın ses girişini ürünlerinde niş bir seçenek değil varsayılan bir etkileşim modu haline getirmek istediğini de gösteriyor.

  • #gemini
  • #speech-to-text
  • #google
  • #ai
  • #apis

İlgili yazılar