deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak The Verge

Google'ın Gemini 3.5 Transcribe'ı dolgu kelimeleri kaldırıyor ve 85'ten fazla dilde jargonu anlıyor

Google'ın yeni Gemini Audio modelleri, transkriptlerden dolgu kelimelerini ayıklıyor, uzmanlaşmış jargonu ve 85'ten fazla dili tanıyor; macOS, Android ve developer preview'da kullanıma sunuluyor.

Google'ın Gemini 3.5 Transcribe'ı dolgu kelimeleri kaldırıyor ve 85'ten fazla dilde jargonu anlıyor

Google, Gemini Audio serisini üç yeni modelle genişletti — Gemini 3.5 Transcribe, 3.5 Live ve 3.5 Live Experimental — vaat ettikleri arasında, "şey" ve "ııı" gibi dolgu kelimelerini transkriptlerden otomatik olarak düşüren, belirgin şekilde daha akıllı konuşma işleme yetenekleri de var. The Verge'nin haberine göre kullanıma sunulma süreci 26 Ağustos'ta başladı.

Yeni gelenler

Başrolde Gemini 3.5 Transcribe var; bu model, Google'ın mevcut konuşma yığınına yapılan küçük bir yükseltme değil, bambaşka bir model. The Verge, Google'ın bu modeli önceki transkripsiyon modeli Chirp 3'e kıyasla büyük bir adım olarak konumlandırdığını, özellikle çok dilli performans ve kelime hata oranında ciddi kazanımlar sunduğunu yazıyor. 85'ten fazla dili destekleyen model, gerçek konuşmanın dağınık gerçekleriyle — arka plan gürültüsü, araya giren sözler ve uzmanlaşmış kelime dağarcığıyla — başa çıkmak üzere tasarlandı.

Varsayılan olarak daha temiz transkriptler

Öne çıkan yetenek otomatik temizlik. Konuşmayı metne çevirmenin ötesinde 3.5 Transcribe, çıktıyı biçimlendirebiliyor ve dolgu kelimelerini kaldırabiliyor; böylece transkript çiğ bir dikteden çok düzenlenmiş bir metin gibi okunuyor. Google ayrıca kullanıcıların özel bir kelime dağarcığı tanımlamasına izin veriyor; yani isimler, ürün terimleri veya alana özgü jargon, elle düzeltme gerektirmeden doğru tanınıp yazılabiliyor — bu, geleneksel dikte araçlarında uzun süredir devam eden bir sorundu.

Google'ın ifadesiyle kullanıcılar "yalnızca sesinizle doğal biçimde düzenleme" yapabiliyor ve transkripti klavyeye dokunmadan düzeltebiliyor. Kayıtlı sesler için model, konuşmayı en fazla üç ayrı konuşmacıya atfedebiliyor ve kelime düzeyinde zaman damgaları üretiyor; bu da çıktının gezinmesini, aranmasını ve yeniden kullanılmasını kolaylaştırıyor.

Live modelleri

Transcribe'ın yanı sıra Google, Gemini 3.5 Live ve Gemini 3.5 Live Experimental'ı da sundu; her ikisi de Gemini'nin sesli sohbet modunun arkasındaki konuşma tanıma teknolojisi üzerine inşa edildi. The Verge'ye göre 3.5 Live, cümlenin ortasında söz kesme, dil tanıma ve canlı görsel işleme konularında iyileştirmeler getiriyor. Experimental varyantı daha da ileri gidiyor: daha karmaşık akıl yürütme görevleri üzerinde çalışırken kendi ilerleyişini adım adım, gerçek zamanlı olarak anlatıyor ve kullanıcıları sessiz bir final cevabı beklemek yerine modelin ne yaptığını görebilme imkânına kavuşturuyor.

Nereden edinebilirsiniz

Güncelleme, tüm macOS Gemini uygulaması kullanıcılarına İngilizce olarak ulaşmanın yanı sıra, seçili ülkelerde ve dillerde Android'deki Rambler dikte özelliğine geliyor. Geliştiriciler modelleri AI Studio ve Antigravity üzerinden Gemini API ile public preview'da deneyebilir. Chrome desteği ise "yakında" olarak listelenmiş durumda.

Özellikle The Verge, bu ses modellerinin, şirketin Haziran'da çıkacağını söylediği Gemini 3.5 Pro henüz ortaya çıkmamışken geldiğine dikkat çekiyor.

Neden önemli

Transkripsiyon en yaygın kullanılan yapay zekâ özelliklerinden biri ve zayıf yönleri herkesçe biliniyor: bozulan isimler, eksik noktalama, birebir aktarılan dolgu kelimeleri ve aksanların ya da teknik jargonun kötü işlenmesi. Otomatik dolgu kaldırma, yapay zekâ transkripsiyonunu çiğ bir kayıttan ilk taslak niteliğinde bir belgeye yaklaştırıyor; bu da gazeteciler, öğrenciler ve toplantı notlarıyla çalışan herkes için düzenleme süresini ciddi biçimde kısaltabilir.

Özel kelime dağarcığı desteği ve çoklu konuşmacı atfı, birçok transkripti pratikte güvenilmez kılan kalan boşlukları hedefliyor. Modeller public preview'da sunulduğu için geliştiriciler de bu yetenekleri beklemeden kendi uygulamalarına gömebilir. Gemini 3.5 Pro'nun hâlâ ortalıkta olmaması takip edilmesi gereken bir konu; ancak ses tarafında Google, dikteyi ve ses arayüzlerini günlük, güvenilir kullanıma net biçimde yaklaştırıyor.

  • #gemini
  • #transcription
  • #speech-recognition
  • #google
  • #voice-ai

İlgili yazılar