· kaynak Hacker News – Front Page (native)
Wispr Flow, gürültülü gerçek dünya dikleri için eğitilmiş Canto konuşma modelini yayınladı
Wispr Flow'un yeni Canto modeli, şirketin kendi gerçek dünya dikleme benchmark'ında en düşük hata oranını elde etti; gürültüyü, düşük ses seviyesini ve kısa konuşmaları yönetmek için GRPO pekiştirmeli öğrenme kullanıyor.
.jpg)
Günlük ses için tasarlanmış bir dikleme modeli
Wispr Flow, insanların diklemeyi gerçekte nasıl yaptığına odaklanan bir konuşma tanıma modeli olan Canto'yu duyurdu: masa başında, yolculuk sırasında ve kalabalık ofislerde dizüstü bilgisayar mikrofonlarına ve kulaklıklara konuşmak, arka planda başka sesler, müzik veya trafik gürültüsüyle birlikte. Hacker News'in ana sayfasına ulaşan şirket duyurusuna göre Canto, gerçek dünyadan diklemeler üzerinde yapılan bir değerlendirmede Wispr'ın test ettiği tüm modeller arasında en düşük kelime hata oranını elde etti ve Google, OpenAI, AssemblyAI ve Deepgram sistemlerinin önünde yer aldı. Bu, şirketin daha geniş bir araştırma programının başlangıcı olarak tanımladığı Wispr Advanced Interfaces Lab'in ilk modeli.
Benchmark nasıl oluşturuldu
Gerçekçi koşullardaki performansı ölçmek için Wispr, kendi ürününden, 2.300'den fazla farklı konuşmacıdan gelen ve uygulamalar ile kullanım senaryoları arasında rastgele örneklenen 10 saatlik İngilizce diklemeden oluşan bir değerlendirme seti oluşturdu. Şirket, belirli seslere fazla uyum sağlamayı (overfitting) önlemek için eğitim ve test konuşmacılarını kesin şekilde ayırdığını ve her örneğin veri paylaşımı ayarını etkinleştirmiş bir kullanıcıdan geldiğini belirtiyor. Bu set üzerinde Canto, karşılaştırılan modeller arasında en düşük kelime hata oranını — insan transkripsiyonuna göre yapılan değiştirmeler, eklemeler ve atlamalar — elde etti. Belirtilmesi gereken bir nokta: değerlendirme Wispr'ın kendi tarafından, ürününün kullanım dağılımından gelen veriler üzerinde yapıldı.
Stres testi
Rastgele örnekler hikayenin tamamı değildi. Wispr ayrıca, diklemeyi en çok bozması muhtemel koşulları içeren üç saatlik ayrı bir zorluk seti oluşturdu: yakındaki konuşmalar, müzik, trafik, rüzgâr, düşük kayıt sesi, fısıltı veya uzaktan gelen konuşma ve çevresinde neredeyse hiç bağlam bulunmayan çok kısa ifadeler. Zorluk setinin tamamında Canto genel olarak ikinci sırayı aldı; birinci, Wispr'ın gerçek zamanlı, düşük gecikmeli uygulamalar için fazla büyük olduğunu belirttiği frontier ölçeğinde çok modlu bir model olan Gemini 3.1 Pro'nun oldu. Değerlendirilen gerçek zamanlı modeller arasında Canto yine de en düşük hata oranına sahipti. Daha ayrıntılı bakıldığında, gürültülü sesde en iyi sonucu Gemini 3.1 Pro verdi; Canto ise düşük sesli konuşmada ve kısa diklemelerde en iyi sonuçta eşit oldu. Yalnızca bir veya iki kelimelik kayıtlar, karşılaştırmadaki her model için en yüksek hata oranlarını üretti; çünkü tek bir hata kısa bir ifadede ağır basar ve belirsizliği çözecek dilbilimsel bağlam çok azdır.
Herkese açık benchmark'lar farklı bir tablo çiziyor
Üç herkese açık İngilizce veri setinde Canto, LibriSpeech'te en düşük hata oranında eşit oldu ancak FLEURS veya Common Voice'da liderlik etmedi; Wispr bu sonuçlarını rekabetçi olarak nitelendiriyor. Şirket, bu veri setlerinin çoğunlukla okunan konuşmadan — sesli kitaplar ve hazır cümleler — oluştuğunu, bunun da konuşmacıların durakladığı, düşünce ortasında düzeltme yaptığı ve minimum bağlam sağladığı kendiliğinden diklemeden farklı bir dağılım olduğunu savunuyor. Bu fark, Wispr'ın hem herkese açık benchmark'lar hem de kendi kullanım verisi üzerinde değerlendirme yapmasının beyan edilen nedeni.
Denetimli ince ayar artı pekiştirmeli öğrenme
Canto, milyonlarca saat konuşma ve metin üzerinde ön eğitilmiş bir modelle başlıyor, ardından iki aşamada eğitiliyor. Denetimli ince ayar (supervised fine-tuning), transkripsiyon görevini ses ile referans transkriptleri eşleştirerek öğretiyor. Ardından bir pekiştirmeli öğrenme aşamasında model, aynı ses için birkaç aday transkript üretiyor; her aday bir referansla puanlanıyor ve bu puanlar gelecekteki eğitimi daha iyi çıktılara yönlendiriyor. Wispr, DeepSeekMath'te tanıtılan Group Relative Policy Optimization (GRPO) yöntemini kullanıyor; bu yöntem her gruptaki adayları karşılaştırıyor ve göreli ödüllerinden öğreniyor. Bu tür dizilim seviyesinde eğitimin konuşma tanımada uzun bir geçmişi var; minimum kelime hata oranı eğitimi dahil, ancak GRPO'nun otoregresif konuşma tanımaya doğrudan uygulanmaları yenidir. Wispr, ses rollout'larını ölçekli şekilde üretmek ve puanlamak için kurduğu altyapının bağlamsal tanıma, kişiselleştirme, diarizasyon ve zor ses koşulları araştırmalarını da desteklediğini söylüyor. Şirket ayrıca kullanıcı düzeltmelerinden öğrenme üzerinde çalışıyor; çünkü kelime dağılımı modellerin yeniden eğitilebileceğinden daha hızlı değişiyor — örneğin verilen örnek, bir zamanlar "cloud" olarak okunan "Claude" gibi bir kelime.
Neden önemli
Konuşma tanıma benchmark'larının çoğu temiz, okunan sesi ölçüyor; oysa gerçek diklemelerin çoğu gürültülü odalarda, vasat mikrofonlarla ve neredeyse hiç bağlam olmadan gerçekleşiyor. Canto'nun öne çıkması esas olarak Wispr'ın bu gerçek koşullar için açıkça optimize etmesi ve ölçmesi, ayrıca hem kazandığı yerleri (kendi veri dağılımı) hem de kazanmadığı yerleri (zor sesde bir frontier modelin gerisinde kalması ve herkese açık okunan konuşma veri setlerinde lider olmaması) bildirmesinden geliyor. GRPO tabanlı bu yaklaşım — yalnızca toplam doğruluğun peşinden koşmak yerine pekiştirmeli öğrenmeyle belirli hata türlerini hedeflemek — ses birincil giriş yöntemi hâline geldikçe diğer konuşma ekiplerinin de izleyeceği bir örüntü olabilir. İddialar hâlâ satıcı tarafından yürütüldüğü için gerçek test bağımsız doğrulama olacak.
- #speech-recognition
- #machine-learning
- #wispr-flow
- #dictation
- #reinforcement-learning