· kaynak Hacker News – Front Page (hnrss.org)
Tiny Audio, yaklaşık 25 dolara 1.8% WER'lik bir konuşmadan metne modeli eğitiyor
Tiny Audio adlı açık kaynak bir proje, dondurulmuş bir konuşma kodlayıcısını bir Qwen LLM'e bağlayarak yaklaşık 25 dolara eğitilebilen ve LibriSpeech test-clean üzerinde 1.8% WER'e ulaşan bir konuşmadan metne sistemi olduğunu iddia ediyor.
25 dolarlık bir konuşmadan metne yığını
Hacker News ana sayfasında ortaya çıkan Tiny Audio adlı açık kaynak proje, yazarına göre yaklaşık 25 dolara eğitebileceğiniz bir konuşmadan metne sistemi sunuyor. Projenin GitHub deposuna göre, yayımlanan model LibriSpeech test-clean üzerinde %1.84 kelime hata oranı (WER) ve 11.822 örneği kapsayan 12 benchmark üzerinde havuzlanmış %7.42 değerine ulaşıyor — üstelik yalnızca yaklaşık 80 milyon parametre eğiterek.
Öneri pratik olduğu kadar eğitici de. Kod tabanı bir öğleden sonra okunabilecek kadar küçük olarak tanımlanıyor ve gerçek bir eğitim döngüsü, herhangi bir GPU donanımı kiralanmadan önce bir dizüstü bilgisayarda yaklaşık beş dakikada çalışıyor.
Dondurulmuş kodlayıcı, küçük projektör, LLM çözücü
Mimari, bir algı ön ucuna dil modeli ekleme desenini izliyor. 16 kHz'deki ses, kare gömmeleri (frame embedding) üretmek için önceden eğitilmiş bir konuşma kodlayıcısından geçiyor. Küçük bir MLP projektörü komşu kareleri üst üste istif ediyor ve LLM'in gömme uzayına eşliyor — sıfırdan eğitilen tek bileşen bu. LLM daha sonra bu yansıtılmış kareleri sanki token'mış gibi okuyor ve transkripti yazıyor.
Depo ile iki tarif geliyor ve depo, kodlayıcı, projektör ve çözücünün her birinin yapılandırmadan değiştirilebilir olduğunu belirtiyor:
- Yayımlanan model, Granite Speech 470M kodlayıcı ve LoRA'lı dondurulmuş bir Qwen3.5 çözücü kullanıyor; projektör ve LoRA adaptörleri (~80M parametre) eğitiliyor.
- Varsayılan kurs tarifi, GLM-ASR-Nano 635M kodlayıcı ve ince ayarlanmış bir Qwen3-0.6B çözücü kullanıyor.
Çözücü bir dil modeli olduğu için çıktı, herhangi bir son işleme adımı olmadan noktalama işaretleri, büyük harfler ve biçimlendirilmiş sayılarla geliyor. Ağırlıklar bf16 ve yaklaşık 6 GB GPU ya da Apple Silicon belleği gerektiriyor; model standart Hugging Face automatic-speech-recognition pipeline'ı üzerinden çalışıyor (mazesmazes/tiny-audio olarak yayımlandı, trust_remote_code ile).
Benchmark tablosu
Depo, kendi değerlendirme araçlarıyla, bir RTX 4090 üzerinde HTTP API'sine karşı ölçülen veri kümesi başına sayıları raporluyor. Temiz okuma konuşması iyi skor alıyor: SPGISpeech %2.29 ve TED-LIUM %3.71 ile LibriSpeech test-clean'i takip ediyor. Daha zorlu, gürültülü materyal sayıları yükseltiyor — LibriSpeech test-other %6.38, Common Voice %7.18, GigaSpeech %9.06, Earnings22 %10.58, People's Speech %17.59 ve AMI'nin tek uzak mikrofon kurulumu %23.53. 12 küme ortalaması %8.71. İki veri kümesi (LoquaciousSet ve Earnings22) eğitimden tamamen hariç tutuldu.
Aynı değerlendirme aracı aynı örnekleri ticari API'lerden — AssemblyAI, Deepgram, ElevenLabs ve Apple Speech — geçirebiliyor, böylece kullanıcılar karşılaştırmayı bir satıcının verdiği tabloya güvenmek yerine kendileri doğrulayabiliyor.
Düz metinden fazlası
Pipeline, zorlamalı hizalama yoluyla kelime düzeyinde zaman damgalarını ve konuşmacı ayırma (diarization) desteğini sunuyor; bu, NeMo'nun masked_asr tarifinin zero-shot bir uyarlaması olarak uygulanmış: Nemotron-3-Diarization'ın bulduğu her konuşmacı, herkesin susturulduğu sesin bir kopyasında ayrı ayrı transkribe ediliyor. Depo sınırlamalar hakkında açık sözlü — çakışan konuşma yalnızca kısmen ele alınıyor; bir tur içinde başka bir konuşmacının kelimeleri o konuşmacının akışında kalıyor. Token token akış (streaming) da mevcut.
Pakete dahil ta serve komutu, modeli toplu iş yapabilen bir HTTP sunucusunun arkasına koyuyor; eşzamanlı istekler GPU batch'lerini paylaşıyor. Depo, bir RTX 4090 üzerinde 128 eşzamanlı istekte yaklaşık 460x gerçek zaman raporluyor; 45 dakikalık bir ses yaklaşık 10 saniyede transkribe ediliyor (konuşmacı etiketleriyle 21 saniye). RunPod, CUDA, Apple Silicon veya CPU üzerinde çalışıyor.
Eğitim kademeleri ve ücretsiz bir kurs
Eğitim kademeli. Ücretsiz bir duman testi dizüstü bilgisayarda 73 LibriSpeech klibi üzerinde eğitim yapıyor. 25 dolar iddiasının temeli olan kurs çalışması, kiralanmış bir GPU'da birkaç saat boyunca yaklaşık 250 saat ses kullanıyor. On küme genelinde yaklaşık 3 milyon klipte yapılan bir üretim tarifi ise bir gün veya daha fazla süreyle 80 GB'lık bir GPU gerektiriyor ve yüzlerce dolara mal oluyor. Ücretsiz 3.5 saatlik bir kurs tüm döngüyü adım adım anlatıyor; ancak daha küçük tarifi eğittiği için öğrenci sonuçları yayımlanan tablonun gerisinde kalacak.
Neden önemli
Yüksek kaliteli ASR, bireylerin yeniden üretmesi için fazla pahalı olan büyük ticari API'ler ve modeller tarafından domine edildi. Tiny Audio, ~80M eğitilebilir parametreli dondurulmuş kodlayıcı artı LLM tarifiyle neredeyse herkesin karşılayabileceği bir eğitim maliyetinde rekabetçi bir doğruluğa ulaşılabileceğini, üstelik gerçekten anlaşılabilecek kadar küçük bir kod tabanıyla gösteriyor. Ekipler için değiştirilebilir bileşenler ve ucuz eğitim döngüsü, alana özgü ASR'yi gerçekçi kılıyor; öğrenenler için ise modern konuşma sistemlerinin nasıl inşa edildiğinin perdesini aralıyor. Uyarılar gerçek — tüm rakamlar kendi tarafından raporlanıyor ve en zor benchmark'lar manşetteki %1.8'in çok üzerinde — ancak erişilebilirlik argümanı kendi başına ayakta duruyor.
- #speech-to-text
- #open-source
- #machine-learning
- #asr
- #llm