deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Meta'nın 7,8 milyar parametreli omnilingual ASR modeli, 1.693 dil desteğiyle Replicate'te

Meta'nın 1.693 dili kapsayan 7,8 milyar parametreli konuşma tanıma modeli artık Replicate üzerinden çalıştırılabiliyor; dillerin yüzde 78'inde karakter hata oranı 10'un altında.

Meta'nın 7,8 milyar parametreli omnilingual ASR modeli, 1.693 dil desteğiyle Replicate'te

Meta'nın omnilingual ASR modeli Replicate'te

Meta'dan 7,8 milyar parametreli otomatik konuşma tanıma modeli, artık geliştiricilerin kullanımına Replicate üzerinden açıldı; model, Subformer tarafından sürdürülen paketlemeyle meta-omnilingual-asr-7b adıyla çalışıyor. AImodels.fyi'nin dev.to'da yayımladığı yeni başlayanlar rehberine göre model 1.693 dili kapsıyor ve bunların yüzde 78'inde 10'un altında karakter hata oranı (CER) sergiliyor; bu yüzden transkripsiyon kalitesinin işleme hızından daha önemli olduğu görevler için Meta'nın önerdiği tercih.

Mimari ve performans

Model, wav2vec2 tabanlı bir encoder ile büyük bir dil modeline dayalı bir decoder'ı birleştiriyor; bu yaklaşım, her dil için eşleştirilmiş eğitim verisi gerektirmek yerine dilleri zero-shot veya few-shot olarak transkribe etmesini sağlıyor. Replicate sürümü, rehbere göre orijinal LLM-ASR sürümünden daha doğru olan yeni v2 mimarisini kullanıyor. Meta, modeli Meta Omnilingual Audio Dataset ve ek çok dilli külliyatlardan alınan 1,6 milyonun üzerinde saatlik sesle eğitti; mimari fairseq2 araç setinde uygulandı.

Donanım tarafında model ağır sınıfta: rehber, BF16 hassasiyetinde bir A100 üzerinde 30 saniyelik parçalarla batch size bir durumunda çıkarım için yaklaşık 17GB VRAM, ayrıca ilk kullanımda 30GB'lık model indirmesi listeliyor. Hız gerçek zamana yakın; 0,097'lik gerçek zaman faktörü, bu donanımda 30 saniyelik bir örneğin yaklaşık 2,9 saniyede transkribe edildiği anlamına geliyor.

Planlanması gereken kısıtlar

Birkaç sınır, ekiplerin modeli nasıl konuşlandıracağını şekillendirecek:

  • Standart varyantlarda ses süresi 40 saniyeyle sınırlı. Sınırsız uzunluktaki ayrı varyant omniASR_LLM_Unlimited_7B_v2, uzun kayıtlarda aynı doğruluğu sunuyor ancak şu anda fine-tuning'i desteklemiyor; sesi elle bölmek ise temizlik gerektiren sınır artifact'lerine yol açabiliyor.
  • Çıktı yalnızca düz metin. Timestamp, konuşmacı diarizasyonu, güven skoru veya kelime düzeyinde hizalama yok; zamanlama bilgisi gereken her şey için ayrı bir hizalama adımı gerekiyor.
  • Doğruluk dengesiz. Desteklenen dillerin kalan yüzde 22'sinde doğruluk ciddi biçimde düşüyor ve bazı düşük kaynaklı diller kullanılamaz çıktı verebilir. Dil başına CER değerleri README'de CSV olarak geliyor; böylece ekipler karar vermeden önce beklentilerini kontrol edebiliyor.
  • Diller, eng_Latn veya cmn_Hans örneğindeki gibi ISO 639-3 kodları ve ISO 15924 yazı sistemi kodlarıyla belirtiliyor. Geçersiz kodlar otomatik algılamaya düşüyor; bu daha yavaş ve benzer ya da kod değiştirmeli (code-switched) sesi yanlış tanıyabiliyor.
  • VRAM ve indirme boyutu, GPU hızlandırması olmayan edge cihazlarını ve sunucusuz ortamları eler.

Replicate dışında yerel kullanım, omnilingual-asr pip paketiyle mümkün (macOS'ta ayrıca libsndfile kurulumu gerekiyor); ağırlıklar ilk çalıştırmada fairseq2 assets dizini altında önbelleğe alınıyor. Yapılandırılabilir batch boyutlarıyla toplu işleme destekleniyor.

Karşılaştırma

Rehber ayrıca modeli Replicate'teki komşularına karşı konumlandırıyor. twangodev'in qwenasr modeli Mandarin, Kantonca ve akraba dillerde uzmanlaşmış ve Doğu Asya seslerinde daha doğru olabilir; lucataco'nun seamless_communication modeli transkripsiyonun üzerine makine çevirisi ekliyor; NexaAI'nin OmniAudio-2.6B modeli ise çok daha küçük bir pakette düşük gecikmeli edge dağıtımını hedefliyor. Meta modeli; Çince'ye özgü doğruluk, çeviri veya cihaz üstü verimlilikten ziyade, 1.600'den fazla dili tek bir sistemde kapsamasıyla öne çıkıyor.

Neden önemli

Ticari ASR ürünlerinin çoğu en iyi ihtimalle birkaç düzine dili destekliyor. 1.600'den fazla dili — rehbere göre hiçbir ticari ASR sisteminin daha önce desteklemediği yüzlerce dil dahil — transkribe eden tek bir barındırılmış model; özel veri kümeleri veya dil başına pipeline'lar oluşturmadan dil dokümantasyonu, arşiv dijitalleştirme, medya yerelleştirme ve diller arası araştırma için pratik olanı değiştiriyor. Replicate'te bulunması, geliştiricilerin kendi GPU bütçelerini taahhut etmeden önce bir API üzerinden test edebilecekleri anlamına geliyor. Yine de uyarılar gerçek: dil başına dengesiz doğruluk, standart sürümde 40 saniyelik süre sınırı ve düz metin çıktı, üretimde kullanımın yayımlanan hata oranlarına karşı doğrulama ve çoğu zaman modelin etrafında ek araç gerektirdiği anlamına geliyor.

  • #speech-recognition
  • #meta
  • #replicate
  • #multilingual
  • #asr