deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Nvidia'nun Nemotron 3.5 ASR'si açık ağırlıklarla ve beş adımlı bir fine-tuning rehberiyle geliyor

Nvidia'nın yeni 600M parametreli konuşmadan metne modeli tek bir checkpoint'ten 40 dil varyantını tanıyor ve şirket, modeli belirli dillere, alanlara ve aksanlara uyarlamak için yeniden üretilebilir bir fine-tuning pipeline'ı yayımladı.

Nvidia'nun Nemotron 3.5 ASR'si açık ağırlıklarla ve beş adımlı bir fine-tuning rehberiyle geliyor

Nvidia, tek bir checkpoint'ten gerçek zamanlı olarak 40 dil varyantını tanıyan konuşmadan metne modeli Nemotron 3.5 ASR'yi yayımladı ve şirketin araştırma ekibi bunu eksiksiz bir fine-tuning rehberiyle birlikte sundu. JudyAI Lab'in dev.to'daki yazısına göre, Hugging Face blogundaki rehber, modeli uyarlamanın her aşamasını veri hazırlığından dağıtıma kadar ele alıyor; böylece ekipler, bir tanıyıcıyı sıfırdan eğitmek yerine modeli belirli bir dil, sektör veya aksan için ayarlayabiliyor.

Açık ağırlıklarla gelen kompakt bir akış tanıyıcısı

Model 600 milyon parametreye sahip ve akış (streaming) konuşma tanıma için tasarlanmış Cache-Aware FastConformer-RNNT mimarisinde çalışıyor. dev.to yazısına göre model düşük gecikmeli senaryolarda iyi performans gösteriyor; bu da sesli ajanlar, canlı altyazı ve çağrı merkezi analitiği gibi kullanım alanlarına işaret ediyor.

Noktalama ve büyük harf restorasyonu modelin içinde ele alınıyor. Transkriptler ek bir temizleme aşaması olmadan okunabilir biçimde çıkıyor; dev.to yazarı bunu prototipleme sırasında pratik bir kazanç olarak öne çıkarıyor.

Ağırlıklar Hugging Face üzerinde açık şekilde erişilebilir. Geliştiriciler bunları indirebilir, inceleyebilir, fine-tuning yapabilir ve modeli kendi altyapılarında dağıtabilir; harici bir API'ye bağımlılık yok ve istek başına ücret birikmiyor.

Beş adımlı uyarlama pipeline'ı

dev.to'ya göre Nvidia araştırmacılarının Hugging Face rehberi fine-tuning sürecini beş aşamaya bölüyor:

  1. Veri hazırlığı
  2. Eğitim
  3. Değerlendirme
  4. Ölçekleme
  5. Dağıtım

Rehber tamamen yeniden üretilebilir olarak tanımlanıyor; yani aynı tarif baştan sona yeniden çalıştırılabiliyor. Hedeflenen iş akışı, Nemotron 3.5 ASR'yi yetenekli bir genel amaçlı temel olarak ele alıyor: sağlık, hukuk veya finans alanında çalışan ya da temel modelin kusurlu işlediği belirli bir aksanı hedefleyen bir ekip, sıfırdan bir sistem için veri seti ve işlem gücü bütçesi oluşturmak yerine yayımlanan checkpoint'ten başlıyor ve modeli özelleştiriyor.

Bulut transkripsiyon yerine yerel çalıştırma

JudyAI Lab yorumu yayımı daha geniş bir değişimin parçası olarak çerçeveliyor: modelleri edge'de veya özel ortamlarda çalıştırmak, ekipler araç seçerken bir ek özellik olmaktan çıkıp temel bir kriter haline geliyor. Çağrı kayıtları, tıbbi dikte ve toplantı seslerini içeren konuşma verileri hassastır; yerel transkripsiyon bu verileri üçüncü taraf bulutlarının dışında tutarken ölçümlü API fiyatlandırmasından da kaçınıyor. Yazının kaynakları arasında modelin çok dilli transkripsiyonunu bir dizüstü bilgisayarda çalıştırmaya dair bir LiveKit yazısı yer alıyor; bu da yerel çalıştırmanın sonradan eklenmiş bir düşünce değil, hedeflenen dağıtım yolu olduğunu vurguluyor.

Neden önemli

Dil modellerini dönüştüren desen — açık bir temel modelden başlayıp onu bir alana göre fine-tuning yapmak — artık konuşma tarafında da olgunlaşıyor. 40 dil varyantını kapsayan tek bir checkpoint, dil başına ayrı tanıyıcılar bakım ihtiyacını ortadan kaldırıyor; açık ağırlıklar ise hem çağrı başına yinelenen maliyetleri hem de sesi barındırılan bir API'ye göndermenin gizlilik riskini ortadan kaldırıyor. Yayımlanan pipeline, sıfırdan bir ASR sistemi eğitmeyi hiçbir zaman gerekçelendiremeyecek küçük ekipler için engeli daha da düşürüyor. dev.to yazısı daha büyük barındırılan sistemlerle kıyaslama testleri içermiyor; bu yüzden katı doğruluk gereksinimleri olan ekiplerin modeli kendi ses verileri üzerinde değerlendirmesi gerekecek. Yine de akış mimarisi, yerleşik transkript biçimlendirme, açık ağırlıklar ve belgelenmiş bir fine-tuning tarifi birleşimi, Nemotron 3.5 ASR'yi özel bir ortamda çalışması gereken ses özellikleri geliştiren herkes için güçlü bir aday haline getiriyor.

  • #nvidia
  • #speech-recognition
  • #fine-tuning
  • #open-weights
  • #hugging-face

İlgili yazılar