deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

k2-fsa, 600'den fazla dili kapsayan ve 3 saniyelik örnekten ses klonlayabilen zero-shot TTS modeli OmniVoice'u açık kaynak yaptı

k2-fsa ekibi, 600'den fazla dili kapsayan açık kaynak bir zero-shot TTS modeli olan OmniVoice'u yayımladı. Model, 3-15 saniyelik bir kayıttan ses klonlama destekliyor ve CUDA, Apple Silicon ile Intel Arc GPU'larda çalışıyor.

k2-fsa, 600'den fazla dili kapsayan ve 3 saniyelik örnekten ses klonlayabilen zero-shot TTS modeli OmniVoice'u açık kaynak yaptı

600 dilli açık kaynak konuşma modeli

dev.to'da yayımlanan bir gönderiye göre k2-fsa ekibi, 600'den fazla dili destekleyen açık kaynak bir metin okuma (text-to-speech) modeli olan OmniVoice'u yayımladı. Ekip, en çok yaygın olarak kullanılan iki konuşma tanıma araç seti olan k2 ve icefall ile tanınıyor. Gönderiye göre bu, şu anda mevcut herhangi bir zero-shot TTS modelinin kapsamadığı kadar geniş bir dil kapsamı; büyük dünya dillerinden bölgesel dillerin uzun kuyruğuna uzanıyor.

Burada zero-shot, modelin her dil için ek eğitim gerektirmemesi anlamına geliyor. Her dil için ayrı bir ses oluşturmak yerine, model eğitim verisi genelinde genelleme yapıyor ve konuşmayı doğrudan girdi metninden üretiyor.

Klonlama ve talimat tabanlı ses tasarımı

Gönderi, çıktı sesini kontrol etmenin iki yolunu anlatıyor. İlki klonlama: OmniVoice, yalnızca 3 ila 15 saniyelik bir referans kayıttan konuşmacının sesini kopyalayabiliyor; bu süre, kısa bir ses parçasından özel bir anlatım sesi oluşturmak için yeterli. İkincisi ses tasarımı: kullanıcı istediği sesi doğal dilde tanımlıyor — verilen örnek "erkek, İngiliz aksanı" — ve model herhangi bir referans ses olmadan eşleşen bir ses sentezliyor.

Teknik tarafta OmniVoice, günümüz TTS sistemlerinde yaygın olan otoregresif tasarımlar yerine bir diffusion dil modeli üzerine inşa edilmiş. Gönderiye göre bu yaklaşım, yüksek ses kalitesinin yanında otoregresif alternatifinden daha hızlı çıkarım (inference) sunuyor.

Yerel çalışmak için tasarlandı

OmniVoice, bir Python API'si ve komut satırı araçlarıyla geliyor. Gönderideki örnekler, k2-fsa/OmniVoice adıyla Hugging Face üzerinden checkpoint'i indiriyor, bir metin dizesini bir referans WAV ve transkriptiyle eşleştirerek ses üretiyor ve çıktıyı 24 kHz'de yazıyor. Referans kayıt olmadığında talimat tabanlı üretim için ayrı bir CLI bayrağı mevcut.

Bir açık kaynak sürüm için donanım desteği alışılmadık derecede geniş: gönderi CUDA GPU'ları, MPS üzerinden Apple Silicon ve XPU üzerinden Intel Arc GPU'ları listeliyor. Bu, modeli yalnızca bulut altyapısına hapsetmek yerine tüketici donanımının erişimine açıyor.

Sürüm ve ekosistem

Kod ve ağırlıklar GitHub ile Hugging Face'te yayımlandı; sürüm, "OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models" (Zhu vd., arXiv:2604.00688) adlı bir makaleyle destekleniyor. Gönderiye göre topluluk entegrasyonları da şimdiden ortaya çıktı; bunlara ComfyUI-OmniVoice-TTS adlı bir ComfyUI eklentisi ve akıllı ev kurulumunda yerel TTS çalıştırmak için bir Home Assistant entegrasyonu dahil.

Neden önemli

Günümüzde yüksek kaliteli çok dilli TTS'nin çoğu ticari API'lerin arkasında duruyor. 3 saniyelik bir kayıttan ses klonlayan, 600'den fazla dili kapsayan ve bir dizüstü bilgisayarda çalışan açık kaynak bir model, geliştiriciler için ekonomiyi değiştiriyor: karakter başına API ücreti yok, veri üzerinde tam kontrol ve çevrimdışı çalışma.

Asıl büyük hikâye belki de dil listesi. Ticari sistemler genellikle birkaç düzine yüksek talepli dile odaklanıyor ve daha küçük dilleri zayıf ya da eksik seslerle baş başa bırakıyor. dev.to gönderisi örnek olarak Tay dilini gösteriyor ve bu tür diller için bulut bağımlılığı olmadan yüksek kaliteli yerel sentezin artık uygulanabilir olduğunu savunuyor.

Göz önünde bulundurulması gereken uyarı ise rıza. Saniyelerce ses kaydından bir sesi klonlamak, tam da taklit ve dolandırıcılığa kapı açan yetenektir; gönderinin kendisi de kullanıcıları, bir referans sesi kullanmadan önce haklarına sahip olduklarını doğrulamaları konusunda uyarıyor. Diğer açık ses klonlama sürümlerinde olduğu gibi, erişilebilirlik ve yerelleştirme kazanımları, modeli dağıtacak herkesin yönetmesi gereken gerçek bir kötüye kullanım yüzeyiyle birlikte geliyor.

  • #text-to-speech
  • #open-source
  • #voice-cloning
  • #machine-learning
  • #local-ai

İlgili yazılar