· kaynak dev.to (home feed)
OpenBMB'nin VoxCPM2'si Apache-2.0 ses klonlama ve 30 dilli TTS'yi kendi GPU'larınıza getiriyor
Bir dev.to karşılaştırması, OpenBMB'nin Apache-2.0 lisanslı VoxCPM2'sinin ücretli TTS API harcamalarının çoğunu karşılayabileceğini savunuyor: 2 milyar parametre, ses klonlama, metinle tasarlanan sesler, 30 dil ve OpenAI uyumlu servis.

VoxCPM2 nedir
Eylül 2026'da yayımlanan bir dev.to karşılaştırmasına göre, MiniCPM model ailesinin arkasındaki ekip OpenMB, VoxCPM2'yi Nisan 2026'da yayımladı: Apache-2.0 lisanslı, 2 milyar parametreli bir metin-konuşma (TTS) modeli. Model tokenizer kullanmıyor. Konuşmayı önce ayrık token'lara bölmek yerine, uçtan uca bir diffusion-autoregressive mimari aracılığıyla sürekli konuşma temsilleri üretiyor; makale bu yaklaşımı, nefes alma, tempo ve cümle ortasındaki duygusal değişimleri token tabanlı sistemlerden daha iyi ele almakla övüyor.
Tek bir checkpoint'te üç yetenek birlikte geliyor. Düz TTS, duygusal renklendirmeyi girdi metninin kendisinden çıkarıyor. Ses tasarımı (voice design), bir geliştiricinin bir sesi referans kaydı olmadan doğal dilde tanımlamasını ve modelin bu sesi yaratmasını sağlıyor. Zero-shot klonlama, kısa bir referans klipteki sesi yeni metne uyguluyor; klibin transkriptini de vermek, yalnızca tınıyı değil, tempo ve vurguyu da aktarıyor. Çıktı, Arapça, Hintçe, Japonca ve Türkçe ile Kantonca ve Siçuanca gibi dokuz Çin lehçesi dahil 30 dilde 48 kHz ses.
Yerel olarak çalıştırma
Makale kurulumu, bir pip paketi artı ilk çalıştırmada Hugging Face'ten indirilen birkaç gigabaytlık ağırlık olarak, CLI ya da Python API üzerinden kullanılabilir biçimde tarif ediyor. Önceki 0.5B ve 1.5B sürümlerinden daha hafif checkpoint'ler daha küçük donanım için hâlâ mevcut. Apple Silicon kullanıcıları bu eski checkpoint'leri topluluk destekli MLX-Audio projesiyle çalıştırabiliyor; ancak projenin belgeleri VoxCPM2 desteğinin henüz gelmediğini belirtiyor. Yazar ayrıca bir dağıtıma karar vermeden önce ücretsiz Hugging Face oyun alanında gerçek cümleler test etmeyi öneriyor.
Bellek tarafında model 8 GB VRAM sınıfında yükleniyor; ancak makale, KV cache, eşzamanlılık ve daha uzun prompt'lar devreye girdiğinde 24 GB'lık bir kart için bütçe yapmayı tavsiye ediyor.
Üretimde servis
Servis tarafı, VoxCPM2'yi barındırılan bir API'nin güvenilir bir alternatifi yapan şey. Resmi olarak önerilen üretim yolu, batching ve KV-cache yönetimiyle OpenAI uyumlu bir /v1/audio/speech uç noktası sunan vLLM-Omni. Makaleye göre halihazırda OpenAI biçiminde ses uç noktalarını çağıran uygulamalar için arka ucu değiştirmek, baştan yazmak değil küçük bir yapılandırma değişikliği anlamına geliyor. Alıntıladığı PyPI belgeleri, Nano-vLLM-VoxCPM arka ucu üzerinden RTX 4090'da yaklaşık 0.13 olan gerçek zaman faktörünü, düz PyTorch yolunda kabaca 0.3 olan değere karşı bildiriyor; bu da üretimin oynatmadan birkaç kat daha hızlı bitmesi demek.
Karşılaştırma
Dev.to yazısı, ElevenLabs'yi hâlâ kullanım kolaylığı ve tutarlı kalite açısından ölçek olarak görüyor; API fiyatını v3 katmanında 1.000 karakter başına 0,10 dolar, Flash/Turbo'da 0,05 dolar olarak veriyor. Önerdiği paylaşım: üretimin rutin kısmını (çoğu ürün için kabaca yüzde 80) kendi sunucularınızda barındırmak, geriye kalan en zorlu kısım için barındırılan bir API tutmak.
Karşılaştırmada diğer açık kaynak seçenekler de yer alıyor. Resemble AI'nin Chatterbox'ı MIT lisanslı; duygu abartma kontrolü ve yaklaşık beş saniyelik sesle klonlama sunuyor ama 23 dili kapsıyor ve serbest biçimli ses tasarımından yoksun. Alibaba'nın Qwen3-TTS'si doğal dille ses tasarımı sunuyor ve 0.6B halinde 4 GB VRAM kadar düşük bellekle çalışabiliyor ama 10 dili destekliyor. Makale, VoxCPM2 kalitesinin daha az kaynaklı dillerde tutarsız olduğunu ve durum durumda test edilmesi gerektiği konusunda uyarıyor; klonlamanın yalnızca açık izin verilmiş seslere uygulanması gerektiğini vurguluyor.
Neden önemli
Barındırılan metin-konuşma hizmetlerindeki karakter başına fiyatlandırma, konuşan herhangi bir ürün için sabit bir maliyet oldu. Klonlamayı, metinle yönlendirilen ses tasarımını ve 30 dili tek bir checkpoint'te birleştiren ve çoğu kodun halihazırda hedeflediği OpenAI uyumlu uç noktanın arkasında servis edilen bir Apache-2.0 modeli, yinelenen bir faturayı sahip olduğunuz bir GPU'ya dönüştürüyor ve müşteri metnini ağınızın içinde tutuyor. Ödünleşim operasyonel: altyapıyı siz işletiyorsunuz ve en zor cümleler yine de ücretli bir yedekte daha iyi duyulabilir. Donanıma sahip ekipler için soru, hangi API'ye abone olunacağından, konuşma trafiğinin hangi payının şirket içine taşınabileceğine kayıyor.
- #text-to-speech
- #open-source
- #voice-cloning
- #self-hosting
- #vllm