· kaynak dev.to (home feed)
CPU destekli konuşma sentezi karşılaştırmasında Piper TTS, Kokoro-82M'den 9,3 kata kadar daha hızlı çalıştı
İki çekirdekli ARM sunucusunda yapılan bir dev.to karşıştırmasında Piper TTS x8,47'ye kadar gerçek zaman hızına ulaşırken Kokoro-82M x1'in altında kaldı; Fransızca sentez için Piper 8,7 ile 9,3 kat daha hızlı çıktı.

dev.to'da yayınlanan bir karşılaştırmada, Piper TTS'nin aynı GPU'suz sunucuda Fransızca konuşmayı Kokoro-82M'den 8,7 ile 9,3 kat daha hızlı sentezlediği belirlendi. Kokoro-82M x0,91 ile x0,93 gerçek zaman oranı ölçtü — makine, üretilen sesin çalınmasından daha yavaş hesaplıyordu — mientras Piper, fr_FR-siwis-medium sesiyle on iki çalışma üzerinde ortanca x8,32 olmak üzere x8,11 ile x8,47 arasına ulaştı.
Gönderiyi imzalayan Obole, kendisini test edilen sunucunun aynısı üzerinde çalışan ve olumsuz sonuçlar dahil ham ölçümleri yayınlayan bir yapay zekâ olarak tanımlayan bir kişilik. Kapsam bilinçli olarak dar tutulmuş: bu bir hız karşılaştırması, bir hüküm değil. Dinleme testi yapılmadı ve yazar, lisans koşulları ile Piper'ın değişken ses uzunluklarını karşılandırmanın yakalayamayacağı faktörler olarak belirtiyor.
Nasıl ölçüldü
Makine, 11 GiB RAM'e ve GPU'ya sahip olmayan, Python 3.12.3, piper-tts 1.8.0 ve onnxruntime 1.30.0 çalıştıran iki çekirdekli bir ARM Neoverse-N1 (aarch64) örneği. İş yükü, sekiz cümlelik, 505 karakterlik sabit bir Fransızca metindi; model bir kez yüklenerek cümle cümle sentezlendi. Aynı metin önceki Kokoro ölçüm betiğinden içe aktarıldı, böylece yanlışlıkla yapılan bir düzenleme karşılaştırılabilirliği bozamazdı. Her Piper sesi, yazarın çekici bir aralık oluşturmayı reddettiği bir aykırı değeri öncül bir çalışmanın işaret etmesinin ardından, arşivlenmiş iki altılı seri hâlinde on iki kez çalıştırıldı.
Sonuçlar
| Sistem | Gerçek zaman oranı | Çalışma sayısı |
|---|---|---|
| Piper fr_FR-siwis-medium | x8,11 ile x8,47, ortanca x8,32 | 12 |
| Piper fr_FR-tom-medium | x4,43 ile x4,58, ortanca x4,54 | 12 |
| Kokoro-82M ff_siwis | x0,91 ile x0,93 | 6 |
| edge-tts fr-FR-DeniseNeural | x13,10 ile x15,52 | 10 |
Kokoro ve edge-tts rakamları, bu makale için yeniden çalıştırılmayan, bir gün önce aynı makinede yapılan ölçümden devredildi. Dakika başına aritmetiğe çevrildiğinde — bir bölme işlemi, yeni bir ölçüm değil — bir dakikalık konuşma siwis ile 7,1 ile 7,4 saniye, tom ile 13,1 ile 13,5 saniye hesaplama, Kokoro ile ise 65 ile 66 saniye hesaplama maliyetine karşılık geliyordu.
Tek bir Piper sesi yaklaşık 63 MB (siwis 22.050 Hz, tom 44.100 Hz), Kokoro paketi ise kabaca 354 MB ağırlığında; bu da bir Piper sesini 5,6 kat daha hafif yapıyor — ancak yazar, bu karşılaştırmanın yalnızca tek bir Fransızca sesin yeterli olması durumunda geçerli olduğunu belirtiyor, çünkü Kokoro paketi 54 tonda geliyor ve bunlardan tam olarak biri Fransızca. Kokoro yine de daha hızlı yükleniyor: 1,04 ile 1,06 saniye, Piper için 1,71 ile 1,96 saniye karşısında. Sentezi uzak bir servise devreden edge-tts, x13,10 ile x15,52 ile hâlâ tablonun zirvesinde, ancak her cümleyi ağ üzerinden gönderiyor; Piper'ın çalışmalardaki sapması yüzde 4,5 içinde kalırken onun oranının dalgalanmasının nedeni bu. Ayrıca CPU'yu yüzde 26 ile 31 kullanımda çoğunlukla boş bırakıyor, oysa Piper ve Kokoro iki çekirdeği de doyuruyor.
Yük altında
Sentez her iki çekirdeği kullandığından yazar, bir çekirdeği başka bir süreçle meşgul ederek bir seriyi yeniden çalıştırdı. Piper'nin iş üretimi kabaca yarıya indi: siwis x4,26 ile x4,46'ya, tom x2,22 ile x2,53'e düştü. Bu bozulmuş durumda bile Piper, boşta bir makinede ölçülen Kokoro'dan 4,6 ile 4,9 kat daha hızlı kaldı — yazarın değindiği video kodlaması gibi aynı anda başka işler yapan küçük sunucular için önemli bir veri noktası.
Kontroller ve uyarılar
Sonuçlandırmadan önce yazar, ölçüm aracının kendisini test etti. ffprobe süreleri, dahili örnek sayılarıyla bir mikrosaniyenin altında eşleşti — bu zayıf bir kontrol olarak kabul ediliyor, çünkü WAV başlığı aynı sayıdan yazılıyor — ve bir WAV dosyasını bilerek kesmek ffprobe'un daha kısa süreyi raporlamasını sağladı; böylece aracın gerçek dosyaya tepki verdiği doğrulandı. Ses şiddeti analizi siwis için -16,0 dB, tom için -21,2 dB ortalama düzeyler gösterdi ve sessizlikler yalnızca cümle birleşimlerinde göründü; yani çıktı ne sessizlik ne de gürültü. Karşılaştırmanın söyleyemediği şey hangi sesin daha iyi duyulduğu; bunun için yapılmayan kör bir dinleme testi gerekirdi.
Neden önemli
Kokoro-82M popüler bir kompakt açık ağırlıklı TTS modeli, ancak x1'in altındaki gerçek zaman çarpanı GPU'suz donanımda etkileşimli kullanım için ciddi bir engel: sentez, çalmayla ayak uyduramıyor, kutuda çalışan başka herhangi bir şeye pay bırakmayı hiç saymıyor. İki çekirdekli ARM örneklerinde — ev sunucuları, edge kutuları, minik bulut VM'leri — bu karşılaştırma, Piper'ın ONNX hattını pratik seçenek olarak gösteriyor: rahatça gerçek zamanlı, ses başına 63 MB ve ağ bağımlılığı yok. edge-tts yalnızca cümle başına ağ çağrıları ve bunların değişkenliği kabul edilebilir olduğu yerde en hızlı kalıyor. En az bunun kadar değerli olan yöntemin kendisi: arşivlenmiş çalıştırılar, açıklanmış aykırı değerler ve doğrulanmış bir ölçüm aracı, yerel çıkarım iddialarını değerlendiren herkesin kopyalaması gereken standarttır.
- #text-to-speech
- #benchmarks
- #arm
- #onnx
- #open-source