· kaynak TechCrunch
ElevenLabs v4 ve v4 Turbo, üst üste bindirilebilir ifade etiketleri, 90'tan fazla dil ve daha düşük gecikme süresi getiriyor
ElevenLabs, en yeni konuşma modelleri olan v4 ve v4 Turbo'yu yayınladı; modeller 10 saniyelik ses klonlama, genişletilebilir ifade etiketleri ve 90'dan fazla dil desteği sunarken, gecikme süresindeki azaltmalar ses ajanlarına yönelik.

Ne yayınlandı
ElevenLabs pazartesi günü iki yeni konuşma modeli tanıttı: ElevenLabs v4 ve v4 Turbo, diye bildiriyor TechCrunch. Bu sürüm, geçen yıl piyasaya çıkan ve bu yıl başında Varşova'daki bir etkinlikte duyurulan şirketin v3 modelinin ardından geliyor. Öne çıkan iyileştirmeler arasında ses ifadesi üzerinde daha ayrıntılı kontrol, sohbet ajanlarına yönelik azaltılmış gecikme süresi ve desteklenen dil sayısının 70 civarından 90'ın üzerine çıkması yer alıyor.
v4 nesli, şirketin hem daha ince kontrol hem de daha hızlı ses klonlama sunduğunu söylediği yeniden tasarlanmış bir mimari üzerinde çalışıyor. TechCrunch'a göre kullanıcılar artık yalnızca 10 saniyelik bir sesle bir sesi klonlayabiliyor.
İfade kontrolü ve uzun metinler
Yaratıcı tarafta yeni model, konuşma sentezinde yaygın bir zayıf nokta olan uzun metinler boyunca tutarlı bir ses kimliği korumak üzere tasarlandı. Ayrıca çevresindeki bağlamın farkında olarak okuyor ve tek düze bir ton uygulamak yerine, sunuşunu metnin gerçekte söylediğine uyacak şekilde değiştiriyor.
İş akışındaki en büyük değişiklik ifadenin yönlendirilme biçiminde. ElevenLabs v3 ile sunuşu yönlendirmek için satır içi etiketler getirmişti ve v4 bu sistemi genişletiyor: kullanıcılar artık birden fazla etiketi üst üste bindirebiliyor ve model, etiketlerin göründükleri sıraya uyuyor. Bu, içerik üreticilerinin sesi defalarca yeniden üretmeden, tek bir pasaj içinde fısıltıdan aciliyete geçmek gibi daha katmanlı performanslar senaryolaştırabilmesini sağlamalı.
Diller konusunda şirket, TechCrunch'a en belirgin kalite kazanımlarının Japonca, Brezilya Portekizcesi, Mandarin ve Kantonca'da elde edildiğini söyledi.
Ses ajanları için tasarlandı
Sunumun büyük bir kısmı kurumsal arama senaryosuna odaklanıyor; ElevenLabs'a göre bu iş, şirketin gelirinin %55'inden fazlası artık büyük şirketlerden gelirken, son bir yılda hızla büyümüş. Bu kullanım senaryosu için v4, gecikme süresini düşürerek sohbetlerin daha doğal hissettirmesini sağlıyor ve tam yanıtın üretilmesi beklenmek yerine, temel alınan dil modeli yanıtını üretmeye başlar başlamaz ses üretebiliyor.
TechCrunch ayrıca modelin gergin anları farklı biçimde ele aldığını bildiriyor: model, karşılıklı gerilim anları, tırmanan tartışmalar ve bekleme talepleriyle, aramalarda sorunların çözülme biçimini iyileştirmeyi amaçlayan şekilde başa çıkacak şekilde ayarlanmış — ajan sohbetlerinin her zaman sorunsuz gitmediği gerçeğine bir gönderme.
Kalabalık ve iyi fonlanan bir alan
Bu lansman yoğunlaşan rekabet ortamında geldi. Cartesia, Deepgram, Fish Audio, Boson ve WellSaid Labs gibi girişimler etkileyici konuşma modelleri geliştirirken, Google ve OpenAI gibi daha büyük oyuncular da kendi ses çözümlerini geliştirmeye devam ediyor.
Buna rağmen ElevenLabs'ın ticari konumu güçlü görünüyor. Şirket bu yılın başında Sequoia liderliğinde 11 milyar dolarlık bir değerlemeyle 500 milyon dolar topladı ve TechCrunch, onu 22 milyar dolar değerleyecek bir sonraki tur söylentilerini bildiriyor. Yıllıklaştırılmış gelir koşu hızının bildirildiğine göre yıl başındaki kabaca 330 milyon dolardan 600 milyon doların üzerine çıktı ve çalışan sayısı, Hindistan, Avrupa ve Brezilya'daki işe alımlarla 800'ü geçti. TechCrunch ile yakın tarihli bir röportajda şirket kurucu ortağı ve CEO'su Mati Staniszewski, şirketin "önümüzdeki yıllarda" bir hedefine sahip olduğunu, ancak bir zaman çizelgesine bağlı kalmadığını söyledi.
Neden önemli
Ses, hızla yapay zeka ajanları için birincil arayüz haline geliyor ve rekabet artık yalnızca anlaşılırlıkla ilgili değil. Farklılaştırıcı unsurlar artık gecikme süresi, duygusal aralık ve gerçek sohbet baskısı altındaki güvenilirlik — ElevenLabs'ın v4'ü tam da buna yönelttiği nokta: LLM'nin çıktısıyla paralel akan ses, üst üste bindirilen ifade yönergeleri ve zorlu müşteri anlarıyla başa çıkma, hepsi ana savaş alanının canlı ajan aramaları olduğuna işaret ediyor.
Dil genişlemesi de aynı nedenden önemli. Kurumsal dağıtımlar küresel ve Japonca, Mandarin ile Portekizce'deki önemli kazanımlar, modeli önceki nesillerin geride kaldığı pazarlarda kullanılabilir hale getiriyor. Şirketin bildirilen gelir büyümesi ve IPO hedefleriyle birlikte bu sürüm, bir demo kalitesinde gösteri hilesinden çok, iyi fonlanmış girişimlerin ve en büyük yapay zeka laboratuvarlarının önünde ses tabanlı yapay zekanın altyapı katmanını ele geçirmekle ilgili.
- #ai
- #text-to-speech
- #voice-agents
- #elevenlabs
- #speech-synthesis