deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

OpenRouter, model API'sine ElevenLabs konuşmadan metne ve metinden konuşmaya özelliklerini ekledi

OpenRouter'ın 7 Ekim'deki lansmanı, ElevenLabs transkripsiyon ve konuşma sentezini LLM kataloğunun yanına tek bir API altında taşıyarak ses özelliklerini basitleştiriyor — ancak yalnızca dosya tabanlı ses için.

OpenRouter, model API'sine ElevenLabs konuşmadan metne ve metinden konuşmaya özelliklerini ekledi

Ne lansman edildi

Birçok dil modelinin önünde tek bir API olarak bilinen OpenRouter, kataloğuna ElevenLabs ses modellerini ekledi. 7 Ekim lansmanını ele alan bir dev.to makalesine göre uygulamalar, artık OpenRouter üzerinden eriştikleri chat modellerinin yanı sıra ElevenLabs konuşmadan metne ve metinden konuşmaya endpoint'lerini de çağırabiliyor; bu da zaten trafiğini oraya gönderen ekipler için yönlendirme ve faturalandırmayı basitleştirebilir.

Eklemeler dokuz ElevenLabs metinden konuşmaya modeli ile iki konuşmadan metne modelini kapsıyor. dev.to anlatımı, bunlardan üçünü ana yapı taşları olarak öne çıkarıyor: transkripsiyon için elevenlabs/scribe-v2, daha düşük gecikmeli sözlü yanıtlar için elevenlabs/eleven-v4-turbo ve daha ifade dolu anlatım için elevenlabs/eleven-v4. Makalenin aktardığı duyuruya göre v4 Turbo, gerçek zamanlı tarzı kullanımlar için konumlandırılmış ve karakter başına fiyatı v4'ün yarısı kadar.

Önemli bir sınır var: bu gerçek zamanlı bir ses bağlantısı değil. Lansmanda Scribe v2'nin WebSocket üzerinden bir streaming sürümü bulunmuyor. Endpoint'ler ses dosyalarını istek/yanıt deseninde işliyor; bu nedenle sürekli ileri geri ses akışı, farklı bir gerçek zamanlı yol gerektiren ayrı bir ürün sorunu olmaya devam ediyor.

Endpoint'ler nasıl çalışır

Transkripsiyon, base64 ile kodlanmış ses ve açık bir kaynak formatı içeren JSON girişini ya da file, model ve response-format alanlarını taşıyan multipart yükleme yöntemini kabul ediyor — bu iki biçim alternatiftir ve seçim, bir istemcinin sesi nasıl sakladığına veya yüklediğine bağlıdır. Yüklenen ses 25 MB ile sınırlıdır; makale bunun kabaca 27 dakikalık 128 kbps MP3'u kapsadığını belirtiyor, ancak istekler yine de 180 saniye sonra upstream tarafında zaman aşımına uğrayabilir. Pratik tavsiye, uygulama düzeyinde daha sıkı boyut ve süre sınırları uygulamak, API anahtarlarını sunucuda tutmak ve istemcilerin OpenRouter'ı doğrudan çağurmak yerine kimlik doğrulamalı bir uygulama endpoint'ine yükleme yapmasını sağlamaktır.

Scribe v2 bir transkript döndürüyor ve ayrıca kelime zaman damgaları, konuşmacı etiketleri ve ses olayı etiketleri sağlayabiliyor. Yanıtları, ses saniyelerini ve dolar maliyetini raporlayan bir usage nesnesi içeriyor. Çok konuşmacılı kayıtlar için anlatım, kelime düzeyinde zaman damgalarıyla verbose_ istemeyi ve diarization'ı etkinleştirmeyi, isteğe bağlı olarak bilinen konuşmacı sayısını geçmeyi gösteriyor.

Çıkış tarafında speech endpoint'i metin, model ve ses (voice) alıyor. response_format'ı mp3 olarak ayarlamak, çoğu tarayıcı ve mobil oynatıcının açabileceği 44.1 kHz, 128 kbps ses üretir; alanı atlamak ise 24 kHz'de ham 16-bit little-endian mono PCM döndürür — indirilebilir bir yanıttan çok özel bir ses hattına daha uygundur. Eleven v4 Turbo'nun hız kontrolü yoktur ve varsayılan olmayan hız ayarlarını reddeder; desteklenen teslim etiketleri mevcuttur, ancak etiketler modele gönderilen metin olduğundan faturalandırmaya dahil edilir.

Tek değil, iki maliyet sayacı

Hattın iki tarafı farklı birimlerle faturalandırılıyor: transkripsiyon ses süresine göre, konuşma ise Unicode kod noktası olarak sayılan, etiketler dahil giriş karakterlerine göre. Bu sayaçlar pratikte birbirinden ayrışır. Kısa bir komut duraksamalarla dolu uzun bir kaydın içinde olabilir ve kısa bir soru uzun bir sözlü yanıtı tetikleyebilir. dev.to makalesi, iki tarafı ayrı ayrı izlemeyi, transkripsiyon maliyetini tek bir karışımlı ortalama yerine ürünle eşleşen süre bantlarına göre özetlemeyi ve sağlayıcı panolarının gerçek kullanımı gizlememesi için başarısız, yeniden denenen ve yarım bırakılan istekleri ürün metriklerine kaydetmeyi öneriyor.

Ayrıca, bitiş zamanı 19 Ekim 2026 Pasifik Saatiyle sabah 8 olarak belirtilen geçici bir lansman indirimi de tarif ediliyor. Makale bunu kalıcı bir fiyat değil, tarihli bir promosyon olarak ele alıyor ve aylık harcamayı projeksiyonlamadan önce canlı fiyatları yeniden kontrol etmeyi tavsiye ediyor.

Etiketler ve gecikme dikkatle incelenmeli

Konuşmacı etiketleri model çıktısıdır, doğrulanmış kimlik değil. Bir speaker_0 etiketi isimli bir kişi olarak gösterilmemelir; bir uygulamanın konuşmacıları isimlendirmesi gerekiyorsa, bu eşleştirme açık ve kullanıcı tarafından onaylanan bir adımdan geçmelidir. Makale ayrıca testi gerçek koşulları yansıtan seslerle — aksanlar, ortam gürültüsü, mikrofonlar, kelime dağarcığı — yapmayı ve ortalama kelime hata puanları yerine niyeti değiştiren hataları, örneğin "can" ile "can't" karışması veya yanlış bir tarih gibi, önceliklendirmeyi vurguluyor.

Gecikme de ölçümü hak ediyor. Yol bir seri hattır — yükleme, transkripsiyon, chat yanıtı üretme, konuşma sentezleme — ve her aşama gecikme ekler; bu yüzden bir şeye "konuşma tarzı" demeden önce uçtan uca zamanlama kontrol edilmelidir.

Neden önemli

Zaten LLM çağrılarını OpenRouter üzerinden yönlendiren uygulamalar için ses girişi ve çıkışı artık aynı API anahtarı ve faturalandırma hesabının arkasında yaşayabilir; bu, ses özelliklerinden bir entegrasyon yükü katmanını kaldırır. Kapsam ise uyarı niteliğinde: bu lansman kayıtlı sesi ele alıyor, canlı oturumları değil; bu yüzden gerçek anlamda gerçek zamanlı ürünler hâlâ başka bir yola ihtiyaç duyuyor. Ve maliyetler bir tarafta ses saniyeleri, diğer tarafta karakterlerle ölüldüğünden, ekipler ses harcamasını tek bir "ses kullanımı" rakamına indirgemek yerine özellik bazında modellemelidir.

  • #openrouter
  • #elevenlabs
  • #speech-to-text
  • #text-to-speech
  • #ai-api