deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Realtime-Venus, tam çift yönlü tasarımıyla video ve konuşma alanında en iyi skorları elde etti

9 milyar parametreli bir audio-visual model ile专用 bir konuşma modelinin birleşimi, sekiz video benchmark'ından altısında ve dört konuşma görevinde lider konumda; model, kullanıcı sözünü kestiği kesintilerin yüzde 75'inde diyaloğu sürdürüyor.

Realtime-Venus, tam çift yönlü tasarımıyla video ve konuşma alanında en iyi skorları elde etti

dev.to üzerinde yayımlanan bir yazıya göre, yakın zamanda bir makalede tanımlanan tam çift yönlü (full-duplex) multimodal ajan Realtime-Venus, birkaç video anlama ve konuşmalı diyalog benchmark'ında yeni zirve skorları belirledi. Sistem, 9 milyar parametreli bir audio-visual modeli专用 bir konuşma modeliyle birleştiriyor, konuşmayı doğal olarak üretiyor ve arka plan süreçlerine devredilen tool call'lar sayesinde hesaplama konuşmayı duraklatmıyor.

Önceki ajanlardan farkı

dev.to yazısı, bu çalışmayı Gemini 3.1 Live ve GPT-4o gibi sistemlerle karşılaştırıyor; bu sistemleri tek bir modda güçlü performans sergilemekle birlikte ses ve görüntü akışlarında akıcı, eşzamanlı etkileşim kuramamakla eleştiriyor. Yazıya göre önceki multimodal ajanların çoğu yarı çift yönlü çalışıyordu — dinliyor ya da konuşuyordu, asla ikisini aynı anda yapmıyordu — ya da arka planda işlem yaparken diyaloğu donduran sonradan akıl yürütme hatlarına dayanıyordu. Realtime-Venus ise konuşurken girdilerini kesintisiz algılıyor.

Benchmark sonuçları

İki varyant değerlendirildi. Video yetenekli model Realtime-Venus-Omni, karşılaştırılan çevrimiçi modeller arasında sekiz video benchmark'ından altısında en yüksek skorları elde etti; StreamingBench'te yüzde 70,2, OVO-Bench'te yüzde 64,7 ve Daily-Omni'de yüzde 81,3 dahil olmak üzere çeşitli akış senaryolarında önceki çevrimiçi baselines'lara karşı istikrarlı bir üstünlük sergiledi.

Konışma odaklı varyant Realtime-Venus-Audio ise sekiz ses anlama ve konuşmalı soru cevaplama benchmark'ından dört görevde karşılaştırılan modeller arasında liderdi: MMAU'da yüzde 78,0, MMAU-Pro'da yüzde 63,2, Llama Questions'da yüzde 83,8 ve Speech CMMLU'da yüzde 67,8. Ayrıca karşılaştırılan sistemler arasında en iyi VoiceBench AlpacaEval skoruna, 4,81 ile ulaştı. Yazıya göre bu rakamlar bir arada değerlendirildiğinde, yalnızca algılayan modeller ile bir diyaloğun kendi tarafını da sürdürmek zorunda olan ajanlar arasındaki uçurum daralıyor.

Kesintilerle başa çıkma

Full-Duplex-Bench v1.5'te Realtime-Venus-Audio, kullanıcı kesintilerinin yüzde 75'ine yanıt verdi ve devam etme oranlarını backchannel durumunda yüzde 97, sahnede başkalarıyla konuşulduğunda yüzde 88 ve arka planda konuşma varken yüzde 86 seviyesinde tuttu — yazıya göre üç devam etme metriğinde de Gemini 3.1 Live ve GPT-4o'yu geride bıraktı. Bunun sonucu, kullanıcı sistemle aynı anda konuşsa bile diyaloğun tutarlı kalması; bu durum, sıra temelli hatlar üzerine kurulu sesli ajanlar için tarihsel olarak zayıf bir nokta olagelmiştir.

Henüz test edilmeyenler

Değerlendirme yalnızca kontrollü benchmark ortamlarındaki 9B checkpoint'lerini kapsadı. Yazı, daha büyük modellere ölçeklenme, gerçek dünya ağ değişkenliği altındaki gecikme süresi ve eğitim dağılımından uzak görsel sahnelerle karşılaşıldığındaki sağlamlık konusunda açık sorulara dikkat çekiyor. Ayrıca asenkron tool devrinin harici API'ler yavaş ya da öngörülemeyen biçimde yanıt verdiğinde nasıl davrandığını ve mimarinin avantajlarının yüz milyar parametrelik ölçekte varlığını sürdürüp sürdüremeyeceğini soruyor.

Neden önemli

Multimodal ajanlar için çoğu benchmark seti, kesintilere uğrayıp yola devam etme yeteneğini değil sıra temelli doğruluğu ölçüyor. Realtime-Venus'un rakamları üretim ortamında da tutarsa, değerlendirme uygulamalarının tam çift yönlü kesinti yönetimini — bir sistemin bir araya girmeye ne sıklıkla tepki verdiği ve ardından tutarlı biçimde devam edip edemediği — sonradan akla gelen bir kriter değil, temel bir ölçüt olarak ele alması gerekecek. Aksi takdirde gerçek zamanlı ses ve video ajanlarındaki ilerleme, kullanıcıların en çok fark ettiği özellik tartışılır bir biçimde diyaloğun sürekliliği olurken, bunu gözden kaçıran vekil ölçümlerle değerlendirilme riski taşıyor.

  • #multimodal-ai
  • #speech-models
  • #video-understanding
  • #benchmarks
  • #conversational-ai