· kaynak dev.to (home feed)
ServiceNow AI, 3 alan boyunca 213 voice-agent senaryosu içeren EVA-Bench Data 2.0'ı açık kaynak yaptı
ServiceNow AI, havayolu, ITSM ve sağlık HRSD alanlarını kapsayan, 121 tool ve 213 test senaryosu içeren kurumsal voice agent'lar için açık bir benchmark olan EVA-Bench Data 2.0'ı yayımladı.

ServiceNow AI, EVA-Bench Data 2.0'ı yayımladı
ServiceNow AI'nın araştırma ekibi, kurumsal sesli ortamlarda AI agent'larını test etmek için tasarlanmış açık bir benchmark olan EVA-Bench Data 2.0'ı yayımladı. ServiceNow AI'nın Hugging Face blogundaki bir yazısını özetleyen JudyAI Lab'ın dev.to üzerindeki değerlendirmesine göre güncelleme, benchmark'ı tek alandan üçe çıkarıyor; toplamda 213 değerlendirme senaryosu ve 121 tool içeriyor — bu, önceki sürümün yaklaşık dört katı bir büyüklük.
Alanlar havayolu müşteri hizmetleri yönetimi (CSM), kurumsal IT hizmet yönetimi (ITSM) ve sağlık insan kaynakları hizmet sunumu (HRSD). Değerlendirmeye göre senaryoların dağılımı şöyle: havayolu için 50, ITSM için 80 ve sağlık HRSD için 83 senaryo.
Gerçek destek işinden türetilmiş senaryolar
Açıklanan tasarım vurgusu gerçekçilik. Değerlendirmeye göre her senaryo test için uydurulmak yerine gerçek telefonla destek iş akışlarından elendi ve tool şemaları production API spesifikasyonlarını birebir yansıtıyor. Amaç, agent'ları bir destek hattında gerçekte alacakları türden isteklere göre ölçmek.
Sağlık HRSD alanı düzenleyici ayrıntılara en derinlemesine inen alan; NPI sağlayıcı tanımlayıcıları, FMLA aile izni kuralları ve sigorta kapsamı koşulları gibi ABD sağlık sistemi ayrıntılarına senaryoları bağlıyor. Değerlendirme, bu yoğunluktaki iş detayının, düzenlenmiş bir alanda sistemleri anlamlı biçimde ayırt edebilmek için bir değerlendirmenin ihtiyaç duyduğu şey olduğunu belirtiyor.
Çözülebilirlik üç model üzerinde doğrulandı
Yayımlanmadan önce 213 senaryonun tamamı, her görevin çözülebilir olduğunu doğrulamak amacıyla üç frontier modelle — OpenAI'nin GPT-5.4'ü, Google'ın Gemini 3.1 Pro'su ve Anthropic'in Claude Opus 4.6'sı — kontrol edildi. Değerlendirme, bu çoklu model kontrolünü, benchmark'ı zorlayıcı tutarken tek bir model ailesini kayırmasının önüne geçmenin bir yolu olarak sunuyor.
Açık veri, şimdilik yalnızca İngilizce
Üç veri kümesinin tamamı tamamen açık kaynak ve Hugging Face Datasets üzerinden doğrudan yüklenebilir. Değerlendirme, tasarım ilkelerinin ve senaryo üretim sürecinin özgün yazıda belgelendiğini ekliyor; bu da yayını, kendi değerlendirme setlerini kuran ekipler için bir başvuru kaynağı haline getiriyor. Benchmark şu anda yalnızca İngilizce ve bu durum kurumsal odağını yansıtıyor; ekip bu sınırı aşmak için çok dilli bir genişletme duyurdu.
Neden önemli
Ses, kurumsal agent'lar için hızla standart bir arayüz haline geliyor; ancak bu agent'ların gerçek destek işinde nasıl performans gösterdiğine dair yaygın olarak benimsenmiş bir ölçüt hâlâ yok. Gerçek çağrı merkezi iş akışlarına bağlanan ve tool şemaları production API'lerinden kopyalanan bir benchmark, değerlendirmeyi soyut model yeteneği yerine production davranışını öngörmeye yaklaştırıyor.
Bir eval veri kümesi oluşturan herkes için ödünç alınmaya değer iki tasarım tercihi var. Model yetenekleri listesinden ileriye değil, iş akışlarından geriye doğru çalışmak, dağıtımda ortaya çıkan boşlukları görünür kılmaya daha çok eğilimlidir. Üç farklı satıcının modelleri arasında çözülebilirliği doğrulamak ise benchmark'ın sessizce birini kayırmasına karşı korur. Veri, şemalar ve üretim hattının tamamı halka açık olduğundan EVA-Bench Data 2.0 hem bir ölçüm aracı hem de kurumsal değerlendirme tasarımı için bir şablon olarak işlev görüyor.
- #ai-agents
- #benchmark
- #open-source
- #voice-ai
- #servicenow