deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Microsoft'un ThinkingBox'ı, yapay zeka agent'larının görevlerin yarısından azında 20 denemenin tümünü geçtiğini ortaya koydu

Veritabanı durumunu sohbet kayıtları yerine değerlendiren bir Microsoft/Hugging Face benchmark'ı, en iyi agent'ların iş süreçlerinin ancak yarısında bir görevi 20 koşunun tamamında tamamladığını, başarısızlıkların üçte ikisinde ise hiçbir hata oluşmadığını gösterdi.

Microsoft'un ThinkingBox'ı, yapay zeka agent'larının görevlerin yarısından azında 20 denemenin tümünü geçtiğini ortaya koydu

Kayıtları değil, durumu değerlendiren bir benchmark

Microsoft araştırmacıları ve Hugging Face, ThinkingBox'ın ekim sonuçlarını yayımladı. Bu benchmark tek bir tasarım tercihi üzerine kurulu: agent'ın sohbet kaydını hiç okumaz. Bunun yerine, agent başlamadan önce arka uçtaki veritabanının anlık görüntüsünü alır, agent'ın araçlarıyla işini yapmasına izin verir, ardından deterministik değerlendiriciler kullanarak son veritabanını istenen bitiş durumuyla karşılaştırır ve dokunulmaması gereken kayıtlarda yasak yan etkileri işaretler. Bir dev.to yazısına göre eşlik eden makalenin başlığı "Tek Başarı Güvenilirlik Değildir" — tüm argüman dört kelimede özetleniyor.

Benchmark; perakende, seyahat ve konaklama, oto sigortası, neobank BT ve danışmanlık BT/İK alanlarında 507 iş akışını kapsıyor — siparişleri değiştirme, sigorta talepleri oluşturma, seyahat yeniden rezervasyonu ve talep çözme gibi görevler. Araçlar MCP sunucuları olarak sunuluyor, yani Model Context Protocol konuşabilen herhangi bir agent bağlanabiliyor. Her koşu, yeni sıfırlanmış, izole bir arka uçla çalışır; böylece bir deneme bir sonrakini kirletemez ve her görev 20 kez tekrarlanır.

Sonuçlar üç şekilde raporlanıyor: ilk deneme kalitesi için pass@1, yetenek tavanı için pass@20 (yirmi denemede en az bir kez çözme) ve güvenilirlik için gözlemlenen 20/20 (her seferinde çözme).

Rakamlar

121.680 denemenin tamamında benchmark 79.853 başarısızlık kaydetti. Lider model Claude Opus 5.5, 507 görevin yalnızca 241'inde — yüzde 47,53 — 20 denemenin tümünü geçti; pass@1'de ise yüzde 66,50 elde etti. Kimi-K3 daha sert düştü: pass@1'deki yüzde 57,37'den 20/20'de yüzde 17,60'a. Hugging Face yazısı Kimi sonucunu çarpıcı biçimde ortaya koyuyor: görevlerin yüzde 93,89'unu en az bir kez çözüyor ama yalnızca yüzde 13,41'inde güvenilir. dev.to yazarı, kesin ondalıkların makale özeti ile HF gönderisi arasında biraz farklı olduğunu, ancak her bulgunun yönünün tutarlı olduğunu belirtiyor.

Alan da önemli. Perakende iş akışları ortalama yüzde 59,52 pass@1 elde ederken oto sigortası ortalama yüzde 33,83'te kaldı; yazı bunu, sigortanın daha fazla poliçe kuralı ve tam olarak doğru olması gereken daha fazla alana sahip olmasına bağlıyor — tam da bir işletmenin otomatikleştirmek isteyeceği türden bir görev.

Başarısızlıkların kaynağı

Üretimde agent çalıştıran herkes için iki bulgu öne çıkıyor.

Birincisi, başarısız denemelerin yüzde 67,24'ü hiçbir araç hatasıyla sonlanmadı. Çökme yok, döngü yok, hız limiti yok — yalnızca geçerli durum değiştiren eylemlerden sonra üretilmiş kendinden emin bir özet. Hataları ve zaman aşımlarını izleyen bir izleme sistemi bu koşuları başarılı sayardı ve hata daha sonra bir müşteriden, bir denetçiden veya bir mutabakat işinden ortaya çıkardı.

İkincisi, kök nedenler yoğun biçimde araç kullanımı etrafında kümeleniyor: başarısızlıkların yüzde 79,9'u agent'ın yanlış aracı seçmesine, şemayı yanlış okumasına veya parametreleri karıştırmasına dayanıyor. Yanlış güncellemeler yüzde 10,3, eksik çözüm yüzde 7,0 ve hiç eylem yapılmaması yüzde 2,9 pay aldı. Başarısızlık türüne göre, başarısız denemelerin yaklaşık yüzde 77,6'sı yanlış alan değerleri içeriyordu, yüzde 43'ü istenmeyen yan etkilere yol açtı ve yüzde 25'i zorunlu değişiklikleri kaçırdı — bir deneme birden fazla şekilde başarısız olabileceği için bu kategoriler örtüşüyor.

Yazı ayrıca güvenilir görev başına maliyeti GPT-5.4 için yaklaşık 6,80 dolar, GPT-6 Astra için 7,45 dolar ve Claude Opus 5.5 için 7,80 dolar olarak tahmin ediyor ve daha fazla yeniden denemeye veya insan müdahalesine ihtiyaç duyan daha ucuz bir modelin, token başına fiyatının ima ettiğinden daha pahalıya mal olabileceğini savunuyor.

Uyarılar

dev.to gönderisi sınırlar hakkında açık konuşuyor. 507 iş akışı iyi tasarlanmış ama gerçek sistemlerin sentetik alternatifleri; tüm sonuçlar tek bir agent ortamından geliyor ve deterministik değerlendiriciler, birinin elle yazdığı bitiş durumları kadar iyi. Microsoft, framework'ü MIT lisansıyla GitHub'da yayımladı ve veri setini Hugging Face'e koydu; yazarlar başkalarını yalnızca liderlik tablosunu okumak yerine yöntemi yeniden kullanmaya teşvik ediyor.

Neden önemli

Benchmark, bir agent'ın iyi bir günde yapabildiğiyle her seferinde yaptığı şey arasındaki farkı nicelleştiriyor ve bu fark, agent'lı yapay zeka için asıl benimseme sorusu. Demolar tek koşudur; iade, rezervasyon ve sigorta ödemesi gibi üretim iş akışlarının tekrar tekrar başarılı olması gerekir ve pass@1 onlar için verilebilecek sözü sistematik olarak abartır. Başarısızlıkların üçte ikisi sessiz olduğundan, hata oranı panoları onları yakalayamaz — yalnızca bitiş durumu kontrolleri yakalayabilir; bu da yazma erişimi olan her agent için üretim izlemesine mutabakat tarzı doğrulama eklenmesini destekliyor. Ve kök nedenlerin yüzde 79,9'u araç kullanımından kaynaklandığına göre, araç şemalarını, açıklamalarını ve parametre adlandırmalarını keskinleştirmek, model değiştirmekten daha etkili bir güvenilirlik düzeltmesi olabilir.

  • #ai-agents
  • #benchmarks
  • #mcp
  • #reliability
  • #microsoft
  • #hugging-face

İlgili yazılar