deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Tek yeşil koşum az şey ifade eder: %77'lik agent başarı oranı beş koşumda %53'e düşüyor

IBM Research 24 puanlık bir tutarlılık açığı ölçtü: koşum başına görevlerin %77'sini geçen bir agent, beş koşumun yalnızca %53'ünde tümünü geçebildi; bir dev.to yazısı da bunu yakalamanın ucuz test değişikliklerini anlatıyor.

Tek yeşil koşum az şey ifade eder: %77'lik agent başarı oranı beş koşumda %53'e düşüyor

Ölçülmüş 24 puanlık bir güvenilirlik açığı

Bir AI agent'ını her vaka için yalnızca bir kez test etmek, üretim ortamındaki davranışını olduğundan iyi gösterebilir; yeni bir IBM Research makalesi bu soruna bir sayı koyuyor. Çalışmayı ele alan bir dev.to yazısına göre makale — Evelyn Duesterwald ve ekibinden Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course — GPT-4.1 üzerine kurulu bir ReAct agent'ını AppWorld benchmark'ından geçirdi ve her görevi beş kez yürüttü. Koşum başına ortalama geçme oranı %77 çıktı, ancak görevlerin yalnızca %53'ü beş denemenin tamamında başarılı oldu. Araştırmacılar bu 24 puanlık farka tutarlılık açığı diyor ve bu açığı, suçlanacak ortam gürültüsü olmayan kontrollü bir benchmark üzerinde ortaya çıktı.

Yazının yazarı aynı hata moduna dair üretimden bir anekdot ekliyor: üç gün üst üste 22 test vakasını geçen bir fatura triyaj agent'ı, aralarında prompt, model veya veri değişikliği olmadığı halde, onar dakika arayla iki kez yüklenen bir PDF'i iki farklı satıcı altında kaydetti.

Neden tek yeşil koşum kanıt değildir

Yazıya göre sıcaklık (temperature) bariz neden gibi görünür ama yanlış bir teşhistir. Sıfıra ayarlansa bile, istek toplu işlemi (batching), donanım farkları ve stabil bir adım arkasından sunulan model güncellemeleri gibi sağlayıcı tarafı etkenlerden kaynaklanan değişkenlik kalır. Daha da önemlisi, agent döngüsü küçük sapmaları büyütür: üçüncü adımda biraz farklı olan bir tool call, dördüncü adımdaki gözlemi değiştirir ve sekizinci adıma gelindiğinde agent tamamen farklı bir yörüngededir.

Makalenin yaklaşımı

Araştırmacıların katkısı teşhis değil bir çözüm. Bir Consistency Analyzer, bir göreve ait beş kayıtlı yörüngeyi karşılaştırır ve ayrıştıkları adımı tespit eder. Ardından bir Guideline Generator, o adım için kısa ve hedefli bir talimat yazıp episodic memory olarak saklar; agent benzer bir görevle karşılaştığında bu talimat devreye girer. AppWorld'de bu, beş-tamamı geçme oranını özgün görevlerde 16 puan, benzer ama önce görülmemiş görevlerde 13 puan yükseltti. Yazarlar bunu açığı kapatmak değil daraltmak olarak sunuyor; yazının yazarı da en ikna edici sayıyı görülmemiş görevlerdeki buluyor, çünkü yönergeler sabit bir görev listesine overfit edilebilir.

Framework gerektirmeyen pratik değişiklikler

Yazı, yazarın makalenin mekanizmasını benimsemeden yaptığı üç değişikliği anlatıyor:

  • Her eval vakası N kez çalışıyor ve rapor hem koşum başına oranı hem de tüm-N oranını, vaka başına tool call yollarının sayacıyla birlikte gösteriyor. Bu sayaç, ayrışan koşumların nerede bölündüğünü ortaya çıkarıyor: yazarın kararsız fatura vakalarının hepsi, bazen iki eşleşme döndüren bir satıcı sorgulamasında ayrışmıştı ve system prompt'a eklenen tek satır bunu düzeltti.

  • Tüm-N oranı müşterilere raporlanan ana sayı oluyor, koşum başına oran dipnota indiriliyor; gerekçe olarak tüm-N sayısının destek taleplerini öngören şey olduğu gösteriliyor.

  • Kararsız vakalar sürümü engelliyor. Beş koşumun dördünü geçen bir vaka, bilinen bir tekrarlanabilir hatası olan bug olarak ele alınıyor: kararsız adım ya bir kural, sorgulama veya katı filtre ile deterministik hale getiriliyor ya da yola bir insan onayı kapısı ekleniyor.

  • Dikkate değer uyarılar bölümünde değil, ancak devamla: Yazar, beş tekrarın yüksek hacimli otomasyon için az olabileceği konusunda uyarıyor; günde 400 kez çalışan ve %2 ters dönme oranına sahip bir agent hâlâ istikrarlı bir yanlış cevap akışı üretir, bu yüzden N, makaleden değil çağrı hacminden seçilmelidir. Enjekte edilen yönergelerin de bir maliyeti var: biriken kurallar context ağırlığı ekler ve hiç kararsız olmayan vakaları bozabilir; yazıya göre makale bu takası nicelleştirmiyor. Yayımlanan sayılar yalnızca GPT-4.1'i kapsıyor; yazarın Claude Sonnet 5 ile bir akşam üstünden yaptığı gayri resmi beş tekrarlı koşu, %91 koşum başına ve %79 beş-tamamı geçme oranı verdi — küçük ama aynı biçimli bir veri setinden, tek bir akşamdan gelen daha dar bir açık. İlgili bir arXiv makalesi olan AgentAudit ise soruya başka bir açıdan yaklaşıyor ve hataları belirli bir aşamaya atfetmek için planlama, tool seçimi, yürütme ve bellek boyunca tam trace'leri değerlendiriyor.

Neden önemli

Girdilerin bilinen %23'ünde başarısız olan bir sistem kenarından dolaştırılabilir; aynı girdiyi günden güne farklı ele alan bir sistem dolaşılamaz, çünkü dolaşılacak stabil bir şey yoktur. Tek koşumlu değerlendirmeler bu yüzden agent güvenilirliğini sistematik olarak abartır ve koşum başına ile tutarlı geçme oranları arasındaki açık, karar açısından daha ilgili metrik sayılabilir. Mevcut test vakaları üzerine kurulu beş tekrarlı bir harness ucuzdur ve yazının gösterdiği gibi, ortaya çıkardığı tool call ayrışma desenleri çoğu zaman doğrudan düzeltilebilir adımları işaret eder.

  • #ai-agents
  • #testing
  • #llm
  • #evaluation
  • #reliability

İlgili yazılar