deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Real-SWE benchmark'ı: En iyi coding agent kurumsal görevlerin yüzde 38,8'inde başarı gösteriyor

Specific Labs'ın özel kurumsal kod tabanlarında uç model ajanları test eden Real-SWE benchmark'ı, en iyi kurulumun görevlerin yalnızca yüzde 38,8'ini çözebildiğini gösteriyor — bu başarısızlık oranı, insan inceleme yükünü doğrudan belirliyor.

Real-SWE benchmark'ı: En iyi coding agent kurumsal görevlerin yüzde 38,8'inde başarı gösteriyor

Real-SWE neyi ölçüyor

dev.to'da yayımlanan bir yazıya göre Specific Labs, Eylül 2026'da Real-SWE'yi yayımladı; bu benchmark, uç coding agent'larını çoğu değerlendirmenin odaklandığı herkese açık depolar yerine özel, lisanslı kurumsal kod tabanlarında değerlendiriyor. Görevler gerçek üretim çalışmalarını modelleyecek şekilde tasarlandı — faturalandırma mantığı, vergi işlemleri ve birden fazla servise yayılan migration değişiklikleri — ve puanlama, görev başına sekiz çalıştırmanın ortalaması alınarak pass@1 üzerinden yapılıyor.

Yazıya göre ölçek önemli bir ayrıştırıcı: Real-SWE görevlerinin referans çözümleri medyan olarak 11 dosyayı değiştirirken, bu sayı hem FrontierCode hem de DeepSWE için altı — bu da herkese açık benchmark'ların genellikle yakalayamadığı, daha geniş ve birbirine daha çok geçmiş değişikliklere işaret ediyor.

Agent'lar nasıl puan aldı

dev.to yazısına göre en güçlü model ve harness eşleşmesi görevlerin yüzde 38,8'ini çözerken, diğer tüm konfigürasyonlar daha düşük kaldı ve en zayıf yüzde 16,2'de kaldı. Terse çevirirsek, en iyi performansı gösteren kurulum bile yaklaşık on görevden altısında hatalı sonuç üretiyor ve geri kalanlar daha sık başarısız oluyor.

İnceleme yükü nereye binecek

Yazarın ana argümanı şu: İnceleme yükünü belirleyen, pull request uzunluğu değil, bu başarısızlık oranıdır. Bir değişiklik üretmek dakikalar sürebilir; ancak o değişikliğin doğru olup olmadığını — dokunduğu düzine dosya boyunca davranışın korunup korunmadığını — değerlendirmek hâlâ sistemi bilen bir insana bağlı. Öncü kurulum yaklaşık yüzde 60 oranında yanılıyor; dolayısıyla agent çıktılarının çoğu düzeltme gerektiriyor ve düzeltmeler bedelsiz değil. Bu dinamiği, kod daha hızlı gelse bile toplam inceleme süresinin neden tırmanabildiğini açıklıyor.

Önerilen iş akışı ayarlamaları

Yazı, rakamlardan iki pratik öneri çıkarıyor.

Birincisi, agent tarafından üretilen pull request'leri neredeyse bitmiş çalışmalar değil, taslak olarak ele alın. Bir taslağı incelemek, agent'ın asla yapmaması gereken varsayımları aktif olarak avlamak demektir; tamamlanmış olarak sunulan bir şeyi incelemek ise bu titizliği atlamaya davet eder.

İkincisi, kabul oranlarını her agent ve kod tabanının her bölgesi için ayrı ayrı izleyin, sonra inceleme derinliğini bu rakamlara göre ayarlayın. Tutarlı biçimde düşük başarı oranı gösteren alanlar, çabayı her gelen değişikliğe eşit yaymak yerine inceleyicinin dikkatinin yoğunlaşması gereken yerlerdir. Yazara göre inceleyici saatlerinin nerede tükeneceğini tahmin etmede kod tabanının yapısı, ham pull request hacminden daha önemli.

Neden önemli

Herkese açık depolar üzerine kurulu benchmark'lar, gerçek kurumsal değişikliklerin boyutunu ve birbirine bağlılığını nadiren yansıttıkları için coding agent'larını olduğundan iyi gösterme eğiliminde. Real-SWE, referans çözümleri neredeyse iki kat fazla dosyaya dokunan lisanslı özel kod tabanlarında çalışarak daha sert ve daha gerçekçi bir başarı oranı sunuyor — ve en iyi kurulum için yüzde 38,8'lik bu oran, otomasyonun henüz emmediği doğrulama işini nicelleştiriyor.

Agent'ları benimseyen ekipler genellikle darboğazın prompting'e veya orchestration'a kaydığını varsayar. Bu veri, darboğazın merge öncesinde hatalı değişikliklerin çoğunu yakalamak zorunda olan kıdemli inceleyicilere kaydığını gösteriyor. Benchmark'ın değeri, modelleri sıralamaktan çok bir maliyeti boyutlandırmakla ilgili: her agent üretimi değişikliğe bağlı insan inceleme yükü. Kapasite planlayan mühendislik liderleri için, bu tek başarısızlık oranı rakamı herhangi bir leaderboard sıralamasından daha önemli olabilir.

  • #ai
  • #code-review
  • #benchmarks
  • #developer-tools
  • #machine-learning

İlgili yazılar