· kaynak dev.to (home feed)
Real-SWE benchmark'ı: daha uzun agent runtime'ları neredeyse hiç yardımcı olmuyor ve harness modeli gizliyor
Specific Labs'ın Real-SWE benchmark'ı, kodlama agent'larını lisanslı, özel kurumsal kod tabanlarında test ediyor. İki çıkarım: daha uzun rollout'lar çözüm oranını neredeyse hiç artırmıyor ve Codex CLI gibi harness isimleri modele bağlı büyük farkları gözden saklıyor.

Specific Labs, kodlama agent'larını — faturalandırma sistemleri, vergi mantığı ve çok servisli entegrasyonlar gibi — çoğu yazılım mühendisliği benchmark'ının dayandığı herkese açık depolar yerine lisanslı, özel kurumsal kod tabanlarında değerlendiren Real-SWE benchmark'ını yayımladı. dev.to'da yayımlanan bir çift analize göre, leaderboard'dan iki bulgu öne çıkıyor: bir agent'a daha fazla süre vermek bir görevi çözüp çözmeyeceğini neredeyse hiç değiştirmiyor ve bir modelin çalıştığı CLI harness'i, işi aslında hangi modelin ve ne kadar yetenekli bir modelin yaptığını gizleyebiliyor.
Daha fazla dakika, aşağı yukarı aynı sonuçlar
Süre verisi şaşırtıcı derecede düz. dev.to analizine göre, on dakikanın altında biten rollout'ların yüzde 71,4'ü başarısız olurken, on dakika veya daha uzun süren rollout'ların yüzde 73,4'ü de başarısız olmuş. Genel geçiş oranları runtime'dan bağımsız olarak yüzde 27–29'luk dar bir bantta yer alıyor; yani bir rollout'u birkaç dakikadan çok daha uzun bir oturuma uzatmak sonucu kabaca iki yüzde puanı kaydırıyor — analiz bunu gürültü olarak nitelendiriyor.
Önerilen açıklama şu: hızlı, yüzeysel görevler çabuk çözülüyor ve bu da kısa rollout'larda yüksek verim izlenimi yaratıyor. Gerçek bordro, vergi ve entegrasyon kodunun derinlerine gömülü iş ise bilişimsel değil yapısal sınırlara takılıyor. Agent compute bütçesini tüketmiyor; anlayış ya da bağlam eksikliği yaşıyor ya da harness ona kullanılabilir bir giriş noktası hiç sunmuyor. Ekstra yeniden deneme turları bunların hiçbirini çözmüyor.
Aynı harness, çok farklı skorlar
Leaderboard ayrıca harness isimlerini dikkatli okumayı gerektirdiğini gösteriyor. Real-SWE, Codex CLI üzerinde GPT-6 Astra'yı yüzde 33,8 çözüm oranıyla, GPT-5.6 Sol'u ise yüzde 16,2 ile listeliyor — tek bir sağlayıcının CLI'sı, tek bir benchmark ve iki sayı arasında iki kattan fazla fark. Aynı açıklık Claude Code altında da görülüyor: Fable 5.1 yüzde 38,8'e ulaşırken GLM 5.3 yüzde 28,8'de kalıyor; tek bir harness isminin arkasında on puanlık fark.
dev.to analizine göre Real-SWE her sonucu yalıtılmış bir model yerine model-artı-harness kombinasyonu olarak sunuyor; yazar bu yaklaşımı çoğu leaderboard'dan daha dürüst buluyor, çünkü sağlayıcılar kendi araçları altında elde edilmiş düşük bir skoru nadiren yayımlıyor. Pratik sonuç şu: "Codex CLI" ya da "Claude Code"a atfedilen bir sayı çifti tanımlıyor, ürünü değil. Sabit bir harness içindeki modeli değiştirmek sonuçtaki en büyük kaldıraç ve bu kaldıraç, bu araçların pazarlanış biçiminde büyük ölçüde görünmez.
Lider bile çoğu kurumsal görevi başarısız ediyor
Tablodaki en üst konfigürasyon olan Claude Code ile eşleşmiş Fable 5.1 görevlerin yüzde 38,8'ini çözüyor; Codex CLI üzerindeki GPT-6 Astra yüzde 33,8 ile hemen arkasında. Yani en iyi performans gösteren çift bile özel kurumsal görevlerin kabaca onda altısını başarısız kılıyor — cilalı sağlayıcı demolarının genellikle atladığı türden bir açık.
Neden önemli
Kodlama agent'ı arayan ekipler için, bir ekibin belirli bir CLI kullandığını bilmek, edindikleri agent'ın yeteneği hakkında neredeyse hiçbir şey söylemiyor; içinde çalışan model sonucu domine ediyor. Bir sağlayıcı size bir geçiş oranı gösterdiğinde, sayının arkasındaki iki bileşeni — modeli ve harness'i, onun kuralları, bağlam yönetimi, araç döngüsü ve jürisiyle birlikte — belirleyin ve rakamın hangi görev diliminden geldiğini sorun. Hızlı, yüzeysel işleri bitirdiği için güçlü görünen bir model, tam da çözülmesini istediğiniz daha zor seti gizliyor olabilir. dev.to yazıları ayrıca scaffold'u sabitlemeden yalın model isimleri yayımlayan leaderboard'ların anlamsız karşılaştırmalara davetiye çıkardığı ve scaffold'u değiştirmenin skoru, reasoning eforunu artırmaktan daha çok oynatabileceği uyarısını yapıyor. Bir sağlayıcı bir benchmark sayısını hangi modelin ürettiğini söylemiyorsa, bu eksikliği bir ayrıntı değil uyarı işareti olarak değerlendirin.
- #benchmark
- #coding-agents
- #llm
- #enterprise-software
- #evaluation