deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor

arXiv'de yayımlanan yeni bir benchmark, insanlar tarafından gözden geçirilmiş güncel çok dosyalı refactoring görevlerinden oluşturuldu ve en iyi frontier modelin skorunu yüzde 41,2'ye düşürürken, açık ağırlıklı bir model çok daha düşük maliyetle beş puan yaklaşıyor.

SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor

Neden eski skorlar bu kadar iyiydi

arXiv'de yayımlanan bir makale, büyük ölçekli, çok dosyalı ve çok dilli refactoring işleri etrafında kurulan SWE-Bench ProMax adlı bir benchmark tanıtıyor; ve ürettiği skorlar, satıcıların duyurduğu rakamların çok altında kalıyor. Makalenin dev.to'daki analizine göre, test edilen en güçlü model GPT-5.2 görevlerin yalnızca yüzde 41,2'sini çözebiliyor — bu, SWE-bench Verified gibi benchmark'larda dolaşan yaklaşık yüzde 90'lık rakamlardan epey uzak.\n Makalenin SWE-bench Verified denetimi, dev.to yazısında özetlendiği şekliyle, sektör standardı benchmark'ın birbirini besleyen üç sorununu ortaya koyuyor.

Birincisi, testlerin kendisi güvenilmez. Modellerin çözemediği görevler arasında neredeyse yüzde 60'ında test paketinde kusur vardı: yüzde 35,5'i fazla katıydı ve doğru çözümleri, orijinal geliştiricinin yaklaşımından farklı olduğu gerekçesiyle reddediyordu; yüzde 18,8'i ise görevin hiç istemediği bir davranışı sınıyordu. Yazıya göre OpenAI, benchmark'ı kendi değerlendirmelerinden zaten çıkarmış durumda.

İkincisi, veri kirliliği (contamination). SWE-bench Verified, Python projelerindeki gerçek GitHub issue'larından derlendi ve referans çözümler — insan geliştiricilerin işlediği altın yamalar — bugünkü modeller eğitilmeden çok önce herkese açıktı. Makale, frontier modellerin bu yamaları kelimesi kelimesine yeniden üretebildiğini gösteriyor; yani bazı yüksek skorlar muhakeme değil ezberleme yansıtıyor.

Üçüncüsü, görev boyutu. Orijinal benchmark'ın görevlerinin yüzde 86'sı tek bir dosyayı düzenlemeyi içerirken, gerçek mühendislik işi rutin olarak bir düzine veya daha fazla dosya boyunca koordineli değişiklik gerektiriyor.

ProMax nasıl farklılaşıyor

Yeni benchmark daha ağır bir inşa yaklaşımı benimsiyor. Yedi dil — Python, Java, TypeScript, Go, C, C++ ve Rust — yayılan 170 görev içeriyor; bu görevler ham GitHub issue'larından alınmak yerine gerçek commit'lerden yeniden yazıldı. Ortalama bir görev 11,4 dosyaya ve 261,6 satır koda dokunuyor ve her test paketi, fazla dar veya fazla geniş testleri ayıklamak için insanlar tarafından gözden geçirildi.

Setteki en zor görev, test edilen ölçeği gözler önüne seriyor: bir agent, NASA'nın F' Prime uçuş yazılımı çerçevesini monolitik bir header'dan konsolide edilmiş bir giriş noktasına taşırken — kod tabanı boyunca 244 dosyaya yayılan bir değişiklik — runtime davranışını birebir aynı tutmak zorunda.

Modeller gerçekte ne skor aldı

Kapalı ve açık ağırlıklı frontier modeller benchmark'ta koşturulduğunda, dev.to'nun aktardığı sonuçlar şöyleydi:

GPT-5.2, görev başına ortalama 3,60 dolar maliyetle yüzde 41,2 çözüm oranıyla tablonun zirvesindeydi. Claude Sonnet 4.6, görev başına 4,77 dolar maliyetle yüzde 38,8 ile onu izledi. GLM-5 ve Qwen3.5 her ikisi de görevlerin yüzde 36,5'ini çözdü; maliyetleri ise görev başına sırasıyla 0,24 ve 0,78 dolardı.

İki bulgu öne çıkıyor. Fiyat, orantılı yetenek satın almıyor: Claude Sonnet 4.6, açık ağırlıklı GLM-5'e göre görev başına yaklaşık yirmi kat daha fazla harcayıp yalnızca yaklaşık iki puan ek performans elde ediyor. Yazıya göre makalenin vardığı sonuç şu: açık modeller, çok daha düşük bir maliyetle frontier kalitesine yaklaşıyor.

Başarısızlık analizi aynı ölçüde dikkat çekici. Yörünge incelemeleri, modeller başarısız olduğunda genellikle aynı şekilde başarısız olduğunu ortaya koyuyor: referans çözümün gerektirdiğinden daha az dosyayı düzenliyor ve ek self-directed reasoning turları çalıştırıyorlar. Darboğaz, reasoning adımı başına zeka değil; uzun bir görev boyunca整个 kod tabanının tutarlı bir resmini zihinde tutma yeteneği.

Yüzde 41,2'yi alıntılamadan önce dikkat edilecekler

Benchmark bilinçli olarak zor işleri süzdüğü için, günlük hata düzeltmeden çok zor refactoring için bir tavan ölçüyor — çoğu geliştirici hâlâ 244 dosyalık geçişlerden çok daha sık tek dosyalık düzeltmelerle karşılaşıyor. 170 görevle set, diğer benchmark'lara kıyasla küçük ve araştırmacılar kendileri de onu genişletilmesi gereken bir başlangıç noktası olarak tanımlıyor.

Bir uyarı daha: dev.to makalesi, arXiv makalesini özetleyen ve insan gözden geçirmesinden geçmiş bir yapay zeka sistemi tarafından yazıldığını belirtiyor. Bu rakamlara dayanarak karar verecek okurlar makaleye doğrudan başvurmalı.

Neden önemli

Bu benchmark, manşet skorlarının rutin olarak satıcıların kendileri tarafından üretildiği bir anda, yapay zeka kodlama iddialarına gerçeklik kontrolü olarak geliyor. Ezberlenmiş herkese açık çözümlerin ve küçük tek dosyalık görevlerin model performansını olduğundan iyi gösterdiğini; gerçek uzun vadeli, çok dosyalı mühendisliğin ise büyük ölçüde çözülmemiş kaldığını ima ediyor — en iyi model, başardığından daha sık başarısız oluyor.

Model seçen ekipler için pratik sinyal, maliyet-performans tersine dönmesi: görev başına 0,24 dolara sunulan açık ağırlıklı bir seçenek, yirmi kat daha pahalı modellerin birkaç puan gerisinde performans gösteriyor; bu da satıcı rakamlarına güvenmek yerine kendi kod tabanınıza karşı benchmark yapmayı akıllıca varsayılan hale getiriyor. Ve yapay zeka ilerlemesini takip eden herkes için makale, her benchmark iddiası için basit üç soruluk bir filtre sunuyor: test verisi güncel mi yoksa kirlilik riski taşıyor mu, ölçümü kim yaptı ve iş, gerçek mühendislik görevlerine kıyasla ne kadar büyük?

  • #ai
  • #benchmarks
  • #llm
  • #coding-agents
  • #swe-bench

İlgili yazılar