deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Yalnızca harness tasarımı, SWE-bench hata düzeltmesini 43'ten 72 göreve çıkardı

Bir dev.to makalesi, harness mühendisliği üzerine yazısında, aynı modelin, çevresindeki agent sisteminden başka hiçbir şey değişmeden, SWE-bench Verified'daki 169 görevin 43 yerine 72'sini çözdüğünü belirten bir arXiv makalesine atıf yapıyor.

Yalnızca harness tasarımı, SWE-bench hata düzeltmesini 43'ten 72 göreve çıkardı

Tek model, iki harness, 29 ek hata düzeltmesi

Harness mühendisliği hakkında bir dev.to makalesi, uygulayıcıların en çok sorduğu sorunun — hangi modelin seçileceği — her çeyrekte biraz daha az önem taşıdığını savunuyor. Makalenin merkezindeki kanıt, Ağustos ayında arXiv'e yüklenen ve yazıda "Same Model, Different Harness" olarak anılan bir bildiri: aynı model, ağırlıkları, görevleri ve context penceresi sabit tutularak SWE-bench Verified'daki 169 hata düzeltme görevinde çalıştırıldı. Yalnızca modelin çevresine sarmalanan agent sistemi değişti ve çözülen görev sayısı 43'ten 72'ye çıktı.

Yazar, frontier modellerin artık birbirine o kadar yakın olduğunu, çevredeki yazılımın ekiplerin önem verdiği şeylerin çoğunu belirlediğini yazıyor: görev maliyeti, tamamlanma ve çıktıya güvenilip güvenilemeyeceği.

Harness tam olarak nedir

Makale, Martin Fowler'ın sitesinde yazan Thoughtworks'ten Birgitta Böckeler'in özlü tanımını ödünç alıyor: bir agent, model artı harness'e eşittir. Model kiralanan bir kapasitedir; harness ise onun etrafına inşa edilen her şeydir — agent'ı çalışmaya devam ettiren döngü, çağırabileceği araçlar, context'ine nelerin girdiği, neler yapmasına izin verildiği ve işinin nasıl denetlendiği. Bu bakışla Claude Code ve Codex CLI birer harness'tir.

Bu disiplin zamanla katmanlaştı. Prompt engineering kelimelerle ilgileniyordu; context engineering onlarla birlikte seyahat edenlerle — getirilen belgeler, bellek ve önceki turların özetleri gibi — ilgileniyordu; harness engineering ise bir modelin konuşmak yerine harekete geçmesi için neye ihtiyacı olduğunu ekliyor. Bir sonraki katman olan loop engineering de şimdiden şekilleniyor: bir agent'ı zamanlamaya veya olaya bağlı olarak yeniden çalıştıran ve her biri makinenin denetleyebileceği bir koşulla sonlanan dış döngüler.

Yazıdaki otuz satırlık pseudocode döngüsü bu dengesizliği gösteriyor. Bir satır modeli çağırıyor; diğer her satır bir insan kararını kodluyor — ne zaman sıkıştırma yapılacağı, 4.000 satırlık bir test günlüğünün ne kadarını modelin göreceği ve politikanın zorla bir git push'a izin verip vermediği.

Kazanımlar nereden geldi

Uzun görevler sonunda context limitine takılır ve o anda harness'in yapacağı şey, agent'ın işi bitirip bitirmeyeceğini belirler. Makaleye göre bildirideki geliştirilmiş harness, pencere doldukça eski araç sonuçlarını aşamalı olarak kısalttı ve agent başarısız bir komutu tekrarladığında devreye girdi. Başka hiçbir şey değişmedi.

Bir uyarı var: 262K token'lık bir pencerede harness'ler arasındaki fark neredeyse kayboluyor. Yazar, bunun kulağa geldiği kadar yardımcı olmadığını belirtiyor, çünkü üretim sistemleri her token için fatura kesiyor.

Yaygın teknikler arasında compaction (eski turları özetleme), truncation (eski araç çıktısını kırparak güncel çıktıyı bütün halinde koruma), oturum başında yüklenen CLAUDE.md veya AGENTS.md gibi bellek dosyaları ve bir yan görevi taze bir context'e taşıyıp yalnızca cevabı geri döndüren sub-agent'lar yer alıyor. En yenisi tam bir context reset: bunun var olma sebebi, uzun süre çalışan uygulamalar geliştiren Anthropic ekibinin compaction'ın yetersiz kalmasını fark etmesi — pencereler doldukça modeller, ekibin context anxiety dediği şeyi gösteriyor ve limiti önceden hissederek işi erken bitiriyor. Yapılandırılmış bir devir dosyasıyla temiz bir reset, modelin yerinin tükendiğini bildiği bir özetten daha iyi sonuç verdi.

Guardrail'ler ve doğrulama

Komut çalıştırabilen bir agent şeyleri silebilir de; bu yüzden her harness bir spektrum üzerinde bir nokta seçer. Cline'ın varsayılanı her işlem için onay bekler; Claude Code'un auto modu ve Cursor'ın Auto-review'i kararları ikinci bir modelden geçirir; Codex CLI varsayılan olarak yalnızca çalışma alanına açık, ağ kapalı, işletim sistemi düzeyinde bir sandbox kullanır; Pi sandbox'ı ve onay istemlerini tamamen atlar; yazarı buna full YOLO modu der ve bir container önerir. Makaleye göre hiçbiri yanlış değil — doğru seçim, bir hatanın neye mal olacağına bağlı.

Doğrulama, agent çıktısını her satırı okumadan güvenilir kılan şeydir. Böckeler bunu, agent'ı harekete geçmeden önce yönlendiren guide'lara (talimatlar, kabul görmüş pratikler, örnekler) ve sonradan denetleyen sensor'lara (testler, linter'lar, tip denetleyiciler, inceleme yapan agent'lar) ayırıyor. İhtiyaç gerçek: Anthropic, kendi işini değerlendirmesi istenen agent'ların, bir insanın vasat görebildiği işi bile kendinden emin bir şekilde övdüğünü gördü. Çare olarak üç agent kullandılar — spesifikasyonu yazan bir planner, inşa eden bir generator ve çalışan uygulamayı önceden belirlenmiş kriterlere karşı Playwright ile test eden ayrı bir evaluator. Tek başına çalışan agent 20 dakika ve 9 dolar sürdü; üç agent'lı kurulum altı saat ve 200 dolar sürdü ve çok daha iyi bir sonuç verdi.

Bu arada shell hâlâ yük çeken at. Tek bir shell aracını açığa çıkarmak, modele makinedeki her programı, on yıllara dayanan dokümantasyonla birlikte verir; makale, Doug McIlroy'un 1978 tarihli kuralına atıf yapıyor: bir programın çıktısının, henüz bilinmeyen başka bir programa girdi olmasının beklendiği — bu da bir dil modeli için adil bir tanım.

Neden önemli

43'ten 72'ye sıçrama, anekdotların ima ettiğini sayısallaştırıyor: modelleri değiştirmeden, context yönetimi, politika ve doğrulamayı mühendisleştirerek önemli performans kazanımları elde etmek mümkün. Bu ayrıca ödünleşimleri açıkça ortaya koyuyor — Anthropic'in 20 dakikada 9 dolar ile altı saatte 200 dolar karşılaştırması, doğrulama kalitesinin zaman ve parayla satın alındığını gösteriyor ve harness tasarımını teknik olduğu kadar ekonomik bir karar hâline getiriyor. Ve agent'lar kendi işlerini güvenilir biçimde değerlendiremediği için, onları devreye alan herkes bunu yapabilecek denetimleri inşa etme işini de devralıyor.

  • #coding-agents
  • #ai-agents
  • #llms
  • #swe-bench
  • #context-engineering

İlgili yazılar