· kaynak dev.to (home feed)
Sekiz arXiv makalesi, agent harness'i yeni savaş alanı olarak gösteriyor
dev.to'da yayımlanan bir derleme, sekiz güncel arXiv makalesine dayanarak agent güvenilirliğinin artık modelin çevresindeki runtime olan harness'e bağlı olduğunu savunuyor; konu state yönetimi, self-evolution ve değerlendirmeyi kapsıyor.

dev.to'da yayımlanan bir derleme, Alibaba'nın DreamX grubu, Meta AI, Google Cloud, ByteDance Seed ve çeşitli üniversite ekiplerinden gelen sekiz güncel arXiv makalesini bir araya getiriyor — hepsi aynı katmanı hedefliyor: "agent harness", yani bir dil modelinin çevresine sarılan ve bağlam inşası, state yönetimi, araç çağrısı, hata kurtarma ile sonuç doğrulamasından sorumlu runtime.
dev.to yazısına göre terim, Brezilya'daki Federal Institute of Goiás'tan bir araştırmacının ayrı bir tanım makalesi yayımlayacak kadar yeni; makale, dört gerekli ve yeterli koşulda karar kılıyor: akıl yürütme, eylem ve gözlemi iç içe geçiren bir agent döngüsü; modelin dış bir ortamı algılamasına ve değiştirmesine izin veren bir araç arayüzü; modelin penceresine neyin gireceğini aktif olarak deciding eden bağlam yönetimi; ve model işbirliği yapmadığında bile ayakta kuran kontrol mekanizmaları.
Derlemenin çerçevesiyle motivasyon, büyüyen bir mühendislik uzlaşısu — yazıya göre Anthropic'in mühendislik blogu da yankılıyor — agent güvenilirliğinin artık modelin kendisinden çok harness tarafından belirlendiği. Ağırlıkları dondur, yalnızca harness'i değiştir, ve aynı agent'ın başarı oranı kat kat farklı olabilir. Sekiz makale bu görüşü üç cepheden ilerletiyor.
Ufuk uzun yürütme bir state problemi olarak
dev.to'ya göre uzun süre çalışan bir agent'ın klasik başarısızlığı bağlam şişmesi: agent nerede olduğunu kaybeder ve yanlış öz değerlendirmeler sonraki her karara sirayet eder.
Alibaba DreamX'nin LongHorizon-Harness'ı, uzun ufuklu yürütmeden açık state yönetimi olarak yeniden çerçeveliyor. Manage–Execute–Audit döngüsü, görev state'ini bağlam penceresinin dışında tutar ve yalnızca ortama karşı bağımsız olarak doğrulanan olgularla güncellenir. Aynı Qwen 3.7-Plus omurgasıyla WeaveBench skorlarının reportedly %51,8'den %80,7'ye sıçradığı, OSWorld 2.0'daki binary completion'ın üçe katlandığı ve kazanımların Claude Opus 4.7'ye de aktarıldığı (bir OSWorld alt kümesinde %20,0'dan %34,3'e) bildiriliyor.
UIUC ve Meta AI'dan EvoHarness-RL ise agent'a state kullanmayı öğretmeye izin veriyor: Belief, Progress ve Experience dış state olarak yapılandırılıyor ve cost-aware GRPO ile eğitiliyor. Qwen3-8B varyantı ALFWorld'de %96,9'a ulaşıyor ve agent'ın zamanla kendi deneyimini daha kompakt state'e damıttığı bildiriliyor. İki makale de aynı sonuca varıyor — state, sohbet geçmişinin dışında yaşamalı.
Self-evolution: gerçek ama düzensiz
ByteDance Seed'in HarnessDev'i, agent'ların kendi araçlarını inşa edip edemeyeceğini test ediyor: minimal bir seed'den başlayarak tam bir harness inşa etmek ve onu downstream geri bildiriminden evrimleştirmek. Dört alan ve 2.207 örnek genelinde, model üretilen harness'ler yazma ve ML deneyi görevlerinde insan tasarımlarına eşit ya da üstün, ancak kod ve aramada geride — ve 64 evrimsel değişiklikten yalnızca 34'ü gizli görevlere genelliyor.
Harness-R1 (SJTU, Xiaohongshu ve SEU), online RL ile başarısızlık yörüngelerinden öğreniyor ve ham bir Qwen3.5-9B'yı WebShop, ALFWorld ve DBBench genelinde %44,3'ten %53,6'ya çıkarıyor. EnvHarness (WashU ve Google Cloud) yaklaşımı tersine çeviriyor ve agent yerine ortamı evrimleştiriyor; programlanabilir bir wrapper, başlangıç state'lerini ve görev yapılarını yeniden tasarlayarak held-out testlerde 9,0 puana varan kazanımlar sağlarken adım sayısını %9,8 azaltıyor.
Derlemenin kendi özeti sert: self-evolution işe yarıyor, ama kazanım istikrarı, aktarılabilirlik ve maliyet çözülmemiş durumda — ve 64 değişiklikten 34'ünün genellediği rakamı, herhangi bir ürün duyurusundan daha fazla sanatın mevcut durumu hakkında şey söylüyor.
Değerlendirme teşhise dönüşüyor
MirroS, Tsinghua, NVIDIA, CMU ve diğerlerinden HarnessEval-W, world-model değerlendirmesindeki tek saydam olmayan skoru agentic bir pipeline ile değiştiriyor: bir LLM agent her değerlendirmeyi ölçülebilir alt sorulara ayrıştırıyor ve tanısal araçlarla donatılmış uzmanlaşmış sub-agent'lar türetiyor. 18 world model ve 330 vaka genelinde, fiziksel geçiş yargılarında en yakın rakip protokolün %31,9'una karşı %71,7 pairwise accuracy'ye ulaştığı ve her yörünge için doğrulanabilir bir tanı sunduğu bildiriliyor.
Google Cloud AI Research ve UCLA'dan, FinanceGym adıyla da bilinen FinanceHarness ise finanstaki açığı ortaya koyuyor: öncü agent'lar bile zaman noktasına sabitlenmiş finansal derin araştırmada %40'ın altında kalıyor ve amaca özel bir harness bir omurgayı %25,3'ten %32,4'e çıkarıyor — hâlâ düşük, ki derleme bunu iyi değerlendirmenin amacı olarak görüyor: açığı görünür kılmak.
Neden önemli
dev.to derlemesinin ana teması, agent rekabetinin "kimin modeli daha güçlü"den "kimin runtime altyapısı daha güçlü"ye kaydığı. Bir framework seçen ekipler için pratik tavsiye şu: hangi modele bağlandığını sormayı bırakın ve state nerede yaşıyor, sonuçlar nasıl doğrulanıyor, başarısızlıklar nasıl kurtarılıyor ve maliyet nasıl ölçülüyor sormaya başlayın. Modeller birkaç ayda bir değişir; harness, bir mühendislik ekibinin yıllarca sürdürdüğü katmandır.
Bir uyarı: yukarıdaki tüm rakamlar tek bir ikincil derlemeden geliyor ve burada bağımsız olarak doğrulanmadı; bu nedenle belirli sayıları yerleşik sonuçlar değil, aktarılan iddialar olarak değerlendirin.
- #ai-agents
- #arxiv
- #llms
- #agent-harness
- #research