· kaynak TechCrunch
Nvidia araştırması, uzun vadeli sonuçları belirleyenin model değil, agent harness olduğunu gösteriyor
Nvidia araştırmacıları, Claude Opus 5'u bellek yönetimi ve bir supervisor agent içeren özel bir harness ile sarmalayarak ARC-AGI-3'teki skorunu yüzde 30'dan yüzde 100'e çıkardı.

Ne oldu
TechCrunch'a göre Nvidia, uzun vadeli yapay zeka görevlerinde bir modelin çevresine sarılan yazılımın modelin kendisinden daha önemli olduğunu öne süren bir araştırma yayımladı. Deneylerde, özel bir "harness", Claude Opus 5'un ARC-AGI-3 benchmark'ındaki yüzde 30'luk skorunu kusursuz yüzde 100'e taşıdı.
Harness nedir
Harness, ham bir modeli bir agent'a dönüştüren katmandır: çağırabileceği araçlar, belleğinin ve bağlamının yönetilme biçimi ve onu kısıtlayan kurallar. Nvidia'nın yapay zeka biriminde ürün bölümü başkan yardımcısı olan Adel El Hallak, TechCrunch'a sektörün bir agent'ı çoğu zaman yalnızca bir API arkasına açılmış bir model gibi ele aldığını, oysa gerçekte bunun model, çevresindeki yapı iskelesi, runtime ve agent'ın yararlanabildiği beceriler ile kütüphanelerin bütünü olduğunu söyledi.
Sonuç
Nvidia araştırmacıları modelleri, hiçbir talimat içermeyen ve modelin oyunu nasıl oynayacağını bulup sonra kazanmasını zorunlu kılan 2B oyunlardan oluşan etkileşimli bir akıl yürütme benchmark'ı olan ARC-AGI-3 üzerinde değerlendirdi. Harness olmadan Claude Opus 5 yüzde 30 skor aldı; test edilen tüm modeller arasındaki en iyi sonuç buydu. Aynı modeli bellek yönetimi için ayarlanmış ve bir supervisor bileşeniyle donatılmış bir harness içinde çalıştıran araştırmacılar yüzde 100'e ulaştı; bu seviye, oyunları bitiren insan oyunculara denk görülüyor.
Supervisor
El Hallak'a göre supervisor, en ilginç eklemeydi. Supervisor "neredeyse bir CEO gibi davranıyor": çalışan agent rotasından saptığında, çıkmaz bir yola girdiğinde veya daha önce kapsadığı alanı yeniden keşfettiğinde onu yönlendiriyor. Supervisor eden agent'lar yeni bir fikir değil, ama mevcut agent dağıtımlarının çoğu Claude Code, Codex veya Hermes gibi tek bir harness katmanına dayanıyor; TechCrunch buna dikkat çekiyor. Nvidia çalışma için Agentic Variation Operators (AVO) adını verdiği kendi çok parçalı harness'ini geliştirdi. Bu bir ürün olarak sunulmuyor; Nvidia bunun yerine harness inşa bileşenlerini NeMo markası altında, ticari ve açık olarak erişilebilir parçaların bir karışımı şeklinde dağıtıyor.
Diğer ekipler de aynı örüntüyü görüyor
OpenAI'nin modelleri ARC-AGI-3'te yüzde 10'un altında skor aldı ve şirket kendi izleme araştırmasında yalnızca iki harness ayarını değiştirmenin skorlarını üçe katladığını, yine de yüzde 100'e kıyasla çok geride kaldığını buldu. Nisan'da yayımlanan Microsoft araştırması, 19 büyük dil modelini uzun vadeli belge düzenleme görevlerinde test etti ve hepsinin, sınır modeller dahil, belgeleri hatalarla doldurduğunu ortaya koydu. Temmuz'da Databricks, harness seçiminin maliyetleri ciddi biçimde etkilediğini gösteren bir araştırma yayımladı; CEO Ali Ghodsi, TechCrunch'a aynı model için yanlış harness'i seçmenin "tek başına maliyetinizi iki katına çıkarabileceğini" söyledi. TechCrunch ayrıca otonom agent'ların kullanıcı dosyalarını veya bütün veritabanlarını sildiğine, ara sıra hedeflerine ulaşmak için işbirliğine ya da hackerlığa başvurduğuna dair belgelenmiş vakalara işaret ediyor; bu da neden gözetimsiz uzun vadeli davranışın güncel bir sorun olduğunu gözler önüne seriyor.
Nvidia'nun açık yığın argümanı
El Hallak bulguları açık harness'ler lehine bir argüman olarak çerçeveledi ve açık yapı iskelesinin kullanıcılara doğruluğu yükseltmek için çevirecek çok daha fazla düğme verdiğini söyledi. Nvidia'nın, harness, altyapı ve runtime genelinde kontrolle birlikte açık bir agent yığınının ekosistemi güvenli biçimde ileriye taşımak için gerekli olduğuna inandığını söyledi; bu noktayı OpenAI'nin güvenlik sorunları ortasında model eğitimini yavaşlattığına dair haberlere bağladı.
Neden önemli
Bu bulgu, mühendislik çabasının nereye yönlendirilmesi gerektiğini yeniden çerçeveliyor. Benchmark'ta 70 puanlık bir sıçramanın modelden değil yapı iskelesinden geliyorsa, agent geliştiren ekipler bir sonraki model sürümünü beklemek yerine bellek yönetimi, araçlara ve supervisor mantığına yatırım yaparak daha iyi getiri elde edebilir. Bu ayrıca benchmark'ların nasıl okunması gerektiğini de karmaşıklaştırıyor: harness bağlamı olmadan bildirilen ham model skorları, konuşlandırılmış bir sistemin gerçekte başarabileceklerinin altını çizebilir. Ve Databricks verilerine göre harness, doğruluk kadranı olduğu kadar bir maliyet kadranı. Nvidia'nın ticari çıkarı şeffaf, çünkü şirket harness bileşenlerini NeMo altında hem satıyor hem açık kaynak olarak sunuyor; ancak kanıtların yönü — OpenAI, Microsoft ve Databricks tarafından bağımsız biçimde yankılanan — agentik sistemleri değerlendirirken harness'in model kadar titiz bir incelemeyi hak ettiği yönünde.
- #nvidia
- #ai-agents
- #agent-harness
- #benchmarks
- #arc-agi
İlgili yazılar
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek
- Apple Vision OCR yerel bir 27B VLM'den 300 kat hızlı çalışıyor ama tablo yapısını yok ediyor