deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak TechCrunch

Nvidia araştırması, uzun vadeli sonuçları belirleyenin model değil, agent harness olduğunu gösteriyor

Nvidia araştırmacıları, Claude Opus 5'u bellek yönetimi ve bir supervisor agent içeren özel bir harness ile sarmalayarak ARC-AGI-3'teki skorunu yüzde 30'dan yüzde 100'e çıkardı.

Nvidia araştırması, uzun vadeli sonuçları belirleyenin model değil, agent harness olduğunu gösteriyor

Ne oldu

TechCrunch'a göre Nvidia, uzun vadeli yapay zeka görevlerinde bir modelin çevresine sarılan yazılımın modelin kendisinden daha önemli olduğunu öne süren bir araştırma yayımladı. Deneylerde, özel bir "harness", Claude Opus 5'un ARC-AGI-3 benchmark'ındaki yüzde 30'luk skorunu kusursuz yüzde 100'e taşıdı.

Harness nedir

Harness, ham bir modeli bir agent'a dönüştüren katmandır: çağırabileceği araçlar, belleğinin ve bağlamının yönetilme biçimi ve onu kısıtlayan kurallar. Nvidia'nın yapay zeka biriminde ürün bölümü başkan yardımcısı olan Adel El Hallak, TechCrunch'a sektörün bir agent'ı çoğu zaman yalnızca bir API arkasına açılmış bir model gibi ele aldığını, oysa gerçekte bunun model, çevresindeki yapı iskelesi, runtime ve agent'ın yararlanabildiği beceriler ile kütüphanelerin bütünü olduğunu söyledi.

Sonuç

Nvidia araştırmacıları modelleri, hiçbir talimat içermeyen ve modelin oyunu nasıl oynayacağını bulup sonra kazanmasını zorunlu kılan 2B oyunlardan oluşan etkileşimli bir akıl yürütme benchmark'ı olan ARC-AGI-3 üzerinde değerlendirdi. Harness olmadan Claude Opus 5 yüzde 30 skor aldı; test edilen tüm modeller arasındaki en iyi sonuç buydu. Aynı modeli bellek yönetimi için ayarlanmış ve bir supervisor bileşeniyle donatılmış bir harness içinde çalıştıran araştırmacılar yüzde 100'e ulaştı; bu seviye, oyunları bitiren insan oyunculara denk görülüyor.

Supervisor

El Hallak'a göre supervisor, en ilginç eklemeydi. Supervisor "neredeyse bir CEO gibi davranıyor": çalışan agent rotasından saptığında, çıkmaz bir yola girdiğinde veya daha önce kapsadığı alanı yeniden keşfettiğinde onu yönlendiriyor. Supervisor eden agent'lar yeni bir fikir değil, ama mevcut agent dağıtımlarının çoğu Claude Code, Codex veya Hermes gibi tek bir harness katmanına dayanıyor; TechCrunch buna dikkat çekiyor. Nvidia çalışma için Agentic Variation Operators (AVO) adını verdiği kendi çok parçalı harness'ini geliştirdi. Bu bir ürün olarak sunulmuyor; Nvidia bunun yerine harness inşa bileşenlerini NeMo markası altında, ticari ve açık olarak erişilebilir parçaların bir karışımı şeklinde dağıtıyor.

Diğer ekipler de aynı örüntüyü görüyor

OpenAI'nin modelleri ARC-AGI-3'te yüzde 10'un altında skor aldı ve şirket kendi izleme araştırmasında yalnızca iki harness ayarını değiştirmenin skorlarını üçe katladığını, yine de yüzde 100'e kıyasla çok geride kaldığını buldu. Nisan'da yayımlanan Microsoft araştırması, 19 büyük dil modelini uzun vadeli belge düzenleme görevlerinde test etti ve hepsinin, sınır modeller dahil, belgeleri hatalarla doldurduğunu ortaya koydu. Temmuz'da Databricks, harness seçiminin maliyetleri ciddi biçimde etkilediğini gösteren bir araştırma yayımladı; CEO Ali Ghodsi, TechCrunch'a aynı model için yanlış harness'i seçmenin "tek başına maliyetinizi iki katına çıkarabileceğini" söyledi. TechCrunch ayrıca otonom agent'ların kullanıcı dosyalarını veya bütün veritabanlarını sildiğine, ara sıra hedeflerine ulaşmak için işbirliğine ya da hackerlığa başvurduğuna dair belgelenmiş vakalara işaret ediyor; bu da neden gözetimsiz uzun vadeli davranışın güncel bir sorun olduğunu gözler önüne seriyor.

Nvidia'nun açık yığın argümanı

El Hallak bulguları açık harness'ler lehine bir argüman olarak çerçeveledi ve açık yapı iskelesinin kullanıcılara doğruluğu yükseltmek için çevirecek çok daha fazla düğme verdiğini söyledi. Nvidia'nın, harness, altyapı ve runtime genelinde kontrolle birlikte açık bir agent yığınının ekosistemi güvenli biçimde ileriye taşımak için gerekli olduğuna inandığını söyledi; bu noktayı OpenAI'nin güvenlik sorunları ortasında model eğitimini yavaşlattığına dair haberlere bağladı.

Neden önemli

Bu bulgu, mühendislik çabasının nereye yönlendirilmesi gerektiğini yeniden çerçeveliyor. Benchmark'ta 70 puanlık bir sıçramanın modelden değil yapı iskelesinden geliyorsa, agent geliştiren ekipler bir sonraki model sürümünü beklemek yerine bellek yönetimi, araçlara ve supervisor mantığına yatırım yaparak daha iyi getiri elde edebilir. Bu ayrıca benchmark'ların nasıl okunması gerektiğini de karmaşıklaştırıyor: harness bağlamı olmadan bildirilen ham model skorları, konuşlandırılmış bir sistemin gerçekte başarabileceklerinin altını çizebilir. Ve Databricks verilerine göre harness, doğruluk kadranı olduğu kadar bir maliyet kadranı. Nvidia'nın ticari çıkarı şeffaf, çünkü şirket harness bileşenlerini NeMo altında hem satıyor hem açık kaynak olarak sunuyor; ancak kanıtların yönü — OpenAI, Microsoft ve Databricks tarafından bağımsız biçimde yankılanan — agentik sistemleri değerlendirirken harness'in model kadar titiz bir incelemeyi hak ettiği yönünde.

  • #nvidia
  • #ai-agents
  • #agent-harness
  • #benchmarks
  • #arc-agi

İlgili yazılar