deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

FrontierHarness Eval: aynı model, dokuz harness, başarılı görev başına maliyette 17 kat fark

Yeni bir benchmark, aynı modeli özdeş görevlerde dokuz coding-agent harness ile karşılaştırdı ve başarılı görev başına medyan maliyette 17 kat bir fark ile geçme oranının ve maliyetin çoğu zaman ters yönde ilerlediğini ortaya koydu.

FrontierHarness Eval: aynı model, dokuz harness, başarılı görev başına maliyette 17 kat fark

Harness ekonomisi için bir benchmark

2 Eylül'de Hacker News'in ana sayfasına çıkan yeni bir benchmark projesi olan FrontierHarness Eval, çoğu model değerlendirmesinin atladığı bir soruyu soruyor: model aynı kaldığında, agent harness seçimi faturanızı nasıl etkiler? Proje, dokuz harness'i — Codex v0.148.0, DeepSeek Harness v0.1.0-rc.8, Claude Code v2.1.237, Piv v0.84.2, Oh My Piv 17.4.0, Kimi Code v0.37.2, Exo Harness v0.1.0, OpenCode v1.18.19 ve Hermes v0.20.4 — yazılım mühendisliği ve terminal tabanlı görevlerde çalıştırarak geçme oranını, başarılı görev başına medyan maliyeti, görev başına medyan maliyeti, başarılı görev başına medyan cache isabet oranını ve başarılı görev başına medyan süreyi karşılaştırdı.

Çalışmaları karşılaştırılabilir kılmak için her şey Runta agent runtime'larında çalıştırılıyor. Harness ve görev ortamı bir kez golden checkpoint olarak hazırlanıyor ve her çalışma, özdeş vCPU, bellek, disk boyutu, disk içeriği ve bellek durumuyla taze bir geri yüklemeden başlıyor. Böylece harness'in kendisi — prompt'ları, agent döngüsü, araç kullanımı ve context yönetimi — ana değişken olarak kalıyor.

Özdeş işte on yedi katlık bir fark

FrontierHarness Eval sitesine göre, model sabit tutulmasına rağmen başarılı görev başına medyan maliyet dokuz harness arasında 17 kat değişiyor. Projenin kendi yorumu da geçme oranı ile maliyetin zıt yönlere hareket edebildiğini gösteriyor: Claude Code 19 görevi geçiyor ancak görev başına maliyeti 18,34 dolara ulaşıyor — bu, saf bir verimlilik zaferinden çok yüksek bedel karşılığında alınmış güçlü sonuçların bir örneği.

Bunun anlamı şu: temeldeki model hiç değişmese bile, yalnızca harness katmanı toplam harcamayı kabaca bir büyüklük mertebesi kadar oynatabiliyor.

Yazarların belirttiği uyarılar

Benchmark kendi sınırları konusunda açık sözlü ve sitede üç uyarı listeliyor.

OpenCode'un göz önündeki maliyet rakamları başarısız denemeleri hariç tutuyor ve yalnızca 15 geçişe dayanıyor; başarısız denemeler sayıldığında rakam görev başına 3,24 dolara dönüşüyor. Dolayısıyla geçiş başına maliyet tanımı, ince yazıyı okumadığınız sürece satırlar arasında farklılık gösteriyor.

Cache isabet oranı maliyetin bir vekili değil. 300 turlu, cache'lenen bir başarısız deneme, cache'i hiç kullanmayan kısa bir çalışmadan daha fazlasını yakabilir; bu yüzden etkileyici bir isabet oranı bir harness'i ucuzlatmaz.

Kapsam dar. FrontierHarness v1.0 yazılım mühendisliği bağlamlarına ve terminal tabanlı görevlere odaklanıyor ve yazarlar bunun diğer bilgi işi alanlarına genellenmeyebileceğini söylüyor.

Tartışmaya değer bir nokta daha: site, geliştiricileri kendi harness'lerini Runta üzerinde test etmeye davet ediyor ve başlamak için 100 dolar kredi sunuyor; yani proje, ölçüm yaptığı platforma sıkı sıkıya bağlı.

Neden önemli

Çoğu ekip hangi modeli kullanacaklarına kafa yorar ve harness'i onun etrafında nötr bir kabuk olarak görür. Bu benchmark tam tersini savunuyor: harness, birinci dereceden bir maliyet ve kalite kararıdır. 17 katlık fark, aynı modelin aynı görevlerde, etrafına sarılan iskelete ya da bir avantaj ya da bir bütçe delici olabileceği anlamına geliyor. AI destekli mühendislik için bütçe planlayan herkes için takip edilmesi gereken rakam, ham geçme oranı ya da cache istatistikleri değil, başarılı görev başına maliyettir. Ve genel olarak benchmark okuyucuları için OpenCode uyarısı, başarısız denemeleri hariç tutmanın bir harness'in ekonomisini epey güzelleştirebileceğinin bir hatırlatması; dolayısıyla metodoloji notları, leaderboard'ın kendisi kadar dikkat hak ediyor.

  • #ai-agents
  • #benchmarks
  • #coding-agents
  • #llm
  • #developer-tools

İlgili yazılar