· kaynak Hacker News – Front Page (native)
Fable 5, Prime Intellect'ın 18 modellik nanoGPT speedrun'ında zirvede: insan rekoruna açılan farkın yüzde 81,7'sini kapattı
Prime Intellect, 18 frontier modeli nanoGPT optimizer speedrun'ında 153 otonom çalışmayla test etti. En iyi model insan rekoruna açılan farkın yüzde 81,7'sini kapattı ve 41 agent trace artık herkese açık.

Prime Intellect, 18 frontier modeli nanoGPT optimizer speedrun'ında — küçük bir GPT modelini olabildiğince verimli eğitmeye dayalı bir topluluk yarışması — çalıştıran kapsamlı bir otonom benchmark yayımladı. 153 otonom çalışma arasında en güçlü performansı gösteren model, Fable 5 olarak listelenen model, benchmark'ın baseline'ı ile insan rekoru arasındaki mesafenin yüzde 81,7'sini kapattı. Hiçbir model rekoru kıramadı. Araştırma sayfası Hacker News ana sayfasında öne çıktı.
Sonumlar nasıl ölçülüyor
Çalışmalar speedrun'ın metriğine göre puanlanıyor ve düşük sayılar daha iyi: sayfada insan rekoru 2.600, değiştirilmemiş baseline ise 3.290 olarak belirtiliyor. Prime Intellect her model için doğrulanmış en iyi puanını ve o çalışmanın insan rekoruna açılan farkın ne kadarını kapattığını raporluyor. Tablonun alt sıralarında doğrulama önemli hale geliyor — GLM 5.3 hiçbir kayıt olmadan listeleniyor.
Liderlik tablosu ne gösteriyor
Fable 5, claude-code harness'i ile yüksek effort seviyesinde 8,7 günlük agent süresi sonunda elde edilen 2.726 puan ve yüzde 81,7'lik fark kapanmasıyla zirvede tek başına duruyor. Yarım noktayı geçen tek giriş bu. Opus 5, 2.920 ile (%53,6) ikinci sırada; onu prime-agent harness'i altında çalışan Kimi K3, 2.930 ile (%52,2) izliyor. Kimi K3 tabloda iki kez yer alıyor; kendi kimi-code harness'i altında yalnızca 2.970'e (%45,8) ulaşabildi ve bu daha uzun bir 5,1 günlük çalışmaydı — bu da iskelet (scaffolding) seçimlerinin, model seçimi kadar sonucu değiştirebildiğinin kanıtı.
Orta sıra kabaca yüzde 11 ile 40 arasında kümeleniyor: Opus 4.8 yüzde 39,4; GPT-5.6 ailesi Sol (%35,9) ve Sol Pro (%33,6) üzerinden Terra'ya (%11,0) kadar yayılıyor; Sonnet 5 yüzde 26,8; Grok 4.5 ile Qwen3.8 Max yüzde 24,6'da berabere; GLM 5.2 yüzde 20,3; DeepSeek V4 Pro yüzde 12,3. Kuyrukta — Grok 4.6, Muse Spark 1.2 ve 1.1, GPT-5.5 ve Kimi K2.7 — hepsi yüzde 11'in altında kaldı; Kimi K2.7 doğrulanmış çalışmalar arasında yüzde 7,2 ile son sırada.
Zaman ve harness bütçeleri
Agent süresi on kattan fazla değişti: Grok 4.6 ve Muse Spark 1.2 için 0,6 günden Fable 5'in kazanan çalışması için 8,7 güne kadar. Orta tablodaki bazı modeller — Sonnet 5, GPT-5.6 Luna, Qwen3.8 Max, GLM 5.2 — kabaca iki günde tamamlandı. Çalışmalar, yüksek seviyeden xhigh olarak etiketlenen bir seviyeye kadar effort kademelerinde çeşitli harness'ler (claude-code, codex, prime-agent, kimi-code, grok-cli, qwen-code, pi ve muse-code) kullandı.
Ham çalışma uzunluğu ve compute girişler arasında farklılaştığı için sayfa ayrıca eşit bütçeli bir görünüm sunuyor. Her modelin en iyi final çalışmasına aynı kaynak bütçesini veriyor — 6 saatten 9 güne kadar ayarlanabilir, varsayılan 24 saat — ve o pencere içinde ulaşılan en iyi doğrulanmış kaydı raporluyor; seçilen bütçeden önce duran çalışmalar gri gösteriliyor.
Açık trace'ler
Prime Intellect, liderlik tablosunun yanı sıra tool çağrılarını, subagent etkinliğini ve scratchpad'leri kapsayan 41 adet seçilmiş, tam uzunlukta agent trajectory yayımladı. Bu, yüzde 24,6'lık bir çalışma ile yüzde 81,7'lik bir çalışma arasındaki farkın sözlü olarak kabul edilmesi yerine adım adım incelenebileceği anlamına geliyor.
Neden önemli
Agentic coding için benchmark'lar bolca var; ancak çok günlük otonom araştırma çalışmasına ilişkin kontrollü, modeller arası veri nadir. Bu çalışma üç şey sunuyor: açık uçlu bir optimizasyon görevinde birebir karşılaştırılabilir bir yetenek sıralaması, belgelenmiş bir harness etkisi (aynı Kimi K3 modeli, araçlarına bağlı olarak birkaç puan farklı yerlere düşüyor) ve frontier agent'ların uzman insanlardan hâlâ ne kadar uzakta olduğuna dair tabandan tavana bir görünüm — en iyi çalışma bile farkın yüzde 18,3'ünü açık bıraktı. Yayımlanan trace'ler belki de en kalıcı çıktı olabilir: bir liderlik tablosunu veri setine dönüştürüyor, araştırmacılara uzun vadeli agent davranışını incelemek için ham malzeme ve gelecekteki eğitim çalışmalarına öğrenilecek somut örnekler sunuyor.
- #ai
- #benchmarks
- #llm-agents
- #nanogpt
- #machine-learning
İlgili yazılar
- SWE-Bench ProMax: en iyi model büyük çok dilli refactoring görevlerinin yalnızca yüzde 41,2'sini çözebiliyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- Eski LinkedIn SRE'si, yapay zekâ ile olay yönetiminin mühendislerin sistem bilgisünü aşındırdığı konusunda uyarıyor