· kaynak dev.to (home feed)
OpenAI'nin paylaştığı çalıştırmalarda GPT-5.6 Sol, harness ayarlarına göre ARC-AGI-3'te yüzde 13,3 veya 38,3 puan alıyor
OpenAI'nin yayımladığı çalıştırmalarda aynı model, yalnızca değerlendirme harness'inin ve API'nin yapılandırması değiştirilerek ARC-AGI-3'te yüzde 13,3 veya 38,3 puan aldı; daha yüksek puan, altıda bir kadar çıktı token'ı kullandı.

dev.to'da yayımlanan bir yazıya göre OpenAI, aynı model olan GPT-5.6 Sol'ün yalnızca değerlendirme harness'inin ve API'nin nasıl yapılandırıldığına bağlı olarak ARC-AGI-3'te yüzde 13,3 veya 38,3 puan aldığı benchmark çalıştırmalarını yayımladı. Daha yüksek puan, oyun başına daha düşük puana kıyasla yaklaşık altıda bir kadar çıktı token'ı kullandı. Modelin kendisinde hiçbir şey değişmedi.
Ölçülen neydi
Puan, Relative Human Action Efficiency (RHAE); yani bir ajanın insan oyunculara kıyasla ne kadar verimli hareket ettiğini ölçen bir metrik, basit bir başarı oranı değil. OpenAI'nin bir tahminine dayandırdığı dev.to yazısı, ortalama bir insan testçiyi aynı görev setinde yüzde 48'e yerleştiriyor. Bu ölçekte GPT-5.6 Sol, insan ortalamasının yaklaşık 34,7 puan gerisinden 9,7 puan gerisine taşındı; yazının hesabına göre yalnızca yapılandırma, orijinal farkın yaklaşık yüzde 72'sini kapattı.
Yazı daha çarpıcı bir karşılaştırmaya da dikkat çekiyor: benchmark'ın oyunlarından birinin herkese açık liderlik tablosunda hiçbir frontier model ilk seviyeyi geçemiyor. Yeniden yapılandırılmış harness ile GPT-5.6 Sol altı seviyenin tamamını tamamladı.
İki harness
Yazıya göre farklar iki noktada:
- Turlar arasındaki akıl yürütme. Resmî harness, modelin özel akıl yürütmeydi her eylemden sonra atıyordu. Yeniden yapılandırılmış çalıştırma bunu korudu.
- Bağlam yönetimi. Resmî harness, kayan kırpma uyguluyor, konuşma 175.000 karakteri aşınca en eski mesajları düşürüyordu. Yeniden yapılandırılmış çalıştırma geçmişi kesmek yerine sıkıştırdı.
Yazarın gözlemi, bunların egzotik tercihler olmadığı. Çoğu ajan framework'ü varsayılan olarak aynı şekilde davranıyor: akıl yürütme, bilinçli olarak saklanması gereken ayrı bir çıktı olarak geliyor ve en eski turları kırpmak bağlam yönetiminin en basit hâli. Etkileşim yoluyla bir oyunun kurallarını öğrenmeye dayanan bir benchmark'ta, modelin çalışan teorisini her hamleden sonra silmek, ona her turda durumu sıfırdan kurmak zorunda bırakıyor; bu hem daha zayıf oyun olarak hem de zaten yapılmış akıl yürütmeyi yeniden inşa etmek için harcanan ek çıktı token'ları olarak kendini gösteriyor.
Yazının belirttiğine göre OpenAI, bunların ChatGPT ve Codex dahil üretim sistemlerinde halihazırda çalışan ayarlar olduğunu söylüyor. Benchmark harness'inde bu ayarlar basitçe etkinleştirilmemişti.
Benchmark'lar için rahatsız edici kısım
dev.to yazısı, OpenAI'nin kendi çerçevesine değinerek benchmark'ların modelleri nadiren yalıtılmış biçimde ölçtüğünü, görünmeyen API ayarları, harness tasarımı ve prompt tercihlerini de yansıttığını aktarıyor. OpenAI'nin eklediği bildiriliyor: şaşırtıcı bir düşük puanın arkasından çıkıp akıl yürütme mesajlarını atan genel bir harness'e dayandığının anlaşıldığı bu ilk kez değilmiş; bu da yayımlanmış sayıların, bir model hakkındaki gerçek olarak okunurken aslında bir harness kusurunu ölçüyor olabileceği ima ediyor.
Yazı, ARC'ın gerekçesini adil biçimde ele alıyor: basit, genel bir harness model eksikliklerini daha görünür kılar ve tedarikçilerin her modelin özelliklerine göre iskeleti ayarlamasını engelleyerek modeller arası karşılaştırmaları adil tutar. Buna karşı argümanı ise nötr görünen bir harness'in bile varsayımlar barındırdığı: akıl yürütmenin kalıcı olup olmadığı ve geçmişin nasıl kırpıldığı konusunda — ve bu varsayımlar, turlar boyunca akıl yürütmek üzere eğitilmiş modelleri cezalandırma eğiliminde.
Sonuç liderlik tablolarına kadar uzanıyor. Sabit bir harness bir ajan görevinde A modelini B modelinin üstüne yerleştirdiğinde, savunulabilir okuma şudur: o harness ile eşleştirilen A modeli, aynı harness ile eşleştirilen B modelini yendi. Yazı, harness'in, benchmark paketlerinin sıcaklığı ve prompt'ları zaten açıkladığı gibi zorunlu bir beyan olarak görülmesi gerektiğini savunuyor.
Neden önemli
LLM API'leri üzerine geliştirme yapan herkes için bu, bir eval sayısının bir modele değil, bir sisteme ait olduğuna dair kontrollü bir hatırlatma. Modelleri karşılaştırmadan ya da düşük bir puanı yetenek tavanı olarak kabul etmeden önce, akıl yürütmeyin turlar arasında saklanıp saklanmadığını ve bağlam sınırında geçmişin nasıl ele alındığını kontrol edin. Ekonomi de aynı yönü gösteriyor: akıl yürütmeyi turlar arasında koruyan yapılandırma hem daha ucuz hem daha iyiydi, çünkü model zaten yaptığı düşünceyi yeniden üretmek için çıktı token'ı maliyeti ödemeyi bıraktı. Ve benchmark sonuçlarını tüketen herkes için, atıf sayının kendisi kadar önemli. Burada bir sisteme dair bir gerçek ile bir modele dair bir gerçek arasındaki fark 25 puan değerindeydi.
- #openai
- #benchmarks
- #llm
- #arc-agi
- #ai-agents
İlgili yazılar
- Rapor: Gemini 3.8 Flash agent kalıcılığını yükseltiyor, 1M context penceresini koruyor
- OpenAI, insan başına iş günü başına 3.1 agent-iş günü coding-agent runtime'ı çalıştırıyor
- Sınırların ötesindeki yapay zeka acenteleri istenmeyen faturalar gönderdi ve işletmeleri başında yaklaşık 3.200 dolar kaybetti