· kaynak Hacker News – Front Page (native)
GPT-6 Astra, ARC-AGI-3'te %99,9'a ulaştı: harness seçimi hem skoru hem maliyeti değiştiriyor
ARC Prize, OpenAI'nin GPT-6 Astra modelinin, state koruyan bir harness ile ARC-AGI-3'ün yarı-özel setinde %99,9'a ulaştığını, aksiyon verimliliğinde insan temel çizgisini geçtiğini ve yol boyunca kendi gösterim sistemini icat ettiğini bildirdi.

ARC Prize, OpenAI'nin GPT-6 Astra modelinin soyut akıl yürütme benchmark'ının üçüncü nesli ARC-AGI-3 üzerindeki değerlendirmesini yayımladı ve model, kurumun test ettiği her iki harness altında da en iyi (state-of-the-art) sonuçları elde etti. Öne çıkan sayılar aynı anda iki farklı yöne işaret ediyor: maksimum akıl yürütme çabasıyla Standard harness'de 26.098 dolara %62,7 ve yüksek çabayla Provider Adapter harness'de 18.817 dolara %99,9. Hacker News'in ana sayfasında öne çıkan yazı, bu iki koşu arasındaki farkı hikayenin bir parçası olarak çerçeveliyor.
ARC-AGI-3 neyi ölçüyor
ARC-AGI-3, ajanları açık yönergeler olmadan, temel bilgi önsellerinden inşa edilmiş yeni, sıra tabanlı ortamlara yerleştirir. Ajanlar keşfetmek, seyrek ödüllerden hedefleri çıkarsamak ve etkili planlama yapmak için her ortamın iç modelini kurmak zorundadır. Benchmark; keşif, modelleme, hedef belirleme ile planlama ve yürütme olmak üzere dört bileşeni değerlendirir. Zorluk seviyesi, insan katılımcılarla kontrollü testler aracılığıyla kalibre edildi ve insanlar ortamların %100'ünü çözebiliyor. Serinin beyan edilen amacı, mevcut yapay zekâ ile AGI arasındaki "kalan boşluğu" ölçmek; ARC Prize, AGI'yi bir sistemin bir insanın yapabildiği her beceriyi, bir insan kadar verimli şekilde edinebilme yetisi olarak tanımlıyor.
Harness her şeyi değiştiriyor
İki harness, turlar arasında ne kadar bağlamın korunduğu konusunda farklılaşır. Standard harness, modelin tutmayı seçtiği notları sonraki turlara taşımasına izin verir. Provider Adapter ise istekler arasında opak akıl yürütme state'ini korur ve daha uzun konuşmaları sıkıştırır, böylece önceki akıl yürütme yeniden kullanılabilir.
Standard harness altında skorlar akıl yürütme çabasıyla ölçekleniyor: akıl yürütme kapalıyken 49.791 dolara %35,2'den, maksimumda 26.098 dolara %62,7'ye kadar çıkıyor. Sezgiye ters şekilde, daha çok düşünmek daha az maliyetliydi: ARC Prize'a göre daha yüksek çaba ayarları oyunları daha az aksiyonla çözdü ve bu da toplam model çağrısı ile token sayısını azalttı.
Provider Adapter bu farkları düzleştirdi. Kapalıdan maksimuma kadar her çaba seviyesi %96,7 ile %99,9 arasında kaldı. En iyi tek skor olan %99,9, yüksek çabayla 18.817 dolara ulaşıldı; en ucuz koşu ise maksimum çabayla 17.332 dolara %98,6 elde edildi. ARC Prize her iki yapılandırmayı da en iyi seviye (state-of-the-art) olarak nitelendiriyor.
Aksiyon verimliliğinde medyan insanın önünde
Benchmark'ı yayınlamadan önce ARC Prize, aksiyon verimliliği temel çizgisini belirlemek için genel halktan yaklaşık 500 kişiyle test yaptı; temel çizgi, seviye başına o seviyeyi tamamlayan oyuncuların medyan aksiyon sayısı olarak tanımlandı. Maksimum çabayla Provider Adapter harness'de Astra, seviyelerin %96,0'ında bu temel çizgiden daha az aksiyon kullandı ve seviye başına ortalama %51,7 daha az aksiyonla tamamladı; ARC Prize bunu önemli bir kilometre taşı ve bu ölçekte insan eşitliğinin geçilmesi olarak nitelendiriyor.
Kurum, aksiyon verimliliğinin insanlar ile yapay zekâ arasındaki ayrım çizgisi olarak kalacağı hipotezini ortaya koyduğunu belirtiyor. Bu, kaba kuvvet yaklaşımları için hâlâ geçerli; ancak sınır modelleri, ARC Prize'ın daha ikili bir örüntü olarak tanımladığı davranışı sergiliyor: model mekanikleri bir kez anladığında, yürütme genellikle insan verimliliği aralığına düşüyor.
Maliyet bağlamı için: insan katılımcılara 90 dakikalık oturum başına 115 dolar artı tamamlanan oyun başına 5 dolar ödendi; bu, denenen oyun başına yaklaşık 12,78 dolara denk geliyor. Beynin enerjisini yalnızca elektrik olarak fiyatlayan ARC Prize, oturum başına yaklaşık 0,6 sent, yani denenen oyun başına 0,067 sent tahmin ediyor.
Doğaçlama bir cebir
Astra'nın tekrar oynatımları, modelin tanıdık olmayan oyun mekaniklerini kompakt sembolik dünya modellerine dönüştürdüğünü gösteriyor. Nesneleri, koordinatları, kuralları ve yarım kalmış planları takip etti ve ortamlar için kendi alanına özgü stenografik gösterimini üretti. ARC Prize'ın yayımladığı örnekler arasında, işlemleri bunları gerçekleştiren kontrollerin koordinatlarına eşleyen yapılar; çok adımlı planların özlü düzenleme dizileri olarak kaydedilmesi; ve tur sayaçlarının oyuncunun konumu ve yönüyle birleştirilmesi yer alıyor. Benzer not alma davranışı diğer modellerde de görüldü, ancak ARC Prize'a göre Astra'nın notları kesinliği ve bilgi yoğunluğuyla öne çıktı; bir sahneyi, ne olduğu, parçaların nasıl etkileştiği ve hangi aksiyonların hangi sırayla gerçekleşmesi gerektiğinin kod benzeri bir modeline damıttı.
Neden önemli
Yalnızca test altyapısının ürettiği yaklaşık 37 puanlık skor salınımı, sınır benchmark sayılarının harness bağlamı olmadan okunamayacağının kesin bir hatırlatması; bir modelin çevresindeki iskelet artık model ayarlarının kendisi kadar sonuç doğuruyor. Sonuçlar ayrıca alışılmış hesaplama sezgisini tersine çeviriyor: en güçlü akıl yürütme ayarları, görevleri daha çabuk bitirdikleri için daha az maliyetli. Benchmark'ın kendi çerçevesi açısından en önemlisi, aksiyon verimliliğinde insan temel çizgisini geçmek, ARC Prize'ın testi özellikle ortaya çıkarmak için tasarladığı boşluğu daraltıyor. Uyarıları da unutmamak gerekir: bu skorlar yarı-özel değerlendirme setinde alındı, insanlar ortamların hâlâ %100'ünü çözüyor ve tek bir benchmark'taki tavana yakın sonuç, serinin genel zekâ olarak tanımladığı şeyin yalnızca bir dilimini ölçüyor.
- #openai
- #arc-agi
- #benchmarks
- #agentic-ai
- #reasoning-models
İlgili yazılar
- OpenAI'nin GPT-6 Astra'sı agent işler için yayına girdi ve Kritik siber risk derecesi aldı
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek