deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Grok 4.7 benchmark tacını değil, varsayılan agent konumunu hedefliyor

xAI'nin Grok 4.7'si vasat bir genel muhakeme puanı elde ediyor ancak kendi harness'iyle eşleştiğinde kodlama agent'i benchmark'larında sıçrayış yapıyor; bu da agent iş akışlarındaki varsayılan model olma oyununa işaret ediyor.

Grok 4.7 benchmark tacını değil, varsayılan agent konumunu hedefliyor

Agent dağıtımına odaklı bir lansman

xAI, Grok 4.7'yi 21 Eylül 2026'da yayınladı ve en aydınlatıcı detay bir benchmark sayısı değil, modelin nerede ortaya çıktığı. Bir dev.to analizine göre Grok 4.7; xAI API, Cursor, xAI'nin Grok Build'i, bir GitHub Copilot dağıtımı ve üçüncü taraf gateway'ler üzerinden erişilebilir. Bu konumlandırma lansmanın çerçevesini çiziyor: xAI, genel bir leaderboard'un tepesindeki sıra için değil, kodlama agent'inizin varsayılan olarak yönlendirdiği konum için yarışıyor.

Bölünmüş bir benchmark hikayesi

Artificial Analysis, Grok 4.7'yi en yüksek "xhigh" muhakeme çabasıyla çalıştığında Intelligence Index'te 46 puanla derecelendirdi — yüksek çabayla çalışan Grok 4.6'nın iki puan üzerinde ve yazıda belirtilen 53'lük lider skorun altında. Tek başına bakıldığında bu bir frontier model zaferi değil.

Tablo agent ürünlerinin içinde değişiyor. Grok Build harness'iyle ölçülen Artificial Analysis'in Coding Agent Index'inde model 56'ya ulaşıyor; Grok 4.6'da bu sayı 47'ydi. dev.to tarafından özetlenen API dokümantasyonuna göre model kimliği grok-4.7; 500K token'lık bir bağlam penceresi, metin ve görüntü girişi, dört muhakeme çabası seviyesi, hem Responses hem Chat Completions API'leri desteği ve Mayıs 2026 bilgi kesim tarihi sunuyor. Daha hızlı sunulan bir varyant, Cursor ve Grok Build'de kabaca iki kat token fiyatıyla görünüyor ancak genel API üzerinden sunulmuyor.

Harness, skorun bir parçası

Aynı model lansmanda üç farklı Terminal-Bench 4.0 sonucu üretti: Grok Build harness'ini kullanan xAI model kartında %38,0 (sonuçlar Harbor'a atfediliyor), Artificial Analysis'in yerel Grok Build kurulumunda %33 ve değerlendiricinin standartlaştırılmış harness'i altında kabaca %26.

dev.to yazısı, bu sayıların farklı soruları yanıtladığını savunuyor. Yerel harness skorları bir ürün yığınının ne sunduğuna yaklaşır; standartlaştırılmış skorlar ortak bir protokol altında model yeteneğini yalıtır. Bir agent bir yığın olduğundan — model, system prompt, araç şeması, depo bağlamı, planlama döngüsü, hata kurtarma, doğrulama politikası — çıplak bir model skoru, gerçekten dağıtacağınız sistemin davranışını öngöremez. Pratik tavsiye, göndermeyi planladığınız tam kombinasyonu benchmark'lamanız yönünde.

Kazanımlar uzun vadeli işlerde yoğunlaşıyor

En güçlü iyileşmeler, bir planı sürdürmeyi ve teslim edilebilir bir çıktı üretmeyi gerektiren görevlerde görünüyor. Gerçekçi profesyonel iş ürünlerini değerlendiren AA-Briefcase'te Grok 4.7, 1657 Elo'ya ulaşıyor; bu, yüksek çabadaki Grok 4.6'nın 111 puan üzerinde. GDPval-AA'de ise 1695 Elo'ya ulaşıyor; 90 puanlık bir artış. Grok Build ile Coding Agent Index'in üç bileşeni de iyileşiyor: DeepSWE %65'ten %73'e, Terminal-Bench 4.0 %18'den %33'e ve SWE-Atlas-QnA %58'den %63'e çıkıyor.

Artificial Analysis ayrıca AA-Omniscience'te daha düşük bir halüsinasyon oranı bildiriyor — %34'ten %29'a düşüş — ancak ham doğruluk kabaca sabit kaldığından, bu durum halüsinasyonlar için genel bir çözüm değil, o değerlendirmede daha iyi bir kısıtlanmaya işaret ediyor. Makul aday iş yükleri arasında depo ölçeğinde uygulama ve hata ayıklama, araç kullanımı ve kurtarma gerektiren terminal görevleri ve yapılandırılmış bir belge, elektronik tablo veya sunumla sonuçlanan araştırmalar sayılabilir.

Çıktı token'ları gizli maliyet değişkeni

xAI'nin liste fiyatı, 200K token'lık uzun bağlam eşiğinin altında milyon giriş başına 2 dolar, önbelleğe alınmış giriş için 0,50 dolar ve milyon çıktı token'ı başına 6 dolar; eşiğin üzerinde ise 4 ve 12 dolara yükseliyor. Bu oranlar rekabetçi görünüyor ancak token başına fiyat, faturanın yalnızca bir kalemi. Artificial Analysis, xhigh'taki Grok 4.7'nin Intelligence Index görevi başına kabaca 81K çıktı token'ı tükettiğini bildiriyor; yüksek çabadaki Grok 4.6 için bu sayı 36K (yazının grafiği xhigh'taki Grok 4.6 için 38K gösteriyor) ve GPT-6 Astra max için yaklaşık 27K.

dev.to analizi bu nedenle kabul edilen görev başına maliyet metriği öneriyor: muhakeme token'ları, yeniden denemeler, zaman aşımları ve başarısız çıktılar dahil tüm denemelerdeki toplam harcamanın, kabul testinden geçen sonuç sayısına bölünmesi. Döngüye giren veya yeniden deneme gerektiren ucuz listeli bir model, işi temiz bitiren pahalı bir modelden daha fazlasına mal olabilir.

Yazı ayrıca gateway sağlayıcısı BeatAPI'nin herkese açık grok-4.7 modelini hem standart hem uzun bağlam satırlarında xAI'nin yayınladığı oranların %35'i üzerinden listelediğini ve OpenAI, Anthropic ile Gemini uyumlu istek formatlarıyla sunduğunu belirtiyor — ancak nihai faturayı yine kabul edilen görev başına ekonomi belirlediği uyarısını da ekliyor.

Neden önemli

Grok 4.7, model lansmanlarının nasıl okunması gerektiğindeki bir değişimi örnekliyor. Genel amaçlı indeks skorları, bir agent'ın gerçekte çalıştırdığı harness içindeki performansdan daha az önem taşıyor ve satıcılar giderek artan biçimde model artı harness'i tek bir ürün olarak sunuyor. Agent geliştiricileri için üç sonuç doğuyor: çıplak model yerine dağıttığınız tam yığını benchmark'layın; birinci taraf harness'lerin yeteneği leaderboard'ların yakalamadığı şekillerde güçlendireceğini (veya maskeleyeceğini) bekleyin; ve maliyetleri kabul edilen görev başına hesaplayın, çünkü muhakeme ağırlıklı modeller çıktı token tüketimini sessizce üçe katlayabilir. xAI, araçlarınızın içinde hangi modelin varsayılan haline geleceğini tek bir taç skorunun değil, dağıtım ve entegrasyon derinliğinin belirlediğine bahse giriyor.

  • #grok
  • #xai
  • #ai-agents
  • #llm
  • #benchmarks

İlgili yazılar