· kaynak Hacker News – Front Page (native)
xAI, en güçlü kodlama modeli Grok 4.7'yi piyasaya sürdü — fiyat değişmedi: milyon token başına 2/6 dolar
xAI, Grok 4.7'nin kodlama ve bilgi işi için en yetenekli modeli olduğunu belirtiyor. Model, Grok 4.6 ile aynı fiyat ve hızda sunuluyor; uzun süreli agentic benchmark'larda ise büyük kazanımlar sağlıyor.

xAI, şirketin kodlama ve bilgi işi için şimdiye kadarki en güçlü modeli olarak nitelendirdiği Grok 4.7'yi yayınladı. Öne çıkan detay teknikten çok ekonomik: xAI'nin duyurusuna göre Grok 4.7, daha yeni ve daha büyük bir temel model üzerinde çalışmasına rağmen Grok 4.6 ile aynı fiyat ve hızda sunuluyor; yani milyon input token başına 2 dolar ve milyon output token başına 6 dolar.
Kaputun altında ne değişti
Grok 4.7, selefinden daha büyük bir temel model üzerine inşa edildi ve daha zor bir görev karışımıyla daha uzun bir pekiştirmeli öğrenme (reinforcement learning) sürecinden geçirildi. xAI, eğitim karışımının bilinçli olarak tamamlanması saatler süren problemlere ağırlık verdiğini ve bunun modelin uzun süreli işlerdeki daha güçlü sonuçlarında kendini gösterdiğini söylüyor.
Şirket iki iyileştirmeye daha dikkat çekiyor: model kendi çıktısını daha güvenilir biçimde denetliyor ve daha uzun context pencelerini daha iyi yönetiyor. Ayrıca model, Grok Bot harness'ini doğal olarak anlaması için eğitildi; xAI bunu daha iyi konuşma davranışı ve genel bilgi performansına bağlıyor.
xAI tarafından bildirilen benchmark sonuçları
Uzun kodlama oturumlarına odaklanan bir benchmark olan CursorBench 4.0'da Grok 4.7, yüzde 46,3 skor alıyor; bu, Grok 4.6'nın yüzde 40,4'ünün üzerinde ve yüzde 41,7'lik GPT-5.6 Sol Max'ın önünde. Fable 5.1 Max bu karşılaştırmayı hâlâ yüzde 51,8 ile lider durumda sürdürüyor.
Kazanımlar en çok sebat gerektiren görevlerde büyük. Saatler süren terminal işlerini ölçen Terminal-Bench 4.0'da Grok 4.7, Grok 4.6'nın skorunu ikiye katlayarak yüzde 20,3'e karşı yüzde 38,0'a ulaşıyor. DeepSWE v1.1'de yüksek çaba (high-effort) yapılandırmasında yüzde 71,0 alıyor; GPT-5.6 Sol'ün yüzde 72,7'sinin hemen arkasında ve Fable 5.1'in yüzde 70,0'ının az önünde.
Model profesyonel bilgi işini de hedefliyor. Elektrik mühendisliği değerlendirmesi EEBench'de Grok 4.6'nın yüzde 53,0'ına karşı yüzde 64,0 skor alıyor. Harvey Legal Agent Benchmark'ta yüzde 19,6'ya ulaşıyor ve tek hanede skor alan diğer modellerin çok önünde. Modellerin normalde avukatların, hemşirelerin ve finans analistlerinin yaptığı görevleri üstlendiği GDPval'de Grok 4.7, 1695 Elo puanı kazanıyor; Grok 4.6 ve GPT-6 Astra'nın önünde ama 1735 puandaki Fable 5.1'in arkasında. HealthBench Professional'daki yüzde 56,7'lik skoru ise hem GPT-5.6 Sol hem de Fable 5.1'in gerisinde kalıyor.
Güvenlik ve siber güvenlik iddiaları
xAI, Grok 4.7'nin tamamen yeni bir koruma yığınıyla (safeguard stack) geldiğini ve reddetme ile jailbreak direnci konusunda test ettikleri en güçlü model olduğunu söylüyor. LatchBio'nun biyogüvenlik benchmark'ında yüzde 62,4 ile alanın zirvesinde yer alıyor ve xAI'nin kendi HackerBench v0.3'ünde riskli çift kullanımlı prompt'ların yalnızca yüzde 3,3'ünü geçirirken meşru güvenlik çalışmalarını nadiren engelliyor. Şirket ayrıca seçili siber güvenlik ortaklarına, savunma araştırmaları için modelin red-team yeteneklerine davetli erişim sunmaya başladı.
Fiyatlandırma ve kullanılabilirlik
Grok 4.7 şu anda Cursor ve Grok Build'de, ayrıca Grok API, üçüncü taraf kodlama harness'leri, model yönlendiricileri (router) ve bulut platformları üzerinden kullanılabiliyor. Hızlı bir varyant, iki kat fiyat karşılığında iki kat output hızı sunuyor. Yukarıdaki tüm benchmark ve fiyat rakamları xAI'nin kendi duyurusundan geliyor.
Neden önemli
Buradaki rekabetçi baskı fiyat-performans üzerinden. xAI'nin karşılaştırma tablosu, rakip frontier modellerin token başına birkaç kat daha pahalı olduğunu gösteriyor: GPT-5.6 Sol Max milyon input başına 4 dolar ve milyon output başına 20 dolar, Fable 5.1 Max ise 10 ve 50 dolar. xAI'nin rakamları tutarsa, Grok 4.7 frontier'e yakın kodlama yeteneğini bu maliyetin çok küçük bir bölümüne sunuyor; bu da token faturalarının ağır bastığı yüksek hacimli agentic iş yükleri çalışan herkes için önemli.
Kazanımlar ayrıca tam olarak sektörün yöneldiği yerde yoğunlaşıyor: tek turluk sohbet değil, terminallerde, IDE'lerde ve ofis işi harness'lerinde saatler süren, kendi kendine yürüyen görevler. Yine de, alıntılanan her skor üretici tarafından bildirildi ve xAI'nin seçtiği benchmark'larda ölçüldü; fiyat-perperformans iddiasının gerçek dünyadaki kullanımla temas edip etmeyeceğini bağımsız değerlendirmeler belirleyecek.
- #xia
- #grok
- #large-language-models
- #ai-coding
- #benchmarks
İlgili yazılar
- Grok 4.7, Vercel'in AI Gateway'sine 500K bağlam penceresi ve %40 lansman indirimiyle geldi
- Apple'ın 12.299 dolarlık M5 Ultra Mac Studio'su The Verge'in ilk benchmark testlerinde büyük performans artışı gösterdi
- Z.ai'nin GLM-5.3-Flash'ı: 18B aktif parametreli ve 1M token bağlamlı 320B açık ağırlıklı MoE modeli