· kaynak dev.to (home feed)
Testler, GPT-6 Astra'da maksimum reasoning effort'ın aynı cevaplar için low'un 2,3 katı maliyete mal olduğunu gösteriyor
dev.to'da yayınlanan bir benchmark, GPT-6 Astra'nın maksimum reasoning effort ayarının low ile aynı cevapları 2,3 kat maliyete verdiğini, lansman benchmark puanlarının ise hangi effort ayarı en yüksek puanı getiriyorsa onunla raporlandığını ortaya koydu.

Maksimum, aynı cevaplar için low'un 2,3 katı maliyetinde
Model karşılaştırma sitesinin sahibi olan Synthorai tarafından dev.to'da yayınlanan bir benchmark, GPT-6 Astra'yı reasoning_effort basamakları boyunca çalıştırdı ve en pahalı ayarın, en ucuz kullanılabilir basamağın zaten çözdüğü görevlerde hiçbir şey satın almadığını ortaya koydu.
reasoning_effort parametresi, modelin cevap vermeden önce ne kadar gizli düşünme yaptığını kontrol eder ve bu düşünme, reasoning tokenları olarak output oranında faturalandırılır. Yazar 11 görev hazırladı — aralarında arka arkaya 40 kez uygulanan bir kural, üç kısıt altında bir sayma problemi, bir knapsack örneği, bir taban dönüşümü ve 7 üzeri 222 mod 1000 — ve her birini önce yerel bir makinede kapsamlı aramayla çözdü; böylece cevap anahtarı herhangi bir API çağrısından önce netleşti. Her görev daha sonra OpenAI Chat Completions API konuşan bir endpoint üzerinden her effort ayarında üç kez çalıştırıldı.
Sonuç bir eğim değil, bir uçurumdu. Low'dan max'a kadar her ayar, hem GPT-6 Astra hem de GPT-5.6 Sol üzerinde 33 üzerinden kusursuz 33 puan aldı. Doğruluğu değiştiren tek değer none oldu; Astra'da 33 koşmanın 17'sinde başarısız oldu ve bir iterated-map görevinde üç denemede üç farklı yanlış sayı döndürdü. Gönderiye göre ayarlanabilecek kademeli bir şey yok: ya reasoning açık ve cevaplar doğru, ya da kapalı ve model tahmin ediyor.
Maliyet ise ayarla birlikte ölçekleniyor. Beş en zor görevde max, çağrı başına ortalama 370 reasoning tokenı ve 0,01946 dolar harcarken, low'da bu 151 token ve 0,00851 dolar — tamamen doğru, aynı cevaplar için 2,3 kat fiyat, reasoning tokenları milyonda 50 dolarlık output oranında ölçülüyor.
Kabul edilen değerler dokümantasyonla çelişiyor
Gönderi, parametrenin hangi değerleri aldığı konusunda üç yönlü bir anlaşmazlığı belgeliyor. Model sayfası beş basamak listeliyor — low, medium, high, xhigh ve max — ve Astra'nın none'ı desteklemediğini söylüyor. API'nin, herhangi bir model devreye girmeden önce istek biçimini inceleyen ilk doğrulama kontrolü, hata metninde yedi değer duyuruyor: none, minimal, low, medium, high, xhigh ve max. İkinci, modele özgü kontrol ise minimal'ı hem Astra'da hem Sol'da reddediyor — hiçbir yerde çalışmayan, duyurulmuş bir değer — buna karşılık dokümantasyona rağmen none'ı her iki modelde de kabul ediyor.
Hiçbir listede görünmeyen bir değer var: disabled, Astra'da kabul ediliyor ama Sol'da reddediliyor. Reasoning'i kapatmak bir yana, orta basamak gibi davranıyor; ortalama 243 reasoning token harcıyor (low'un 151'ine karşı) ve aynı doğrulukta doğru cevap başına %54 daha fazla maliyete mal oluyor. Hata mesajları ayrıca gpt-6-astra takma adının arkasındaki eski sürümü de ortaya çıkarıyor: gpt-6-astra-2026-09-03.
Lansman puanları en iyi basamaktan geliyor
Gönderi bu fiyatlandırmayı OpenAI'nin lansman benchmarklarına bağlıyor; bunların her effort düzeyindeki maksimum olarak dipnotlandığını söylüyor — yayınlanan her sayı, en yüksek puanı alan ayardan geliyor ve bağımsız Artificial Analysis liderlik tablosunda bu en iyi giriş Astra'nın max'ı, xhigh'ın bir puan üzerinde. Gönderide atıf yapılan endeksin güncel v4.2'si, Claude Fable 5.1'i 57 ile birinci, Astra'yı 55 ile üçüncü sırada yerleştiriyor.
Gönderide yeniden üretilen OpenAI'nin kendi lansman tablosu, Astra'yı agent tarzı ve matematiksel işlerde çok önde koyuyor: Terminal-Bench 4.0'da GPT-5.6 Sol'un 37,3'üne karşı %57,9, Terminal-Bench Science'da %64,6, FrontierMath Tier 4'te %97,6 ve ARC-AGI-3'te %99,9. Araçlı Humanity's Last Exam'de Claude Fable 5.1'in gerisinde, 65,0'a karşı 57,2, ve Artificial Analysis Intelligence Index'te de öyle — gönderinin belirttiği bu boşluklar tabloda görünüyor ama lansman metninde yok. Siber güvenlik rakamlarının, OpenAI'nin deyişiyle "production safeguard'lar olmadan" üretildiğini ve gönderilen modelin proof-of-concept exploit görevlerini reddedeceğini de ekliyor.
GPT-5.6 Sol'a göre doğru cevap başına maliyet
Liste fiyatında — 2026-09-07'de OpenAI model sayfalarında gösterildiği gibi Astra için milyonda token başına 10 dolar input ve 50 dolar output, Sol için 4 ve 20 dolar — etiket farkı 2,5 kat. 11 görev boyunca doğru cevap başına ölçüldüğünde, her iki modelin de low'dan yukarı kusursuz olduğu yerde, gerçek oran low'da 1,57 kat (0,00560 dolara karşı 0,00356 dolar), medium'da 1,66, high'da 1,85, xhigh'da 2,27 ve max'ta 2,57.
Neden önemli
API kullanıcıları için bu doğrudan bir maliyet kolu: modelin zaten low effort'ta doğru çözdüğü işlerde max çalıştırmak, ölçülebilir bir kazanç olmadan faturayı yaklaşık 2,3 kat büyütüyor. Gönderinin tavsiyesi, kendi görevlerinizi önce low'da ölçmek ve merdiveni yalnızca doğruluğun gerçekten arttığı yerde tırmanmak.
Bu aynı zamanda manşet puanlarının maliyete göre normalize edilmediği bir hatırlatma. Herhangi bir effort ayarının maksimumunda raporlanan bir benchmark, modelin bir değerini değil tavanını tanımlar ve bir modelin tavanına ulaşmanın diğerinkinden çok daha pahalı olabileceğini gizler. Low'dan daha fazla harcayan, dokümante edilmemiş disabled değeri, dokümantasyona karşı yapılandırma arayüzleri veya maliyet modelleri kuran herkes için ek bir tuzaktır.
Bir uyarı: bu, karşılaştırma araçları satan bir şirketten gelen, kendi kendine yayınlanmış tek bir benchmark; sayıları kesinleşmiş bir sonuç olarak değil, kendi iş yükünüzü test etmek için bir dürtü olarak ele alın.
- #openai
- #api-pricing
- #benchmarks
- #reasoning-models
- #cost-optimization
İlgili yazılar
- OpenAI, insan başına iş günü başına 3.1 agent-iş günü coding-agent runtime'ı çalıştırıyor
- Sınırların ötesindeki yapay zeka acenteleri istenmeyen faturalar gönderdi ve işletmeleri başında yaklaşık 3.200 dolar kaybetti
- Açık kaynak sıkıştırıcısı bzip3, Perl derlem testinde bzip2 ve xz karşısında büyük oran zaferi iddia ediyor