· kaynak Hacker News – Front Page (hnrss.org)
GPT-6.1 Sol, yedi gün sonra GPT-6 Sol'un yerini aldı: Astra'ya yakın zekâ, dörtte bir maliyetle
OpenAI'nin GPT-6.1 Sol'u yalnızca yedi gün sonra GPT-6 Sol'un yerini aldı; Artificial Analysis'in endeksinde GPT-6 Astra'nın bir puan gerisinde kaldı ve görev başına maliyeti dörtte birin altında.

OpenAI'nin Sol kademesi yalnızca yedi gün sonra baştan aşağı yenilendi: GPT-6.1 Sol, GPT-6 Sol'un yerini aldı ve Artificial Analysis Intelligence Index'te daha pahalı olan GPT-6 Astra'nın bir puan gerisinde yer alırken görev başına maliyeti onun dörtte birinden daha düşük. Bulgular, yeni modele ilişkin değerlendirmesi 29 Eylül'de Hacker News ana sayfasına ulaşan Artificial Analysis'ten geliyor.
Benchmark kazanımları
Artificial Analysis'e göre GPT-6.1 Sol, GPT-6 Sol'a kıyasla dört, GPT-5.6 Sol'a kıyasla beş Intelligence Index puanı ekleyerek GPT-6 Astra'nın yalnızca bir puan gerisinde kaldı. En büyük tek sıçrama, modelin 12 puan kazandığı Terminal-Bench 4.0'da geldi; onu AA-Omniscience'da sekiz puanlık doğruluk artışı izledi. Diğer hareketler arasında GDP.pdf'de altı, hem Humanity's Last Exam hem de GDPval-AA v2.1'de beş, AA-Briefcase v1.1'de dört puan var; agent tabanlı bilgi işi değerlendirmeleri en istikrarlı ilerlemeyi gösteriyor.
Doğruluk, dürüstlükle birlikte iyileşti: AA-Omniscience'da ölçülen halüsinasyon oranı %60'tan %54'e düştü. Bu anlamlı bir kayma, ancak gerçeklere dayanan her şey için hâlâ yeterince yüksek bir seviye. AA-Briefcase'te model, güçlü rubric ve analiz kalitesi puanlarıyla yaklaşık 80 Elo yükselirken sunum puanı hafifçe geriledi.
Fiyatlandırma ve maliyet verimliliği
Liste fiyatları değişmedi: milyon giriş başına 2 dolar ve milyon çıktı token'ı başına 10 dolar, tıpkı GPT-6 Sol'daki gibi. Efektif indirim caching'den geliyor; cache okuma indirimi %90'dan %95'e çıktı. Artificial Analysis, bunun agent tabanlı iş yükleri için harmanlanmış fiyatı GPT-6 Sol'ununkinden biraz daha düşük hale getirdiğini hesaplıyor; bu da GPT-6 Sol'un GPT-5.6 Sol'un yarısı fiyatla piyasaya sürülmesiyle başlayan fiyat düşüşünü uzatıyor.
Maksimum çabayla Intelligence Index görevi başına ölçülen maliyette GPT-6.1 Sol 0,72 dolar tutuyor; GPT-6 Astra için bu 3,26, GPT-6 Sol için 1,05 ve GPT-5.6 Sol için 1,99 dolar. Bu, yerini aldığı modelden %31, bir önceki nesilden %64 daha ucuz. Artificial Analysis ayrıca yeni modelin her çaba seviyesinin maliyet verimliliği Pareto sınırını genişlettiğini, yani başka hiçbir modelin aynı zekâ puanını daha az paraya sunmadığını bildiriyor.
Ödünleşim: token kullanımı
Kazanımlar bedelsiz değil. GPT-6.1 Sol, tüm çaba ayarlarında GPT-6 Sol'a kıyasla kabaca %10–30 daha fazla çıktı token'ı üretiyor. Zekâ puanı da yükseldiği için düşük ve orta çaba kademeleri token verimliliği açısından Pareto optimal olmayı sürdürüyor; ancak ham çıktı hacmine göre faturalanan veya bağlam sınırlarına yakın çalışan herkes bu artışı fark edecek.
Kodlama sonuçları
Artificial Analysis Coding Agent Index'te GPT-6.1 Sol, maksimum çabayla GPT-6 Sol'a karşı üç puan kazanıyor ve GPT-6 Astra'nın iki puan gerisinde duruyor. Xhigh çaba ayarında ise GPT-6 Astra'nın bir puan üzerinde skor alıyor ve görev başına maliyeti onun %15'inden daha az; bu, GPT-6 Sol'un maksimum çabasına göre altı puan ve kendi maksimum ayarına göre üç puan daha iyi. Artificial Analysis, xhigh yapılandırmasının maksimumu açık ara geçtiğini buldu; bu olağan dışı bir tersine dönme ve kodlama agent'ları için çaba ayarının artık model seçimi kadar önemli olduğunu gösteriyor.
Neden önemli
Yedi günlük bir değiştirme döngüsü, orta kademe modellerin ne kadar hızlı dayaniksiz ürünlere dönüştüğünü gösteriyor. Görev başına dörtte bir maliyetle amiral gemisine yakın yetkinlik, agent tabanlı ve kodlama iş yüklerinin ekonomisini yeniden şekillendiriyor; çünkü üretime neyin çıkacağına karar veren sayı token başına maliyet değil, tamamlanan görev başına maliyet. Uyarılar da aynı ağırlığı hak ediyor: Yanıt başına daha fazla çıktı token'ı ve AA-Omniscience'da %54 halüsinasyon oranı, başlıktaki fiyatın sözcüklülüğe veya gerçeksel güvenilirliğe duyarlı iş yükleri için toplam maliyeti olduğundan düşük gösterdiği anlamına geliyor. Alıcılar için pratik ders şu: Sol kademesi artık çoğu iş için fiyat/performans seçimi ve bu kadrodaki herhangi bir tek nokta sürümüne derinden bağlanmak ciddi bir değer kaybı riski taşıyor.
- #openai
- #llm
- #benchmarks
- #pricing
- #gpt-6
İlgili yazılar
- Açık ağırlıklı Darwin-180B-RSI, sıfır hukuk eğitim verisiyle İsviçre hukuk sınavı kıyaslamalarında zirvede
- Neuron AI 4 iş akışı motorunu yeniden yazdı, Guzzle'dan vazgeçti ve UI protokol desteğini genişletti
- OpenAI ajan sürüsünün Hugging Face'e yaptığı bildirilen saldırı, model koruma bariyerlerinin sınırlarını ortaya koyuyor