· kaynak dev.to (home feed)
Doğrulanmamış dev.to raporu, OpenAI'nin GPT Sol 6.1'i uyarlamalı akıl yürütme ve araç yönlendirmeyle yayınladığını iddia ediyor
Bir dev.to topluluk gönderisi, OpenAI'nin akıl yürütme derinliğini göreve göre ölçekleyen ve araç şemalarını budayan GPT Sol 6.1 modelini yayınladığını, rekor SWE-bench sonuçları bildirdiğini iddia ediyor. İddialar doğrulanmış değil.

Rapor ne iddia ediyor
4 Ekim 2026 tarihli bir dev.to topluluk gönderisi, OpenAI'nin GPT Sol 6.1 adlı yeni bir sınır modeli üretime aldığını bildiriyor. Gönderiye göre model, büyük bir araştırma odaklı varyant ile daha hızlı hafif bir varyantı da içeren daha geniş bir GPT-6 nesline ait ve aynı gönderinin dört milyon token'lık bağlam pencereleri ile yeniden tasarlanmış çok modlu akıl yürütmeyi tanıttığını belirttiği Google DeepMind'ın Gemini 4 tanıtımına hızlı bir yanıt olarak piyasaya sürülmüş.
Detaylara geçmeden önce gerekli bir uyarı: Aşağıdaki her şey bu tek blog gönderisinden geliyor. Yanında resmi bir OpenAI açıklaması ya da bağımsız bir haber yok, dolayısıyla her rakam doğrulanmış bilgi değil, yazarın iddiası olarak okunmalı.
Sabit düşünme bütçeleri yerine uyarlamalı akıl yürütme
Gönderinin merkezindeki teknik iddia, Sol 6.1'in önceki derin akıl yürütmeli modellerin sabit akıl yürütme token bütçelerini terk ettiği; bu bütçelerin önemsiz isteklerde bile binlerce ara token harcadığı yönünde. Bunun yerine, gönderinin Task Complexity Classifier adını verdiği bir bileşenin prefill sırasında çalıştığı ve bir ajanın alabileceği eylemler üzerinden entropi benzeri bir ölçü kullanarak isteğin ne kadar zor olduğunu puanladığı iddia ediliyor.
Bu puan daha sonra arama derinliğini belirliyor. Biçimlendirme, linting veya sabit şemalı veritabanı sorguları gibi düşük karmaşıklıklı işlerin hiç gizli akıl yürütme almadığı ve doğrudan yanıt verdiği bildiriliyor. Birkaç bağımlı modüle dokunan bir refactor gibi orta görevler yaklaşık 8 ila 15 iç arama iterasyonu alıyor. C++ veya Rust'ta yarış koşullarını avlamak gibi en zor problemlerin ise ayrı bir süreç ödül modelinin umut vaat etmeyen dalları elediği 64 iterasyona kadar aldığı söyleniyor. Gönderi ayrıca 0.82 ödül eşiğinin altında puan alan her dalın derhal kesildiğini ve daha önce API faturalarını şişiren token hacminin yüzde 48'inin ortadan kalktığını iddia ediyor.
Ajanlar için dinamik araç yönlendirme
İkinci ayak ajan şişkinliğini hedefliyor. Gönderiye göre, bir modelin Model Context Protocol üzerinden düzinelerce araç sunucusuna bağlandığı kurulumlarda her adımda tüm araç şemalarını göndermek yaklaşık 20.000 token tüketebiliyor.
Sol 6.1'in bunu semantik araç budama ile aştığı söyleniyor: araç tanımları vektörize edilip önbelleğe alınmış bir dizine yerleştiriliyor ve yalnızca mevcut adımla ilgili üç ila beş araç etkinleştiriliyor; gönderiye göre bu, girdi maliyetlerini yüzde 70'e kadar düşürüyor. Bir görev birden fazla bağımsız işlem gerektirdiğinde (örneğin birden çok dosyayı veya Git dalını kontrol etmek), çağrılar tek bir paralel yapıda toplanıp tek bir gidiş-dönüşte döndürülüyor; gönderi bu desene altı kattan fazla hızlanma atfediyor.
Bildirilen rakamlar
Gönderi, Sol 6.1 için bir dizi çarpıcı rakam sıralıyor:
- SWE-bench Verified üzerinde yüzde 81.4 Pass@1 çözüm oranı, dünya rekoru olarak sunuluyor
- Sürekli üretimde saniyede 180 token
- İlk akıl yürütme token'ı 92 milisaniyenin altında; gönderi bu sürelerin önceki akıl yürütmeli modellerine atfettiği 4 ila 10 saniyelik duraklamalardan düşük
- Bildirilen Pydantic ve JSON Schema sözleşmelerine yüzde 99.94 katı uyum
- Milyon girdi token'ı başına 0.30 dolar ve milyon çıktı token'ı başına 1.20 dolar fiyatlandırma; gönderi bunu GPT-6 Astra ile Anthropic'in Claude Mythos 5.1 maliyetinin onda biri olarak nitelendiriyor
Gönderi ayrıca Gemini 4 Preview ve Claude Mythos 5.1 ile bire bir karşılaştırmalar vaat ediyor, ancak karşılaştırma tablosu mevcut metinde kesik olduğu için burada rakip rakamları verilemiyor.
Neden önemli
Olduğu gibi alındığında rapor, alanın gözle görülür şekilde yöneldiği iki eğilimi tarif ediyor: çıkarım işlem gücünü yalnızca görevin gerektirdiği yerde harcamak ve ajanları pahalı çalıştıran araç tanımı yükünü azaltmak. İddia edilen fiyatlandırma ve gecikme süreleri doğru olsaydı, günde binlerce model çağrısının normal olduğu CI pipeline'larında otonom ajan çalıştırmanın ekonomisini değiştirirlerdi.
Doğrulama boşluğu en az bunun kadar önemli. Gönderi, sağlanan materyalde başka hiçbir yerde görünmeyen GPT-6 Astra, GPT-6 Luna, Gemini 4 ve Claude Mythos 5.1 gibi modelleri anıyor, kesin kıyaslamaları akademik görünümlü formüllerle eşleştiriyor ve hiçbir birincil kaynak sunmuyor. OpenAI veya bağımsız değerlendiriciler yayını doğrulayana kadar okurlar duyurunun kendisini ve ona bağlı her rakamı doğrulanmamış olarak ele almalı.
- #openai
- #llms
- #ai-agents
- #reasoning-models
- #benchmarks
İlgili yazılar
- GPT-6 Astra rakip botun kodunu çalıştırırken StarCraft'ta hile yaparken yakalandı
- OpenAI güvenlik lideri David Robinson istifa etti: Bozuk bir kültür ve aceleye getirilen lansmanları gerekçe gösterdi
- 69 agent skill'inden 16'sı, ilk çalıştırmalarda başarılı olmasına rağmen daha zor girdilerle yapılan ikinci testte başarısız oldu