· kaynak dev.to (home feed)
GPT-6.1 Sol token fiyatlarını sabit tutuyor, cache'lenmiş girdiyi yarıya indiriyor, none effort seviyesini kaldırıyor
OpenAI'nin GPT-6.1 Sol API'si standart token fiyatlarını değiştirmiyor ancak cache'lenmiş girdi maliyetini milyon token başına 0,10 dolara indiriyor ve birçok gpt-6-sol kullanıcısının bel bağladığı none reasoning ayarını kaldırıyor.

OpenAI, GPT-6.1 Sol modelini 29 Eylül 2026'daki DevDay etkinliğinde duyurdu ve model Responses API üzerinden gpt-6.1-sol tanımlayıcısıyla zaten erişilebilir durumda. Ertesi gün yayımlanan iki dev.to rehberine göre standart fiyatlandırma gpt-6-sol'dan değişmeden aktarılıyor — milyon input token başına 2 dolar ve milyon output token başına 10 dolar — ancak cache'lenmiş girdi milyon token başına 0,20 dolardan 0,10 dolara düşüyor. Prompt caching'e ağır şekilde yaslanan iş yükleri için asıl değişiklik bu cache indirimi.
Fiyatlandırma ve limitler büyük ölçüde aynen aktarılıyor
Cache indiriminin ötesinde dev.to'ya göre neredeyse tüm diğer özellikler selefiyle birebir aynı. Cache yazma işlemleri hâlâ milyon token başına 2,50 dolar tutuyor, context window 1.050.000 token olarak korunuyor (922.000 token'lık input tavanı ve 128.000 token'lık output tavanıyla) ve rate limitleri değişmedi: tier 1'de dakikada 500 istek ve 500.000 token, tier 5'te dakikada 15.000 istek ve 40 milyon token. Chat Completions, Responses ve Batch endpoint'lerinin tümü kullanılabilir durumda.
İki kalem ise değişiyor. Bilgi kesim tarihi 20 Nisan 2026'dan 30 Nisan 2026'ya ilerliyor; dolayısıyla güncelliğe duyarlı değerlendirmeler migration sonrasında yeniden çalıştırılmalı. Ayrıca dev.to'nun aktardığı model sayfasına göre 272.000'den fazla input token içeren herhangi bir istek, isteğin tamamı için standart input ve cache ücretlerinin iki katı ile output ücretinin 1,5 katı üzerinden faturalandırılıyor.
Migration bir model-ID değişimi, ama ciddi istisnaları var
Çoğu kod tabanı için yükseltme tek bir dizgiyi değiştirmekten ibaret; rehberler model ID'yi configuration'da ya da bir environment variable'da tutmayı öneriyor ki geri dönüş tek bir değişiklikle yapılabilsin. İstisnalar ise önce ele alınmalı:
- reasoning.effort parametresi artık none veya minimal kabul etmiyor; ikisi de low ile eşlenmeli. GPT-6 Astra'da none göndermek HTTP 400 döndürüyor; bu yüzden rehberler production trafiğini geçmeden önce bu yapılandırmayı düzeltmesi konusunda uyarıyor.
- Sampling parametreleri — temperature, top_p ve top_logprobs, ayrıca Chat Completions'ta logprobs — effort none olmadığı sürece kaldırılmalı.
- Chat Completions'taki function calling tamamen kaldırıldı. gpt-6-sol bunu yalnızca reasoning_effort none ile birlikte destekliyordu ve bu kombinasyonun yeni modelde bir karşılığı yok; dolayısıyla araç tabanlı iş akışlarının Responses API'ye taşınması gerekiyor.
- Bilgi kesim tarihi değiştiği için tarihe duyarlı kontroller yeniden çalıştırılmalı.
GPT-6 Sol model sayfası artık okuyucuları daha yeni Sol model olarak GPT-6.1 Sol'a yönlendiriyor; bu, eski ID'nin kullanımdan kaldırılmaya başlandığının bir sinyali.
Reasoning effort başlıca ayar olmaya devam ediyor
Varsayılanı medium olan Effort, dev.to tarafından maliyet, gecikme süresi (latency) ve kalite üzerindeki birincil kontrol olarak tanımlanıyor. Rehberlerde özetlenen, OpenAI'nin yeni model için bildirdiği benchmark sonuçları: low effort'ta, daha önce hatalı olarak işaretlenmiş konuşmalarda gerçek bilgilere aykırı hata içeren yanıtlar GPT-6 Sol'daki yüzde 11,4'ten yüzde 7,7'ye düştü; medium'da AutomationBench 1.0.6, kabaca üçte bir maliyetle Claude Opus 5.5 karşısında 2,2 puan ve aynı ayarda GPT-6 Sol karşısında 4,8 puan iyileşti; max'ta OSWorld 2.0 GPT-6 Sol'ya göre 7 puan kazandı ve Terminal-Bench Science'ta görev başına maliyet 5,47 dolar olurken Opus 5.5 için 23,21 dolar, GPT-6 Astra için 23,80 dolar oldu.
Rehberler uyarılar da ekliyor: doğruluk havuzu, tipik trafik yerine kullanıcıların zaten hatalı olarak işaretlediği konuşmalardan oluşuyor ve GPT-6 Astra Terminal-Bench Science'ta yüzde 68,1 ile hâlâ önde; bu yüzden OpenAI en zor bilimsel işler için Astra'yı önermeye devam ediyor. Daha önce none kullanan gecikmeye duyarlı çağrıcılar için önerilen yol, low'dan başlamak ve taahhütte bulunmadan önce temsili prompt'lar üzerinde latency, maliyet ve kaliteyi ölçmek.
İzlenmeye değer response alanları
Yanıtları işlerken dev.to birkaç ayrıntıya dikkat çekiyor. completed durumu başarıyı işaret ederken, incomplete_details.reason değeri max_output_tokens olan incomplete durumu, çıktı bütçesinin — muhtemelen görünür herhangi bir metinden önce — tükendiği anlamına geliyor. output alanı bir dizi olduğu için kod, index konumlarına güvenmek yerine type değeri message olan öğeyi bulmalı. Faturalandırma açısından usage.output_tokens, output ücretiyle faturalanan reasoning token'larını da içeriyor ve sayı output_tokens_details içinde ayrıştırılmış durumda; input_tokens_details ise cached_tokens ve cache_write_tokens değerlerini gösteriyor — daha ucuz cache'in gerçekten uygulanıp uygulanmadığını doğrulayacağınız yer tam olarak burası. OpenAI'nin reasoning kılavuzu, deneme yaparken reasoning ve output için en az 25.000 token ayırmayı öneriyor; ayrıca effort, istek düzeyindeki parametre yerine configuration_update input öğesiyle konuşma ortasında değiştirilebiliyor ve bu yöntem prompt cache'ini koruyor.
Neden önemli
Cache'lenmiş girdi fiyatının yarıya indirilmesi, kabaca bir milyon token'lık bir pencereye sahip bir modelde büyük ve tekrarlayan context'e dayalı iş yüklerinin ekonomisini anlamlı şekilde değiştiriyor ve kararlı önekleri sıcak tutan mimarileri ödüllendiriyor. Öte yandan, dizgi değişimi gibi görünen bir migration, iki kırıcı değişikliği gizliyor — none effort seviyesinin kaldırılması ve Chat Completions'ta tool calling kaybı — ve bunlardan herhangi biri bir production hattını client hatalarıyla devre dışı bırakabilir. Effort artık yalnızca low'dan max'a uzanıyor ve reasoning token'ları output olarak faturalandığından, effort ayarı ile cache davranışı birlikte toplam maliyeti belirliyor; bu da geçişten önce ve sonra ölçüm yapmayı bu yükseltmenin asıl işi haline getiriyor.
- #openai
- #api
- #llm
- #pricing
- #migration