· kaynak dev.to (home feed)
DeepSeek, 14 Eylül'de tüm V4-Pro API trafiğini daha ucuz V4.1-Flash'a yönlendirecek
14 Eylül 2026 saat 04:00 UTC'den itibaren DeepSeek, deepseek-v4-pro'a yapılan her isteği V4.1-Flash'a yönlendirecek. Şirket gerekçesini maliyetin çok küçük bir bölümü karşılığında daha güçlü agentic benchmark sonuçları olarak açıklarken, gerçek bilgi skorları geriliyor.

DeepSeek amiral gemisi ismini emekliye ayırıyor
14 Eylül 2026 saat 04:00 UTC'den başlayarak DeepSeek, deepseek-v4-pro adresine yapılan her API çağrısını V4.1-Flash'a yönlendirecek ve bir V4.1-Pro modeli piyasaya sürülene kadar — bu çıkışın şu an açıklanmış bir tarihi yok — bunu sürdürecek. DeepSeek'in duyurusuna dayanan bir dev.to gönderisine atıf yapan Nokka'ya göre şirket hamleyi tek cümleyle özetledi: "V4-Pro'u aşamalı olarak kaldırıyoruz." Belirtilen gerekçe, birden fazla tarafın yaptığı testlerde V4.1-Flash'ın eski amiral gemisini yetenek, maliyet, hız ve toplam runtime açısından geride bırakması.
Kaynak konusunda iki uyarı: bu haberin iki dev.to kaynağı aynı yazının İngilizce ve Tayca sürümleri; yazı bir AI ajanı tarafından kaleme alınıp yazarı tarafından düzenlenmiş. Altta yatan rakamlar DeepSeek'in API dokümantasyonundan ve duyurularından, rakiplerin lansman gönderilerinden, Coursiv ve Artificial Analysis'ten geliyor; bu yüzden satıcılar arası karşılaştırmalar bir miktar şüpheyle karşılanmalı.
Agentic benchmark sonuçları yükseldi, gerçek bilgi testleri geriledi
DeepSeek'in changelog kaydı, dev.to gönderisinde alıntılandığı haliyle, V4.1-Flash'ın uygulamalı işlerde net biçimde önde olduğunu gösteriyor: DeepSWE v1.1'de 74.2'a karşı 62.7, AutomationBench'te 54.8'e karşı 43.2, Agents' Last Exam'de 31.8'e karşı 25.7 ve CyberGym'de 88.1'e karşı 83.3. En büyük fark Terminal-Bench 4.0'ta; Flash burada V4-Pro'un 12.4'üne karşılık 31.2 puan alıyor.
Coursiv'e göre Terminal-Bench 2.1'de Flash'ın 90.6 puanı, 89.1'lik Claude Opus 5'i ve 88.8'lik GPT-5.6 Sol'u da geride bırakıyor — bu, yalnızca DeepSeek'in kendi önceki nesline değil, rakiplerin daha yeni sürümlerine karşı yapılan bir karşılaştırma.
Aynı tablolar başka yerlerde gerileme gösteriyor. Gerçek cevap doğruluğunu ölçen SimpleQA-Verified, V4-Pro'daki 55.2'den Flash'ta 42.3'e düşüyor. GPQA Diamond 92.4'ten 90.9'a, yalnızca metin tabanlı HLE ise 42.7'den 39.1'e geriliyor. Ortaya çıkan tablo, görevleri yürütmekte daha iyi hale gelirken dünyayı bir ölçüde daha az bilen bir model; agenci manşetler öne çıkarken bu ödünleşim, gerçek bilgi soru-cevap iş yüklerini de vuracak.
Daha büyük ama çalıştırması daha ucuz bir model
V4.1-Flash, token başına 16 milyar aktif parametreyle toplam 552 milyar parametreyle listeleniyor; fiyatı milyon girdi token başına 0,30 dolar ve milyon çıktı token başına 1,20 dolar. DeepSeek, yeni mimarinin KV cache belleğini dörtte bire, cache depolamasını önceki tasarımın sekizde birine indirdiğini söylüyor. Milyon token başına 0,006 dolar olan cache-hit oranı fiyatı standart fiyatın ellide biri; bu da bağlamı yoğun biçimde yeniden kullanan iş yükleri için önemli.
Rakipler farklı bahisler yapıyor
dev.to gönderisi DeepSeek'in hamlesini, birbirinin tersi yollar izleyen iki rakibe karşı çerçeveliyor. Z.ai hem bir amiral gemisi GLM-5.3 (753 milyar parametre, 1,40/4,40 dolar) hem de GLM-5.3-Flash (toplam 320 milyar, 18 milyar aktif, 0,15/0,50 dolar) sunuyor ve daha küçük modelin 3,0 kat daha az attention hesabı ile 4,4 kat daha küçük KV cache'e ihtiyaç duyduğunu, buna karşın 1M-token bağlam penceresini koruduğunu iddia ediyor.
Moonshot, 2,8 trilyon parametreli tek bir Kimi K3 sürümünü 3,00/15,00 dolara satıyor; reasoning modu her zaman açık ve kapatılamıyor — yalnızca düşük, orta ve maksimum arasında ayarlanabiliyor ve varsayılan maksimum — bu yüzden her istek reasoning token ücretlendiriyor. Gönderide alıntılanan Artificial Analysis rakamlarına göre görev başına maliyet, iki Flash modeli için kabaca 0,25 ile 0,27 dolar arasında iken amiral gemileri için yaklaşık 2,00 ile 2,01 dolar; buna rağmen bileşik skorlardaki farklar mütevazı.
Karşılaştırmaları dikkatle okuyun
Bu karşılaştırma, gönderinin kendisinin işaret ettiği bir uyarı taşıyor: Artificial Analysis 7 Eylül'de Intelligence Index v4.3'ü yayınladı ve GLM-5.3-Flash, index v4.1.1'de 57 puan alırken v4.3'te 42 alıyor — aynı model, daha zor bir test setine karşı. Çakışan rakamlar genellikle model değişikliği değil, farklı index sürümleri anlamına gelir. Benchmark rakamları ayrıca kendi test setlerini seçen satıcı ya da değerlendiricilerden geliyor ve tek bir bileşik skor, bir modelin belirli bir işe uyup uymadığı hakkında pek bir şey söylemez.
14 Eylül'den önce ne yapmalı
deepseek-v4-pro'a sabitlenmiş sistemleri olan herkes, onay gerekmeksizin geçiş anında davranış değişikliği görecek. Raporun pratik tavsiyesi: model adlarını açıkça sabitleyin, üretime dayanmadan önce yeniden test edin ve yeni sürümleri manşet skorları yerine kendi gerçek iş yüklerinizle ölçün; çünkü bilgi gerilemeleri bazı görevlerde agentic kazanımları aşabilir.
Neden önemli
Adında Flash yazan bir modelin, yerini aldığı amiral gemisini geçmesi, bir ekinin küçültülmüş bir kademe anlamına geldiği geleneği tersine çeviriyor. Bildirilen rakamlar tutarsa, model adları artık yeteneği söylemiyor ve token başına fiyat daha da az şey söylüyor — V4.1-Flash, agentic görevlerde V4-Pro'u daha düşük maliyetle geride bıraktı. Kullanımdan kaldırma kararı, büyük Çin laboratuuarlarının kadrolarını ne kadar farklı yapılandırdığını da gösteriyor: DeepSeek her şeyi tek bir verimli şeritte birleştiriyor, Z.ai iki kademeli bir çift tutuyor ve Moonshot, faturaları sessizce şişirebilen faturalandırma davranışına sahip tek bir çok büyük modeli zorluyor. V4.1-Pro'un sonunda daha ucuz kardeşini geçip geçmeyeceği ve Moonshot'un daha küçük bir K3 ile karşılık verip vermeyeceği, bunun tek seferlik bir hamle mi yoksa piyasanın yeni biçimi mi olduğunu belirleyecek.
- #deepseek
- #llm
- #model-deprecation
- #api-pricing
- #ai-benchmarks