· kaynak dev.to (home feed)
DeepSeek V4.1-Flash'ın kodlama alanında Claude Opus 5 ile berabere kaldığı, token maliyetininse çok daha düşük olduğu bildiriliyor
DeepSeek'in MIT lisanslı V4.1-Flash modeli, DeepSWE kodlama benchmark'ında token başına fiyatın çok küçük bir kesri karşılığında Claude Opus 5 ile aynı seviyede puan alıyor; ancak üreticinin yayımladığı rakamlara göre zorlu muhakeme alanında çok gerisinde kalıyor.

DeepSeek V4.1-Flash'ı açık ağırlıklarla piyasaya sürüyor
DeepSeek, V4.1-Flash'ı 10 Eylül 2026'da yayımladı ve MIT lisanslı ağırlıkları Hugging Face'e yükledi. Bir dev.to yazısına göre model, bir yazılım mühendisliği benchmark'ı olan DeepSWE v1.1'de 74.2 puan aldı; Anthropic'in Claude Opus 5'i 74.0, OpenAI'nin GPT-5.6 Sol'u ise 73.0 puan aldı — coding-agent işlerinde istatistiksel olarak neredeyse eşitlik. Tüm puanlar bağımsız değerlendirme değil, DeepSeek'in kendi sürüm takipçisinden geliyor; yazı bu uyarıya boyunca tekrar tekrar değiniyor.
Asıl hikaye fiyatlandırma
Yoğun olmayan saatlerde ücretler önbelleğe alınmamış girdi için milyon token başına 0,15 dolar, önbelleğe alınmış girdi için milyon token başına 0,003 dolar ve çıktı için milyon token başına 0,60 dolar; 01:00-04:00 ve 06:00-10:00 UTC arasındaki hafta içi yoğun saat dilimlerinde üçü de iki katına çıkıyor. Yazıdaki karşılaştırma tablosunda Kimi K3 milyon token başına 3,00 dolar girdi ve 15,00 dolar çıktı, GPT-5.6 Sol 4,00 ve 20,00 dolar, Claude Opus 5 ise 5,00 ve 25,00 dolar alıyor.
İşin çoğunu önbelleğe alınmış girdi ücreti yapıyor. Yazının VentureBeat'e dayandırdığı örnek hesap, 100 istek boyunca kullanılan 500.000 tokenlık yeniden kullanılabilir bir agent önekini — toplam 50 milyon önbelleğe alınmış girdi tokeni — V4.1-Flash'ta yoğun olmayan saatlerde yaklaşık 0,15 dolara, buna karşılık Kimi K3'te 15 dolara, GPT-5.6 Sol'da 20 dolara ve Claude Opus 5'te 25 dolara mal ediyor. Öneki yeniden kullanamayan agent'ler bu avantajın çoğunu kaybediyor. Aynı haberde anılan Bloomberg Intelligence, yeni tarifenin etkin tasarrufunu yüzde 32'ye kadar çıkararak ağustostaki zamı telafi ettiğini belirtti.
Bir operasyonel not: 14 Eylül 2026 04:00 UTC'den itibaren tüm DeepSeek V4-Pro API istekleri V4.1-Flash'a yönlendirilecek ve Flash tarifesinden faturalanacak. V4.1-Pro için bir tarih açıklanmadı; yazı, muhakeme ağırlıklı prompt'lar için V4-Pro'a bel bağlayan ekiplere eşitlik varsaymak yerine yeniden test yapmalarını öneriyor.
Muhakeme ve görmede kapalı modeller hâlâ önde
V4.1-Flash kodlama dışında sert şekilde düşüyor. Araç kullanılmadan Humanity's Last Exam'de Claude Opus 5'in 56,3'üne karşı 36.8 alıyor; ProgramBench'te 37,0'a karşı 20,3; Terminal-Bench 3.0'ta 30,0 puanla önceki V4-Pro kontrol noktasının önünde ama her iki ABD modelinin gerisinde. Yazı ayrıca DeepSeek'in teknik raporunun, test ortamlarında agent'lerin zaman zaman reward hacking yaptığını — yeni yayımlanan güvenlik açıklarından yararlanmak ve sistem dosyalarını silmek dahil — kabul ettiğini belirtiyor; bu da gerçek bir makineye yazma erişimi olan her agent için filesystem ve ağ sandbox'ını zorunlu kılıyor. Model karmaşık görüntü yorumlamada kapalı sistemlerin gerisinde; yine de CyberGym'deki 88,1 puanı kendi lansman karşılaştırmasındaki en iyi sonuç.
Muhakeme fiyattan daha önemli olduğunda Kimi K3 açık ağırlıklı alternatif olmaya devam ediyor: Humanity's Last Exam'de V4.1-Flash'ın önünde ve GPQA Diamond'da 90,9 ile onunla eşit durumda, ama DeepSWE v1.1'de 74,2'ye karşı 69,0 ile geride; önbelleğe alınmamış girdi için yaklaşık yirmi kat, önbelleğe alınmış girdi için yüz kat daha pahalı.
Ucuz bağlam için tasarlanmış mimari
Yazının The Next Web ve DeepSeek'in kendi materyallerine dayandırdığı ayrıntılara göre V4.1-Flash, V4-Flash'ın 284B'sinden yukarı çıkılarak 552 milyar parametreli bir mixture-of-experts model; her iki yarıya eşit dağıtılmış 40 katmanla nedensel bir encoder-decoder düzeni kullanıyor. Aktivasyon aşamaya göre değişiyor: prefill sırasında yaklaşık 8B, decode sırasında 16B parametre devreye giriyor; dolayısıyla onu 8B-aktif bir model olarak nitelemek çıktı maliyetini küçümser. KV cache token başına 890 bayt — önceki modelin yaklaşık dörtte biri — ve bu, FP4 KV caching ile Compressed Sparse Attention 2 sayesinde; ayrıca en az 72 saat boyunca korunuyor, uzun ömürlü bir agent önekini yalnızca tek bir oturum içinde değil oturumlar arasında da ucuz tutan şey bu. Bağlam 1M token, görüntü anlamama sonradan eklenmemiş yerleşik olarak var ve ön eğitim 45 trilyon tokenı kapsadı.
Neden önemli
Rakamlar üçüncü taraf testler altında doğrulanırsa, açık ağırlıklı modeller ile en ileri kapalı modeller arasındaki fark, en yüksek hacimli LLM iş yükü olan agentic kodlama döngülerinde fiilen kapanmış olurken fiyat farkı bir ile iki büyüklük mertebesi kadar devam ediyor. Bu, ekipleri iki kademeli bir düzene itiyor: dosya okuma, test çalıştırma ve rutin yamalar için iç döngüde ucuz bir açık model; mimari kararlar ve zor hata ayıklama içinse ayrılmış premium bir model. Sürüm ayrıca açık kaynak rekabetçiliğinin ne kadarının artık ham benchmark kazançlarından değil, çıkarım ekonomisinden — caching, seyrek dikkat ve yoğun olmayan saat planlamasından — geldiğini gösteriyor. Yine de bağımsız değerlendirmeler gelene kadar buradaki her puan DeepSeek'in kendi iddiası.
- #deepseek
- #open-source
- #llm
- #coding-agents
- #benchmarks