· kaynak dev.to (home feed)
DeepSeek V4.1 Flash, V4 Pro doğruluğunu cevap başına 3–6 kat daha düşük maliyetle yakalıyor
Bağımsız dev.to kıyaslamaları, DeepSeek V4.1 Flash'ın doğrulanabilir 33 görevde V4 Pro ile aynı doğruluğu yakaladığını, doğru cevap başına 3–6 kat daha ucuz olduğunu ve çok daha hızlı çözümlediğini gösteriyor; ancak thinking modu kapatılınca doğruluk ciddi biçimde düşüyor.

10 Eylül'de yayımlananlar
DeepSeek, V4.1 Flash'ı 10 Eylül'de yayımladı ve dev.to'da yayınlanan uygulamalı bir değerlendirme nelerin değiştiğini ele alıyor. DeepSeek, modeli yeni bir mimari ailesinin en küçüğü olarak tanımlıyor: causal bir encoder-decoder düzeninde toplam 552 milyar parametre; prompt'u okuyan 20 katmanlı bir yığın ve cevabı yazan bir başka yığın, girdi token'ı başına 8 milyar, çıktı token'ı başına 16 milyar aktif parametre. Ayrıca yerel görüntü girdisi — bir Flash modelinde bir ilk — eklenmiş; 1M token'lık bağlam penceresi, 384K çıktı sınırı ve MIT lisansı sunuluyor.
dev.to gönderisinde aktarıldığı şekliyle DeepSeek'in fiyat sayfasına göre fiyatlandırma, yoğun saatlerde (hafta içi 01:00–04:00 ve 06:00–10:00 UTC) milyon girdi token'ı başına 0,30 dolar ve milyon çıktı token'ı başına 1,20 dolar; yoğun olmayan saatlerde yarıya iniyor, cache isabetleri ise 0,006 ve 0,003 dolar. V4 Pro ise yoğun saatlerde 1,32/3,96 dolar seviyesinde. Eski V4 Flash, Vision Exp sürümüyle birlikte emekliye ayrıldı ve API adları artık V4.1 Flash'a, Flash fiyatlarıyla yönlendiriliyor. DeepSeek ayrıca 14 Eylül'den itibaren V4 Pro trafiğini V4.1 Flash'a yönlendirmeyi planlıyordu, ancak kullanıcı talebini gerekçe göstererek aynı gün bu planı değişiklik günlüğünden kaldırdı; böylece Pro, Pro fiyatlarıyla kullanılabilir durumda kaldı.
dev.to yazarı, fiyatın aksine teknik altyapının daha az değiştiğine dikkat çekiyor: tokenizer üç sürümde de aynı, dolayısıyla token bütçeleri doğrudan taşınıyor. Cache sayfaları 1.024 tokendan 512'ye yarıya indi, içine bir değer yerleştirilmiş 902K token'lık bir prompt doğru değeri geri döndürdü ve 1M penceresini aşan promptlar artık sessizce kesilmek yerine 400 hatası veriyor.
Resmî rakamlar ile bağımsız bir kontrol
DeepSeek'in kendi model kartı, V4.1 Flash'ı emekliye ayrılmış Flash'tan her alanda, Pro'dan ise agent ve kodlama işlerinde üstün gösteriyor — Codeforces 3471'e karşı 3348, Terminal-Bench 4.0'ta 31,2'ye karşı 12,4, DeepSWE'de 74,2'ye karşı 62,7, CyberGym'de 88,1'e karşı 83,3, AutomationBench'de 54,8'e karşı 43,2 — ama bilgi görevlerinde Pro'nun gerisinde: GPQA Diamond'da 92,4'e karşı 90,9 ve HLE'de 42,7'ye karşı 36,8.
dev.to'daki bağımsız test, bu tablonun doğrulanabilir yarısını kapsıyor: her biri üç kez çalıştırılan, tek ve doğrulanabilir sayısal cevabı olan 11 görev (asal toplamları, ızgara yolları, 40 kez uygulanan bir kural, kalanı korunarak 222. kuvvetten 7, bir knapsack ve diğerleri). Thinking açıkken üç sürüm de 33 üzerinden 33 aldı; yani bu test takımı modelleri doğruluktan çok maliyet ve hız bakımından ayrıştırdı. Yoğun saat fiyatlarıyla, akıl yürütme çabasına bağlı olarak V4.1 Flash'ta doğru bir cevap 0,00097 ile 0,00149 dolar arasındayken, V4 Pro'da 0,00286 ile 0,00825 dolar arasında — düşük çabada 2,9 kat, varsayılan yüksek çabada 5,2 kat ve maksimumda 6,4 kat fark — ve düşük çabada V4 Flash'tan %26 daha ucuz.
Hız da yeni modelden yanaydı. Thinking kapalıyken akan şekilde çözümlendiğinde, V4.1 Flash ilk token'a 1,4 saniyede ulaşarak saniyede 121–134 çıktı token'ı üretti; buna karşılık V4 Flash saniyede 86–94, Pro ise 46–49 token üretti. İki turluk bir function-calling döngüsünde her sürüm tur başına tam olarak bir çağrı yaptı ve V4.1 Flash her ayağı için 0,00019 dolara mal olurken Pro'da bu tutar 0,00103 dolardı.
Tasarım yaparken dikkat edilmesi gereken davranışlar
dev.to değerlendirmesi iki hata moduna işaret ediyor. Thinking kapatıldığında tüm sürümler 33 üzerinden 21'e düşüyor ve bu modda V4.1 Flash, görünür bir şekilde başarısız olmak yerine çok adımlı aritmetik işlemleri çoğu zaman tek bir yanlış token'la yanıtlıyor. Var olmayan varlıklar hakkındaki beş soruda, thinking açıkken V4.1 Flash beş çalışmanın üçünde 16.384 token'lık tüm çıktı penceresini tüketti, diğer ikisinde cevap uydurdu; thinking kapalıyken ise beş sorunun tamamını reddetti. Bir başka deyişle halüsinasyon koruma davranışı thinking anahtarına göre tersine dönüyor ve bu, göç öncesi mutlaka sınanması gereken bir nokta.
Akıl yürütme kontrolleri de belgelendiğinden daha dar. API, reasoning_effort değerini low, high veya max olarak kabul ediyor; 0 ile 1.024 arası thinking_budget değerleri kabul ediliyor ama yok sayılıyor ve model kartında öne sürülen sürekli 1–100 tam sayı kontrolü API'de sunulmuyor; API tam sayıları reddediyor.
Neden önemli
Doğrulanabilir işler yapan API kullanıcıları — agent görevleri, kodlama, denetleyicili matematik — için doğru cevabın fiyatı çöktü; ayrıca emekliye ayrılan V4 Flash adlarını hâlâ çağıran herkes, planlamış olsun ya da olmasın, farklı bir fiyat yapısıyla birlikte zaten yeni modele yönlendiriliyor. V4 Pro lehine kalan argüman, HLE ve GPQA gibi kıyaslamalardaki bilgi açığı ve DeepSeek'in Pro trafiğini Flash'a katma planını geri çevirmesine yol açacak kadar kullanıcının bu görüşe katılmış olması. dev.to verilerinden pratik çıkarım şu: tasarruf gerçek, ama thinking devre dışıyken ortaya çıkan tek yanlış token'lık hata modu, ucuz ayarın varsayılan olarak değil, kontrollerle birlikte sunulması gerektiği anlamına geliyor.
- #deepseek
- #llm
- #api
- #benchmarks
- #model-pricing