· kaynak dev.to (home feed)
DeepSeek V4.1 Flash beta yerel çok modlu destekle saniyede 420 token hızına ulaştığı bildiriliyor
Bir dev.to haberi, DeepSeek'in 48 saatlik V4.1 Flash beta sürecinin şirketin ilk yerel çok modlu modeli olduğunu ve V4 Flash fiyatları değişmeden saniyede 420 token'a kadar üretim hızına ulaştığını söylüyor.

DeepSeek, yeni bir modeli görünüşe göre dünyaya sessizce sundu. 9 Eylül 2026'da dev.to'da yayımlanan bir yazıya göre şirket, 8 Eylül'de V4.1 Flash için kendi son kullanma tarihini tanımlayıcısına gömmüş bir kimlikle bir beta açtı ve geliştiricilere erişimin 10 Eylül'de kapanmadan önce test etmeleri için yaklaşık 48 saat verdi.
Yazının manşet iddiaları, uzun metin akıl yürütme görevlerinde zirvede saniyede 420 token üretim hızı ve uçtan uca saniyede 409,5 token verimliliği; bu, yazarın anlatısına göre doğruluktan ödün verilmeden elde edilmiş.
Kıyaslamalar reportedly ne gösteriyor
dev.to makalesi hız kazançlarını göreve göre ayrıştırıyor ve önceki modellerle karşılaştırıyor:
- 49.000 token'lık uzun bağlam erişim görevinde 5,2 kat daha hızlı
- SVG kod üretiminde 6,0 kat daha hızlı
- Manacher palindrom algoritmasının uygulanmasında 4,6 kat daha hızlı
- 4,6 kat palindrom rakamı; karmaşık SQL sorgusu üretimi 5,0 kat daha hızlı çıktı
- asyncio tabanlı mimarinin yeniden düzenlenmesinde 3,9 kat daha hızlı
Bunlar yazarın rakamları. DeepSeek model için bir teknik rapor yayımlamadı ve betanın iki günlük penceresi bağımsız doğrulamaya az yer bıraktı; bu nedenle rakamlar topluluk kaynaklı olarak değerlendirilmeli, doğrulanmış değil.
Yerel çok modluluk, sonradan eklenmiş bir encoder değil
Yazıdaki daha etkili iddia mimari olanı. Makalenin V4 Flash Vision-Exp dediği varyantla sunulan önceki DeepSeek görü yeteneği, bir metin tabanlı temel modele harici bir eklenti biçiminde görsel bir encoder iliştiriyordu. Buna karşılık V4.1 Flash, şirketin baştan itibaren metin ve görüntü girdi-çıktısını işleyen ilk yerel çok modlu modeli olarak tanımlanıyor.
Bildirilen sonuçlar, metin ve görüntüler arasında paylaşılan ortak latent temsil, daha güçlü çapraz mod akıl yürütme ve ayrı encoder ile decoder'ların koordinasyonu gerekmediği için daha düşük gecikme. Gerçek dünya sağlama testi olarak yazar, çizgili takım elbiseli bir kişinin fotoğrafını gönderdiğini ve modelin çizgili deseni doğru şekilde tanımladığını, önceki görü modellerını zorlayan bir halüsinasyon başarısızlığına düşmediğini söylüyor.
Belgelenmemiş bir "yeni model yapısı"
DeepSeek yalnızca V4.1 Flash'ın yeni bir model yapısı kullandığını söyledi. Makalede alıntılanan topluluk analizi bunun ne anlama gelebileceği üzerine spekülasyon yapıyor: V4'ün CSA/HCA hibrit tasarımı üzerine inşa edilen attention iyileştirmeleri, mixture-of-experts mimarisinde daha iyi uzman yönlendirmesi ve görsel ile metin özelliklerinin daha derin harmanlanması. Bunların hiçbiri doğrulanmış değil ve makale, mimari ayrıntıların hâlâ bilinmediğini açıkça belirtiyor.
İşe alım sinyali
Betanın yanı sıra DeepSeek'in iki alanda 150 kıdemli mühendis işe almayı planladığı bildiriliyor: model araştırma platformları, agent çerçeveleri ve API altyapısını kapsayan backend geliştirme ile platform çalışmaları, düşük seviye optimizasyon ve elastik bilgi işlemeyi kapsayan agent hesaplama. Yazıda gerekçe DeepSeek'in Cui Tianyi'ye atfediliyor; argümanı özünde şu: veri hacmi, makine ve container sayıları, eğitim ve değerlendirme işleri, agent ortamları, kullanıcı sayıları ve istek trafiği aynı anda büyüdükçe karmaşıklık üstel olarak birikiyor ve mevcut backend bunu karşılayamaz hale geliyor.
Fiyatlandırma ve topluluk tepkisi
Performans iddialarına rağmen fiyatlandırmanın V4 Flash seviyesinde kaldığı bildiriliyor. Yazı, Çinli geliştirici topluluğundaki süregelen bir şakayı aktarıyor: kurucu Liang Wenfeng, performans yüksek ve fiyatlar düşükken "Aziz Liang" lakabını kazanıyor, fiyatlar yükseldiğinde ise daha az hoş bir lakap alıyor. Yazar, V4.1 Flash ile azizane lakabın geri döndüğünü söylüyor.
Makale ayrıca modelin DeepSeek'in API endpoint'ine yönlendirilmiş OpenAI uyumlu bir istemciyle çağırıldığını gösteriyor; bu da erişim genişlediğinde mevcut araçlar için entegrasyonun kolay olacağına işaret ediyor.
Kalabalık bir yayın takvimi
Yazı, lansmanı Çin'deki olağandışı hızlı model yayın temposuna yerleştiriyor: Temmuz'da açık kaynaklanan Kimi K3 ve yayımlanan Qwen3.8-Max, Ağustos'ta GLM-5.3 ve DeepSeek V4 Pro, Eylül'de V4.1 Flash betası ve ardından gelmesi beklenen V4.1 Pro. Halka açık bir V4.1 Flash yayını geçici olarak 10 Eylül'e bağlanmıştı ancak bu zamanlama doğrulanmadı.
Neden önemli
Verimlilik rakamları üçüncü taraf testlerinde doğrulanırsa, çok modlu etkileşimi gerçek anlamda gerçek zamanlı bölgeye taşıyor: görüntü girer, bir saniyenin altında özünde bir yanıt çıkar. Fiyatı sabit tutarken hızı katlamak, daha azına daha fazla ücret alan rakipler üzerindeki baskıyı da artırır ve çıkarım (inference) verimliliğinin, ham yeteneklerin yanı sıra birincil bir rekabet ekseni haline geldiğine işaret eder.
Ancak uyarılar en az rakamlar kadar önemli. Buradaki her şey, 48 saat içinde süresi dolan bir beta hakkındaki tek bir topluluk blog yazısına dayanıyor; teknik rapor yok, yayımlanmış mimari ayrıntı yok. Gerçek test, V4.1 Flash genel kullanıma ulaştığında veya V4.1 Pro düzgün belgelerle geldiğinde ortaya çıkacak; o noktada bu rakamlar ya incelemeye dayanacak ya da dayanamayan kıyaslama iddialarının uzun listesine katılacak.
- #deepseek
- #multimodal-models
- #llm
- #inference-speed
- #benchmarks