deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

DeepSeek V4.1 Flash 1M token bağlam, 384K çıktı ve ucuz API fiyatı getiriyor

DeepSeek, 1M token bağlam, 384K token çıktı tavanı ve uzun agent döngülerinin maliyetini düşürmeye yönelik bir mimariyle açık ağırlıklı çok kipli (multimodal) model V4.1 Flash'ı yayımladı.

DeepSeek V4.1 Flash 1M token bağlam, 384K çıktı ve ucuz API fiyatı getiriyor

DeepSeek ne yayımladı

10 Eylül 2026'da DeepSeek, önceki Flash serisinin üretim halefi olarak konumlanan açık ağırlıklı çok kipli model V4.1 Flash'ı yayımladı. dev.to'da yayımlanan derinlemesine bir incelemeye göre model metin ve görüntü girdisi kabul ediyor, metin çıktısı üretiyor ve MIT checkpoint lisansıyla sunuluyor. Öne çıkan özellikleri bir milyonluk token bağlam penceresi ve en fazla 384K çıktı token'ı — bu, raporun mevcut OpenAI ve Anthropic karşılaştırma modelleri için verdiği 128K tavanının üç katı.

Model kimliği sağlayıcıya göre değişiyor. Birinci taraf endpoint deepseek-flash kimliğini kullanıyor; eski adlar deepseek-v4-flash ve deepseek-v4-flash-vision-exp geçici olarak kabul ediliyor ve Flash ücretleriyle yeni sürüme yönlendiriliyor. DeepSeek, 14 Eylül 2026 04:00 UTC'den itibaren deepseek-v4-pro isteklerinin de bir V4.1 Pro modeli gelene kadar V4.1 Flash'a yönleneceğini söylüyor. Modelflare gateway'inde sürüm, hem Chat Completions hem Responses arayüzleriyle sürüm numaralı deepseek-v4.1-flash-0910 kimliği altında görünüyor ve rapor, birinci taraf bir takma adın her gateway'de geçerli olduğunu varsaymak yerine sağlayıcınızın listelediği tam kimliği kullanmanızı öneriyor.

Uzun süreli agent'lara göre ayarlanmış bir mimari

Model, 552B parametreli bir mixture-of-experts omurgasını ayrı bir 196B parametreli Engram bellek deposuyla eşleştiriyor; ancak iki rakam da token başına hesaplama gücü değil. Prefill sırasında her prompt token'ı için yaklaşık 8B parametre aktifleşiyor, kod çözülen her token için ise kabaca 16B. 40 transformer katmanı, 20 katmanlı bir nedensel (causal) kodlayıcı ve 20 katmanlı bir kod çözücüye bölünüyor.

DeepSeek'in Causal Encoder-Decoder (CED) adını verdiği bu düzen, araç kullanan agent'ların en büyük yinelenen maliyetini hedefliyor: her gözlem ve araç sonucuyla büyüyen bir geçmişi yeniden işlemek. Kod çözücünün her katmanında bağımsız bir global key-value geçmişi oluşturmak yerine, kod çözücünün global anahtar ve değerleri kodlayıcının son gizli durumundan (hidden state) yansıtılıyor; yerel kayan pencere (sliding-window) durumları ise katmana özgü kalıyor. DeepSeek'in kendi tahmini, uzun dizilerde prefill işini eşdeğer bir tüm-katman tasarıma göre kabaca yarıya indiriyor. Ödünleşim ise şu: tasarruf girdiye uygulanıyor, üretimi kapsamıyor — çok büyük prompt'lu ve kısa cevaplı iş yükleri en çok yararlanıyor.

KV önbelleğini küçültmek

Üç ek mekanizma bellek maliyetlerine saldırıyor. Compressed Sparse Attention 2 (CSA2), her katmanı üç moddan birine statik olarak atıyor — Full, Reindex veya Reuse — ve kod çözücünün ilk Full katmanı, sonraki katmanların beslendiği bir Top-512 aday havuzu seçiyor. Global KV girdileri, her 16 kanal için bir E4M3 ölçeğiyle kabaca dört bitlik E2M1 değerlerine kuantalanıyor; DeepSeek bunu token başına 890 bayt olarak raporluyor: V4 Flash'ın yaklaşık dörtte biri ve V1'den 437 kat küçük. Kuantalamaya daha duyarlı yerel kayan pencere önbelleği FP8'de kalıyor ve bir Bounded Replay düzeni, her katmanın yerel durumunu kalıcı tutmak yerine sınırlı bir yerel pencereyi yeniden oluşturarak kalıcı önbelleği V4 Flash'ın ayak izinin kabaca sekizde birine indiriyor. Engram deposu koşullu n-gram örüntülerini seyrek erişilen tablolara taşıyor ve DSpark spekülatif kod çözme (speculative decoding) birkaç aday konumu taslak olarak üretiyor, doğrulama uzunluğunu güvene ve sistem yüküne göre seçiyor. Görüntüler bir DeepSeek-ViT kodlayıcı ve bir projektörden geçiyor ve ön eğitim, 7:1 metin-çok kipli oranıyla 45T token'ı kapsadı.

Servis ayrıntıları ve sınırlar

Akıl yürütme çabası (reasoning effort), dahili bir ölçeğe eşlenen üç ön ayarla sunuluyor: 50'de düşük, 75'te yüksek ve 100'de maksimum. Resmi API 2.500 eşzamanlı isteğe izin veriyor. dev.to raporu, API'yi kesin rakamlar yayımlamadan olağanüstü ucuz olarak nitelendiriyor ve modelin gerçek üstünlüğünün, kodlama, terminal, otomasyon ve araç kullanımı değerlendirmelerinde rekabetçi kalırken her doların ne kadar uzun ufuklu agent işi satın aldığı olduğunu savunuyor.

Uyarılar

Kıyaslama (benchmark) rakamları DeepSeek'ten geliyor ve Modelflare tarafından bağımsız olarak yeniden üretilmedi. DeepSeek'in kendi teknik raporu, modelin en zor akıl yürütme ve uç durumlarda hâlâ en büyük kapalı sistemlerin gerisinde kaldığını kabul ediyor. Mimari hileler daha güçlü akıl yürütme göstermekten çok servis ekonomisini ve verimi iyileştiriyor; ayrıca 384K çıktı tavanı bir hedef değil, bir sınır: çok uzun üretimler gecikmeyi, maliyeti ve çıktının talimatlarından sapma olasılığını artırıyor.

Neden önemli

Agent'lı yapay zekâdaki bağlayıcı kısıt giderek çok uzun geçmişleri korumanın ve yeniden işlemenin maliyeti haline geliyor. V4.1 Flash bu kısıta doğrudan saldırıyor — DeepSeek'in tahminine göre prefill işini yarıya indirmek, global KV'yi selefine göre dört kat sıkıştırmak ve 384K çıktıyla 1M token'lık bir bağlamı MIT lisansı altında sunmak. Liderlik tablolarının zirvesine çıkmasa bile, milyonluk token'lık agent döngülerini ekonomik olarak makul kılan açık ağırlıklı bir model geliştiricilerin deneyebileceklerini değiştiriyor; agresif fiyatlandırması ise benzer iş yükleri sunan her ticari rakibe baskı uyguluyor.

  • #deepseek
  • #llm
  • #open-weights
  • #mixture-of-experts
  • #long-context

İlgili yazılar