· kaynak dev.to (home feed)
DeepSeek 4.1 açık ağırlıklarla geldi: 670B parametreli MoE, 37B aktif, milyon token başına 0,55 dolar
DeepSeek, 4.1 modelinin açık ağırlıklarını ve kurumsal uç noktasını yayınladı: token başına 37B aktif parametreli 670B parametrelik bir MoE, MTP-4x çoklu token kod çözme ve DualPipe 2.0 zamanlama ile; iddiaya göre milyon çıktı token başına 0,55 dolar.

DeepSeek 4.1 açık ağırlıklar ve kurumsal uç noktayla geldi
3 Ekim 2026'da dev.to'da yayımlanan bir mühendislik yazısına göre DeepSeek, DeepSeek 4.1'in — DeepSeek-V4.1 Foundation serisi olarak da anılan — açık ağırlıklarını, kurumsal bir API uç noktasıyla birlikte yayınlayarak modeli küresel ölçüde erişilebilir kıldı. Model, toplam 670 milyar parametreli, token başına yalnızca 37 milyarının aktif olduğu seyrek bir mixture-of-experts (MoE) sistemi. Yazı, modelin kapalı sınır sınıfı rakipleriyle — Anthropic'in Claude Mythos 5.1'i ve OpenAI'nin GPT-6 Astra'sı adını veriyor — eşdeğer performans sunduğunu, buna karşılık API ücretlerinin yalnızca küçük bir kesimini talep ettiğini iddia ediyor.
256 yönlendirilen uzman ve bir paylaşılan uzman
dev.to yazısı, her token'ı 256 yönlendirilen uzmana karşı puanlayan ve en iyi sekizini aktive eden bir router, ayrıca her token'ı koşulsuz işleyen 3,2 milyar parametreli tek bir paylaşılan uzman tanımlıyor. Paylaşılan uzman genel amaçlı işleri üstleniyor — sözdizimi, JSON ve Markdown biçimlendirme, yaygın dilbilgisi — böylece yönlendirilen uzmanlar matematik, derleyici mühendisliği, sözleşme hukuku ve dağıtık sistem tasarımı gibi daha dar alanlarda uzmanlaşabiliyor.
Yük dengelemesi yardımcı kayıplar (auxiliary loss) olmadan yürütülüyor. Yazıya göre eski MoE tasarımları, router'ların birkaç popüler uzmanı aşırı yüklemesini engellemek için ağır auxiliary-loss terimleri kullanıyordu; bu da nihai model kalitesinden vazgeçmek anlamına geliyordu. DeepSeek 4.1 bunun yerine eğitim ve çıkarım sırasında router'ın benzerlik puanları üzerinde dinamik yan terimler ayarlayarak uzman trafiğini bir kayıp cezası olmaksızın dengede tutuyor. Yazıya göre net sonuç, yaklaşık 700 milyar parametreli bir ağın bellek ayak izine ve orta boyutlu bir modelin token başına işlem maliyetine sahip bir model.
Hız iddiaları: MTP-4x kod çözme ve DualPipe 2.0
İki sistem verimlilik rakamlarını belirliyor. MTP-4x, ön eğitim sırasında dört hiyerarik tahmin kafası ekliyor; çıkarım sırasında model tek bir ileri geçişte dört olası token'a kadar üretebiliyor ve bunları paralel olarak doğrulayabiliyor — sonradan eklenen değil doğrudan ağırlıklara gömülü spekülatif kod çözme. Yazı, kodlama iş yüklerinde yüzde 88'in üzerinde bir kabul oranı ve düğüm başına saniyede 240 token'ın üzerinde bir ardışık kod çözme hızı veriyor; bunu kod çözme hızında dört kat bir iyileşme olarak çerçeveliyor.
DualPipe 2.0, MoE yönlendirmesinin düğümler arasındaki GPU'lar arasında all-to-all iletişimi zorunlu kılması ve tensörler bağlantı hattında yol alırken işlemcileri boş bırakmasıyla ortaya çıkan pipeline balonunu hedefliyor. Bir düğüm mevcut grup (batch) için yoğun dikkat (dense attention) ve paylaşılan uzmanı hesaplarken, ağ motorları bir sonraki grup için seyrek uzman tensörlerini gönderip alıyor ve KV-cache dairesel tamponları all-to-all iletişim kanallarıyla hizalanıyor. Yazı, ortalama streaming-multiprocessor kullanımının yüzde 98,2 olduğunu, yani donanım tavanına yakın olduğunu iddia ediyor.
Fiyatlandırma ve doğrulanmamış olanlar
Yazı, çıktı fiyatını üretilen milyon token başına 0,55 dolar olarak veriyor ve bunu kapalı rakiplerin ücretinin kabaca yirmide biri olarak niteleyiyor. Ayrıca kendi sunucularında barındırmak isteyen ekipler için asenkron üretim kodu içeren pratik bir dağıtım kılavuzu vaat ediyor.
Bu yazıdaki her kesin rakam — verimlilik, kabul oranı, kullanım, fiyatlandırma ve sınır sınıfı eşdeğerlik karşılaştırmaları — tek bir dev.to gönderisinden geliyor. Bunları doğrulayacak bağımsız kıyaslama sonuçları veya resmi belgeler mevcut olmadığından, performans iddiaları üçüncü taraf değerlendirmeleri ortaya çıkana dek yazarın rakamları olarak ele alınmalı.
Neden önemli
Bildirilen verimliliğin哪怕 bir kısmı bile doğruysa, bu sürüm sınır ölçekli yapay zekanın iktisadını değiştiriyor. Aşırı seyreklik artı yerleşik çoklu token tahmini, çoğu yapay zeka dağıtımında baskın kalem olan çıkarım maliyetine doğrudan saldırıyor; açık ağırlıklar da yeterli GPU kapasitesine sahip kuruluşların token başına faturalandırmayı tamamen atlamasına izin veriyor. Ağırlıkların yanında yönetilen bir uç nokta, geliştiricilere orta bir yol sunuyor: API ile başlayın, hacim büyüdükçe kendi barındırmanıza geçin. Kapalı model sağlayıcıları için ise beşte bir fiyata benzer kalite iddiasında bulunan açık bir alternatif, tarihsel olarak API fiyatlarını aşağı çeken türden bir baskı yaratıyor.
- #deepseek
- #open-weights
- #mixture-of-experts
- #inference
- #llm
İlgili yazılar
- Aleph Alpha, egemen yapay zeka için 78 milyar parametreli açık ağırlıklı Kolibri modelini yayınladı
- Açıklayıcı yazı, 'saniyede milyon token' iddialarının LLM bağlamı ve çıktı hızı için ne anlama geldiğini ayıklıyor
- Aleph Alpha, Almanca ve İngilizce için açık ağırlıklı 78 milyar parametreli Kolibri adlı MoE modelini yayımladı