· kaynak dev.to (home feed)
Xiaomi'nin 1.02T MiMo-V2.6 Pro'su ve DeepSeek V4.1 Flash, MoE'yi açık-ağırlıklı cephe haline getiriyor
On iki gün arayla iki MIT lisanslı açık-ağırlık sürümü geldi: DeepSeek'in 552B V4.1 Flash'ı ve Xiaomi'nin 1.02T MiMo-V2.6 Pro'su; her biri token başına parametrelerinin yalnızca küçük bir kesriyle hesaplama yapıyor.

On iki gün arayla iki MIT lisanslı sürüm
Ekim 8'de yayımlanan bir dev.to analizine göre Eylül ayı, tekniğin mevcut durumunu iki uçtan çerçeveleyen iki açık-ağırlık Mixture-of-Experts (MoE) sürümüne sahne oldu. DeepSeek V4.1 Flash, 10 Eylül'de toplam 552 milyar parametreyle geldi; bu parametrelerin yaklaşık 8 milyarı her girdi tokenında, 16 milyarı ise her çıktı tokenında aktifleşiyor. Xiaomi'nin MiMo-V2.6 Pro'su ise 22 Eylül'de 1.02 trilyon parametre ve token başına yalnızca 42 milyar aktif parametreyle, top-8 yönlendirme altında 384 uzman olarak düzenlenmiş halde geldi. İkisi de MIT lisansı taşıyor ve ikisi de çok daha küçük yoğun (dense) modelleri fiyat açısından geride bırakıyor: gönderi, V4.1 Flash'ı yoğun olmayan saatlerde milyonun token başına 0.15/0.60 dolar, MiMo-V2.6 Pro'yu ise 0.435/0.87 dolar olarak listeliyor.
Asıl hikaye, kapasite ile hesaplama arasındaki fark. V4.1 Flash 552B parametrelik bilgi depoluyor ama çıktı tokenlarında kabaca 16B'lik bir model gibi hesaplama yapıyor — bu, 34 katlık bir fark; ağın yaklaşık %3'ü herhangi bir adıma katılıyor. MiMo-V2.6 Pro'daki fark ise kabaca 24 kat.
Seyrek numarası nasıl çalışıyor
Yoğun bir transformer'da her parametre her token için değerlendirilir. MoE, her bloktaki ileri beslemeli ağı daha küçük bir dizi uzman ağ artı bir router ile değiştirir. Router, mevcut tokena karşı her uzmanı bir softmax ile puanlar, en iyi k tanesini tutar (genellikle 2 ile 8 arası) ve seçilen uzmanların çıktılarını ağırlıklı bir toplam olarak birleştirir. Modern varyantlar, yönlendirmeden bağımsız olarak her tokenın geçtiği paylaşımlı bir uzman ekliyor — DeepSeek'in tasarımı 256 yönlendirilen uzmanı tek bir paylaşımlı uzmanla eşleştiriyor — böylece yönlendirilen uzmanlar uzmanlaşabiliyor.
Eğitimin kötü bir başarısızlık modu var: router çöküşü, yani router'ın birkaç favori uzmana kilitlenip geri kalanları aç bırakması. Standart çare, Switch Transformer çalışmasından miras alınan ve trafik yoğunlaştığında router'ı cezalandıran yardımcı bir yük dengeleme kaybıdır.
Fikrin kendisi 2017'ye dayanıyor; Shazeer ve ekibi o yıl seyrek kapılı 137B parametreli bir MoE tanımladı. Dev.to sayımına göre, 2026'da fiilen kullanıma giren yedi cephe açık-ağırlıklı modelin altısı bu mimariyi kullanıyor.
Hesaplama tasarrufu, belleme faturası
Gönderinin ortaya koyduğu gibi, sorun şu: seyreklik hesaplama faturasını kesiyor ama bellek faturasını değil. Her uzman, bir token onu kullansa da kullanmasa da VRAM'de duruyor. Yaklaşık 37B aktif parametreli 671B parametrelik DeepSeek V3, kabaca 671 GB FP8 ağırlık — yani çok GPU'lu bir sunucu — gerektiriyor; oysa her token 37B'lik bir model gibi hesaplama yapıyor. V4.1 Flash'ın checkpoint'i tek başına yaklaşık 510 GB. 552B ila 1T parametrelik açık ağırlıklar, token başına maliyet çok düşük olsa bile ciddi donanım sağlanması anlamına geliyor.
2026 yönlendirme araştırmaları ne buldu
dev.to gönderisi, MoE'nin kronik yönlendirme sorunlarına saldıran üç çalışma hattını inceliyor:
- UniPool (arXiv:2605.06665, Mayıs 2026), derin katmanlardaki router'ların çoğunlukla gereksiz olduğunu buldu: öğrenilmiş top-k router'ı derin katmanlarda uniform rastgele yönlendirmeyle değiştirmek yalnızca 1.0 ila 1.6 doğruluk puanına mal oluyor. Çözümü — katman başına uzman kümeleri yerine tüm katmanlarda globally paylaşılan tek bir uzman havuzu — uzman parametresi bütçesinin %41.6 ila %66.7'sini kullanarak vanilla MoE'yi eşitliyor veya geçiyor; doğrulama kaybı en fazla 0.0386 iyileşiyor.
- Latent Prototype Routing, yönlendirmeyi kümeleme olarak yeniden çerçeveliyor ve DeepSeek-V3, Qwen3-MoE ve Mixtral üzerinde uzman yükünün Gini katsayısını 0.70'ten 0.035'e düşürüyor; bildirildiğine göre kalite kaybı yok.
- COMMITTEEAUDIT (arXiv:2601.03425) adlı bir denetim, 64 uzmandan kabaca 6'sının — alan ne olursa olsun, kod, şiir ya da matematik — tokenların ezici çoğunluğu için top-k içinde göründüğünü ve toplam yönlendirme ağırlığının %60 ila %67'sini taşıdığını buldu. Uzmanlaşma gerçek, ama işin çoğunu küçük bir genelci "daimi komite" yapıyor.
Sunum vergisi ve bir doğrulama boşluğu
Tek bir GPU her uzmanı barındırmadığı için sunum, uzmanları expert parallelism yoluyla GPU'lar arasında bölüştürüyor: her token, uzmanlarını barındıran GPU'lara gidiyor, sonra ağırlıklı çıktılar geri dönüyor. Bu all-to-all aktarımı saf ek yük; bant genişliği ve yavaş kalanlar throughput'u sınırlıyor — gönderi, MoE çıkarımının yoğun model sunumundan çok HPC işine benzediğini savunuyor.
Gönderi ayrıca bir doğrulama kör noktasına dikkat çekiyor. Haziran 2026 tarihli "The Expert Shuffle" analizine göre, merkezi olmayan bir sağlayıcı top-k'yı sessizce 8'den 4'e düşürebiliyor — "k-shunting" — ve yalnızca çıktılardan bakıldığında neredeyse tespit edilemez kalabiliyor; çünkü her iki yapılandırmada da aynı daimi komite uzmanları baskın. Bunu yalnızca ara hesaplamaların ölçümü yakalayabilir; üçüncü taraf MoE çıkarımı satın alan herkes sağlayıcının gerçekte neyi ölçtüğünü sormalı.
Neden önemli
Eylül ikilisi, cephe açık ağırlıklarının nereye gittiğini gösteriyor: iki haneli milyar mertebesinde aktif parametre sayılarıyla 552B-1T parametrelik kapasite, MIT lisansları ve küçük yoğun modelleri andıran token başına fiyatlar. Uygulayıcılar için kapasite ve maliyet artık ayrı kalemeler — toplam parametreler bellek faturasını, aktif parametreler hesaplama faturasını belirliyor ve dağıtım planlaması VRAM'i aktif dilim için değil tüm model için bütçelemek zorunda. Araştırma ayrıca, duyurulan uzman sayısının büyük kısmının süs olabileceğini ima ediyor; hesaba katın daimi komiteleri ve derin katman artıklığını. Ve dostane lisanslar ağırlıkların kendisini neredeyse emtia haline getirirken, dev.to analizi rekabet avantajının sunum katmanına — ve bir sağlayıcının gerçekte hangi hesaplamayı teslim ettiğini kanıtlayabilme yeteneğine — kaydığı sonucuna varıyor.
- #deepseek
- #xiaomi
- #mixture-of-experts
- #open-weights
- #llm