· kaynak dev.to (home feed)
Qwen3.8-Flash-Next, Qwen4'ü 125B parametre ve token başına 6B aktif parametreyle önizliyor
Alibaba'nın Qwen3.8-Flash-Next modeli, Qwen4 mimarisinin bir önizlemesi olarak toplam 125B parametreyle çalışıyor ancak token başına yalnızca 6B parametre aktif; tek GPU basitliğini uzun bağlam ve ajan iş yükleri için takas ediyor.

Alibaba ne yayınladı
Alibaba'nın Qwen ekibi, dev.to'nun aktardığına göre 26 Ağustos 2026'da Qwen3.8-Flash-Next'i yayınladı; şirket bu açık ağırlıklı multimodal modeli, gelecekteki Qwen4 ailesinin arkasındaki mimarinin erken bir önizlemesi olarak sunuyor. Model toplam 125 milyar parametre taşıyor, ancak herhangi bir token için yalnızca yaklaşık 6 milyarı aktif. Bunun üzerine, hesaplanmak yerine arama yoluyla erişilen 51 milyar parametrelik bir N-gram embedding tablosu eklenmiş. Ağırlıklar Hugging Face ve ModelScope'ta Qwen/Qwen3.8-Flash-Next adıyla yayımlandı ve bir FP8 varyantı da mevcut. Model metin, görüntü ve video kabul ediyor, doğal olarak 262.144 token işliyor ve YaRN tarzı ölçeklemeyle 1 milyon tokene kadar uzatılabiliyor.
Parametre dağılımı bilinçli: her tokenı yalnızca ağın küçük bir bölümü işlediği için çalıştırma maliyeti küçük bir modeli izlerken, parametre sayısı ve kodladığı bilgi büyük bir modeli izliyor.
Dört mimari bahis
Dev.to, Qwen'un duyuru bloguna dayanarak tasarımı dört unsura ayırıyor:
- Hibrit attention. Gated DeltaNet katmanları bir dizinin geçmişini doğrusal zamanda sabit boyutlu bir duruma sıkıştırırken, Qwen Sparse Attention hafif bir indeksleyici kullanarak yalnızca bağlamın ilgili mikro bloklarını seçiyor. Birlikte, geleneksel tam attention'ın kuadratik maliyet artışından kaçınıyorlar.
- Kapılı artık akış (gated residual stream). Artık yol dinamik kapılama ile dört dala genişletilmiş; Qwen bunu katmanlar arası bilgi akışının iyileşmesine ve daha stabil eğitime bağlıyor.
- N-gram tablosu. 51B parametrelik yapı bir arama olarak çalıştığı için host belleğine taşınıp asenkron önceden yüklenebiliyor ve token başına aritmetik maliyet eklenmeden temsil kapasitesi kazandırıyor.
- Muon optimizer. Eğitim, Muon'un rafine edilmiş bir sürümüyle yapıldı ve scaling law yeni mimari için yeniden uyarlandı.
Qwen ayrıca eğitim maliyetinin Qwen3.7-Plus'ın kabaca dokuzda birine geldiğini, buna karşın daha güçlü kodlama ve ofis görevi sonuçları ürettiğini iddia ediyor. Dev.to bunu bağımsız doğrulama bekleyen bir üretici rakamı olarak işaretliyor; yine de yön — seyrek aktivasyon artı doğrusal attention — endüstrinin genelinin gittiği yönle örtüşüyor.
Flash-Next ile yoğun 27B karşılaştırması
Karşılaştırma modeli olan Qwen3.8-27B yoğun (dense): 27 milyar parametrenin tamamı her tokenda devreye giriyor ve kuantalanınca kabaca 17–19GB VRAM'e sığıyor, yani tek bir RTX 4090 sınıfı kartın erişiminde. Flash-Next'in tam ağırlık ayak izi ise 128GB'lık bir Mac ya da çoklu GPU veya offload kurulumu gerektiriyor.
Üreticinin bildirdiği SWE-bench Pro skorlarında ikisi birbirine yakın: Flash-Next 62,5, 27B ise 61,7. Anlamlı farklar skor tablosundan değil operasyonelden. Flash-Next uzun bağlam verimi daha güçlü ve ajan iş yükleri için daha ekonomik; 27B ise sunumu daha basit ve tek GPU'lu yerel kodlama asistanı için pratik seçim olmaya devam ediyor.
1M tokenlık pencere neyi açıyor
Doğal 262K bağlamda, orta boy bir kod tabanı ya da bir aylık destek kayıtları zaten tek bir prompt'a sığıyor. 1M'de, dev.to'ya göre, arama hatları üzerine kurulu iş akışları — doğru parçacığın ortaya çıkması umuduyla parçalama, embedding ve yeniden sıralama — ham külliyata karşı tek bir prompt'a indirgenebilir. Verilen örnekler arasında müşteri kaybı sinyalleri için satış görüşmesi kayıtlarının bir çeyreğini taramak, önünde bir RAG yığını olmadan tüm sözleşme portföyünü madde madde incelemek ve uzun vadeli ajanların kendi çalışma geçmişlerini her birkaç bin tokende bir sıkıştırıp atmak yerine taşımaları yer alıyor.
Uyarı: 6B aktif parametrede bile uzun prompt'lar bedava değil. Prompt işleme hâlâ işlem gücü tüketiyor; seyrek attention büyüme eğrisini düzleştiriyor ama tamamen ortadan kaldırmıyor.
Neden önemli
Flash-Next, pazara sunulan bir üründen çok Qwen4 için bir şartname olarak önemli: seyrek yönlendirme, doğrusal zamanlı attention ve arama tabanlı kapasite artık bir sonraki neslin ölçüleceği tabanı oluşturuyor. Yoğun 27B ile dar benchmark farkı, bu takasın gerçek olduğunu gösteriyor — ajan kodlama skorlarında yakın eşitlik, bedava bir kazanç değil, çok farklı donanım gereksinimleriyle geliyor. Dokuzda bir eğitim maliyeti iddiası kabaca doğru çıkar da, API alıcıları — ağırlıklara hiç dokunmayanlar — için bir sonraki model neslinin fiyat eğrisini de önizliyor. Yerel kullanıcılar beklemeli: dev.to'nun belirttiği gibi, Qwen tarihsel olarak amiral gemisi MoE sürümlerinin ardından daha küçük yoğun ya da hafif seyrek damıtma modelleri yayınladı.
- #mixture-of-experts
- #qwen
- #large-language-models
- #open-weights
- #long-context