deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Qwen3.8-Flash-Next, Qwen4 mimarisinin açık ağırlıklı multimodal önizlemesi olarak geldi

Qwen, toplam 125B parametreli ve 256K doğal context uzunluğuna sahip deneysel bir açık ağırlıklı multimodal model olan Qwen3.8-Flash-Next'i yayınladı; model, Qwen4 için bir mimari önizleme olarak konumlandırılıyor.

Qwen3.8-Flash-Next, Qwen4 mimarisinin açık ağırlıklı multimodal önizlemesi olarak geldi

Qwen deneysel bir multimodal modeli erişime açtı

Qwen, Hugging Face üzerinde Qwen3.8-Flash-Next'i yayınladı; gömülü vision encoder'a sahip, kodlama agent'larına, uzun süreli tool kullanımına ve bilgisayar kontrolü görevlerine yönelik deneysel bir açık ağırlıklı dil modeli. dev.to üzerinde yayımlanan bir başlangıç rehberine göre bu sürüm, üretime hazır Qwen3.8-Flash servisinin değil, gelecek Qwen4 neslinin bir mimari önizlemesi olarak okunmalı — barındırılan sürüm önemli noktalarda farklılık gösteriyor; varsayılan olarak 1M-token context ve resmi gömülü araçlarla geliyor.

Sürümün içeriği

dev.to'da özetlendiği şekliyle model kartı, token başına yalnızca 6 milyarı aktive edilen 125 milyar toplam dil modeli parametresi, bunun yanı sıra n-gram embedding'lerde 51 milyar ve multi-token prediction için ayrılmış 4 milyar parametre tanımlıyor. Context uzunluğu doğal haliyle 262.144 token ve 1.000.000 token'a kadar genişletilebilir. Post-trained ağırlıklar ve yapılandırma, Hugging Face Transformers formatında geliyor; Transformers, vLLM, SGLang, TokenSpeed ve diğer serving stack'leriyle uyumluluk listelenmiş.\n dev.to rehberi bir dağıtım uyarısına dikkat çekiyor: düşük aktive parametre sayısı, düşük donanım ihtiyacı anlamına gelmiyor. Embedding ve multi-token-prediction parametrelerini de içeren tam ağırlık seti, depolama ve bellek üzerinde hâlâ önemli talepler yaratıyor; ayrıca hiçbir VRAM rakamı, quantize boyutu veya throughput verisi yayımlanmamış.

Bildirilen benchmark sonuçları

Aşağıdaki tüm skorlar, Qwen'ın kendi model kartından dev.to yazısı aracılığıyla aktarılmıştır ve bağımsız olarak doğrulanmamıştır:

  • Kodlama agent'ları: SWE-bench Pro'da 62,5; SWE-bench Multilingual'de 81,0 (73,8 ile Qwen3.8-27B'nin ve 75,8 ile Qwen3.7-Plus'ın önünde); DeepSWE 1.1'de 58,7 ve LiveCodeBench v6'da 91,9.
  • Araç kullanan agent'lar: CoWorkBench'te 73,9; JobBench'te 55,7; Agents' Last Exam'de 51,2 ve Toolathlon Verified'da 73,5.
  • Bilgisayar kullanımı: AndroidWorld'de 84,5; OSWorld 2.0'da 19,4 binary ve 52,3 partial; RecreationBench'te 49,9 ve Vision2Web'de 64,0.
  • Akıl yürütme: GPQA Diamond'da 91,7 ve HLE'de 35,9; burada Claude-Opus-4.6 (Max) 40,0 ile daha yüksek listede yer alıyor. NL2Repo-Bench'te 48,1 puan alıyor; DeepSeek-V4-Flash-0731 ise 54,2'de.

Bu dengesiz tablo önemli: model listelenen satırların birçoğunda zirvede ama hepsinde değil; ayrıca benchmark harness'leri, prompt'lar, temperature değerleri ve jüriler değerlendirmeler arasında farklılık gösterdiğinden, bu rakamlar evrensel bir sıralama kesinleştirmiyor.

Pratik sınırlamalar

Model varsayılan olarak thinking modunda çalışıyor ve nihai yanıttan önce think-tag ayırıcıları içinde ara akıl yürütme üretiyor; bu da çıktıları, maliyetleri ve gecikmeyi uzatıyor. Thinking dışı bir mod mevcut, ancak dev.to rehberi, bunu devre dışı bırakma kodunun incelediği materyalde yer almadığını belirtiyor. Rehber ayrıca, çok turlu agent'larda akıl yürütme çabasını düşürmenin ters tepebileceği uyarısını aktarıyor; çünkü hatalar ve yeniden denemeler, tur başına kazanılan süreyi silebiliyor.

Lisans yalnızca "other" olarak listelenmiş. README'de ticari kullanım, yeniden dağıtım veya değiştirme haklarını düzenleyen hiçbir madde yer almıyor; bu yüzden ticari dağıtım için hukuki inceleme bir ön koşul ve ayrıca ayrıntılı bir bias, güvenlik veya kötüye kullanım analizi bulunmuyor. Qwen, sparse attention'ın uzun context gecikmesini azalttığını iddia ediyor; ancak sağlanan materyal bu azalmayı nicelendirmiyor, ne de tam 1M-token sınırında kalite veya hız davranışını tarif ediyor.

Qwen'ın ürün gamındaki yeri

dev.to'ya göre alternatifler şöyle sıralanıyor: daha küçük, kodlama odaklı yerel dağıtımlar için 3B aktive parametreli Qwen3-Coder-Next; serving kısıtları sıkıysa Qwen3.6-35B-A3B; ve kapasite, altyapı maliyetinden daha önemliyse Qwen3.8-2.4T-A95B. Flash-Next'in quantize yerel araçlar için bir GGUF varyantı mevcut; ancak bunun için hiçbir dosya boyutu veya kalite farkı verisi yayımlanmamış.

Neden önemli

Çeyrek milyon token'lık context ile güçlü, üretici tarafından bildirilen agentic skorlarını birleştiren açık ağırlıklı bir multimodal model, API çağırmak yerine kendi sunucusunda barındırmak isteyen geliştiriciler için nadir bir teklif. Ancak bu sürüm açıkça deneysel: lisans belirsiz, donanım gereksinimleri belgelenmemiş ve rakamlar Qwen'ın kendisine ait. Gerçek önemi belki de Qwen4'ün nereye gittiğine dair erken bir bakış olması — sparse attention, doğal vision ve agent ağırlıklı post-training — üretim nesli gelmeden önce geliştiricilere mimariyi test etme şansı veriyor.

  • #qwen
  • #open-weight-models
  • #multimodal-ai
  • #llm
  • #hugging-face
  • #ai-agents

İlgili yazılar