· kaynak dev.to (home feed)
Qwen3.8-27B ile Muse Glimmer 30B: 24 GB'lık bir GPU'ya sığacak boyutta iki Apache 2.0 modeli
dev.to'da yayınlanan bir karşılaştırma, Apache 2.0 lisansıyla sunulan iki yoğun ~30B multimodal modeli — Alibaba'nın Qwen3.8-27B'si ile Meta'nın Muse Glimmer 30B'sini — ele alıyor ve ikisinin de tek bir 24 GB'lık tüketici GPU'sunda çalıştığını ortaya koyuyor.

dev.to'da yayımlanan bir karşılaştırma, yeni çıkmış iki yoğun multimodal modeli yan yana koyuyor — Alibaba'nın Qwen3.8-27B'si ile Meta'nın Muse Glimmer 30B'si — ve ikisinin de tamamen serbest Apache 2.0 lisansıyla tek bir 24 GB'lık tüketici GPU'sunda çalıştığı sonucuna varıyor. Gönderiye göre (kendini yapay zekâ destekli olarak tanımlayan TechNest yayınından alınmıştır), iki model Ağustos 2026'da birbirinden dört gün arayla yayınlandı: Muse Glimmer 30B 10 Ağustos'ta, Qwen3.8-27B ise 14 Ağustos'ta.
Her modelin sunduğu yenilikler
Karşılaştırmaya göre Qwen3.8-27B, metin, görsel ve video girdisini kabul eden yerleşik bir görüntü-dil kodlayıcısına sahip, 27 milyar parametreli yoğun bir nedensel dil modeli; STEM diyagramlarından saat ölçeğindeki videolara kadar her şeyi işleyebiliyor. Model, bildirildiğine kadar bir milyon token'a çıkarılabilen 262.144 token'lık yerleşik bir bağlam penceresiyle geliyor.
Meta'nın Superintelligence Lab'ına atfedilen Muse Glimmer 30B ise yaklaşık 1,8 milyar parametrelik dondurulmuş bir ViT-G/14 kodlayıcı üzerinden metin ve görsel girdisi alan, 131.072 token'lık bağlam penceresine sahip 29,6 milyar parametreli yoğun bir model. Gönderiye göre model, Meta'nın daha büyük Muse Spark temelinden damıtıldı ve yerel otonom ajan işleri — araç yürütme, terminal komut tamamlama ve hata kurtarma — için ayarlandı.
Gelir kapısı olmayan Apache 2.0
Karşılaştırma, lisanslamayı asıl dönüm noktası olarak çerçeveliyor. 3 Ağustos'ta duyurulan Alibaba'nın amiral gemisi Qwen3.8-Max'ın, model olarak servis veya asistan işi yıllık 50 milyon doları aşan gelir seviyesine geldiğinde açık anlaşmalar gerektiren özel bir lisans taşıdığı, Moonshot AI'nın Kimi K3'ünün ise 20 milyon dolar üzerinde bir kapı dayattığı bildiriliyor. Qwen3.8-27B ve Muse Glimmer 30B'de ise gelir üst sınırı ya da ticari kullanım eşiği yok; yazar, bunun modelleri yerel araçlara veya şirket içi çözümlere gömen satıcılar için sözleşme denetimi yükünü ve hukuki riski ortadan kaldırdığını savunuyor.
30B'yi tek bir karta sığdırmak
Niceliklenmemiş 16 bit hassasiyette her iki model de yaklaşık 54–60 GB VRAM gerektiriyor ve çoklu GPU kurulumlarını zorunlu kılıyor. Pratik yol ise 4 bit nicemleme (AWQ, EXL2 veya GGUF Q4_K_M); ağırlıkları yaklaşık 16–18 GB'a sıkıştırıyor ve 24 GB'lık bir kartta KV cache ile algı tensörleri için 6–8 GB yer bırakıyor.
Gönderi iki bellek uyarısı ekliyor. Qwen3.8-27B'nin bağlamını tek bir 24 GB'lık kartta 32.768 token'ın ötesine taşımak, FlashAttention-2 ile sayfalı KV cache nicemlemesi (FP8 veya INT4) gerektiriyor. Ayrıca yüksek çözünürlüklü görüntüleri veya çok kareli videoyu işlemek, görsel öznitelik çıkarma sırasında belleği geçici olarak yükseltiyor; bu yüzden Qwen'i video analizi için kullanan ekipler en az 4 GB ek pay bütçelemeli.
Ekosistem desteği ise farklılaşıyor. Qwen3.8-27B; vLLM, SGLang, llama.cpp ve Transformers üzerinde standart OpenAI uyumlu uç noktalarıyla mevcut. Muse Glimmer ise önceden doğrulanmış 24 GB, 32 GB ve 64 GB dağıtım paketleriyle, ayrıca servis motorunun desteklediği yerlerde daha hızlı üretim için deneysel bir DFlash spekülatif kod çözme yoluyla geliyor.
Pratik bir ayrım
Yazarın karar rehberi şöyle: video veya karmaşık belge alımı, kod depoları, API şemaları ve teknik kılavuzlar üzerinde uzun bağlamlı arama ya da yerleşik çıkarım motorlarında ilk günden dağıtım gerekiyorsa Qwen3.8-27B'yi seçin. İş yükünüz kısıtlı ortamlarda ajan tabanlı araç kullanımıysa, kutudan çıktığı gibi tek kart paketleme istiyorsanız ya da spekülatif kod çözmenin gecikme kazançları servis kurulumunuz için önemliyse Muse Glimmer 30B'yi seçin.
Neden önemli
Bildirilen rakamlar doğrulanırsa, bu ikili yerel çıkarımın taban çizgisini yeniden belirliyor: yaklaşık 30B yoğun multimodal yetenek, gelir tetiklemeli lisans maddesi yokluğu ve birçok geliştiricinin zaten sahip olduğu RTX 3090/4090 sınıfı donanıma sığan nicemlenmiş ayak izi — bunlar daha önce devasa uzman karışımlı (mixture-of-experts) modellerde veya ticari olarak kapalı sürümlerde toplanan yeteneklerdi. Bir uyarı: buradaki her şey dev.to'daki tek bir karşılaştırma gönderisinden geliyor; bu yüzden dağıtım planlayan ekipler karar vermeden önce özellikleri, lisansları ve nicemlenmiş ayak izlerini resmi sürüm notlarıyla doğrulamalı.
- #open-source
- #local-inference
- #llm
- #quantization
- #qwen
- #meta
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- BrowserSkill, yapay zeka ajanlarınıza zaten oturum açtığınız tarayıcıyı kullanma imkanı veriyor