· kaynak dev.to (home feed)
dev.to rehberi, Qwen3-Coder-Next 80B MoE modelini llama.cpp ile yerel olarak çalıştırmayı anlatıyor
dev.to üzerindeki bir öğretici, 80 milyar parametreli Qwen3-Coder-Next MoE modelini, llama.cpp, 2-bit GGUF quantization ve CPU'da tutulan expert ağırlıkları kullanarak 8 GB GPU'ya sahip bir ev bilgisayarında nasıl çalıştıracağınızı gösteriyor.

dev.to üzerindeki bir öğretici, yüksek uçlu bir GPU gerektirmeden, llama.cpp ile büyük bir Mixture-of-Experts (MoE) kodlama modelini orta seviye bir ev bilgisayarında barındırmanın adımlarını anlatıyor. Daha önce aynı hedefi Ollama ile anlatan yazar, bu kez llama.cpp'e ve büyük bir modelin mütevazı donanımda rahatça çalışıp çalışmayacağını belirleyen dengelere — model boyutu, quantization seviyesi, VRAM ve sistem RAM'i — odaklanıyor.
Mixture-of-Experts bellek hesabını neden değiştirir
Rehber, bir MoE modelini bir uzmanlar ekibine benzetiyor: bir yönlendirici, her görevi tüm kadroyu devreye sokmak yerine en çok yardımcı olabilecek kişilere veriyor. Yerel bir kurulum planlarken iki sayı önemli. Toplam parametre sayısı saklanan tüm ağırlıkları kapsar ve ne kadar RAM, VRAM ve disk gerektiğini belirler; çok daha küçük olan aktif sayı — yani verilen bir token için kullanılan ağırlıklar — ise üretim hızını büyük ölçüde belirler.
Bu kombinasyon, büyük MoE modellerini tüketici makinelerinde cazip kılan şeydir: yanıt kalitesi büyük bir modelinkine yaklaşabilirken, token başına maliyet küçük bir modelinkine yakın kalır. Yazarın da uyardığı gibi, bu bedavasız değildir. Ağırlıklar yine de bir yerde durmak zorundadır; dolayısıyla bellek ve disk kısıtlayıcı etkenler olmaya devam eder.
Donanım hedefleri ve quantization seçimleri
Hedef makine oldukça sıradan bir masaüstü: 8 ila 16 GB VRAM'li bir NVIDIA veya AMD kart, 32 GB sistem RAM'i (16 GB ile çalışılabilir ama dardır), modern altı veya sekiz çekirdekli bir CPU ve en az 50 GB boş alanı olan bir SSD; Windows veya Linux kurulu.
Örnek model, kodlama agent'ları için tasarlanmış, 80 milyar toplam ve token başına yaklaşık 3 milyar aktif parametreli bir MoE sürümü olan GGUF biçimindeki Qwen3-Coder-Next. Kritik nokta dosya boyutu. dev.to'ya göre model sayfasında listelenen UD-Q4_K_M yapısı yaklaşık 49 GB; yazar bunu 8 GB GPU ve 32 GB RAM yanında fazla buluyor. Tavsiye, unsloth'un UD-IQ2_M gibi daha küçük bir 2-bit quantization ile başlamak ya da tamamen daha küçük bir MoE seçmek ve Q4'ü yalnızca toplam RAM ve VRAM'i 45 GB'nin üzerinde olan, context window için de ekstra yeri bulunan makinelerde geçerli saymak. Rehberde alıntılanan model sayfası, 2-bit XL varyantları için 30 GB'den fazla birleşik bellek öneriyor; bu da 8 GB kart ve 32 GB RAM'i hızlı olmasa da gerçekçi bir öğrenme kurulumu haline getiriyor.
llama.cpp kurulumu ve modeli indirme
Windows'ta en hızlı yol resmi WinGet paketidir:
winget install llama.cpp
Terminal yeniden açıldıktan sonra llama --version kurulumu doğrular; önceden derlenmiş sürüm binary'leri veya kendi derlediğiniz bir yapı da iş görür. llama.cpp'in ihtiyacı GGUF dosyalarıdır; bu biçimi bu proje ve diğer çeşitli yerel yapay zeka araçları kullanır. Tek bir komut, quantize edilmiş modeli doğrudan Hugging Face'ten indirir ve terminalde bir sohbet açar:
llama cli -hf unsloth/Qwen3-Coder-Next-GGUF:UD-IQ2_M -c 4096
Yerel servis çalıştırma ve bölünümü ayarlama
Diğer uygulamaların modele erişebilmesi için llama serve, tarayıcı arayüzü ve OpenAI uyumlu bir API sunan bir server başlatır. 127.0.0.1 adresine ve 8080 portuna bağlamak erişimi aynı makineyle sınırlar ve özel bir kodlama uç noktasını ağın dışında tutar; eski Windows paketlerinde llama-server.exe kullanılır ve -m kayıtlı bir GGUF yolunu gösterir.
En önemli ayar modelin adı değil, iş yükünün nasıl bölündüğüdür. -ngl bayrağı kaç katmanın GPU'ya taşınacağını belirler — daha fazla katman VRAM pahasına hız kazandırır — ve --cpu-moe, expert ağırlıklarını sistem RAM'ine sabitlerken modelin geri kalanının kartta yer almasını sağlar:
llama serve -hf unsloth/Qwen3-Coder-Next-GGUF:UD-IQ2_M -c 4096 -ngl 999 --cpu-moe --host 127.0.0.1 --port 8080
Bu hibrit düzenleme, tamamen GPU'da duran bir modelden daha yavaş çalışır; ama büyük bir MoE'in küçük bir karta sığmasını sağlayan şey budur. 12 veya 16 GB VRAM varsa rehber, --cpu-moe seçeneğini kaldırıp verim ve bellek kullanımını karşılaştırmayı öneriyor. Süreç belleği tüketirse önerilen çözümler şunlar: context'i 4096'dan 2048'e düşürmek, daha küçük bir quantization veya modele geçmek, daha fazla expert ağırlığını CPU'da tutmak, GPU yoğun uygulamaları kapatmak ve -ngl değerini 999'un altına indirmek.
Neden önemli
Bu anlatım, yerel yapay zekanın nereye gittiğini gösteriyor: devasa toplam parametre sayısına ama küçük aktif ayak izine sahip modeller, kullanıcılar depolama yükünü ve daha yavaş, GPU/CPU bölmeli çalışmayı kabul ettiği sürece yetenekli kodlama desteğini tüketici bilgisayarlarına çekiyor. llama.cpp'in offload kontrolleri bu bölmeyi sabit değil, makine makine ayarlanabilir kılıyor; OpenAI uyumlu uç nokta ise mevcut araçların ve kodlama agent'larının bir bulut API yerine özel, çevrimdışı bir modeli hedefleyebilmesi anlamına geliyor. Rehber sınırlar hakkında da açık sözlü — 8 GB'lik bir kart Qwen3-Coder-Next'i Q4 doğruluğunda ya da tam hızda çalıştırmaz — ama 2-bit bir quantization ve CPU'da tutulan expert'lerle model, işler bir deneyim ve donanım büyüdükçe bir basamak haline geliyor.
- #local-llm
- #llama-cpp
- #qwen
- #moe
- #gguf