· kaynak dev.to (home feed)
Benchmark, M2 Mac'te yerel LLM'lerde Q4_K_M'nin MXFP4'den neredeyse iki kat hızlı olduğunu gösterdi
Bir Apple M2 dizüstü bilgisayarda yapılan uygulamalı bir benchmark, eski Q4_K_M kuantizasyonunun OpenAI'ın daha yeni MXFP4 formatından yaklaşık 1,8 kat daha hızlı olduğunu buldu; bu da yerel LLM çıkarımı için 'yenisi daha hızlıdır' hikayesini zayıflatıyor.

dev.to'da paylaşılan uygulamalı bir benchmark, GGUF ekosisteminin uzun süredir iş atı formatı olan Q4_K_M'nin, aynı Apple M2 dizüstü bilgisayarda OpenAI'ın daha yeni MXFP4 microscaling formatından yaklaşık 1,8 kat daha hızlı çalıştığını ortaya koydu. Bu sonuç, OpenAI'ın yerel öncelikli gpt-oss modelleri için seçtiği yeni formatın Apple Silicon'da daha hızlı seçenek olacağı beklentisiyle çelişiyor.
Ne test edildi
dev.to'da pitambarmahato adıyla yayın yapan yazar, 24 GB birleşik belleğe sahip bir Apple M2'de Ollama 0.12.8 üzerinden iki model çalıştırdı: Alibaba'nın Q4_K_M formatındaki Qwen3-14B'si (diskte 9,3 GB) ve OpenAI'ın MXFP4 formatındaki gpt-oss-20B'si (diskte 13,8 GB). Her model, aynı 263 karakterlik kod tamamlama prompt'una üç kez yanıt verdi; ilk soğuk çalışma, iki sıcak çalışmadan ayrı olarak rapor edildi. Yazar ayrıca, 2026'da Hugging Face'teki yerel model indirmelerinin kabaca yüzde 70'inin Q4_K_M'ye gittiğine dair bir rakama da atıf yapıyor; bu da eski formatın hâlâ ne kadar yaygın kullanıldığını gözler önüne seriyor.
Bu eşleştirme özgün plandan bir sapmaydı. Yazar tek bir modelin Q4, Q5 ve Q8 varyantlarını karşılaştırmayı planlamıştı; ancak ev bağlantısı üzerinden ek indirmelerin 30-60 dakika süreceğini tahmin edince, yerel olarak önbellekte duran iki modele geçti.
Rakamlar
İkinci ve üçüncü denemelerin sıcak ortalamalarında, Q4_K_M'deki Qwen3-14B saniyede 4,7 token üretti ve 200 tokenlık bir yanıtı 44,0 saniyede tamamladı. MXFP4'deki gpt-oss-20B saniyede 2,6 token üretebildi ve çıktısı için 70,8 saniyeye ihtiyaç duydu; yani aynı nominal iş yükü için yaklaşık 27 saniyelik bir fark oluştu. Soğuk yükleme farkı daha da büyüktü: Q4_K_M modeli için 39,1 saniye, MXFP4 modeli için ise 165,7 saniye.
Yazarın ölçeklendirmesine göre, bu hızlarla 1.000 tokenlık bir tamamlama gpt-oss-20B'de yaklaşık altı dakika, Qwen3-14B'de ise yaklaşık üç buçuk dakika sürerdi.
Yazara göre MXFP4 neden kaybetti
Yazı, kanıttan çok üç gözleme dayanan bir teori sunuyor. Birincisi, Apple Silicon'da MXFP4, Neural Engine yerine AMX matris birimi üzerinden çalışıyor ve M2'nin AMX biriminin yerleşik FP4 desteği yok; yazar bunun yalnızca M4 ile geldiğini söylüyor, dolayısıyla MXFP4 ağırlıklarının her matmul öncesi FP16'ya dekuantize edilmesi gerekiyor. Bu maliyet daha yeni çiplerde ortadan kalkmalı. İkincisi, Q4_K_M llama.cpp'ye yerleşik durumda ve yıllardır süren kernel mikro-optimizasyonlarından yararlanıyor; buna karşılık yazılım yığınındaki MXFP4 desteği görece genç. Üçüncüsü, gpt-oss-20B, 200 görünür token için gizli düşünme blokları dahil yaklaşık 400 toplam token üretirken, Qwen3 için bu sayı yaklaşık 250'ydi; dolayısıyla akıl yürütme yükü ölçülen iş hızını daha fazla zorladı.
Testin göstermediği şeyler
Bu, tertemiz bir format karşı format deneyi değil. İki farklı modeli, farklı parametre sayıları ve disk boyutlarıyla birbirine karşı kıyaslıyor, çünkü her biri yalnızca tek bir quant ile yayınlanmıştı. Yazar çıktı kalitesini ölçmedi; Apple'ın MLX formatını, M3 veya M4 donanımını, çok uzun bağlamları ya da Q5 ve Q8 varyantlarını test etmedi. Pratik sonuçlar da buna göre dar: M2 ve M3 Mac'lerde Q4_K_M ve Q5_K_M hâlâ en hızlı seçimler; MXFP4 ise yerleşik FP4 destekli M4 sınıfı Mac'ler ve NVIDIA Blackwell GPU'lar yaygınlaştığında rekabetçi hale gelmeli. Yazar ayrıca, gpt-oss-20B'nin duyurulan saniyede 20 token hızının daha yeni donanım varsaydığı konusunda uyarıyor; M2'de ise 2,6 token sağladı.
Benchmark betiği herkese açık bir depoda yayınlandı ve yazar, MXFP4'nün tasarlandığı donanımda kazanıp kazanmadığı sorusunu çözmek için M4 Mac'lerde yeniden çalıştırılmasını istiyor.
Neden önemli
Yerel model çalıştıran çoğu kişi en uç donanımda değil ve bu test, kuantizasyon hızının bit sayısına veya çıkış tarihine değil; format, kernel olgunluğu, donanım desteği ve modelin kendi token alışkanlıkları dahil olmak üzere tüm yığına bağlı olduğunun yararlı bir hatırlatması. Geniş M2 ve M3 Mac sahibi kitlesi için hız açısından güvenli seçim hâlâ eski tamsayı quant; yeni format ve modeller için duyurulan çıktı hızları ise, sahip olmayabilecekleri makineler için en iyi durum rakamları olarak okunmalı. Bu aynı zamanda topluluk için somut ve yanlışlanabilir bir soru çerçevesi sunuyor: MXFP4'nün vaat edilen kazanımları gerçekten M4 sınıfı çiplerde ortaya çıkacak mı, yoksa format bugün her yerde sadece daha mı yavaş?
- #local-llm
- #quantization
- #apple-silicon
- #ollama
- #gguf