· kaynak Hacker News – Front Page (native)
Mac Studio'da Qwen3.8 27B: Saniyede 14 token, ancak öz cevaplar öncülüyle başa baş
Mac Studio M3 Ultra'dan gelen benchmarklar, Qwen3.8 27B'nin saniyede yaklaşık 14 token ürettiğini — öncülünün yarısı kadar — ancak daha öz cevaplar sayesinde toplam sürenin neredeyse eşit kaldığını gösteriyor; 1-bit quant hızlı ama tool kullanımı için güvenli değil.

Token başına hız yarıya iniyor, cevap süreleri sabit kalıyor
Gönderiye göre, Qwen3.8 27B'nin varsayılan Ollama Q4_K_M quant'ı — yaklaşık 17GB'lık bir dosya — 256GB birleşik belleğe sahip M3 Ultra'da saniyede yaklaşık 14 token üretiyor. Önceki qwen3.6:27b sürümü, aynı makinede aynı quant boyutunda saniyede 28.6 token'a ulaşıyor ve çalıştırmalar arası sapması çok daha dar: yeni model için 13.2–15.4 iken eski modelde 28.5–28.8. Prompt işleme iki model arasında neredeyse aynı: saniyede 93.1 ve 95.0 token. Yazar, üretim farkını modelin yeni hibrit attention tasarımına ve henüz yetişmemiş Ollama Metal kernel'larına bağlıyor ve runtime'lar olgunlaştıkça farkın daralmasını bekliyor.
Daha yavaş token hızı daha yavaş cevaplara dönüşmüyor. Aynı teknik prompt'larla model başına beş zamanlanmış çalıştırmada, Qwen3.8 cevap başına kabaca 890–1.090 token kullanırken qwen3.6 1.950–3.340 token arasında dağılıyordu. Yazarın hesabı: saniyede 28.6 token'la 2.058 token 72 saniye sürerken, saniyede 14.2 token'la 955 token 67 saniye sürüyor — yani daha yeni model gerçek süre olarak aslında biraz önce bitiriyor.
Üretim ortasında yapılan izleme, çıkarımın neredeyse tamamen Metal üzerinden GPU'da çalıştığını gösterdi: 60 GPU çekirdeğinin tamamı %100'de, GPU yaklaşık 64W çekerken CPU yaklaşık 6W'da ve tüm sistemin güç tüketimi zirvede 291W civarındaydı.
1-bit quant bilgiyi koruyor, kararlılığı kaybediyor
Geçen hafta topluluk tartışmalarının zirvesindeki 1-bit Unsloth quant (UD-IQ1_M, 6.7GB) da test edildi. llama.cpp'de saniyede 27.2 token üretim ve saniyede 309 token prompt işleme hızıyla, 8GB'ın altında RAM kullanarak çalıştı — Q4 üretim hızının neredeyse iki katı. Genel bilgi sağlam kaldı: model Canberra'nın Avustralya'nın başkenti olduğunu ve bunun tarihçesini biliyordu. Ama basit bir bash tek satırlığı istendiğinde çalışan bir komut üretti ve sonra yaklaşık 400 token harcayarak alternatifler arasında karar kılmadan dolaştı. Yazar, bunun Unsloth'un kendi dokümantasyonuyla örtüştüğünü belirtiyor; dokümantasyon agentic ve tool çağrısı için kullanımda 1-bit'e karşı çıkıyor ve bu iş yükleri için en düşük olarak 9.8GB'lık UD-Q2_K_XL quant'ını gösteriyor. Daha geniş ders: quant, bir modeli eşit olarak bozmuyor.
Her quant hangi donanımı istiyor
Gönderi, Unsloth'un tam GGUF merdivenini özetleyerek dosya boyutlarını gerçekçi RAM'le eşleştiriyor: 1-bit dosya (6.7GB) ve Q2_K_XL (9.8GB) 16GB makinelere sığıyor; Q4 quant'lar (16–17.6GB) 32GB istiyor; Q6_K (22GB) rahat için 48GB arzu ediyor; Q8_0 (29GB) 48–64GB gerektiriyor; BF16 (54.7GB) 96GB'den başlıyor. 32GB'lık bir mini PC, Q4'ü CPU çıkarımıyla çalıştırabilir ama yazar tek haneli token hızları bekliyor — arka plan özetleme işleri için kabul edilebilir, etkileşimli sohbet için zahmetli.
Apple donanımı dışında topluluğun referans noktası AMD'nin Strix Halo'su: strix-halo-guide projesi, resmi Q4_K_M'yi bir Ryzen AI Max+ 395 üzerinde üretimde saniyede 20.4 token ve prompt işlemede saniyede 292 token olarak ölçtü ve 64GB GMKtec EVO-X2 1.999 dolarlık giriş noktası olarak gösterildi. Gönderi ayrıca DDR5 fiyatlarının hâlâ yüksek olduğunu uyarıyor — 64GB SODIMM kit 750–870 dolar — dolayısıyla RAM'i önceden takılı bir mini PC almak şu anda sonradan yükseltmekten daha ucuz. Alıntılanan topluluk raporları çift RTX 3090 kurulumlarını saniyede 60 token civarına, RTX 5090'ı ise runtime'a bağlı olarak 75 ile 140 arasına yerleştiriyor.
Bir sürüm tuzağı ve modelin sundukları
Pratik bir tuzak: GGUF qwen35 mimari etiketini taşıyor ve birkaç haftadan eski llama.cpp build'leri "unknown model architecture: 'qwen35'" hatasıyla başarısız oluyor — yazarın kendisinin karşılaştığı bir hata. Modelin kendisi, görüntü ve video anlayışına sahip 27.3B parametrelik yoğun bir sürüm; 262.144 token'lık yerel bağlam penceresi ve Apache 2.0 lisansı var. Model kartı SWE-bench Pro'da 61.7 ve GPQA Diamond'da 89.2 iddia ediyor; erken topluluk faaliyeti ise ücretli API'lerin yerine kodlama hatlarına bağlanması ve ticari bulut katmanlarıyla OCR karşılaştırmaları üzerinde yoğunlaştı.
Neden önemli
Yeni bir açık modelin lansman haftası kapsamısı yeteneği ölçüyor; kendi kendine barındıranlar ayrıca eldeki donanımdaki üretim hızına ihtiyaç duyuyor. Bu gönderi Apple silicon için tam olarak bunu sağlıyor ve iki bulgu öne çıkıyor. Birincisi, ham saniyedeki token karşılaştırmaları yanıltıcı: yarısı kadar hızlı bir model, üç kat daha özse yine de daha hızlı cevap verebilir. İkincisi, quant sonuçları bilgi yarışmasına uygun ve agent-güvenli dosya boyutları arasında net bir sınır çiziyor; 16GB'lık bir makinenin yeterli olup olmadığına karar veren herkes için faydalı. Metal kernel gecikmesi ve llama.cpp uyumluluk kopuşu da parıltılı yeni mimarilerin ilk haftalarında gerçek kurulum sürtünmesiyle geldiğini hatırlatıyor.
- #local-llm
- #apple-silicon
- #ollama
- #quantization
- #benchmarks
İlgili yazılar
- Benchmark, M2 Mac'te yerel LLM'lerde Q4_K_M'nin MXFP4'den neredeyse iki kat hızlı olduğunu gösterdi
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- Apple Vision OCR yerel bir 27B VLM'den 300 kat hızlı çalışıyor ama tablo yapısını yok ediyor