deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Qwen3.8 27B, 4-bit ile 24GB GPU'da tam hassasiyetteki kodlama skorlarına ulaşıyor

Quesma'nın testleri, Qwen3.8 27B'nin 17GB'lık Q4_K_M kuantizasyonunun Terminal-Bench 2.1'de 55GB'lık BF16 orijinaliyle aynı skoru aldığını, 1-bit sürümlerin ise rastgele tahmin düzeyine düştüğünü gösterdi.

Qwen3.8 27B, 4-bit ile 24GB GPU'da tam hassasiyetteki kodlama skorlarına ulaşıyor

Dört-bit kuantizasyon ayakta duruyor

Qwen3.8 27B'yi iyi çalıştırmak için ne kadar GPU belleği gerekiyor? Hacker News ana sayfasına düşen Quesma'nın yayımladığı benchmarklara göre cevap yaklaşık 17 GB. Bu, 4-bit Q4_K_M GGUF kuantizasyonunun boyutu ve bu sürüm, agentic kodlama benchmarkında tam BF16 modelle — 55 GB'lık bir indirme — aynı skoru aldı. RTX 4090 gibi 24 GB'lık bir tüketici kartına sığıyor ve yaklaşık 64k token context için yer kalıyor.

Neler test edildi

Motivasyonun bir kısmı, Reddit'te sık duyulan "her kuantizasyonun, hatta 8-bit'in bile, yerel modelleri gözle görülür şekilde aptalllaştırdığı" şikayetine duyulan şüpheniydi. KL-divergence gibi token düzeyindeki metrikler sapmayı ölçebilir ama görevlerin gerçekten başarısız olup olmadığını ölçemez; bu yüzden Quesma üç suite'te doğrudan benchmark sonuçlarını ölçtü: lisansüstü düzeyde fen bilimleri için GPQA Diamond, talip takibi için IFBench ve agentic kodlama için Terminal-Bench 2.1.

Adaylar, Hugging Face'teki Unsloth'un GGUF kuantizasyonlarıydı: 8-bit Q8_0 (29 GB), 4-bit Q4_K_M (17 GB), 2-bit UD-Q2_K_XL (10,7 GB) ve 1-bit UD-IQ1_S (6,2 GB). Her şey, önceki sürümlerin bu modeli desteklemediği için 16 Ağustos 2026 tarihli bir build kullanılarak llama.cpp üzerinden çalıştırıldı; kuantizasyondan bağımsız olarak 32k token başına yaklaşık 2,3 GB'lık F16 KV-cache kullanıldı. Quesma önce Qwen'in resmi BF16 skorlarını doğruladı, ardından her kuantizasyonu bunlara karşı ölçtü ve kiralık Modal GPU'lara yaklaşık 3.000 dolar harcadı. Bir uyarı: Unsloth, v2 quant dosyalarını 19 Ağustos 2026'da değiştirdi; bu yüzden çoğu testte kullanılan dosyalar artık indirilemiyor.

Skorlar 4-bit üzerinde neredeyse kımıldamıyor

GPQA Diamond'da sonuçlar BF16'dan 4-bit'e kadar istatistiksel gürültü içinde kaldı; yalnızca 2-bit varyant belirgin şekilde daha düşük puan aldı. Akıl yürütme (reasoning) eforu, sıkıştırmadan çok daha fazla fark yarattı: en iyi skorlar, yaklaşık 8k reasoning token tüketen varsayılan xhigh ayarında alındı; ancak Quesma bu ayarın modelin aşırı düşünmesine yol açabileceği konusunda uyarıyor.

IFBench, 11 GB'ın altındaki bir model için 2-bit'te bile hiçbir ölçülebilir bozulma göstermedi.

3 saatlik zaman aşımı ve 98k token ayrılmış context ile çalıştırılan Terminal-Bench 2.1, manşet sonucu üretti: Q4_K_M hem tam modelin ölçülen skorunu hem de Qwen'in resmi açıkladığı rakamı tekrarladı. Q8_0 yanlışlıkla atlandı; Quesma bunu zararsız sayıyor çünkü sonucu 4-bit ile tam hassasiyet arasında güvenle tahmin edilebiliyor. 2-bit model belirgin şekilde düştü ama yine de Opus 4.7 veya Gemini 3.1 Pro düzeyine yakın bir yere yerleşti. Çözülen aynı görevlerde BF16 kadar agent turu sayısına ihtiyaç duydu ama yaklaşık dörtte bir daha fazla çıktı tokeni üretti.

Bir bit, bir bit fazla az

Sıkıştırma hasarının doğrusal olmadığı ortaya çıktı: önce ölçülebilir bir değişim yok, sonra hafif bir düşüş, sonra çöküş. Her iki 1-bit kuantizasyon da GPQA Diamond'da kabaca rastgele tahmin düzeyinde skor aldı; en küçüğü şans düzeyinin altında kaldı. Uzun reasoning işleri daha da kötüleştirdi, çünkü model sık sık token bütçesi bitene kadar akıl yürüyor ve boş bir cevap döndürüyordu. Unsloth, UD-IQ1_S'yi %89 daha küçük olmasına rağmen yaklaşık %72 top-1 doğruluğu koruyacak şekilde tanıtıyor; ancak Quesma'ya göre eksik doğruluk gerçek görevler için belirleyici — bu, 1-bit quant'ı kullanılamaz olarak tanımlayan bir r/LocalLLaMA başlığıyla tutarlı.

Çalıştırmaların maliyeti

Yalnızca Terminal-Bench çalışmaları GPU süresinde 2.308 dolara mal oldu; GPQA ve IFBench buna 663 dolar daha ekledi. Tek bir BF16 konfigürasyonu, Modal üzerinden kiralık NVIDIA L40S, H100 ve H200 donanımında, Q4_K_M için harcanan 502 dolara karşı 804 dolara mal oldu. Ölçek vermek için Quesma, 284B'lik bir model olan DeepSeek V4 Flash 0731'in en ucuz OpenRouter sağlayıcılarında milyon çıktı tokeni başına yaklaşık 0,10 dolara mal olduğunu belirtiyor; ancak bu farkın ne kadarının ölçek verimliliği, fiyatlandırma stratejisi veya popülerliği yansıttığı belirsiz.

Neden önemli

Yerel model çalıştıran herkes için tavsiye somut: GPU belleğine KV-cache ile birlikte sığan en büyük quant'ı seçin; 24 GB'lık bir kartta bu, kodlama ve agentic işlerde fiilen tam kaliteyle Q4_K_M anlamına geliyor. Sonuçlar ayrıca kuantizasyonun kendiliğinden çıktıyı bozduğuna dair tekrarlanan inanca da karşı çıkıyor — 4 bit üzerinde bu benchmarklar hiçbir fark söyleyemedi — ve reasoning-eforu ayarlarının kalite üzerinde sıkıştırmadan çok daha büyük bir kaldıraç olduğunu gösteriyor. 2 bitin altında tasarruf etmeye değmiyor: küçük quant'lar mütevazı bir belleğe sığabilir ama bu kanıta göre görevleri çözemiyorlar.

  • #llm
  • #quantization
  • #benchmarking
  • #local-llm
  • #qwen

İlgili yazılar