· kaynak Hacker News – Front Page (hnrss.org)
ShapeLearn quantları Qwen 3.8 27B'yi 13GB VRAM'de BF16'a yakın kaliteyle çalıştırıyor
ByteShape'ın tamamlanmış ShapeLearn GGUF'ları Qwen 3.8 27B'yi tüketici GPU'larının erişimine sokuyor: en üst varyant 13.1GB VRAM gerektiriyor ve ekibin benchmark'larında BF16'ın %99,63'ünü alıyor.
Beş varyant, tek bir ödünleşim
Sürüm, 2.56 bpw'lik IQ2_XXS'den 3.84 bpw'lik IQ4_XS'ye kadar GPU-1'den GPU-5'e etiketlenmiş beş GGUF'tan oluşuyor. Test edilen altı GPU'nun tamamında daha büyük dosyalar daha yüksek puan aldı, daha küçük dosyalar ise daha hızlı üretim yaptı. ByteShape'e göre Qwen 3.8 27B yoğun (dense) bir model olduğundan ve darboğaz bellek transferleri olduğundan, ağırlık başına kırpılan her bit, mixture-of-experts modellerine kıyasla daha doğrudan verimliliğe dönüşüyor.
RTX Pro 6000'de GPU-1, BF16'a göre 0.9304'lük bir doğruluk değeriyle saniyede 116.11 token çalışırken, GPU-5 0.9963'te 90.42 tok/s sunuyor. RTX 5090 aynı sıralamayı gösteriyor ve GPU-5 93.66 tok/s'ye ulaşıyor.
Varsayılan öneri, sığdığı her yerde GPU-5. Bağlam uzunluğu 13.1 GB'ı aştığında alternatif GPU-4 oluyor: 3.23 bpw'lik IQ3_S, 11.0 GB boyutunda, BF16 puanının %98,72'si ve Pro 6000'de GPU-5'ten daha yüksek verimlilikle 101.11 tok/s.
Quantlar nasıl karşılaştırılıyor
Grafikler ShapeLearn'ı AtomicChat, Bartowski, ISTA-DASLab ve Unsloth Dynamic v3 quantlarıyla karşılaştırıyor. Bartowski'nin en yeni sürümleri ByteShape testleri bitirdikten sonra yayınlandığı için grafiklerde yer almıyor. Ekibin sinir (frontier) ölçütüne göre — yani grafikteki hiçbir rakip aynı anda daha hızlı ve daha doğru değil — beş ShapeLearn modelinin tamamı altı GPU karşılaştırmasının tümünde sinir üzerindedir ve GPU-5, grafikteki her şeyin en yüksek toplam puanını almaktadır. ByteShape ayrıca ISTA-DASLab'ın 3.50 bpw'lik, 0.9943 doğruluklu ve 94.77 tok/s hızındaki GSQ-RCO-IQ3_S'unu rekabetçi başka bir sinir noktası olarak öne çıkarıyor.
Spekülatif kod çözme için iki yol
Her GGUF, gömülü MTP draft head ile geliyor; böylece llama-server tek bir bayrakla spekülatif kod çözmeyi etkinleştirebiliyor ve mmproj projector üzerinden görüntü girdileriyle birlikte çalışıyor. Alternatif olan DFlash2, ana modeli ayrı bir 1.1 GB'lık Q4_K_M draft modeliyle eşleştiriyor ve yalnızca metin kullanımı için en hızlı seçenek; ancak daha fazla belleğe ihtiyaç duyuyor, llama.cpp'de multimodal desteği kaldırıyor ve b10658 veya daha yeni bir build gerektiriyor. ByteShape, her iki yöntemin de test edilen her model ve GPU'da verimliliği artırdığını bildiriyor ve bellek izin verdiğinde maksimum metin verimliliği için DFlash2'yi, VRAM veya görüntü girdisi daha önemli olduğunda MTP'yi öneriyor.
Lite seti, yeniden ele alındı
Aceleyle çıkarılan Lite quantlar beklentiden daha iyi durumdaki yaşlandı. Altı Lite modelinden üçü, Unsloth Dynamic v3 ile karşılaştırmada hâlâ sinir üzerinde ve KLD sıralamasının öngördüğünden daha iyi performans gösteriyor.
Neden önemli
13.1 GB'da benchmark kalitesinin %99,6'sını koruyan 27 milyar parametreli yoğun bir model, KV cache ve bağlam için pay bırakarak ana akım 16 GB'lık bir tüketici ekran kartına sığıyor ve 11 GB'lık GPU-4 bunu daha da mütevazı donanımlara kadar uzatıyor. Sürüm ayrıca topluluk quantlama hattının artık ne kadar hızlı hareket ettiğini gösteriyor: kullanılabilir GGUF'lar modelin yayınlanmasından dört gün içinde ortaya çıktı, haftalar sonra ise Unsloth ve Bartowski gibi köklü isimlerle ölçülen hız-kalite grafiklerinde yarışan, daha titiz şekilde optimize edilmiş bir set geldi. Bir uyarı: tüm rakamlar ByteShape'in kendi benchmark setinden ve test GPU'larından geliyor ve sinir yalnızca ekibin grafike aldığı quantlar üzerinden tanımlı, bu yüzden bağımsız doğrulama hâlâ eksik.
- #qwen
- #gguf
- #quantization
- #llama-cpp
- #local-llm