· kaynak dev.to (home feed)
Saluki 27B: 2-bit, 7.89 GB, tek bir kıyaslamada 54 GB'lık atasını geçiyor, matematikte ise geride kalıyor
Conway Research'ün Qwen3.8-27B'nin 2-bit derlemesi 54 GB'ı 7.89 GB'a indiriyor, ekibin kendi tool-calling kıyaslamasında tam modele karşı 84 yerine 88 puan alıyor ve standart llama.cpp ile çalışıyor — ancak yarışma matematiğinde yalnızca %82-85'lik başarı koruyor.

54 GB'lık atasını geçen 7.89 GB'lık dosya
Conway Research'ün Underdog ekibi, yaklaşık 54 GB'lık yoğun modeli tek bir 7.89 GB'lık GGUF dosyasına — 6.84 kat küçüğe — sıkıştıran, Qwen3.8-27B'nin 2-bit quantize edilmiş derlemesi olan Saluki 27B'yi yayınladı. Bir dev.to yazısına göre Saluki, ekibin kendi tool-calling kıyaslamasında 120 üzerinden 88 puan alırken tam model 84 puan aldı.
Öne çıkan sayı gerçek ama dar kapsamlı. Aynı yazı, geliştiricilerin kendi yayınladığı üç uyarıyı ve yarışma matematiğindeki ölçülebilir gerilemeleri de içeriyor; asıl mesele, dosyanın gerçekte neye iyi geldiğini bu ayrıntılar belirliyor.
Nedir ve nasıl çalıştırılır
dev.to makalesine göre temel model Qwen3.8-27B: gated-delta-net lineer attention ile full attention'ı birleştiren, 262.144 token bağlam penceresine ve Apache 2.0 lisansına sahip yoğun bir model. Saluki yeniden eğitilmiş bir model değil. Ekip, ISTA-DASLab'ın önceki 2-bit GSQ/RCO GGUF sürümünden yola çıktı ve tool-calling davranışını korumak için seçilmiş kalibrasyon verileriyle kendi karışık IQ2 quantization'unu uyguladı.
Satış noktası dağıtım: dosya, fork veya ayrı bir runtime gerektirmeden standart llama.cpp ile yükleniyor. Belgelenmiş çağrı, --jinja, -ngl 99, -fa açık ve -c 32768 parametreleriyle llama-server; OpenAI uyumlu bir chat API'si sunuyor. Önerilen örnekleme, genel kullanım için temperature 0.6, top_p 0.95 ve top_k 20; tool-calling hızı önemliyse temperature 0. Thinking mode varsayılan olarak açık ve istek başına devre dışı bırakılabiliyor. Ana dosya yalnızca metin odaklı; 629–928 MB'lık vision eklentileri ayrı indirmeler.
Bazı haberler dosyanın Ollama, LM Studio ve vLLM'de de çalıştığını iddia ediyor, ancak dev.to yazarının da belirttiği gibi resmi sayfa yalnızca standart llama.cpp'yi vurguluyor ve makale bu çelişkiyi çözme tarafında değil.
Kıyaslama merdiveni
Underdog Bench, Berkeley Function Calling Leaderboard'ün 4. sürümünden alınan, her biri 24 görevden oluşan beş kategoriye bölünmüş ve herhangi bir model test edilmeden 27 Eylül 2026'da dondurulmuş 120 görevden oluşuyor. Bildirilen puanlar:
- Underdog ana derleme, 7.9 GB — 91
- Saluki, 7.89 GB — 88
- Mia 2-bit, 9.1 GB — 85
- Qwen3.8-27B tam, yaklaşık 54 GB — 84
- ISTA 2-bit, 8.4 GB — 76
- Ternary Bonsai 2, 5.95 GB — 70
Tek araç seçiminde Saluki, iki en basit kategoride 48 üzerinden 47 puan aldı; Mia'nınki 48 üzerinden 31'di. Ekip, ana derlemeyle birlikte Saluki'nin tam modelin çözdüğü 84 görevin 76–77'sinde tam modeli geçtiğini söylüyor.
Ekibin kendi yayınladığı uyarılar
Birincisi, ekibin ana derlemesi daha yüksek puan alıyor — 88'e karşı 91 — ama Saluki yine de yayınlandı, çünkü ana derleme gerçek web sorularına daha kötü yanıt veriyor: 150'nin 48'i (%32); Saluki'de ise 150'nin 60'ı (%40). İkincisi, sıkı denetimli paralel tool calling'de Saluki 100 üzerinden 42 yaparken Mia 100 üzerinden 69 ile açık önde; biçimlendirmeyi affeden esnek bir denetleyici Saluki'yi 55'e, Mia'yı yalnızca 70'e çıkarıyor. Üçüncüsü, ekip Saluki'nin orijinalden daha akıllı olduğunu iddia etmediğini açıkça belirtiyor, 120 görevi mütevazı bir test olarak nitelendiriyor, farkın bir kısmını çalıştırmalar arı değişkenliğe bağlıyor ve temel modelin kamuya açık puanlarının farklı bir harness'ten geldiğini not ediyor.
Quantization'un vurduğu yer
Yarışma matematiği en büyük darbeyi alıyor: AIME 2025 96.7'den 79.2'ye, AIME 2026 ise 94.6'dan 80.0'a düşüyor; yaklaşık %82–85 korunmuş oluyor. SWE-bench Verified 50 üzerinden çözülen 33'ten 30'a, MBPP+ 83.9'dan 78.0'a, MuSR 79.6'dan 67.5'e geriliyor. IFEval tek istisna: 91.5'e karşı 93.5. Harf manipülasyonu bilmeceleri en zayıf görev ailesi ve sıkı paralel çağrı denetleyicisi 100 yanıtın 23'ünü, çoğunlukla biçimlendirme nedenleriyle ayrıştıramadı.
Uyumluluka karşı boyut
dev.to makalesi, gerçek ayırt edici farkın puan değil runtime olduğunu savunuyor. Mia, ExLlamaV3'ün EXL3 formatında geliyor ve llama.cpp'ye hiç yüklenemiyor. Ternary Bonsai 2, llama.cpp'nin bir PrismML fork'unu gerektiriyor; standart llama.cpp PQ2_0 ve PTQ1_0 dosyalarını bilinmeyen türler olarak reddediyor ve Q2_0 yüklemesi, Hadamard rotation runtime'ı eksik olduğu için sessizce anlamsız çıktı üretiyor. Bonsai 1.33 kat daha küçük ve kendi 14 kıyaslama setinde %98.2 yetenek korunumu iddia ediyor, ama iki iddia seti farklı testlerden ve harness'lerden geliyor ve doğrudan karşılaştırılamıyor.\n 11 Ekim itibarıyla Saluki, 30 gün içinde 59.191 indirme gösterdi; Bonsai 4.46 milyon, ISTA orijinali 1.48 milyon indirmeye karşı. AlphaSignal ise bir gün önce yalnızca yaklaşık 15.000 Saluki indirmesi bildirmişti.
Neden önemli
Saluki, tek bir davranışa odaklı kalibrasyonla yapılan 2-bit quantization'ın, ticari açıdan önemli bir yeteneği — tool calling — yerel kullanıcıların zaten çalıştırdığı runtime üzerinde, orijinal ayak izinin yaklaşık yedide biri kadarıyla koruyabileceğine dair bir veri noktası. En az bunun kadar yararlı olan da açıklama biçimi: ekip nerede kaybettiğini yayınlıyor ve bu da 88'e karşı 84 sonucunu tanıtımsal değil inandırıcı kılıyor. Elinde yaklaşık 8 GB yeri olan yerel agent çalıştıran herkes için bu pratik bir seçenek; matematik ağırlıklı işler içinse tam model veya daha yüksek bitli bir quant daha güvenli tercih olmaya devam ediyor.
- #quantization
- #local-llm
- #llama-cpp
- #tool-calling
- #open-source
İlgili yazılar
- Ollama'nın llama.cpp runner'ı yerel LLM akışında ölçülen 90 katlık görüntüleme gecikmesini ortadan kaldırıyor
- RTX 3090 üzerinde Qwen 27B ayarlaması üretim hızını neredeyse ikiye katlayarak 60 token/s seviyesine çıkardı
- Agent Standup, Claude Code oturumlarını canlı ve sıfır token maliyetli bir stand-up toplantısına dönüştürüyor