deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

PrismML, Qwen3.8 27B'yi üç değerli ağırlıklarla 5.9GB'a küçülttü, kalitenin %98,2'sini koruduğunu iddia ediyor

PrismML, Qwen3.8 27B'nin üç değerli ağırlıkla sıkıştırılmış halinin 5.9GB'lık bir ayak iziyle benchmark performansının %98,2'sini koruduğunu söylüyor; böylece 27B sınıfı bir multimodal model tüketici donanımının erişimine giriyor.

PrismML, Qwen3.8 27B'yi üç değerli ağırlıklarla 5.9GB'a küçülttü, kalitenin %98,2'sini koruduğunu iddia ediyor

Neler yayımlandı

Caltech araştırmalarından doğan, sinir ağı sıkıştırmaya odaklanmış bir girişim olan PrismML, Ternary Bonsai 2 27B'yi yayımladı — şirketin iddiasına göre Qwen3.8 27B'nin ölçülen yeteneğinin neredeyse tamamını koruyan, yerel olarak çalıştırılacak kadar küçük, ağır sıkıştırılmış bir sürüm. Duyuru 17 Eylül 2026'da Hacker News'in ana sayfasına ulaştı.

Model metin ve görüntü girdisi alıyor, 262K token'lık bir bağlam penceresini destekliyor ve Apache 2.0 lisansıyla yayımlanıyor; ağırlıklar şu anda erişilebilir durumda. Yaklaşık iki ay önce yayımlanan ilk Bonsai 27B'nin yerini alıyor.

Sıkıştırma nasıl çalışıyor

Geleneksel kayan noktalı ağırlıkları depolamak yerine Bonsai 2 27B, her ağırlığı üç değerden biriyle — eksi bir, sıfır veya artı bir — kısıtlıyor ve hassasiyeti geri kazanmak için ağırlık gruplarının üzerine FP16 ölçekleme çarpanları yerleştiriyor. PrismML'e göre bu, ağırlık başına 1.76 efektif bite ve toplam 5.9GB'lık bir ayak izine denk geliyor; bu da tam hassasiyetli modelin boyutunun dokuzda birinden biraz fazla. Teknik, seçili katmanlara değil tüm dil modeline uygulanıyor.

PrismML ne iddia ediyor

Akıl yürütme, matematik, kodlama, talimat takibi, görü ve ajan tabanlı araç kullanımını kapsayan bir benchmark setinde PrismML, sıkıştırılmış model için 83.9 puan rapor ediyor; bu da tam hassasiyetli Qwen3.8 27B'nin toplam performansının %98,2'si olduğunu söylüyor. Önceki Bonsai nesli yaklaşık %95 korumuştu, yani yeni sürüm kalan açığın çoğunu kapatıyor — şirket bunu pratikte kayıpsız olarak nitelendiriyor.

PrismML yalnızca başlıktaki rakama değil, yeteneğin nerede korunduğuna da vurgu yapıyor. Kodlama ajanları, araç kullanan sistemler ve uzun süren görevler, küçük hatalar çok sayıda adımda biriktiği için bozulmaya en duyarlı iş yükleridir. Şirket, sıkıştırılmış modelin tam da bu alanlarda ayakta kaldığını savunuyor ve konuşlandırılabilir bir boyuta ulaşmak için kodlama, görü veya araç kullanımı performansından ödün veren diğer düşük bitli alternatiflere karşı gigabayt başına yetenek açısından elverişli bir konumda sunuyor.

Bu rakamların tümü satıcı tarafından raporlanmış; duyuru, benchmark başına sonuçlar için bir beyaz kağıda işaret ediyor.

İşleme hızı ve enerji rakamları

Bir NVIDIA GeForce RTX 5090 üzerinde model saniyede 143 token'a kadar ulaşıyor; bir M5 Max üzerinde saniyede 46.8 token. PrismML ayrıca bir RTX 4090 üzerinde token başına 0.714 mWh ölçüyor; bu da sıkıştırılmış 27B modelin, tam hassasiyette çalışan bir 8B modelden %40 daha enerji verimli olduğu anlamına geliyor.

Platform desteği CUDA üzerinden NVIDIA GPU'ları ve MLX üzerinden Apple'ın Mac, iPhone ve iPad'lerini kapsıyor; düşük bitli format için yazılmış özel çekirdekler kullanılıyor. PrismML'ye Khosla Ventures, Cerberus ve Google destek veriyor; Samsung desteği sürüyor.

Neden önemli

Koruma iddiaları bağımsız değerlendirme altında doğrulanırsa, bu yayım agresif düşük bitli sıkıştırmanın bir uzlaşma değil bir konuşlandırma stratejisi olduğu tezini güçlendiriyor. 6GB altında bir multimodal 27B sınıfı model, orijinalini asla barındıramayacak tüketici GPU'larına ve Apple silikonuna sığıyor; bu da hangi iş yüklerinin bulut bağlantısı olmadan çalışabileceğini değiştiriyor — özel belge analizi, kodlama ajanı döngüleri ve varsayılan olarak yerelde kalıp seçici olarak büyüyen arka plan asistanları.

Yansımalar yerel çıkarımın ötesine uzanıyor. Daha büyük modelleri aynı bellek zarfına sığdırmak, veri merkezlerinde GPU başına daha fazla kullanıcıya hizmet vermek anlamına geliyor; token başına daha düşük enerji ise pil kısıtlamalı cihazlarda neyin uygulanabilir olduğunu genişletiyor. PrismML'nin çerçevesiyle, yararlı soru ham yetenekten, verili bir bellek, işlem gücü ve güç bütçesine ne kadar yeteneğin sığdığına kayıyor.

Uyarı şu ki, buradaki kaynak şirketin kendi duyuru yazısı; kendi seçtiği benchmarklar var ve henüz üçüncü taraf doğrulaması yok. Bu düzeyde sıkıştırmanın fiilen bedelsiz olduğu iddiası test edilmeye değer — ama iki ayda %95'ten %98'e giden koruma eğrisi, modelleri yerel çalıştırma maliyetinin düşmeye devam ettiğini gösteriyor.

  • #quantization
  • #llm
  • #on-device-ai
  • #open-source
  • #local-inference

İlgili yazılar