deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

BITCOS, ternary LLM ağırlıklarını 1.58-bit bariyerinin altına indiriyor

arXiv'de yayımlanan bir ön baskı, bazı ternary LLM'lerde ağırlıkların yarısından fazlasının sıfırdan oluştuğunu tespit ediyor ve bunu, ağırlıkları 1.585 bitin altında saklayan bir bitmap-artı-işaret düzeniyle kullanarak decode işleme hacmini 1.27 katına kadar yükseltiyor.

BITCOS, ternary LLM ağırlıklarını 1.58-bit bariyerinin altına indiriyor

Bir paketleme şeması ternary'nin nominal tabanının altına sızıyor

arXiv'e yüklenen bir ön baskı, ternary büyük dil modellerinin ağırlıklarını saklamanın yeni bir yolu olan BITCOS'u öneriyor; bu yöntem, formatın bilgi-teorik tabanı olarak genellikle kabul edilen ağırlık başına kabaca 1.585 bitin altına iniyor. Makaleye göre bu düzen, test edilen 29 modelden 26'sında ağırlıkları bugünün standart paketlemesinden daha kompakt saklıyor, en seyrek modelde ağırlık başına 1.485 bite kadar iniyor ve uçtan uca decode işleme hacmini CPU'larda 1.18 kat, GPU'larda 1.27 kata kadar yükseltiyor. arXiv kaydında gönderici olarak Evangelos Georganas'ın göründüğü ve 14 Eylül 2026 tarihli bu çalışma, Hacker News ana sayfasında öne çıkarıldı.

1.58-bitlik rakam nereden geliyor

Ternary LLM'ler her ağırlığı üç düzeyden birine nicemler: -1, 0 veya +1. Eşit olasılıklı üç sembolden birini kodlamak log2(3), yani yaklaşık 1.585 bit gerektirir; formatın halk arasında "1.58-bit" diye anılmasının ve bu sayının katı bir alt sınır gibi görünmesinin nedeni budur. Gerçek dağıtımlar buna bile ulaşamaz: makale, yaygın formatın beş ternary ağırlığı tek bir bayta paketlediğini ve pratikte kullanılan ikinin kuvveti grup boyutlarıyla bunun ağırlık başına 1.625 bit ettiğini belirtiyor. Kritik nokta şu: Her iki rakam da üç sembolün eşit sıklıkta ortaya çıktığını varsıyor.

Ölçülen modeller çoğunlukla sıfırlardan oluşuyor

Bu varsayım gerçek ağlarda geçerli değil. Yazarlar 29 ternary LLM'i inceleyip sıfırların tüm ağırlıkların yüzde 51.5'ine kadar çıkabildiğini raporluyor. Değerlerin yaklaşık yarısı aynı olduğunda, bir ağırlığı tanımlamak için gereken bilginin çoğu konumsaldır: sıfır olmayanlar nerede duruyor ve her birinin işareti ne.

BITCOS: bir bitmap artırılmış sıkıştırılmış işaretler

BITCOS tam olarak bunu kodluyor. Ağırlık başına tek bit ile o ağırlığın sıfır olup olmadığını kaydeden yoğun bir bitmap tutuyor, ardından kalan her ağırlığın işaretini, yine her biri bir bit olacak şekilde, sıkıştırılmış bir listede saklıyor. Toplamda düzen, ağırlık başına 2 - z bit maliyetinde; burada z, modelin sıfır yoğunluğu. Bu formüle göre sıfırları ağırlıkların yüzde 37.5'ini aşan her model, beş-trit paketlemenin 1.625 bitinden daha ucuza saklanıyor. Makale, ölçülen 29 modelden 26'sının bu eşiği geçtiğini, en seyrek olanın ise ağırlık başına 1.485 bite indiğini, yani meşhur 1.585 rakamının altına düştüğünü söylüyor.

Kernel ve uçtan uca sonuçlar

Kompakt bir formatın anlamı ancak silikon onu hızlı çözümleyebiliyorsa var. Yazarlar AVX-512, AVX2 ve Intel Xe2 GPU'ları için optimize edilmiş açma (unpacking) rutinleri anlatıyor ve gerçek ternary modellerin sahip olduğu sıfır yoğunluklarında yeni düzenin, üretimde kullanılan en iyi ternary matris-vektör çarpımı kernel'lerine karşı 1.28 kata kadar kazanç sağladığını raporluyor. Beş platformda — istemci ve sunucu CPU'ları ile entegre ve ayrık Xe2 GPU'ları — yapılan uçtan uca çıkarım testlerinde decode işleme hacmi işlemcilerde 1.18 kat, GPU'larda 1.27 kata kadar iyileşti.

Dikkate değer uyarılar

Bu daha birinci sürüm bir ön baskı ve hakem incelemesinden geçmedi. GPU sonuçları yalnızca Intel'in Xe2 mimarisini kapsıyor; diğer üreticilerin donanımındaki davranış burada test edilmedi. Ve kazanç yoğunluğa bağlı: 29 modelden üçü mevcut formattan daha sıkı paketlenemedi, yani modelin ağırlık dağılımı düzgün dağılıma yaklaştıkça kazançlar küçülüyor.

Neden önemli

LLM'lerde token üretimi bellek bant genişliğine bağlı olduğundan, ağırlıktan kırpılan her bit neredeyse doğrudan etkili bant genişliğine, işleme hacmine ve güç tasarrufuna dönüşüyor. Ternary modeller zaten bellek ayak izini küçültmek için var ve BITCOS bunu daha da sıkıştırıyor: etkili 1.625 bitten 1.485'e kadar iniyor ve iki haneli decode hızlanmaları sağlıyor. Bu, pazarın ucuz ucunda — telefonlar, dizüstü bilgisayarlar, entegre grafikler ve gömülü cihazlarda — en çok önemli; çünkü orada bellek küçüktür ve her vat değerlidir.

Daha derin ders şu: 1.585 bit hiçbir zaman fiziksel bir taban değildi, yalnızca düzgün dağıtılmış semboller için bir tabandı. Gerçek ağırlık istatistikleri çarpıktır ve kullanılabilir; bu ilke muhtemelen diğer nicemleme şemalarına da uzanıyor. Ve BITCOS zaten eğitilmiş ağırlıkların optimize edilmiş kernel'lerle yeniden paketlenmesi olduğundan, mevcut ternary modeller ilke olarak yeniden eğitim gerektirmeden benimseyebilir, bu da benimseme eşiğini önemli ölçüde düşürür.

  • #ternary-llm
  • #quantization
  • #on-device-inference
  • #machine-learning
  • #arxiv

İlgili yazılar