· kaynak Hacker News – Front Page (native)
Samsung Labs' LittleBit, LLM ağırlıklarını ağırlık başına 0.1 bite indiriyor
Samsung Labs, ağırlık matrislerini ikili (binarized) düşük ranklı çarpanlara ayrıştırarak LLM'leri ağırlık başına 0.1 ile 1.0 bit arasına sıkıştıran LittleBit ve LittleBit-2'yi açık kaynak olarak yayımladı.
Samsung Labs'tan 1 bit altı bir yaklaşım
Samsung Labs, büyük dil modelleri için ağırlık başına bir bitin altında çalışan bir sıkıştırma şeması olan LittleBit'in referans uygulamasını yayımladı. Hacker News ana sayfasında ortaya çıkan GitHub deposu iki makaleyi kapsıyor: Banseok Lee, Dongkyu Kim, Youngcheon You ve Youngmin Kim imzalı, NeurIPS 2025'te sunulan özgün LittleBit ile Lee ve Youngmin Kim'den gelen, ICML 2026'ya ait devam çalışması LittleBit-2.
Önce çarpanlara ayır, sonra ikili hale getir
Nicelendirme (quantization) çalışmalarının çoğu her ağırlığı yerinde az sayıda seviyeye yuvarlar. LittleBit ise bunun yerine her yoğun ağırlık matrisini düşük ranklı gizli çarpanlara ayrıştırır ve bu çarpanları ikili hale getirir; böylece saklanan her eleman fiilen bir işaret olur. Küçük, öğrenilmiş ölçekler daha sonra ikilileştirmenin attığı büyüklük bilgisini geri kazandırır ve depoya göre tam da bu, yöntemin ağırlık başına 1.0'dan 0.1 bite kadar etkili hassasiyetlere ulaşmasını sağlıyor. Proje ayrıca çıkarım (inference) sırasında özgün model mimarisinin korunduğunu belirtiyor; yani sıkıştırılmış katmanlar yeni bir mimari değil, doğrudan yerine takılabilen bileşenler olarak davranıyor.
LittleBit-2 başlangıç noktasını düzeltiyor
Devam çalışması eğitimin nasıl başladığına dair ince bir noktaya odaklanıyor. Tekil değer ayrışımı (SVD) ile üretilen çarpanlar, ikilileştirilmiş değerlerin yaşadığı ikili hiperküpün köşeleriyle doğal olarak hizalanmıyor ve depo, başlatma aşamasındaki bu gizli geometri uyuşmazlığını özgün tarifiğin bir zayıflığı olarak tanımlıyor. LittleBit-2, Internal Latent Rotation with Joint Iterative Quantization (Joint-ITQ) uygulayarak nicelik duyarlı eğitimin başlamasından önce SVD'den türetilen çarpanları o hiperküp ile hizalayacak şekilde döndürüyor.
Bu değişiklik --use_itq bayrağıyla isteğe bağlıdır ve yalnızca başlatmayı etkiler: dağıtılan çarpanlara ayrılmış katman aynı kaldığı için iyileştirme çıkarım yükü eklemiyor.
Çalıştırmak
Kod tabanı, eğitim sonrası bir kısayol değil, eğitim tabanlı. Nicelik duyarlı eğitim, isteğe bağlı artık çarpanlara ayırma ile birlikte SmoothSign nicelendirme fonksiyonu kullanıyor ve örnek komutlar, deponun c4_wiki veri seti üzerinde beş epoch çalışıyor; çoklu GPU kurulumları için DeepSpeed sunuluyor.
Model kapsamı geniş: OPT, Llama ve Llama 2/3, Phi-4, Qwen2.5 ve QwQ, Gemma 2 ve Gemma 3 ile Qwen3. Önerilen ortam Python 3.12, CUDA 12.4.1 araç seti ve PyTorch 2.8.0; yazarlar, makale sonuçlarını yeniden üretirken transformers'ı 4.51.x hattına sabitlemeyi öneriyor çünkü daha yeni sürümler model iç yapısını ya da değerlendirme davranışını değiştirebilir. Ayrı bir değerlendirme betiği, yerel bir kontrol noktasına ya da Hugging Face Hub'da barındırılan bir modele karşı WikiText-2 ve C4 üzerinde perplexity raporluyor ve BoolQ, PIQA, HellaSwag, WinoGrande, ARC ile OpenBookQA dahil sıfır atış (zero-shot) kıyaslamalarını çalıştırıyor.
Bir lisans uyarısı: proje CC BY-NC 4.0 altında yayımlanıyor ve bu, ayrı bir düzenleme olmadan ticari kullanımı dışlıyor.
Neden önemli
Bellek kapasitesi ve bant genişliği, ham işlem gücünden daha çok, hangi modellerin dizüstü bilgisayarlarda, telefonlarda ve uç cihazlarda çalışabileceğini belirliyor ve bu ayak izini küçültmenin ana kaldıracı nicelendirme. Ağırlık başına 0.1 bitta kaliteyi koruyan bir şema hesabı ciddi biçimde değiştiriyor: bu oranla yedi milyar parametreli bir model, öğrenilmiş ölçekler, aktivasyonlar ve KV cache hesaba katılmadan, ağırlıkları için ilkesel olarak bir gigabaytın oldukça altına ihtiyaç duyar.
Ödünler gerçek. Bu, nicelik duyarlı bir eğitim hattı olduğan modeli yeniden eğitmek için işlem gücü gerektiriyor ve ticari olmayan lisans doğrudan ürün kullanımını sınırlıyor. Deponun kendisi hiçbir çarpıcı kıyaslama sayısı yayımlamıyor; dolayısıyla bu aşırı bit hızlarındaki kalite iddiasının dürüst sınavı, kısıtlı donanımlı bir dağıtımı ona bağlamadan önce verilen değerlendirme paketini çalıştırmak ya da NeurIPS ve ICML makalelerini okumaktır.
- #llm
- #quantization
- #compression
- #machine-learning
- #open-source
İlgili yazılar
- StepFun'un 1M token bağlam penceresine sahip Step 5 Preview modeli Vercel AI Gateway'de
- Qdrant Turbo4 benchmark: TurboQuant'a karşı 9 kat depolama tasarrufu, 3 puana varan recall kaybı
- MIT Technology Review: robotikteki yapay zeka ilerlemesi gerçek, ancak tüketici için insansı robotlar hâlâ çok uzakta