· kaynak TechCrunch
PrismML, cihaz üstü yapay zeka hamlesiyle 27 milyar parametreli modeli 5,9 GB'a küçülttü
Caltech kaynaklı PrismML, 22,25 milyon dolarlık bir seed yatırım turu tamamladı ve Alibaba'nın Qwen3.8 27B modelinin sıkıştırılmış hali olan Bonsai 2 27B'yi yayınladı; model 5,9 GB'a sığıyor ve benchmark puanlarının yüzde 98'ini koruyor.

6 GB altında 27 milyar parametreli model
Caltechli bir araştırmacı grubu tarafından kurulan yapay zeka araştırma laboratuvarı PrismML, en yeni sıkıştırılmış dil modeli Bonsai 2 27B'yi Perşembe günü yayınladı. TechCrunch'a göre model, Alibaba'nın yaygın olarak kullanılan açık kaynak modeli Qwen3.8 27B'yi 5,9 GB'a indiriyor — bu, modeli bir PC'de ve muhtemelen üst seviye bir akıllı telefonda çalışacak kadar küçük yapan 9 ila 10 katlık bir bellek azaltması.
Şirkete, sıkıştırma teknolojisi alanında uzmanlaşmış Caltech profesörü Babak Hassibi liderlik ediyor ve şirket, Khosla Ventures, Cerberus Capital ve Caltech'ten 22,25 milyon dolarlık bir seed turu aldı. Databricks'in kurucu ortağı ve Berkeley Sky Computing Lab'ın direktörü Ion Stoica da şirket tarafında danışman olarak yer alıyor.
Benchmark sonuçları neredeyse aynı
Şirketi farklı kılan şeyin, sıkıştırmanın performansa çok az mal olması olduğunu Hassibi, TechCrunch'a söyledi. Bonsai 2'nin Qwen'in toplam benchmark puanlarının yüzde 98'ini koruduğu bildiriliyor; bu, Mart ayında yayınlanan ilk Bonsai'nin koruduğu yüzde 95'e göre bir iyileşme. Şirket, ilk modelin o zamandan beri 11 milyondan fazla kez indirildiğini, daha küçük modellerinin ise ek olarak 2,6 milyon indirme aldığını belirtiyor.
Kusursuz eşitlik belki hiç gelmeyecek: Hassibi, sıkıştırmanın her zaman en azından bir miktar bedeli olacağını düşünüyor. TechCrunch ayrıca kalan farkın büyük ölçüde akademik olduğunu savunuyor; çünkü sıkıştırılmamış modeller bile kusursuz doğruluktan uzak, benchmarklar gerçek görevleri ancak gevşek biçimde yansıtıyor ve modelin kendisi kadar çevresindeki yazılım stack'i de sonuçları etkiliyor.
Küçültmeyi ternary ağırlıklar yapıyor
Teknik, model ağırlıklarının saklanma biçimini değiştirerek çalışıyor. Ağırlıklar, bir modelin eğitim sırasında öğrendiği değerlerdir ve normalde her biri 16 bit olarak saklanır. PrismML bunun yerine yalnızca üç değer alabilen (+1, −1 veya 0) ternary ağırlık adını verdiği bir yöntem kullanıyor. Her ağırlığı bu kadar küçük değerlerle sınırlamak, modelin depolama ayak izini çarpıcı biçimde azaltıyor.
Sıradaki hedef ölçek. Hassibi, önümüzdeki birkaç ay içinde beklenen yeni sürümlerin birkaç yüz milyar parametre aralığına denk geleceğini ve zekânın orada korunmasının daha kolay olacağını düşünüyor. Argümanı şu: Daha büyük modellerde sıkıştırma için daha fazla pay var, dolayısıyla boyut büyüdükçe son performans farkını kapatmak basitleşiyor.
PrismML bu alandaki tek oyuncu değil. TechCrunch, İspanya'daki Donostia International Physics Center'dan tanınmış bir profesör tarafından kurulan Multiverse Computing'yi, ciddi ölçüde daha fazla sermaye toplamış, sıkıştırmaya odaklı başka bir firma olarak gösteriyor. Raporda PrismML'in Apple ile görüşmelerde olduğuna dair bir söylenti de yer alıyor; Hassibi bu konuda yorum yapmayı reddetti.
Neden önemli
Günümüzdeki güçlü akıl yürütme modelleri çoğunlukla veri merkezlerinde yaşıyor; bu da API ücretleri, inference maliyetleri, ağ gecikmesi ve kullanıcı verisini buluta göndermenin gizlilik bedeli anlamına geliyor. PrismML'in sıkıştırması daha büyük ölçeklerde de tutarsa bu denklem değişir: Yüz milyarlarca parametreli modeller insanların zaten sahip olduğu donanımın içinde sunulabilir. Stoica çekiciliği tam olarak bu terimlerle çerçeveliyor ve TechCrunch'a, cihaz üstü modellerin zekâyı fiilen ücretsiz çalıştırdığını ve varsayılan olarak gizli kıldığını, çünkü hiçbir şeyin cihazdan ayrılması gerekmediğini söylüyor. İndirme rakamları da gerçek bir talebe işaret ediyor — seed turuna kadar zar zor tanınan bir şirket için toplam 13 milyondan fazla indirme. Daha geniş endüstri için, güvenilir ve neredeyse kayıpsız sıkıştırma, API merkezli iş modellerine baskı uygular ve yapay zeka iş yüklerinin fiilen nerede çalıştığını, hyperscaler kümelerinden dizüstü bilgisayarlara ve telefonlara kaydırır.
- #llm-compression
- #on-device-ai
- #edge-ai
- #funding
- #open-source-models