deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Sonsuz Parametreli LLM makalesi, model ağırlıklarının canlı etkileşim verisinden üretilmesini öneriyor

arXiv'de yayımlanan bir ön baskı, çalışma zamanı verisini düşük ranklı ağırlık modülasyonlarına dönüştüren kompakt bir hypernetwork öneriyor; böylece sabit ayak izli bir LLM, bilgiyi prompt'tan tekrar tekrar okumak yerine canlı etkileşimden öğreniyor.

Sonsuz Parametreli LLM makalesi, model ağırlıklarının canlı etkileşim verisinden üretilmesini öneriyor

arXiv'de yayımlanan "Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data" başlıklı bir ön baskı (2609.18842), dil modellerinin çalışma zamanında aldığı bilgiyi özümseme biçimi için farklı bir yol öneriyor: bilgiyi prompt'ta tutmak yerine, model bu bilgiden yeni ağırlıklar üretecek. Makale, araştırmacı Jinli Hu tarafından 16 Eylül 2026'da gönderildi ve toplayıcının listelemesine göre ertesi gün Hacker News'in ana sayfasına ulaştı.

Makalenin hedeflediği sorun

Scaling law'lar, modellerin daha fazla parametre ve daha fazla veriyle iyileştiğini söyler; Mixture-of-Experts (MoE) mimarileri de bunu, devasa bir expert havuzu depolayıp token başına yalnızca küçük bir bölümünü etkinleştirerek ileri taşımıştır. Makaleye göre bu başarının temeli statik ön eğitim verisidir. Model bir kez devreye alındığında, onu en kullanışlı kılacak bilgi çoğu zaman etkileşimin kendisi sırasında gelir: kullanıcının oturum ortasında verdiği gerçekler ya da modelin yanlış yaptığı bir şeye ilişkin düzeltmeler.

Geleneksel bir model bunların hiçbirini kendi içine yazamaz, çünkü ağırlıkları eğitimden sonra donmuş durumdadır. Standart çözüm, çalışma zamanı bilgisini retrieval ya da talimat yoluyla context window'a yerleştirmektir; burada bilgi her istekte yeniden okunur ve oturum bittiğinde çöpe atılır. Makale bunu kapatmak istediği boşluk olarak çerçeveliyor: canlı etkileşimden, bilgiyi doğrudan ağırlıklara yazarak öğrenebilen bir mimari kurmak.

Canlı veriden ağırlık üretimi

Önerinin merkezinde kompakt bir hypernetwork var. Modelin çalışma zamanında verildiği veriyi, paylaşımlı bir temel ağın üzerine bindirilen düşük ranklı ayarlamalara dönüştürüyor; böylece feed-forward ağırlıkları önceden depolanmış bir expert havuzundan seçilmek yerine canlı girdiden üretiliyor.

Yazarlar bunu, bağlamı bir kez okuyup ortaya çıkan parametreleri donduran önceki ağırlık üretimi çalışmalarının karşısına koyuyor. Tasarımları ise üreticinin latent koduna dair bir Bayesian inanç tutuyor ve bu inancı çevrim içi güncellemeye devam ediyor; dolayısıyla etkin ağırlıklar oturum ilerledikçe yeniden türetiliyor, tek bir geçişten sonra sabitlenmiyor. Depolanan ayak izi sabit kalarken, modelin derleyebileceği ağırlık kümesi yazarların ifadesiyle fiilen sonsuz.

Öne sürülen avantajlar ve değerlendirme planı

Makaleye göre çalışma zamanı bilgisini prompt'ta değil ağırlıklarda taşımak, hesaplama açısından daha ucuz: bilgi her istekte yeniden okunmak yerine bir kez yazılıyor. Ayrıca context window alanını boşaltıyor, turlar arasında kalıcı oluyor ve yazarlar, bağlam içinde kullanılan eşdeğer bilgiden daha iyi genelleme yapabileceğini savunuyor.

Makale, bu iddiaları in-context learning ve retrieval ile doğrudan karşı karşıya test eden bir değerlendirme protokolü tanımlıyor. Hacker News üzerinden dolaşıma giren özet, benchmark sayıları içermiyor; dolayısıyla karşılaştırmanın gerçekte nasıl sonuçlanacağı yalnızca tam sonuçlardan anlaşılacak.

Neden önemli

Yaklaşım tutarsa, scaling için farklı bir eksen açıyor: statik bir parametre havuzunu büyütmek yerine model, ağırlıkları o anda kendisine söylenen her şeyden talep üzerine derleyecek. Bu, uzun oturumlar, kişiselleştirme ve kullanıcıların aynı gerçekleri tekrar tekrar verdiği her türlü dağıtım için pratik sonuçlar doğuruyor; bugün bu durumlar prompt doldurma ya da harici bellek eklemeyle çözülüyor.

Bu aynı zamanda erken, hakem incelemesinden geçmemiş bir ön baskı; ve özet, zor mühendislik sorularını açık bırakıyor: hypernetwork ile üretilen ağırlıklar uzun bir oturum boyunca kararlı kalıyor mu, donmuş temel modelle nasıl etkileşime giriyor ve yöntem oyuncak ortamlarının ötesinde nasıl performans gösteriyor. Bu uyarılar not edildiğinde, temel yeniden çerçeveleme kendi başına ayakta duruyor: canlı etkileşimi prompt dolgusu değil eğitim sinyali olarak ele alıyor ve mevcut retrieval artı bağlam ortodoksisine doğrudan bir meydan okuma ortaya koyuyor.

  • #llms
  • #machine-learning
  • #hypernetworks
  • #mixture-of-experts
  • #research

İlgili yazılar