· kaynak Hacker News – Front Page (native)
Jane Street çalışması, sequence ağırlıklandırmasının LLM öğrenmesi üzerindeki etkisinin ölçekle monotonik olmadığını ortaya koydu
Jane Street araştırmacıları, eğitim sequence'larını ağırlıklandırmanın farklı model ölçeklerinde öğrenme üzerinde monotonik olmayan bir biçimde etkilediğini buldu; küçük modellerde ayarlanan veri karışımı seçimlerinin büyük modellere aktarılamayabileceği uyarısında bulunuyorlar.

Çalışmanın arkasındaki soru
Büyük dil modellerini eğiten ekipler sürekli olarak veriyle ilgili ödünleşimler yapar: bir alanı diğerine göre ne kadar vurgulamaları gerektiği, yüksek kaliteli materyali daha fazla ağırlıklandırıp ağırlıklandırmayacakları ya da eski verinin yeni veriye kıyasla ne kadar değerli olduğu. Farklı veri karışıımlarıyla tam ölçekli deneyler pahalı olduğundan, standart kısayol bunları küçük modellerde çalıştırmak, bir scaling law uydurmak ve yukarı doğru dış değerleme yapmaktır — Chinchilla tarzı compute-optimal eğitimin arkasındaki mantık da budur.
Hacker News'in ana sayfasına ulaşan bir Jane Street blog yazısına göre bu kısayol ancak model davranışı ölçekle birlikte kararlı kalırsa ya da öngörülebilir, dış değerleme yapılabilir bir biçimde değişirse işe yarar. Araştırmacılar her iki testi de geçemeyen davranışları "anormal" olarak nitelendiriyor ve veri karıştırmanın bu anormalliklerin sık görüldüğü bir ayar olduğunu bildiriyorlar. Benzer bir gözleme MAI-Thinking-1 teknik raporunda da değinildiğine dikkat çekiyorlar: kod ağırlıklı bir karışım ile STEM ağırlıklı bir karışım, model boyutu büyüdükçe kalite sıralamalarında yer değiştirmiş.
Ağırlığı diğer her şeyden ayırmak
Veri karışımı deneyleri birkaç değişkeni bir arada ele alır: bir kaynağın ne kadar ağırlık aldığı, o kaynağın ne kadar iyi olduğu ve token'larının ne kadar marjinal bilgi taşıdığı. Yalnızca ağırlığın etkisini izole etmek için Jane Street, sequence ağırlıklandırmasını inceledi; bu yöntemde eğitim setindeki her bir sequence, loss içinde kendi çarpanını alır.
Yöntem basitti: her sequence için 0.01 ile 10 arasında log-uniform dağılımla rastgele bir ağırlık çekildi; model üç epoch boyunca eğitildi; ardından model aynı eğitim verisi üzerinde yeniden değerlendirilerek her sequence'ta loss'un ne kadar düştüğü kaydedildi. Araştırmacılar bundan "etkili sequence ağırlık üssü" diye adlandırdıkları bir değer tüitti. Kavramsal olarak, üssün bire eşit olması modelin öğrenmesinin sequence ağırlığını tam olarak izlediği, sıfıra eşit olması ise modelin ağırlıklandırmadan bağımsız olarak her sequence'tan eşit derecede öğrendiği anlamına gelir.
Çalışma üç model ailesini kapsıyordu: onlarca milyondan yüzlerce milyar parametreye uzanan iki dahili aile — dokuz modelli bir dense aile ve sekiz modelli bir sparse mixture-of-experts ailesi — ile 500 milyondan 72 milyar parametreye kadar açık ağırlıklı Qwen 2.5 ailesi. Held-out performans ölçekle birlikte sürekli arttı; dolayısıyla aşağıda açıklanan etkiler, modeller büyüdükçe kötüleşmesinin bir belirtisi değil.
Önce yükselen sonra düşen bir eğri
Üssü düzgün bir güç yasası izlemiyor. Bunun yerine, sonuçlar monotonik olmayan bir eğriyle tutarlı. Küçük ölçekli modeller düşük üssüler gösteriyor: büyük ölçüde herhangi bir sequence'ın nasıl ağırlıklandırıldığından bağımsız olarak veri seti genelindeki kalıpları öğrendiler. Orta ölçekli modeller daha yüksek üssüler gösteriyor: öğrenmeleri kabaca sequence ağırlığıyla orantılı hale geldi. Büyük ölçekli modeller ise yeniden düşük üssülere döndü; kalıplar ağırlıklandırılmış olsun ya da olmasın, verideki kalıpları özümsediler. Daha fazla epoch eğitmek eğrinin tepe noktasını daha küçük modellere doğru kaydırdı.
Bu sonuç, birbiriyle çelişen iki önceki çalışma çizgisinin arasında yer alıyor. Byrd & Lipton'un 2019'daki importance weighting araştırması ile interpolasyon yapan aşırı parametreli modellerin davranışı, büyük modellerin ağırlıktan bağımsız olarak her şeyi öğrendiğine işaret ederken, Li ve arkadaşları (2026) değerli alanlar için en iyi tekrar sayısının sabit token-parametre oranında model boyutuyla hafifçe arttığını buldu. Jane Street'in ölçümleri ne monotonik bir eğilim ne de küçük deneylerden dış değerlenebilecek bir ilişki gösteriyor.
Önerilen çözümler
Jane Street bulguyu ağırlıklandırmaktan vazgeçmek için değil, eğitim metodolojisi için bir uyarı olarak çerçeveliyor. Önerilen önlemler arasında veri karışımı dış değerlemesini yalnızca yeterince büyük modellerdeki deneylerle sınırlamak ve belirli bir ölçekte gözlemlenen üsse karşılık gelecek şekilde eğitim ağırlıklarını ayarlamak yer alıyor. Ekip ayrıca, bir scaling law'daki bir sonraki bozulmanın erken yakalanması için tahminlerle gözlemlenen davranış arasındaki farkı sürekli ölçmeyi de anlatıyor.
Neden önemli
Veri seçimi kararları — hangi alanların ağırlıklandırılacağı, hangilerinin tekrarlanacağı, hangilerinin bırakılacağı — genellikle tam ölçekli taramalar imkânsız olduğundan küçük ölçekli vekil deneylerle alınır. Bir sequence'ın ağırlığının öğrenme üzerindeki etkisi boyut aralığının ortasında bir yerde zirve yapıp iki uçta sönüyorsa, birkaç milyar parametrede kazanan bir karışım birkaç yüz milyar parametrede kaybedebilir ve tersi de geçerlidir. Büyük model geliştiren ekipler için bu çalışma, veri karışımı sonuçlarının hedef ölçeğe daha yakın doğrulanması gerektiğine dair somut bir uyarı; bu süreçte izlenebilecek ölçülebilir bir nicelik — etkili sequence ağırlık üssü — de sunuyor.
- #llm-training
- #scaling-laws
- #data-curation
- #machine-learning