· kaynak dev.to (home feed)
Latin kare çalışması: Transformer mixer yerleşimi gürültü, aile çeşitliliği değil
Heterojen Transformer yığınlarının önceden kayıtlı bir ablasyon çalışması, dengeli bir mixer programını karıştırmanın istatistiksel olarak anlamsız olduğunu gösterdi; tek başına duran state-space mixer'ı silmek ise %2'den fazla kayba yol açtı ve bu fark ölçek büyüdükçe açıldı.

Sonunda test edilmiş bir gelenek
GPT'den bu yana neredeyse her Transformer aynı attention bloğunu onlarca kez üst üste yığar; aralarındaki fark yalnızca öğrenilen ağırlıklardır. VIDRAFT AI Research'tan bir makale (arXiv:2609.20269), dev.to'da özetlendiği üzere, bu tekdüzeliği kanıtlanmış bir tasarım kararı rather than tested edilmemiş bir gelenek olarak ele alıyor ve farklı sequence mixer'lar bir yığını paylaştığında gerçekte neyin değiştiğini soruyor.
Bunu ölçmenin önündeki engel bir karışıklılık (confound) faktörü: heterojen bir yığın tek düze olana üstünlük sağlıyorsa, bu kazanç seçilen mekanizmalardan ya da konumlarından gelebilir. Makale, yerleşim değişkenini yapısal olarak ortadan kaldırıyor. Bir Latin kare — Sudoku'nun arkasındaki grid, ekstra kısıtlamaları olmadan — yedi mekanizmanın her birini her satır ve sütunda tam bir kez yerleştirir. 49 katmana yayıldığında, her mixer'ın ağın derinliğine eşit dağılması garanti edilir; böylece kümelenme yalnızca gözlemlenmemiş değil, yapısal olarak imkânsız hale gelir.
Amiral gemisi model Aether-7B-5Attn, yaklaşık 2,98 milyar aktif parametreli ve 7×7 kare üzerine dizilmiş 49 katmanlı, 6,59 milyar parametreli bir mixture-of-experts ağıdır. Eğitim, iki node üzerinde 16 B200 GPU'da 162.000 adım boyunca 144,2 milyar token üzerinde gerçekleştirildi ve son aşamada yaklaşık 11.700 B200-saat tüketti.
Ablasyonlar ne gösterdi
Amiral gemisi ölçeğinde sekiz tekrarlı tohumlanmış ablasyon mümkün olmadığından araştırmacılar parametre eşleşmeli bir vekil model kurdu: 700,9 milyon parametre, 16 katman üzerinde 4×4 karede dört mekanizma, her kolda sekiz tohum. Latin kare taban çizgisine karşı (ortalama cross-entropy 5,28639), sonuçlar mekanizmaların derinlikte ne kadar sıkı sıkıya sınırlandırıldığına göre ayrıştı:
- Aynı dengeli programın periyodik bir yeniden düzenlenmesi: +%0,16, gürültü sınırında.
- Her biri tek bir mekanizmadan oluşan bitişik bloklar: +%0,59, birleştirilmiş standart sapmanın 2,5 katı seviyesinde gerçek bir etki.
- Her yerde tek bir mekanizma: +%1,68, bu da gerçek.
Takip deneyi, parametreleri yeniden eşleştirerek ve kalanları derinlik boyunca döndürerek mekanizmaları tek tek sildi. Sliding-window attention, differential attention veya full attention'ı kaldırmak gürültü sınırında kaldı (sırasıyla −%0,03, −%0,04 ve +%0,18). State-space model olan Mamba-2'yi kaldırmak ise %2,14'e mal oldu — yük taşıyan tek silme buydu.
dev.to'daki yazıya göre örüntü şu: sliding window, differential ve full attention aynı operatörün varyasyonlarıyken, bir state-space model diziyi yapısal olarak farklı bir şekilde karıştırır. Kol, mekanizma sayısı değil aile çeşitliliğidir — yedi attention çeşidi hâlâ homojen bir yığın gibi davranır. Bu, homojen kol ile SSM'siz kolun aynı civara düşmesini de açıklar: SSM'yi bırakmak yığını tekdüzeliğe doğru çöker.\n
Öleçekte ayakta kalıyor mu
Makale, üç belirleyici kolu 1,514 milyar parametrede, her birinde üç tohumla, diğer her şeyi sabit tutarak yeniden koştu. Her iki ceza da büyüdü: homojen yığın +%1,68'den +%2,63'e, SSM'siz yığın ise +%2,14'ten +%3,20'a çıktı. Ölçekle büyüyen etkiler, küçük model artefaktlarından ziyade yapısal olmaya daha yakındır — ancak makalenin sınırlılıklar bölümünün itiraf ettiği gibi, yerleşim ekseni 700,9 milyon parametrenin üzerinde asla yeniden test edilmedi ve hiçbir eksen N=7'de veya amiral gemisi boyutunda test edilmedi.
Kopyalanmaya değer yöntemler
İki prosedürel detay öne çıkıyor. Anlamlılık eşiği — birleştirilmiş standart sapmanın iki katını aşan fark — son tohumlar koşulmadan önce, 22-07-2026'da sabitlendi. Erken bir iki tohumlu koşu, Latin ve periyodik kolların net şekilde ayrıldığını göstermişti; bu, daha satılabilir bir yerleşim hikâyesi olurdu; dört tohum onu eritti, sekiz ise bu erimeyi doğruladı. Yazarların tercih ettiği sonucu yok eden kural, blok ve homojen bulgularını onaylayan kuralın ta kendisidir.
Güvenlik denetimi pozitif bir kontrol de içeriyordu. Zaman ekseni boyunca karıştırılmış operatörler, nedensellik sızıntılarının tam da gizlendiği yerdir ve gelecek token'lara göz atan bir yığın yanltıcı olarak iyimser loss eğrileri gösterir. 49 katmanın tümü negatif kontrolü geçti ve aynı yüklenmiş checkpoint üzerinde, bilerek enjekte edilen 16 hatadan 16'sı NSA, hibrit ve linear-attention katmanlarında tam olarak yerelleştirildi.
Neden önemli
Mimari tasarlayan herkes için pratik sonuçlar ucuz: dengeli bir program üzerinde doğru katman sırasını arayarak GPU saatleri yakmayı bırakın ve bütçeyi farklı bir aileden en az bir mixer'ı dahil etmeye ayırın. Latin karenin kendisi, arama yürütmeksizin dengeyi garanti etmenin bedava bir yoludur. Yayın; ağırlıkları, eğitim verisi tariflerini, eğitim kodunu, logları ve mimari kaynağı, ayrıca Aether-6B-11Attn-base'i içeriyor — bu, 11 mekanizmanın (attention, Mamba-2, Hyena, GDN ve MLA dahil) 121 katman üzerinde 11×11 kareye yerleştirildiği ve yapımın N=7'ye özgü olmadığını göstermek için mid-training artefaktı olarak sunulan bir model; o boyuttaki kompozisyon bulguları ise açıkça açık bırakıldı. En az bunun kadar değerli olan, önceden kaydedilmiş bir karar kuralının yazarların umduğu sonucu gömebileceğinin ve null bir sonucun yayınlanmasının herkesin işlem gücünden tasarruf ettiğinin gösterilmesidir.
- #transformers
- #attention
- #state-space-models
- #model-architecture
- #ablation-study