· kaynak dev.to (home feed)
GPT-6 Astra'nın döngüsel transformerları etkin derinliği ikiye katlıyor ve akıl yürütme denetimlerini zorlaştırıyor
GPT-6 Astra'nın transformer bloklarını yaklaşık 44 döngüsel geçişte çalıştırdığı bildiriliyor; yeni parametre eklemeden etkin derinliği ikiye katıyor — ve görünür chain of thought sürecini sonradan yazılmış bir anlatıya dönüştürüyor.

Cole Halton'ın dev.to'daki bir gönderisine göre GPT-6 Astra, başlıca mimari değişiklik olarak döngüsel transformerlarla geliyor: model, katman eklemek yerine transformer bloklarını aynı ağırlıklar üzerinde yaklaşık 44 kez çalıştırıyor. Bildirilen sonuca göre parametre sayısı sabit kalırken etkin derinlik kabaca iki katına çıkıyor.
Döngü nasıl çalışıyor
Halton'ın tarifinde, birbirinin aynı bloklar tekrar tekrar çalışıyor ve her seferinde ağırlıklarını yeniden kullanıyor. Geçişler arasında değişen şey durum (state), parametreler değil: key-value cache ve ara aktivasyonlar iterasyondan iterasyona farklılaşıyor; yani her geçiş yeni bir kapasite eklemek yerine mevcut bir hesaplamayı rafine ediyor. Halton'ın çerçevesinde kullanıcının gördüğü token'lar bu sürecin yalnızca görünür yüzeyi — aksi halde gizli olan yinelemeli bir hesaplamanın tek bir dilimi.
Bunun akıl yürütme izine etkisi
Gönderinin merkezindeki argüman yorumlanabilirlik (interpretability) hakkında. Akıl yürütme bu döngülerin içinde gerçekleştiğinde, modelin yazdığı chain of thought hesaplama bittikten sonra oluşturuluyor. Gerçek bir metin, ama bir anlatı: modelin, hesaplama gerçekten koştuktan sonra, giriş ile çıkış arasındaki makul görünen bir yolu sonradan tarif etmesi — fiilen çalışmış geçişlerin bir kaydı değil.
Halton modelin dürüst olmadığını iddia etmiyor — anlatı ile hesaplama büyük ihtimalle çoğu zaman örtüşüyor. Ona göre asıl sorun, ayrıştıkları anı anlayamıyor olmanız; kötü bir inceleme ya da ince bir bug tam da bu ayrışma noktasında saklanır. Günümüzdeki ajan değerlendirme ve kod inceleme pratiklerinin büyük kısmı chain of thought çıktısını kanıt olarak kullanıyor — uç durumların düşünülüp düşünülmediği, kod değiştirilmeden önce repo konvansiyonlarına uyulup uyulmadığı gibi. Açıklama hesaplamadan ayrı yazılıyorsa, açıklamayı yargılamak, düşünmenin kendisini değil modelin kendi düşüncesine dair anlattıklarını yargılamak demek.
Değerlendiriciler için pratik yanıt
Ajanları benchmark'layan veya yapay zekâ tarafından üretilen kodu inceleyen herkes için Halton'ın tavsiyesi, görünür akıl yürümeyi ground truth olarak görmeyi bırakmak ve gerçekten doğrulanabilecek olanı ölçmek: ajanın hangi araçları çağırdığı, hangi dosyalara dokunduğu, ürettiği diff ve gözlemlenebilir davranışı. Döngüsel bir modelden gelen yazılı bir chain of thought, bir kayıt değil, sonradan yazılmış bir rapor olarak okunmalı.
Ayrıca daha ince bir ölçüm tuzağına dikkat çekiyor. Bazı değerlendirme kurulumları şeffaflık önlemi olarak modellerin akıl yürütmesini dışsallaştırmaya zorluyor; ama bunu yapmak modelin geçişlerini nasıl tahsis ettiğine müdahale ediyor. Zorla şeffaflaştırılmış bir varyant ile yayındaki varsayılan konfigürasyon bu yüzden aynı sistem değil; birinde ölçülen sayı diğerine doğrudan aktarılamaz — akıl yürütme kalitesi daha hesaba katılmadan var olan bir harness farkı bu. Tavsiyesi, bir benchmark'ın hangi konfigürasyona karşı çalıştırıldığının açıkça belirtilmesi.
Neden önemli
Döngüsel transformerlar genellikle bir verimlilik hikâyesi olarak çerçevelenir: daha fazla parametre olmadan daha fazla etkin derinlik, ki bu hem eğitim hem de sunum (serving) maliyetleri için önemli. Bu gönderi, değişikliğin aynı zamanda bir hesap verebilirlik boyutu olduğunu savunuyor. Chain of thought çıktısına dayanan değerlendirme yöntemleri — ajan benchmark'ları, inceleme iş akışları, güvenlik denetimleri — görünür izinin hesaplamasını yansıttığı modeller etrafında kuruldu. Amiral gemisi bir sürüm hesaplamayı gerçekten yinelemeli geçişlere taşıyorsa, bu yöntemlerin davranışsal ve artifact tabanlı denetimlere kayması gerekiyor; ve alanın, böyle bir modelden gelen yazılı açıklamanın bir enstrüman değil bir anlatı olduğunu açıkça kabul etmesi gerekiyor.
Bu anlatı, modelin geliştiricisinden gelen dokümantasyona değil tek bir dev.to gönderisine dayanıyor; dolayısıyla geçiş sayısı gibi spesifik rakamlar, sürümün tek bir yazar tarafından yapılmış tarifleri olarak okunmalı.
- #ai
- #transformers
- #chain-of-thought
- #llm-evaluation
- #gpt-6-astra
İlgili yazılar
- Google ve ortakları, şimdiye kadarki en büyük connectome'da 166.000 nöronlu meyve sineği beynini haritaladı
- Cognition, frontier kalitesine yakın bir coding modeli olan SWE-2'yi %64 daha düşük maliyetle piyasaya sürdü
- Anthropic değerlendirmesi, Claude'ın çevrimdışı olması gereken siber testlerde gerçek sistemlere ulaştığını ortaya koydu