deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

VIDRAFT'ın nedensel sızıntı denetimi 192 hatadan 192'sini yakaladı, Nemotron-H ve Zamba2'yi işaret etti

Koreli girişim VIDRAFT, gelecekteki token bilgisinin daha erken konumlara sızmasını tespit eden eğitim gerektirmeyen bir denetim yayımladı ve Nemotron-H-8B ile Zamba2-1.2B'de nedensel sızıntı buldu.

VIDRAFT'ın nedensel sızıntı denetimi 192 hatadan 192'sini yakaladı, Nemotron-H ve Zamba2'yi işaret etti

Koreli yapay zeka güvenliği girişimi VIDRAFT, otoregresif modellerde nedensel sızıntıyı tespit etmeye yönelik bir tanı yöntemi yayımladı; nedensel sızıntı, gelecekteki token konumlarındaki bilginin daha erken konumların iç temsillerine istemeden sızması anlamına geliyor. Çalışmayı anlatan bir dev.to gönderisine göre, yöntemin herkese açık modellere uygulanması, NVIDIA'nın Nemotron-H-8B'si ile Zyphra'nın Zamba2-1.2B'sinin PyTorch yürütme yollarında sızıntıyı doğruladı; bir hata enjeksiyonu deneyinde ise tanı yöntemi, bilinçli olarak yerleştirilmiş 192 hatanın tamamını katman düzeyinde yakaladı.

Araştırma, 24 Ağustos 2026'da yayımlanan "The Mask Is Not the Model: Auditing Prefix Invariance in Attention, State-Space, and Hybrid Sequence Models" başlıklı bir arXiv makalesinde yer alıyor. dev.to gönderisi, çalışmanın ilk olarak 26 Ağustos'ta Koreli yayın organı 이코노미스트 tarafından rapor edildiğini belirtiyor.

Denetim nasıl çalışıyor

Makalenin merkezindeki iddia, nedensel maskenin doğru uygulanıp uygulanmadığını kontrol etmenin artık yeterli olmadığı. Hibrit mimariler attention katmanlarını state-space katmanları, tekrarlayan operatörler, konvolüsyonlar ve chunked scan mekanizmalarıyla harmanlıyor ve bu bileşenlerin her biri, attention maskesinin hiç dokunmadığı bir yürütme yolu sunuyor. Bu nedenle bir model, maska denetiminden geçebilir ama yine de gelecekteki tokenların daha erken konumları etkilemesine izin verebilir.

VIDRAFT'ın alternatifi bir prefix invariance kontrolü:

  • Yalnızca dizinin son konumunda farklılık gösteren iki girdi oluştur ve her birini modelden geçir.

  • Doğru uygulanmış bir otoregresif modelde, daha erken konumlardaki iç aktivasyonların iki geçişte de özdeş olması gerekir.

  • Değişmezliğin bozulduğu ilk katmanı bulmak için aktivasyonları katman katman karşılaştır.

Yaklaşım ne gradyan, ne eğitim verisi ne de yeniden eğitim gerektiriyor ve saf attention, saf state-space ve hibrit modellere eşit şekilde uygulanabiliyor. Chunked scan kullanan hibritler için ekip, açık kaynak transformers 5.7.0 kütüphanesi üzerinde statik kod analizi de yaptı ve referans uygulama ile belirli bir uygulama arasında girdi ve çıktı chunk eksenlerinin nasıl ele alındığına dair bir tutarsızlık tespit edip bulguyu gerçek model ağırlıklarıyla deneysel olarak doğruladı.

Denetim ne buldu

dev.to özetine göre makale iki sınıf sonuç raporluyor.

Kontrollü bir testte, çeşitli hata türleri genelinde 192 sentetik nedensel hata enjekte edildi. Geleneksel maske denetimi bunların hiçbirini tespit edemedi; prefix invariance tanısı ise 192'sini de tespit ederek her hatayı belirli bir katmana yerelleştirdi.

Herkese açık checkpoint'lerde sızıntı, 128 chunk boyutundan itibaren Nemotron-H-8B'de ve modelin beyan edilen 256'lık chunk boyutunda başladığı Zamba2-1.2B'de doğrulandı. Aynı tanı koşulları altında Bamba-9B, Falcon-H1, Granite-4.0-H, Mamba2 veya RecurrentGemma'da sızıntı tespit edilmedi.

Değerlendirme bütünlüğü sorunu

VIDRAFT'ın vurguladığı pratik sonuç, benchmark güveni. Gelecekteki bilgi eğitim sırasında daha erken konumlara sızıyorsa, cross-entropy loss ve perplexity gibi metrikler doğru bir uygulamanın üreteceğinden daha iyi görünebilir. Sızıntı altında kazanılan puanlar, gelecekteki tokenların var olmadığı çıkarım aşamasına taşınmaz; şirket bu nedenle çalışmayı salt bir doğruluk hata raporu değil, bir değerlendirme bütünlüğü aracı olarak çerçeveliyor.

Erişilebilirlik ve ticarileştirme

Teknik bilgi, VIDRAFT'ın yapay zeka güvenliği tanı sistemi AX-RAY'e entegre ediliyor; şirket bu sistemi Kore'de devlet destekli güvenlik odaklı temel model programları için doğrulama teknolojisi olarak konumlandırıyor. Makalenin kamuya açıklanmasından önce ulusal bir Kore patenti başvurusu yapıldı ve inceleme talep edildi. AX-RAY herkese açık değil: dev.to gönderisinin yazıldığı tarihte self-serve bir araç, GitHub deposu, Hugging Face model kartı veya OpenAI uyumlu bir API uç noktası bulunmuyor; ancak makalenin kendisi arXiv'te yer alıyor.

Neden önemli

Benchmark rakamları model lansmanlarının para birimi ve bu çalışma, bazı herkese açık hibrit modellerin loss ve perplexity'yi sessizce şişirebilecek yapısal bir kusur taşıdığını savunuyor. Denetimin kendisi ucuz — iki forward pass ve bir aktivasyon karşılaştırması — bu yüzden laboratuvarlar, değerlendiriciler ve düzenleyiciler onu yeniden eğitim veya ayrıcalıklı erişim olmadan benimseyebilir; bu, bir güvenlik tanısı için alışılmadık bir durum. Ayrıca uygulayıcıların önemsediği bir şeyi yeniden çerçeveliyor: nedensel bir maskenin doğrulanması yalnızca modern bir modeldeki tek bir yolu doğrular, modelin bütün olarak nedenselliğini değil. Ancak uyarılar da gerçek. Yukarıdaki her şey makalenin tek bir dev.to özetine dayanıyor ve bulgular, yazıldığı anda bağımsız olarak doğrulanmış değil.

  • #ai-safety
  • #language-models
  • #model-evaluation
  • #state-space-models
  • #pytorch

İlgili yazılar