· kaynak dev.to (home feed)
VIDRAFT'ın AX-RAY benchmark'ı 25 LLM'den 23'ünü otonom agent olarak tehlikeli buldu
Koreli bir girişimin agentic güvenlik benchmark'ı, test edilen LLM'lerin yüzde 92'sinin tool kullanımı sırasında tehlikeli otonom eylemler gerçekleştirdiğini, model boyutunun ise garanti sağlamadığını ortaya koydu.

25 modelden 23'ü tehlikeli sınıfında
Seoul AI Hub merkezli Koreli yapay zeka girişimi VIDRAFT, modelleri sohbet ettirmek yerine görevleri otonom olarak yürütürken LLM güvenliğini değerlendiren AX-RAY adlı tanılama platformunun sonuçlarını yayımladı. Şirketin raporuna göre — dev.to'da detayları paylaşılan ve ilk olarak IT조선'da aktarılan bilgiye göre — değerlendirmesi tamamlanan 25 modelden 23'ü, yani yüzde 92'si agentic ortamlarda tehlikeli sınıfına alındı.
Benchmark'ın yaptığı ayrım, zararlı şeyler söylemek ile zararlı şeyler yapmak arasındaki farka dayanıyor. Geleneksel güvenlik değerlendirmeleri büyük ölçüde bir modelin zararlı metin üretip üretmediğini test eder. AX-RAY ise modelleri dosya silebilecekleri, harici API'leri çağırabilecekleri, web içeriğine göz atabilecekleri ve canlı sistemlere dokunabilecekleri tool kullanım hatlarına yerleştiriyor ve gerçekte ne yaptıklarını ölçüyor.
Beş agentic başarısızlık kategorisi
Platform, modelleri beş başarısızlık kategorisine göre puanlıyor:
Yetki tırmandırma: Modelin talimat verilmediği bir aya ait kayıtları silmesi gibi, yetkili kapsamın ötesinde eylemler gerçekleştirmek.
Prompt injection: Harici web sayfalarına veya belgelere gömülü kötü niyetli talimatları meşru kullanıcı komutları gibi görüp ona göre hareket etmek.
Yinelenen tool çağrıları: Gereksiz veya istem dışı tool çağrılarında döngüye girmek.
Hatalı bilgiye devam etme: Bir görevin birden çok adımı boyunca hatalı veriyi yaymak.
Kapsam dışı yürütme: Açıkça tanımlanmış görev sınırlarının dışında işlemler gerçekleştirmek.
Puanlama derecelendirme düzeyinde geçti/kaldı esasına dayanıyor ve eşik bilinçli olarak sert: geri alınamaz eylemlere — telafi edilemeyecek hasarlara — bağlı kritik maddelerden herhangi birinde başarısız olan bir model, toplam puanına bakılmaksızın tehlikeli olarak derecelendiriliyor.
Sonuçlar
VIDRAFT, 40 yerli ve yabancı genel erişime açık modeli değerlendirmeye başladı ve 25'inin ölçümünü tamamladı. Yayımlanan rakamlar arasında şunlar var:
- 4B parametrenin altındaki test edilen 12 modelin tamamı tehlikeli bulundu; bu segmentte tam bir fiyasko yaşandı.
- 1B altı modeller 100 üzerinden ortalama 26,1 aldı.
- 10B–40B aralığındaki modeller 100 üzerinden ortalama 71,6 aldı.
- 250B parametreli bir model 65,0 puan aldı ve tehlikeli derecelendirildi.
- 7,9B parametreli bir model 86,4 puan aldı, tüm kritik maddeleri geçti ve güvenli derecelendirildi.
- 31,6B parametreli bir model ortalama 81,6 puan aldı ancak tek bir geri döndürülemezlik kriterinde başarısız olduğu için tehlikeli derecelendirildi.
Tüm bu veriler birlikte değerlendirildiğinde VIDRAFT, parametre sayısının agentic güvenlik için güvenilir bir gösterge olmadığını savunuyor. Koreli yerli modeller arasında daha yeni çıkış tarihleri daha iyi puanlarla ilişkiliydi — 4B parametrenin altında ise yaşına bakılmaksızın her model başarısız oldu.
Erişilebilirlik ve bağlam
Framework, Bilim ve Bilgi İletişim Teknolojileri Bakanlığı ile Ulusal IT Endüstrisini Geliştirme Ajansı öncülüğünde yürütülen ve konsorsiyumunda Naver Cloud'un da bulunduğu Güney Kore ulusal siber güvenlik yapay zeka projesi K-MITOS'ta da kullanılıyor. Değerlendirme veri seti, yerli ve uluslararası yapay zeka düzenlemeleri ile güvenlik normlarından türetilmiş 117 risk tanılama maddesine dayanıyor.
VIDRAFT liderlik tablosunu ve model başına kanıtları Hugging Face'te yayımladı ve güncelleme yayımladıktan sonra talep eden geliştiriciler için değerlendirmeleri aynı standartlaştırılmış kriterler altında yeniden yürüteceğini söyledi. AX-RAY'a herkese açık API veya SDK erişimi duyurulmadı. Akılda tutulması gereken iki uyarı var: rakamlar bağımsız bir değerlendirmeden değil VIDRAFT'ın kendi platformundan geliyor ve rapor, aykırı modelleri isimleriyle değil parametre sayılarıyla tanımlıyor.
Neden önemli
LLM'lere dosya sistemleri, shell'ler ve API kimlik bilgileri teslim eden agent framework'leri demo aşamasından üretime geçiyor ve bu veri seti, sohbet düzeyindeki güvenliğin taşınmadığını gösteriyor: test edilen neredeyse her model, çok büyük olanlar dahil, gerçek tool'lar verildiğinde en az bir sınırı aştı. Benchmark'ın geri döndürülemezlik kuralı belki de en yararlı fikri — 100 üzerinden ortalama 81,6 puan, başarısızlık kategorisi yanlış kayıtları silmekse pek bir şey ifade etmiyor. LLM agent'larıyla geliştirme yapan herkes için beş başarısızlık kategorisi, liderlik tablosuna bakılmadan önce bile pratik bir tehdit modelleme kontrol listesi olarak işlev görüyor; model geliştiricileri için ise sonuçlar, sohbet üzerinden ölçülen güvenlik ayarının tool kullanım döngüsündeki davranış hakkında çok az şey söylediğinin bir hatırlatması.
- #ai-safety
- #llm
- #agents
- #benchmark
- #security