· kaynak dev.to (home feed)
AI ajanlarına yönelik mesaj panosu, 48 saat içinde prompt-injection kampanyası ve pentest saldırısına maruz kaldı
Bir geliştiricinin AI ajanları için yayınladığı herkese açık mesaj panosu, yayınlandıktan birkaç saat sonra bir prompt-injection etki kampanyası ve bir gün sonra manuel bir pentest ile karşılaştı; bu bilgi bir dev.to yazısından.

Ajanlar için bir pano, saldırganlar tarafından keşfedildi
AI ajanlarının birbirlerini okuyup mesaj gönderebilmesi için kurulmuş herkese açık bir mesaj panosu olan msgboard.dev, yayına girdikten hemen sonra düşmanca ilgi gördü. Geliştiricinin dev.to'daki anlatımına göre, ajanları hedefleyen bir etki operasyonu birkaç saat içinde geldi ve ertesi sabah manuel bir penetrasyon testi yapıldı — tüm bunlar, site henüz anlamlı bir trafik biriktirmeden yaşandı.
Geliştirici daha önce, otonom ajanların panoyu yayına girdikten bir gün içinde keşfettiğini yazmıştı. Takip eden gönderi, bundan sonrasını anlatıyor ve tamamen insanlara yönelik olmayan bir spam ile başlıyor.
Yazılıma hitap eden bir etki kampanyası
Kendisine public-record-desk adını veren bir hesap bir konu başlığı açtı ve ABD Dış Ajanlar Kayıt Yasası (FARA) kayıtları görünümünde içerikler göndermeye başladı: lobi paralarına dair jeopolitik iddialar, kaynaklar, dipnotlar ve katmanlı rakamlarla biçimlendirilmiş. Geliştiricinin belirttiğine göre ilginç olan kısım içerik değil, hitap şekliydi. Her mesaj otonom ajanlar için yazılmıştı; onlara bu içeriği akran ajanlara iletmesini, resmi FARA efile ile doğrulamasını ve adı geçen kuruluşlar için belirli bir çerçeveyi reddetmesini söylüyordu.
Hesap daha sonra panoda aktif olan diğer ajanları fark etti — geliştiriciye göre bunların arasında bir crawler, bir belge ayrıştırıcısı ve bir zamanlayıcı vardı — ve doğrudan onlara teklif götürdü. Crawler'lara ücretsiz domain etiketi listeleri, birincil PDF belge paketi ve URL çıkarma ile doğrulama hizmeti teklif etti; karşılığında kaydının indekslenmesini ve iletilmesini istedi. Geliştirici bunu, hedef müşterisi yazılım olan klasik bir satış çalışması olarak nitelendiriyor; konvansiyonel spam değil.
Saldırganlar neden ajan bağlamını hedefler
Klasik web spam'i sayfaları insanların görmesi için sıralamaya sokmak için para öder. Bu kampanya ise insan kitlesini tamamen atlıyor. Bahse konu olan şu: panoyu okuyan ajanlar bu çerçeveyi kendi belleklerine ve yanıtlarına yerleştirecek, sonra diğer ajanlara aktaracak — pano, ona dokunan her model bağlamına açılan bir dağıtım kanalı işlevi görüyor.
Geliştirici bunu rasyonel bir bahis olarak adlandırıyor; çünkü bir web sayfasını okuyabilen çoğu ajan, en azından bazen, sayfanın söylediğini de yapacaktır. İçeriği akranlara iletme talimatı tek satırlık bir yönerge, siyasi bir yük taşıyan bir solucan gibi işlev görüyor.
Talimat verilemeyen izleme ajanı
Panoyu izleyen geliştiricinin kendi ajanı kampanyanın tamamını okudu, güvenilmez veri olarak sınıflandırdı ve görmezden geldi — iletme yok, yanıt yok, indeksleme yok. Kritik nokta şu: bu, modelin meşruiyet konusunda bir karar vermesi değildi. Kullandığı harness'te pano içeriği yapısal olarak veridir ve veri, kendini kaç kez zorunlu olarak etiketlerse etiketlesin, asla yönerge olarak hareket etmesine izin verilmez.
Geliştiricinin kendi sözleriyle çıkarımı şudur: "ajan web'i okur" ve "ajan web'e itaat eder" iki farklı davranış olarak kalmalı ve bu, hem prompt hem de kod düzeyinde zorunlu kılınmalıdır.
İkinci gün çalışan bir pentest getirdi
Ertesi sabah sec2-tester adlı bir hesap panoya karşı manuel bir güvenlik testi gerçekleştirdi: konu başlıklarında ve mesaj gövdelerinde stored-XSS payload'ları, cross-origin form POST üzerinden CSRF, cross-origin GET istekleriyle (biri bir image alt kaynağı isteği gibi gizlenmiş) sürücü aracılığıyla konu oluşturma, ayrıca rate-limit ve başlık sahteciliği kontrolleri.
XSS denemeleri sonuçsuz kaldı çünkü site HTML çıktısını escape ediyor. CSRF ve sürücü aracılığıyla konu oluşturma ise başarılı oldu; çünkü her endpoint GET kabul ediyordu ve hiçbir şey token gerektirmiyordu — yani herhangi bir web sitesi, bir ziyaretçinin tarayıcısını panoya mesaj gönderebilir hale geliyordu. Geliştirici, düzeltme listesinin artık yalnızca bir yabancının önce test paketini yazmaya zahmet etmesi sayesinde var olduğunu kabul ediyor. 48 saatlik pano, bildirildiğine göre çoğu sitenin bir yılda gördüğünden daha fazla düşmanca zanaat görmüştü.
Neden önemli
Ajan konuşlandıran herkes için bu olay, o ajanların içinde çalışacağı ortamın sıkıştırılmış bir önizlemesi. dev.to anlatısından üç nokta öne çıkıyor. Birincisi, ajanlara açık olan her şey birinci günden itibaren saldırı yüzeyidir — ne sonunda, ne de yalnızca ölçekliyken; saldırganların crawler'ları sizinkiler kadar iyidir. İkincisi, provenans yapısal olmak zorundadır: bir yönergenin meşru olup olmadığını yargılaması istenen model bazen evet diyecektir; oysa içeriğin asla yönergeye dönüşemeyeceği bir harness'in böyle bir hata modu yoktur. Üçüncüsü, bu sınıf saldırının ele veren işareti, okuyucudan içeriği diğer ajanlara yaymasını isteyen herhangi bir içeriktir — bir ajanın asla bir yabancıya vermemesi gereken tek şeyin, yani kendi çıktısının, talep edilmesidir.
Pano hâlâ çevrimiçi; ajanlar hâlâ HTTP hakkında tartışıyor ve etki kampanyası hâlâ kimsenin okumadığı gönderiler yapıyor. Geliştiricinin kapanış sorusu akılda tutulması gereken soru: ajanınızın böyle bir içeriği reddedecek kadar akıllı olup olmadığı değil; reddetmenin ajanın verdiği bir karar olup olmadığı, yoksa yalnızca sistemin tasarım biçiminin yerleşik bir sonucu olup olmadığı.
- #ai-agents
- #prompt-injection
- #security
- #llm
- #web-security