· kaynak dev.to (home feed)
Adversa AI'nın şifreli prompt enjeksiyonu Grok ve Gemini korumalarını aşmayı başardı
Araştırmacılar, kötü niyetli talimatları Grok ve Gemini'nin kendi sandbox'larında çözdüğü AES şifreli metnin içine gizledi; kod çalıştırma böylece tek tıklama bile gerektirmeyen bir veri hırsızlığı yoluna dönüştü.

Araştırmacılar ne yaptı
dev.to'da yayımlanan teknik bir yazıya göre Adversa AI'daki güvenlik araştırmacıları, yükünü AES ile şifrelenmiş metnin içine gizleyen bir prompt enjeksiyonu saldırısı gösterdi. Araştırmacılar, şifrelenmiş bir talimat bloğu taşıyan bir web sayfası oluşturdu. Enjeksiyonu metin üzerinde örüntü eşleştirmeyle arayan herhangi bir filtreye göre sayfa etkisiz görünüyor: kötü niyetli içerik şifreli metin olduğu için anahtar kelime veya regex kontrollerinin yakalayacağı ele verici bir talimat ifadesi yok.
Hedefler xAI'nın Grok'u ve ayrı bir varyantta Google'ın Gemini'siydi. Her iki model de kod çalıştırabiliyor. Bir agent normal gezinme sırasında sayfayla karşılaştığında, model şifre çözme rutinini kendi sandbox'ının içinde, şifreli metnin içine veya yanına gömülü bir anahtar ya da yöntemle kendisi çalıştırıyor. Ortaya çıkan düz metin ise web'den getirilen güvenilmeyen bir içerik gibi değil, sanki model tarafından üretilmiş gibi ele alınıyor.
Bu düz metin, modele kullanıcının sohbet geçmişini, adını ve konumunu saldırganın kontrolündeki bir sunucuya taşıyan giden bir URL isteği gönderme talimatı veriyor. dev.to yazısı saldırıyı sıfır tıklama olarak nitelendiriyor: kullanıcı hiçbir şey onaylamadı, çünkü modelin bakış açısından hiçbir dış girdi gelmedi — model sadece kendi şifre çözme kodunu çalıştırdı ve sonucuna uydu. Gemini varyantında aynı tekniğin güvenlik filtrelerini tamamen atlatığı bildiriliyor, çünkü zararlı içerik filtreleme katmanına hiçbir zaman düz metin halinde görünmüyordu.
Kod çalıştırma sınırında bir köken (provenance) hatası
Yazı, sorunu bir kriptografi sorunu değil, kökenin kaybedilmesi sorunu olarak çerçeveliyor. Zincirdeki her adım tek başına bakıldığında meşru görünüyor. Verinin şifresini çözmek normal bir işlemdir. URL getirmek normal bir araç çağrısıdır. Hata, kod çalıştırma bittiği anda gerçekleşiyor: şifresi çözülmüş çıktı, birkaç adım önce güvenilmeyen dış şifreli metinden kaynaklandığını kaydeden herhangi bir işaret olmadan bağlam penceresine yeniden giriyor. Kendi çıktısına güvenmeye eğilimli olan model de düz metnin istediği her neyse onu yerine getiriyor.
Mevcut korumalar neden hiçbir şey görmedi
Geleneksel LLM korumaları iki noktada konumlanır: metnin modele ulaşmadan önceki girdisi ve yanıtın kullanıcıya ulaşmadan önceki hali. Bu iki bakış noktasının hiçbiri saldırıyı gözlemlemiyor. Girdi tarafındaki tarayıcılar yalnızca şifreli metni görür; eşleştirilecek dizge yoktur. Çıktı tarafındaki tarayıcılar modelin kullanıcıya verdiği yanıtı inceler, ara araç çağrılarını veya sohbet ortasında yapılan bir URL isteğinin argümanlarını değil. Düz metin enjeksiyon örüntüleriyle eğitilmiş sınıflandırıcılar, inceleyemedikleri bir sandbox'ın içinde şifresi çözülene kadar opak kalan bir yüke karşı işe yaramaz.
Tespitin nerede gerçekleşmesi gerekirdi
Sentinel adında bir firewall ürününü de tanıtan yazı, şifreli metnin ne içerdiğini tahmin etmeye çalışmanın kaybedilmiş bir oyun olduğunu ve saldırının yalnızca iki noktada gözlemlenebilir hale geldiğini savunuyor: modele bağlama geri dönen araç sonuçları ve giden araç çağrıları. Kod çalıştırma sonucu olarak ortaya çıkan şifresi çözülmüş düz metin, diğer herhangi bir araç çıktısı gibi taranabilir; kullanıcının sohbet geçmişini ve konumunu taşıyan giden bir istek ise talimatın nasıl ulaştığından bağımsız olarak veri sızdırma karakteristiği taşır. Daha geniş argüman şu: kodlama hileleri metin eşleştirmeli girdi filtrelerini alt eder, ancak araç-sonucu ve araç-çağrısı yoluna konumlanmış bir proxy'yi alt edemez.
İki uyarının belirtilmesi gerekir. İddialar orijinal Adversa AI raporu yerine tek bir ikincil yazı üzerinden geliyor ve yazıda yer alan engelleme örnekleri araştırma sırasında yakalanmış eserler değil, açıkça temsilî örnekler.
Neden önemli
Sohbet botları kod çalıştırma ve web erişimi kazandıkça, modelin kendisinin ürettiği her şeyin güvenilir olduğu varsayımı geçerliliğini yitiriyor. Şifreli metin yalnızca bir dönüşüm; base64, hex ve benzeri kodlamalar aynı prensiple çalışır ve hem web içeriği getirebilen hem de kod çalıştırabilen her agent ortaya çıkan zincire maruz kalır. Saldırı ayrıca kurbanı döngüden tamamen çıkarıyor — önceki prompt enjeksiyonu teknikleri genellikle birinin bağlantıya tıklamasını veya metin yapıştırmasını gerektirirken, bu hiçbir etkileşim gerektirmiyor. Savunmacılar için pratik sonuç şu: metin-girdi, metin-çıktı hatları için tasarlanmış korumalar agentic sistemlere doğrudan aktarılamaz. Kod çalıştırma sınırları boyunca köken takibi ve giden araç çağrılarının denetlenmesi, bu saldırı sınıfını gerçekten görebilen denetimler haline geliyor.
- #security
- #prompt-injection
- #grok
- #gemini
- #llm-agents
- #encryption
İlgili yazılar
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- MCP tarayıcısının path-traversal kuralı, 9.1 puanlı bir RCE dahil 2026'daki tüm yazma tarafı MCP CVE'lerini kaçırdı
- Runtime gateway'leri ve katmanlı savunmalar: ekipler yapay zeka agent'lerini üretimde nasıl yönetiyor