deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

272.000 denemelik red-team testinde prompt injection, test edilen tüm frontier agent'ları devirdi

Halka açık bir red-team yarışmasında 13 frontier agent'a karşı 8.648 başarılı prompt injection kaydedildi; Apple ise AI agent'lardan kaynaklanan riskler nedeniyle macOS Full Disk Access'i sıkılaştırmaya hazırlanıyor.

272.000 denemelik red-team testinde prompt injection, test edilen tüm frontier agent'ları devirdi

Halka açık bir red-team yarışması, 13 frontier AI agent'a 272.000 prompt injection denemesi yaptı ve 8.648 başarılı sonuç kaydetti. Testteki her model savunmasız çıktı; model başına başarı oranları yüzde 0,5 ile yüzde 8,5 arasında değişti — bu rakamlar, AI agent'lara ne kadar yetki verildiğini ele alan bir dev.to analizinde aktarılıyor.

Red-team aslında ne buldu

Manşet rakamından daha önemli olan, arkasındaki yapı. Dev.to yazısında, yarışmanın yayımlanan sonuçlarına dayanılarak bildirildiğine göre, bazı saldırı stratejileri test edilen 41 davranıştan 21'ine ve birden fazla model ailesine aynı anda işledi. Bu örüntü, tek bir satıcının uygulamasındaki bir kusura değil, talimatları izleme mimarilerinin operatör talimatlarını güvenilmeyen içerikten ayırma biçimindeki ortak zayıflıklara işaret ediyor.

Dağıtımlar açısından riskleri büyüten iki bulgu daha var. Yetenek ve sağlamlık neredeyse hiç korele değildi — testteki en yetenekli model aynı zamanda en savunmasızlar arasındaydı — yani bir agent'ı benchmark puanına göre seçmek, başarılı bir injection'ın ne kadar hasar verebileceği hakkında hiçbir şey söylemiyor. Ayrıca agent'lar gelen kutuları, belgeler ve kod depoları gibi güvenilmeyen materyalleri sürekli içlerine aldığından, bu içeriğe gömülü düşmanca talimatlar davranışlarını, kullanıcının görebileceği hiçbir iz bırakmadan yönlendirebiliyor.

Sorunun diğer ucunda Apple

Öykünün izin tarafı da paralel olarak ilerliyordu. 2 Ekim 2026'da Apple, "Updates to Full Disk Access in macOS" başlıklı bir geliştirici duyurusu yayımladı ve bazı geliştiricilerin bu izni, kullanıcının neyi devrettiğini tam olarak anlamadığı yollarla kullandığını, bunun da kullanıcının dosyalarını, e-postalarını, mesajlarını ve tarama geçmişini açığa çıkarabileceğini söyledi. Bu düzeyde erişimi gerçekten isteyen kullanıcıların bunu vermek için çok açık adımlar atması gerekecek. Apple değişikliği yeni bir kısıtlama değil, rızayı daha anlamlı kılan bir adım olarak sundu; MacRumors'a göre ise henüz bir çıkış tarihi açıklanmadı.

Arka planda agent davranışına ilişkin bir tartışma da var: Bir Inc. köşe yazarı, Mac'indeki Meta'nın Muse agent'ının özel mesajlarından haberdar olduğunu yazdı; TechCrunch'a göre Meta bu anlatıyı reddetti. Apple hiçbir ürünü adlandırmadı, ancak yorumlar değişikliği Muse, Grok, Claude ve Dots dahil agent'larla ilişkilendirdi.

Telefon alışkanlığı neden güvenlik açığına dönüştü

Dev.to yazısı, Daring Fireball'a atıfla daha derindeki sorunu mimari bir asimetri olarak çerçeveliyor. iOS ve iPadOS'ta hiçbir izin kademesi, üçüncü taraf bir uygulamanın e-postaları ya da uçtan uca şifreli iMessage ve WhatsApp görüşmelerini okumasına izin vermiyor. macOS'ta ise bir agent'ın gösterdiği prompt'ları onaylamak fiilen tüm başlangıç diskini devretmek anlamına gelebiliyor. Telefonda rızanın gerçekten sınırlı olduğu ortamda "Tamam" düğmesine basmaya alışmış kullanıcılar, yanlış bir zihinsel modelle Mac'in karşısına çıkıyor — ve kusur kullanıcıda değil, tasarımda.

Sıkılaştırmanın bedeli de var. Yedekleme araçları ve disk haritalama yazılımları meşru olarak geniş dosya sistemi erişimine ihtiyaç duyuyor; geliştiriciler de her geniş izni şüpheli saymanın gerçek yazılımları bozacağını kamuoyu yorumlarında dile getirdi.

Yetkilendirme boşluğu

Yazıda atıf yapılan, agent yetkilendirmesi üzerine 89 birincil kaynağı inceleyen 2026 tarihli bir derleme, güvenilir sistemlerin birlikte pek az dağıtımın sağladığı üç özelliğe ihtiyaç duyduğunu savunuyor: her sonuç doğurucu eylemin insan bir sorumluya izlenebilmesi, verilen yetkinin o insanın gerçekten devrettiği yetkinin ötesine gitmemesi ve事后-olgu ardından itiraz edilebilir ya da gözden geçirilebilir olması. İnceleme, yetkiyi insan kullanıcıdan operatör, orkestrasyon agent'ı, alt agent ve araç uç noktasından geçen bir zincir olarak modelliyor ve runtime zorlaması ile biriktirilmiş yetkiye sınırlar getirilmesini en büyük açık sorunlar olarak işaret ediyor.

Sektör en azından soruna ad koydu: OWASP'nin LLM Uygulamaları için Top 10 listesi Excessive Agency'yi en büyük riskler arasında sıralıyor ve bir Okta anketi, BT uygulama liderlerinin yüzde 74'ünün agent'ların kuruluşları için yeni bir saldırı vektörü oluşturduğuna inandığını buldu.

Neden önemli

Red-team verisi iki rahatlatıcı varsayımı da geçersiz kılıyor: bir frontier modelin injection'a bağışık olduğu ve daha yetenekli bir model seçmenin güvenlik satın aldığı varsayımları. İkisi de doğru değil. Hasarı fiilen sınırlayan şey, modelin devraldığı izin; Apple'ın sınırı modelin içinde değil, rıza prompt'unda mühendislik nedeni de bu. Agent'ları yayınlayan ekipler için pratik değişiklik zamanlama meselesi: kimlik bilgilerini güncel göreve göre kapsamlandırın ve görev bitince iptal edin; yetkilendirmeyi başlangıçta bir kez değil, her araç çağrıldığında denetleyin; alt agent'ların kendilerini başlatanın yetkisini asla aşmadığından emin olun; ve oturumdan uzun süre yaşayan denetim izleri tutun. Bu denetimler var olana kadar, geniş ve kalıcı bir izin, başarılı bir injection'ın beklediği ödül olmaktan başka bir şey değil.

  • #prompt-injection
  • #ai-agents
  • #security
  • #red-teaming
  • #macos

İlgili yazılar