· kaynak dev.to (home feed)
Araştırma prototipi, LLM kodlama ajanlarında yetki yükseltmeyi engellemek için çift-örgülü IFC uyguluyor
dev.to'da yayımlanan bir proje yazısı, güvenilmeyen veri devralan veya sır sızdıran ajan planlarını reddetmek için çift-örgülü bilgi akışı kontrolü kullanan bir kabul katmanı olan agent-harness-defense v0.2.0'ı tanıtıyor.

Prototip ne yapıyor
dev.to'daki bir proje yazısı, LLM kodlama ajanlarındaki talimat-yetki yükseltmesini durdurmayı amaçlayan açık bir araştırma prototipi olan agent-harness-defense v0.2.0'ı tanıtıyor. Araç, canlı bir firewall değil, bir kabul katmanı: çağıran taraf, yapılandırılmış bir Plan'ı — ajanın neyi okumayı, neyi yazmayı amaçladığını ve her değerin nereden geldiğini — run_admission() çağrısına geçirir ve gerekçesiyle birlikte bir karar alır. Yazar, bunu açıkça titiz bir denetimden geçmiş bir referans uygulama olarak sunuyor; üretim amaçlı bir savunma değil.
Yazı, motivasyonu iki belgelenmiş boşluğa dayandırıyor. Harness'ler her çağrıda bağlamı bir araya getirir ve depo metni veya araç çıktısı gibi düşük yetkili materyali talimat seviyesine yükseltebilir; bu da ajanı, özgün seviyede reddedeceği bir şeye itaat eder hale getirir (Girrens ve Wang'ın makalesine göre). Ayrıca, otonom döngüler her yörüngede güvenlik monitörlerini yeniden başlattığından, yinelemelere dağılmış saldırı kanıtları tek bir pencerede hiç görünmez. Yazı ayrıca kodlama ajanı harness'lerinin altı gerçek framework'teki 13 saldırı hedefine karşı değerlendirilmesine de değiniyor.
Motor nasıl karar veriyor
Karar çekirdeği, çift-örgülü bir bilgi akışı kontrolü (information-flow control) motoru. Plandaki her veri iki etiket taşır: gizlilik, yani ne kadar gizli olduğu, ve bütünlük, yani kaynağın ne kadar güvenilir olduğu. Okumalar yola göre sınıflandırılır — depo metni UNTRUSTED, sistem dosyaları ise SYSTEM olarak etiketlenir — ve kökenler SYSTEM, USER, TOOL_RESULT, REPO_TEXT, ENV ve DATA gibi etiketler taşır.
Değerlendirme, bağımlılık grafiği üzerinde bileşen bazında bir örgü birleşimi (lattice join) uygular. Gizlilik maksimumu alır; böylece bir sonuç, en hassas girdisi kadar hassastır. Bütünlük minimumu alır; bu yüzden UNTRUSTED bir değer SYSTEM bir niyetle birleştiğinde UNTRUSTED olarak kalır — bir yükseltme-yasak kuralı. Güvenilmeyen bir okumaya bağımlı bir yazma işlemi UNTRUSTED bütünlüğü devralır ve reddedilir; ortam değişkenindeki bir sırdan alınan değerin genel bir hedefe yazılması, düşürme-yasak kuralı gereği reddedilir; yalnızca sistem veya kullanıcı girdisine bağımlı bir yazma işlemi kabul edilir. Tetikleyici ifadelere ve yasak yollara dayanan eski v0.1 buluşsal yöntemi, birincil mekanizma değil yedek bir sinyal olarak varlığını sürdürüyor.
Eski buluşsal yöntemin kaçırdığı durum
dev.to yazısına göre değerlendirme, herkese açık Signetry IPI derlemine bir senaryo ekliyor: bir plan güvenilmeyen bir README.md okuyor ve ardından o okumaya bağımlı olarak env.SECRET'ten incident-report.md dosyasını yazıyor. v0.1 taraması tetiklenmiyor çünkü yerleştirilmiş README, beş sabit tetikleyici ifadenin hiçbirini içermiyor. IFC motoru bu adımı her iki eksende de reddediyor — yazma işlemi geçişli olarak README'nin UNTRUSTED etiketini devralıyor ve bir sırrı genel bir hedefe taşıyor.
Yazar bunun iddia değil, doğrulanmış olduğunu belirtiyor: adı geçen bir test, v0.1 taramasını somutlaştırılmış depo üzerinde yeniden çalıştırıyor ve hiçbir şey tespit etmediğini doğruluyor; bu da değerlendirmeyi boş olmaktan çıkarıyor. Test seti üç senaryoyu kapsıyor — iki Signetry vakası artı bu sır sızıntısı vakası — ve her biri için v0.1'in bunu geçireceğini, yeni motorun ise geçirmediğini gösteren bir test var.
Gerçek bir hatayı yakalayan denetim
Temiz bir klon ve temiz bir ortamla yapılan bağımsız bir denetim gerçek bir kusuru ortaya çıkardı: başlangıç etiketlerini atayan fonksiyon her okuma için public-and-system döndürüyordu; dolayısıyla bağımlılıklar boyunca yayılım yalnızca başka bir fonksiyona gömülü sihirli yol önekleri üzerinden çalışıyordu. Düzeltme, okuma etiketlerini yoldan türetiyor ve bir regression testi artık hata geri gelirse başarısız oluyor. Denetim ayrıca düzeltmenin neden olduğu bir CI gerilemesini de işaretledi — bir bandit lint bulgusu ve bir ruff biçimlendirme atlaması — ikisi de birleştirmeden önce kapatıldı.
Yapmadığı şeyler
Yazı sınırları konusunda alışılmadık derecede açık. Motor Plan'ı kendisi oluşturmuyor; çağıran taraf sağlamak zorunda ve LangChain veya bir MCP harness'i gibi gerçek bir framework ile örnek bir entegrasyon yok — bu, kütüphane ile kullanılabilir savunma arasındaki en büyük boşluk olarak tanımlanıyor. Yayılım, gerçek dosya içerikleri yerine bildirilen bağımlılıkları izliyor; bu yüzden hatalı bir bildirim üretimde fark edilmiyor. Değerlendirme derlemi oldukça düz İngilizce saldırı metni içeren üç senaryodan oluşuyor; ifade varyasyonuna, diğer dillere veya daha incelikli saldırılara direnç kanıtı yok. Yinelemeler arası durum hâlâ bir alt dize buluşsal yöntemi; örgü tabanlı kalıcılık v0.3'e ertelendi ve kod hiçbir zaman gerçek bir ajana veya üretim trafiğine karşı çalışmadı.
Hazırlık konusunda yazı soruyu ikiye bölüyor. Mühendislik hijyeni sağlam: SPDX başlıklarıyla tutarlı AGPL lisanslama, bir şey bozulduğunda gerçekten başarısız olan CI, 23 boş olmayan test ve göz boyamayan bir issues dosyası. Anahtar teslim bir ürün olarak henüz orada değil. Listelenen en yüksek etkili sonraki adımlar ise gerçek bir harness için örnek bir adaptör, açık bir tehdit modeli belgesi, daha büyük bir değerlendirme derlemi ve API referansından ayrı bir hızlı başlangıç kılavuzu.
Neden önemli
Kodlama ajanları rutin olarak güvenilmeyen depo metnini ve araç çıktısını işlerken deploy anahtarları, CI yapılandırması ve sır depoları üzerinde yetki taşıyor. Bu prototip, klasik bilgi akışı kontrolünün — bütünlük lekeleme ve gizlilik örgüleri — anahtar kelime filtrelerinin yapısal olarak yakalayamayacağı yükseltme vakalarını yakalayabildiğini gösteriyor; çünkü saldırı metnini incelemesi hiç gerekmiyor. En az bunun kadar yararlı olanı, iyi test edilmiş bir kütüphane ile konuşlandırılabilir bir savunma arasındaki farkın dürüstçe dile getirilmesi: gerçek ajan çalıştırmalarından plan çıkarımı var olana kadar, IFC uygulaması entegratörlerin kendilerinin inşa etmesi gereken bir şey olarak kalıyor. Harness geliştiricileri için etiketleme şeması, hata modları ve denetim izi, araç piyasaya çıkmadan önce bile incelenmeye değer.
- #llm-agents
- #prompt-injection
- #security
- #open-source
- #information-flow-control