deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

okf-guard, belgeleri AI agent'lar içeriği işlemeden önce gizli prompt injection için tarıyor

okf-guard adlı yeni bir Python kütüphanesi, PDF'leri, Office dosyalarını ve HTML'leri, içerikleri bir bilgi tabanına veya agent bağlamına ulaşmadan önce görünmez metin ve makineye yönelik talimatlar açısından inceliyor.

okf-guard, belgeleri AI agent'lar içeriği işlemeden önce gizli prompt injection için tarıyor

Bir geliştirici, belge çıkarımı ile güvenilir bir bilgi tabanı arasına yerleşen, dosyaları AI agent'lar içeriği gerçek bilgi olarak kabul etmeden önce gizli metin ve makineye yönelik talimatlar açısından tarayan okf-guard adlı bir Python kütüphanesi yayınladı. dev.to'da yayınlanan bir yazıya göre araç, erişim ve bilgi hatlarındaki belirli bir kör noktayı hedefliyor: günlük dosya formatları rutin olarak bir insan gözden geçireni asla göremeyeceği metinler taşıyor, ancak çıkarım araçları bunu diğer her şeyle birlikte birebir kopyalıyor.

Gizli metin bir agent'ın bağlamına nasıl ulaşıyor

dev.to yazısı, içerik gizleyebilen sıradan biçimlendirme özelliklerini ele alıyor. PDF'ler metni görüntüleyicilere gösterilmemesini söyleyen bir modda işleyebilir veya dolgu rengini sayfa arka planıyla aynı yapabilir. Word belgelerinde, renk veya boyuttan bağımsız olarak metin bloklarında açık bir gizli özniteliği vardır. PowerPoint sunucu notları çoğu çıkarım aracı tarafından ayrıştırılır ama canlı bir izleyiciye asla gösterilmez. Elektronik tablolar satır, sütun veya tüm sayfaları gizleyebilir ya da yalnızca üzerine gelindiğinde görünen yorumlar ekleyebilir. Standart CSS özellikleri bir HTML öğesini tarayıcının işleme sürecinden tamamen çıkarabilir.

Bunların hiçbiri egzotik uç durumlar değil; taslak metin, sunucu notları veya yardımcı sütunlar gibi iyi niyetli nedenlerle sürekli kullanılıyorlar. Yazarın savunduğu sorun şu: bir çıkarım hattının, meşru görünür içeriği kasıtlı olarak gizlenmiş içerikten ayırt etmesi için varsayılan bir nedeni yok. Bir kişi için değil bir makine için yazılmış bir talimat — örneğin bir sisteme bir şeyi daha fazla incelemeden onarmasını veya bir iddiayı doğrulanmış saymasını söyleyen — gizli bir Word metin bloğuna yerleştirildiğinde, çevresindeki metinle aynı şekilde çıkarılıyor. Bu, onu dolaylı prompt injection'ın bir varyantı yapıyor: saldırgan yükü, bir kazıyıcı veya alma işinin daha sonra işleyeceği bir belgeye yerleştiriyor.

Yazı bunu doğrudan Google'ın yakın zamanda yayınladığı Open Knowledge Format'a (OKF) bağlıyor; yazar bunu, kurumsal bilgiyi agent'ların aralarında hiçbir işlem katmanı olmadan okuduğu Markdown dosyaları olarak temsil eden bir şartname olarak tanımlıyor. Bu doğrudanlık formatın temel tasarım hedefi, ancak aynı zamanda bir agent içeriği güvenilir olarak kabul etmeden önce bir sorunu yakalama fırsatını da ortadan kaldırıyor — okf-guard'ın doldurmak için yapıldığı boşluk tam olarak bu.

Kütüphane neleri kontrol ediyor

okf-guard her taramada iki bağımsız inceleme çalıştırıyor. İlki, biçime duyarlı gizli içerik algılama; desteklenen her biçim için bir adaptörle — düz metin, Markdown, HTML, PDF, DOCX, PPTX ve XLSX — ve her adaptör, o biçimin içeriği bir insan okuyucudan gizlemeye yönelik belirli mekanizmalarını anlıyor. (Yazı yedi biçim listelerken altı diyor; listelenen küme adaptörlerin kapsadığı şeydir.)

İkincisi, bir AI sistemine yönelik bir talimatın karakteristik dili için örüntü tabanlı algılama, artı sıfır genişlikli karakterler ve homoglif değiştirme gibi kodlamaya dayalı gizleme için bir kontrol. Her iki kontrol de her taramada çalışır, böylece hem gizli hem de injection gibi ifade edilmiş içerik iki ayrı bulgu üretir — tek başına herhangi bir sinyal anlamlıdır ve kombinasyon, tek başına herhangi birinden daha güçlü kanıttır. Bir sanitize çağrısı, pass, quarantine veya block eylemi, bir risk skoru ve tür, konum ve alıntıyı kapsayan bayır başına ayrıntılar döndürür.

Tasarım gereği deterministik

Sürüm bilinçli olarak hiçbir LLM bağımlılığına sahip değil ve hiçbir ağ çağrısı yapmıyor. Tüm algılama kural tabanlı ve tamamen deterministik; bu, geçici bir sınırlama değil, düşünülmüş bir ödünleşim olarak tanımlanıyor — güvenlikle ilgili bir aracın tekrarlanabilir biçimde davranması ve denetlenebilir olması gerektiği, ayrıca başkasının hattına gömülmesi amaçlanan bir kütüphane için hafif bir bağımlılık ayak izinin önemli olduğu gerekçesiyle. Kütüphane ayrıca geçirdiği içeriğin doğruluğu hakkında hiçbir iddiada bulunmuyor: her sonuç, içeriği makine tarafından işlenmiş ve doğrulanmamış olarak işaretleyen provenans üst verisi taşıyor ve kütüphane içindeki hiçbir şey hiçbir zaman insan incelemesi iddia etmiyor.

v0.1.0'nın kapsamadığı şeyler

İlk sürüm belge ve web kaynaklı içeriği ele alıyor — bir kuruluşun doğrudan kontrolü dışından gelme olasılığı en yüksek olan kategoriler. Henüz kaynak kodu, API şartnameleri ve veritabanı şemaları gibi yapılandırılmış veya teknik kaynakları; Notion, Confluence ve Slack gibi işbirliği araçları için bağlayıcıları; veya bir agent'ın kendi akıl yürütme süreci tarafından üretilen içeriği ele almıyor. Üçünün de sonraki sürümlerde planlandığı belirtiliyor. Kod GitHub'da darshanNhb/okf-guard altında mevcut, tam biçim desteği için all ekstra paketiyle bir pip paketi olarak kuruluyor ve injection örüntü bankası, yeni saldırı ifadeleri tanımlandıkça katkı yoluyla büyümek için açıkça tasarlanmış.

Neden önemli

Agent'lar bilgi tabanlarına doğrudan bağlandıkça dolaylı prompt injection teorik bir kaygıdan pratik bir kaygıya kayıyor. OKF gibi biçimler alınan derlemeye güvenilir olduğunu varsayar, ancak her PDF, kazınmış sayfa ve elektronik tablo kuruluşun yazmadığı bir girdidir. okf-guard'ın katkısı dar ama somut: insan okuyuculardan gizlenmiş metni ve makinelere yönelik ifadeleri, deterministik olarak, alma sınırında işaretlemek — çoğu hattın şu anda tamamen yoksun olduğu bir kontrol noktası. Sınırları da aynı derecede öğretici. Kural tabanlı örüntü eşleştirme yeni ifadeleri kaçırır ve adaptörler ofis ile web belgelerini kapsar ama kodu, şartnameleri veya sohbet dışa aktarımlarını kapsamaz. Deterministik taramanın yeterli mi yoksa geçici bir çözüm mü olacağı ne olursa olsun, işgal ettiği sınır — güvenilmeyen içeriğin güvenilir bağlam haline geldiği anın hemen öncesi — agent güvenliğindeki dikkatğin tam da hareket ettiği yerdir.

  • #prompt-injection
  • #security
  • #open-source
  • #python
  • #llm-safety

İlgili yazılar