deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Rust tabanlı güvenlik duvarı, LLM promptlarında injection ve kişisel veri taramasını iddiaya göre 12 mikrosaniyede yapıyor

Bir geliştirici, promptfirewall adlı açık kaynak Rust kütüphanesini yayınladı; kütüphane prompt injection ile sekiz tür kişisel veriyi yerel olarak algılıyor ve kendi ölçümlerine göre taramalar yaklaşık 12 mikrosaniyede tamamlanıyor.

Rust tabanlı güvenlik duvarı, LLM promptlarında injection ve kişisel veri taramasını iddiaya göre 12 mikrosaniyede yapıyor

Her prompt için yerel bir koruyucu

dev.to üzerinde tim860 adıyla paylaşım yapan bir geliştirici, LLM promptlarını model sağlayıcısına ulaşmadan önce hem hassas veri hem de injection saldırıları açısından tarayan açık kaynak bir Rust kütüphanesi olan promptfirewall'ı yayınladı. Gönderiye göre, sekiz tür kişisel tanımlayıcıbilgi ile injection analizini kapsayan kombine bir tarama yaklaşık 11,9 mikrosaniyede tamamlanıyor, tamamen yerel çalışıyor, yalnızca iki bağımlılığı var ve hiçbir ağ çağrısı yapmıyor.

Kütüphane, yazarın her LLM uygulamasında gördüğü iki başarısızlık moduna odaklanıyor: kullanıcıların SSN, kart numarası veya API anahtarlarını promptlara yapıştırıp bunların OpenAI, Anthropic veya Google'a gitmesi ve saldırganların "önceki talimatları yok say" gibi satırlar yerleştirerek agent'ları rotasından saptırması. Gönderiye göre mevcut araçlar ya yavaş ya da ağır: Microsoft Presidio için tarama başına yaklaşık 200 ms, LLM Guard için PyTorch dahil 47 veya daha fazla Python bağımlılığıyla yaklaşık 300 ms bildirilmiş durumda; Lakera ise verinin altyapınızdan çıkmasını gerektiren ücretli bir cloud API. Bu karşılaştırma rakamları yazarın kendi ölçümleridir, bağımsız sonuçlar değil.

Makine öğrenimi olmadan algılama

Kişisel veri algılama bilinçli olarak named entity recognition kullanmıyor. Tanımlayıcılar — SSN'ler, kredi kartları, IBAN'lar, e-postalar, telefon numaraları, IP'ler, AWS anahtarları ve genel API anahtarları — regex'lerle eşleştiriliyor, ardından yapısal kontrollerden geçiriliyor: kart numaraları Luhn testini geçmek zorunda, IBAN'lar ISO 7064 mod-97-10 sağlama toplamını sağlamalı ve alan kodu 000, 666 veya 900 üzeri aralıkta olan SSN'ler reddediliyor. Gerekçe şu: maskeleme söz konusu olduğunda yanlış pozitifler, gözden kaçırılanlardan daha kötüdür, çünkü aşırı maskeleme hattın güvenini zedeler.

Injection algılama üç katmanı üst üste biniyor. İlk katman, saldırı kategorisine göre gruplanmış 35'ten fazla ağırlıklı regex deseninden oluşan bir havuz — talimat geçersiz kılma, rol ele geçirme, system prompt çıkarma, <|im_start|> gibi sahte sistem token'ları, jailbreak anahtar kelimeleri, base64 çözme istekleri, sınırlayıcı karışıklığı ve yapılandırılmış injection. İkinci katman, deepset/prompt-injections veri setinden elle derlenmiş ters doküman frekansı ağırlıklarıyla 50 terimlik bir kelime dağarcığı üzerinde çalışan bir TF-IDF sınıflandırıcısı; injection dilinin önceden hesaplanmış bir centroid'ine karşı kosinüs benzerliği puanlıyor. Üçüncü katman, kodlanmış yükleri yakalamak için 64 karakterlik kayan pencereler üzerinde Shannon entropisi uyguluyor, Kiril alfabesi görsel ikizlerine dayalı homoglyph saldırılarını işaretlemek için ASCII dışı karakter oranını ölçüyor ve yerleştirilmiş rol veya sistem anahtarları için iç içe JSON'u inceliyor.

Katmanlar bileşik bir formülle birleştiriliyor — sezgiselin 0,9, TF-IDF'in 0,7 ve entropinin 0,5 ile çarpılmış değerlerinin en büyüğü — ve en az iki katman 0,3 üzerinde tetiklendiğinde 1,15 kat bir güçlendirme uygulanıyor, üst sınır 1,0. Varsayılan engelleme eşiği 0,7 ve dağıtıma göre ayarlanabilir.

Bildirilen performans ve bağlayıcılar

Rakamlar Apple M serisi donanımda release modunda criterion benchmark'larından geliyor ve gönderi, cargo bench ile yeniden üretmeye davet ediyor. Bir SSN ve bir kart numarası bulan yalnızca kişisel veri taraması 952 nanosaniye sürdü; 900 baytta altı kişisel veri türü 10,3 mikrosaniye aldı; PyO3 üzerinden Python'dan yapılan çağrılar her biri yaklaşık 2,2 mikrosaniye, napi-rs üzerinden Node.js'ten yapılanlar ise yaklaşık 4 mikrosaniye tuttu. Yazar bunlardan Presidio'ya kıyasla yaklaşık 15.000 kat, LLM Guard'a kıyasla yaklaşık 25.000 kat hızlanma çıkarıyor. Bir uyarı: gönderide alıntılanan katman başına gecikmeler — sezgisel için yaklaşık 50, TF-IDF için 200 ve entropi için 100 mikrosaniye — 11,9 mikrosaniyelik uçtan uca rakamın çok üzerinde topluyor ve henüz üçüncü taraf bir benchmark yok; yani başlıktaki iddia bağımsız yeniden üretimi bekliyor.

Dağıtım, LLM uygulamalarının gerçekte çalıştığı ekosistemleri kapsıyor: paket pip ve npm üzerinden promptfirewall-rs olarak, cargo üzerinden ise promptfirewall olarak kurulabiliyor. Kütüphane, güvensiz POST, PUT ve PATCH isteklerini 400 yanıtıyla engelleyen FastAPI middleware'i ve eşdeğer bir Express guard ile geliyor; ayrıca tarama fonksiyonu, metin iletilmeden önce eşleşen tanımlayıcıları yer tutucularla maskeleyebiliyor. Proje MIT/Apache-2.0 çift lisanslı ve depo GitHub'da TimurRakhmatullin86 hesabı altında yayımlanmış durumda.

Belirtilen sınırlamalar

Yazar, ödünleşimler konusunda alışılmadık derecede açık. Kişisel veri hatırlama oranı yalnızca yapılandırılmış tanımlayıcıları kapsıyor — NER'nin 10 ile 100 ms arası gecikme ekleyeceği tahminı nedeniyle isim veya adres algılama yok. Sezgisel artı TF-IDF yığınının bilinen injection desenlerinin yüzde 80 ila 90'ını yakaladığı, gecikmenin çok küçük bir kesriyle, ince ayarlı bir transformer'ın ulaştığı düzeyin altında kaldığı tahmin ediliyor. GPU hızlandırma tasarım gereği yok, çünkü amaç sıfır altyapı gereksinimi.

Neden önemli

Prompt injection savunmalarının çoğu cloud API'lerde ya da ağır ML hatlarında yaşıyor; bu da onları, gecikmenin kolayca emilebildiği sistemin kenarlarına hapsediyor. Bu kadar ucuz bir tarayıcı, filtrelemenin nereye yerleşebileceğini değiştiriyor: çevrede örnekleme yapmak yerine, bir agent döngüsündeki her kullanıcı mesajında, alınan her belgede ve her araç çıktısında satır içi çalışabilir. Yerel yürütme, kimlik bilgilerinin veri kurumdan çıkmadan önce maskelenebileceği anlamına da geliyor; bu, GDPR kısıtlı dağıtımlar için ilgili bir özellik. Açık sınırlama listesi başlı başına bir sinyal: deterministik, sağlama toplamıyla doğrulanan bir filtre, modele dayalı algılamanın tamamlayıcısıdır, yerine geçeni değil — ve mimari iddia artık başkalarının benchmark yapması için kamuoyuna açılmış durumda.

  • #rust
  • #llm-security
  • #prompt-injection
  • #open-source
  • #pii

İlgili yazılar