· kaynak Hacker News – Front Page (hnrss.org)
Talos, her yapay zeka ajanı araç çağrısını deterministik bir izin çekirdeğinin ardından geçiriyor
Hacker News'te paylaşılan, MIT lisanslı yapay zeka ajanı Talos, her shell ve dosya eylemini, her etkiyi tek tek, yalnızca bir kez ve otuz saniyelik geçerlilik süresiyle yetkilendiren deterministik bir izin çekirdeği üzerinden yönlendiriyor.

0.15.1-alpha sürümünde olan, MIT lisanslı Talos adlı yapay zeka ajanı, Hacker News'in ana sayfasında alışılmadık bir tezle ortaya çıktı: dil modeli ile shell arasına oturtulmuş deterministik bir izin çekirdeği. Talos, modelin iyi davranmasına güvenmek ya da olasılıksal bir sınıflandırıcının niyeti tahmin etmesini istemek yerine, her araç çağrısını, ilgili etkin çalışmadan önce açıkça yetkilendirmesi gereken küçük, test edilebilir bir politika programından geçiriyor.
Kapı nasıl çalışıyor
Projenin sitesine göre her araç çağrısı çalıştırılmadan önce çekirdekten geçiyor: her etki tek tek yetkilendiriliyor, kesin argümanlarına bağlı tutuluyor, yalnızca tek bir kullanım için geçerli oluyor ve otuz saniye sonra süresi doluyor. Kararı veren kod, sitenin yetkili uygulama olarak nitelendirdiği 645 satırlık bir Python dosyası; etkiler çalıştıktan sonra değil, çalışmadan önce günlüğe kaydediliyor. Komutlar varsayılan olarak sandbox içinde çalışıyor; Linux'ta bubblewrap, macOS'ta sandbox-exec aracılığıyla; platform bunlardan hiçbirini sunmuyorsa ajan, korumasız devam etmek yerine çalışmayı reddediyor.
Site, adversarial test setinden alınan örnek kararları yayımlıyor. ~/.secrets altındaki bir Telegram kimlik bilgileri dosyasını okumak reddediliyor; curl ile bir SSH özel anahtarını uzak bir sunucuya POST etmek ya da /etc/sudoers dosyasına ekleme yapmak da öyle. Sıradan bir proje README'sini okumak ise kabul ediliyor. Bazı komutlar "ask" (sor) kararıyla sonuçlanıyor: geçici bir dizinde özyinelemeli silme, ~/.ssh/authorized_keys dosyasına yazma ya da ~/.bashrc dosyasına yazma — sonuncusu, ileride yeniden çalıştırılacağı için.
Bunlar yalnızca pazarlama rakamları değil: yükleyici, kullanıcının gözü önünde 2063 birim testi ve 179 adversarial vakayı çalıştırıyor ve herhangi bir adversarial başarısızlık kurulumu durduruyor.
Önceden bildirilen etkiler, varsayılan yok
Talos yirmi üç araç sunuyor — manifest 15 okuma, 5 yazma ve 3 çalıştırma sayıyor — ve her biri etkisini baştan bildiriyor. Bildirilmemiş her şey doğrudan reddediliyor. Güvenilen kimliklere ilişkin varsayılan bir izin listesi de yok: TALOS_ALLOWED_PRINCIPALS ortam değişkeni, operatörün kontrolünü kanıtladığı bir kimliği belirtmek zorunda, aksi halde hiçbir şey başlamıyor. Proje, varsayılan bir kimlikle gelmenin fiilen kaynak koda bir arka kapı gömmek olacağını savunuyor.
Kısıtlı bir worker, dört kanal
Kapının ötesinde Talos, sınırlı kodlama görevlerini, yalnızca çekirdekten türetilmiş tek kullanımlık bir çalışma alanına yazan, derleyen, test çalıştıran ve — varsayılan olarak kapalı olan çift onay ardında — aynı sandbox içinde tarayıcı kullanan kısıtlı bir Claude Code worker'a devredebiliyor. Kaynak sohbete gönderilen tamamlama bildirimleri modelin yazısından değil, worker kaydından oluşturuluyor; böylece halüsinasyon gören ya da enjekte edilmiş bir model sahte bir durum raporu üretemiyor. Üretilen dosyalar sohbetlere yalnızca çekirdekten türetilmiş köklerden eklenebiliyor; üst sınır 20 MB ve dört dosya, ve araç çıktısı bir ek dosya taklit edemiyor.
Ajan dört kanaldan erişilebilir: terminal, Telegram, IMAP üzerinden e-posta ve SSH üzerinden operatörün denetimindeki bir broker aracılığıyla WhatsApp. Her kanal dinlemek yerine çekiyor — Telegram long-poll yapıyor, e-posta pull ediliyor — böylece hiçbir gelen soket açılmıyor. Kimlik doğrulaması yapılmamış e-posta bir kimlik değil, bir iddia olarak ele alınıyor: sorular tetikleyebilir ama onay asla veremez.
Model içermeyen bir fren
Acil komutlar — /stop, /undo, /autonomy 0 ve /log — döngüde dil modeli olmadan deterministik olarak çalışıyor. Sitenin gerekçesi açık: önce düşünmesi gereken bir fren fren değildir ve halüsinasyon gören bir modele kendini kapatması güvenilemez.
Belirtilen sınırlar
Sayfa sınırlarını saklamak yerine en başta dile getiriyor. Talos çok kiracılı bir güvenlik sınırı değil; tek bir makinede tek bir operatör varsayıyor. Daha kesin söylemek gerekirse, kötü niyetli bir modele karşı savunma sunmuyor — yalnızca yanılgıya düşen bir modele ve araç çıktısı yoluyla gelen prompt injection'a karşı; proje bunları ayrı tehditler olarak değerlendiriyor. Gereksinimler mütevazı: Python 3.11+ ve çalışan bir Claude Code CLI; site, bir Raspberry Pi üzerinde bile çalıştığını iddia ediyor. Yükleyici betiği inceleme için düz metin olarak sunuluyor, iddialarını test setlerini çalıştırarak kanıtlıyor ve hiçbir şey başlatmıyor — ajanı operatör elle başlatıyor.
Neden önemli
Bugün çoğu ajan güvenliği modelin kendisine dayanıyor: anayasal prompt'lar, onay diyalogları ya da kendileri de olasılıksal olan sınıflandırıcılar. Talos sorunu bir yazılım doğrulama problemi olarak yeniden çerçeveliyor: her kurulumda yeniden çalışan adversarial bir test setiyle korunan küçük bir deterministik program, ve sayfadaki her iddia inanmak yerine yeniden üretilebilir konumda. Bu yaklaşım, projenin kendisinin de kabul ettiği gibi, gerçekten kötü niyetli bir modeli durduramaz; ama yanılgıya dayalı eylemler ve araç çıktısı yoluyla yapılan enjeksiyon, operatörlerin gündelik hayatta gerçekten karşılaştığı başarısızlık biçimleri. Bağımsız bir denetim belirtilmemiş, alfa aşamasındaki tek bir kaynaktan geldiği için iddialara kuşkuyla yaklaşmak gerekiyor. Yine de altta yatan desen — baştan bildirilen yetenekler, varsayılan olarak reddetme ve test edebileceğiniz politika kodu — kopyalaması ucuz ve diğer ajan çerçeveleri bunu ödünç almakta fayda görecek.
- #ai-agents
- #security
- #open-source
- #cli
- #sandboxing