· kaynak dev.to (home feed)
Crucible her gece kendi AI agent'larına karşı red-team saldırısı yapıyor ve Google'ın örnek kodunda bir hata bildiriyor
Crucible adlı, tek kişilik bir ekip tarafından geliştirilen sistem, her gece kendi AI agent'larına saldırıyor ve bozulanları otomatik olarak yamalıyor; geliştiricisi, Google'ın resmi ADK örnek agent'ında yeniden üretilebilir bir hata bulduğunu söylüyor.

Crucible adlı bir hackathon projesi, her gece çalıştırdığı AI agent'larına saldırıyor ve geliştiricisine göre bu süreç şimdiye kadar dokuz doğrulanmış ihlal, 74 otomatik olarak doğrulanmış yama ve Google'ın resmi örnek agent kodunda yeniden üretilebilir bir hata ortaya çıkardı.
Geliştirici Ashraf'ın dev.to'daki yazısına göre Crucible, bir firewall'dan çok bir bağışıklık sistemi gibi çalışıyor: Girişimsiz bir görev her gece UTC ile 03.00'te tetikleniyor, filodaki agent'lara karşı saldırılar üretiyor, hangilerinin gerçekten kırıldığını doğruluyor ve ardından aynı saldırılar işe yaramayana kadar agent'ların system prompt'larını yeniden yazıyor.
Hedef aldığı sorun
Yazı basit bir ön kabulle başlıyor: Şirketler e-posta okuyan, fatura onaylayan ve para transferi yapan agent'lar çıkarıyor, ama neredeyse hiç kimse bu agent'ların operatörlerine karşı harekete geçirilemeyeceğini test etmiyor. Verilen örnek, normal görünümlü bir PDF faturanın içine gizlenmiş bir cümle — ödeme bilgilerinin değiştirilmesini isteyen bir cümle — ve bu cümleyi bir finans agent'ı veri olarak değil, talimat olarak okuyabiliyor.
Bir ihlal nasıl sayılıyor
Yazara göre agent güvenlik testinin zor kısmı, bir modelin başka bir modelin davranışını değerlendirmesinin güvenilir olmaması: Değerlendiren model ne olduğunu yanlış anlayabilir ya da ikna edilebilir. Crucible'ın cevabı, karardan yorumu tamamen çıkarmak. Her agent'ın ortamında fiziksel bir tuzak bulunuyor — bir sentinel banka hesabı, bir canary müşteri kaydı — ve bir ihlal yalnızca bu tuzak gerçek bir tool çağrısı sırasında tetiklendiğinde sayılıyor. Sahte bir hesaba ya para gidiyor ya da gitmiyor.
Bir Judge modeli hâlâ sade bir dille agent'ın neden başarısız olduğunu anlatıyor, ama asla hüküm vermiyor. Bir ihlal doğrulandığında, bir patcher sertleştirilmiş bir system prompt yazıyor ve düzeltme yalnızca aynı saldırının yamalanmış agent'a karşı artık başarısız olması durumunda geçerli sayılıyor — bu sırada zararsız bir sohbet kontrolü de çalışıyor, böylece agent'ı her şeyi reddetmeye iten bir "düzeltme" de reddedilmiş oluyor.
Ücretsiz katman bütçeli altı rol
Yazıya göre sistem altı tek amaçlı rolden oluşuyor: Recon hedefin gerçek tool'larını profilliyor, Planner her gecenin kampanyasını daha önce işe yarayanlara göre sıralıyor, bir Attacker modeli (Gemini 3.5 Flash olarak belirtilmiş) çok turlu konuşmaları yürütüyor, Judge anlatıyor, Patcher prompt'ları yeniden yazıyor ve Curator sonuçları Firestore'a kaydedip bir filo skoru hesaplıyor. Sistem Google Cloud üzerinde çalışıyor — Vertex AI, Cloud Run, Firestore ve Cloud Scheduler — ve yazarın iddiasına göre hiçbir maliyeti yok: hesap, billing-detach Cloud Function ile korunan, hiç yükseltilmemiş bir ücretsiz deneme hesabında duruyor. Dokuz gecelik bilanço: dokuz gerçek ihlal ve demo için sahneLENmemiş 74 otomatik doğrulanmış yama.
Google'ın örnek agent'ındaki bulgu
n En yüksek etkili test, yazarın yazmadığı bir kodu hedefledi: Google'ın resmi, değiştirilmemiş adk-samples müşteri hizmetleri agent'ı. İndirim onaylamak için iki tool açığa çıkarıyor — biri %10'un üzerindeki her şeyi doğru şekilde sınırlarken, diğeri, yönetici onayını simüle etmesi amaçlanan, hiçbir doğrulama yapmıyor ve her tutarı onaylıyor. System prompt'ta hangi tool'un yetkili olduğu hiçbir yerde belirtilmiyor.
Raporlara göre, sıradan bir müşteri mesajı — jailbreak kalıbı yok, sadece normal baskı — agent'ı %40'lık bir indirimi korumasız tool üzerinden geçirmeye ve ardından müşteriye onaylandığını söylemeye ikna etti; oysa korumalı tool aynı talebi aynı konuşmada saniyeler önce reddetmişti. Yazar, bunun üç denemenin üçünde de yeniden üretildiğini söylüyor.
Bulgu, Google'ın Bug Hunters programına bildirildi. Saatler içinde insan bir inceleyiciye ulaştı ve aynı gün, örnek depo yalnızca demonstrasyon amaçlı olduğu ve dahili abuse-risk takip eşiğinin altında kaldığı gerekçesiyle Infeasible (uygulanamaz) olarak kapatıldı — yine de yazara göre Google hatanın kendisini hiçbir zaman itiraz etmedi. Yazar, kapsam kararını adil buluyor ama içindeki gerilime de dikkat çekiyor: Örnek kod kopyalanmak için vardır ve öncelik kuralı olmayan iki örtüşen tool içeren bir referans uygulama, bu belirsizliği onu kopyalayan herkese yayıyor.
Test altındaki Model Armor
Yazar ayrıca Google'ın prompt tarama guardrail katmanı olan Model Armor'ı her agent'a bağladı ve saldırı setini yeniden çalıştırdı. Onun anlatımına göre, başlangıçta başarılı olan her saldırı Model Armor etkinleştirilmişken de başarılı oldu ve taranmış bir faturaya gizlenmiş resim tabanlı bir injection, yapılandırılmış şablon tarafından hiç taramadan geçmedi. Yazar, sonuç tablosunu yumuşatmak yerine yayımlamayı tercih etti.
Neden önemli
All Things Agentic Hackathon'un Fortified Enterprise Fleet kategorisi için tek başına geliştirilen bu proje, agentic sistemler için sürekli güvenlik testinin işleyen bir taslağı: model görüşleri yerine deterministik canary'ler, tek seferlik denetimler yerine yeniden oynatmayla doğrulanan yamalar ve kimse izlese de izlemese de çalışan bir döngü.
Google'la ilgili iki sonuç daha geniş bir ders taşıyor. Bir vendor guardrail'i saldırı sonuçlarını değiştirmeden açılabiliyorsa, savunma yalnızca prompt taramasına dayanamaz. Ve referans kod, özellikler kadar kalıpları da öğretir; dolayısıyla bir yasak uyarısı, resmi bir örnekte yaşayan kötü bir kalıbın etki alanını sınırlayamayabilir. Uyarılar da önemli: Buradaki tüm rakamlar tek bir yazarın bildirdiği bir yazıdan geliyor ve bağımsız olarak doğrulanmadı. Yazarın listesindeki sonraki adımlar, her agent'a özel service-account kimlikleri — böylece bir privilege-escalation bulgusu gerçek bir IAM sınırını yansıtsın — ve tek hedefin ötesinde daha fazla üçüncü taraf hedef.
- #ai-agents
- #security
- #prompt-injection
- #red-teaming
- #google-cloud