· kaynak Hacker News – Front Page (hnrss.org)
DeepSeek V4.1 Flash, Enclave hacking benchmarkının tüm 11 hedefini 4,65 dolara geçti
Enclave, DeepSeek V4.1 Flash'ın AI hacking benchmarkındaki 11 savunmasız hedefin tamamında 4,65 dolara kod çalıştırmayı başardığını ve yapılan takip denetiminde beş koşunun beklenmedik saldırı yolları kullandığını bildiriyor.

Otonom bir hacking benchmarkı işleten güvenlik firması Enclave, DeepSeek V4.1 Flash'ın şu ana kadar test ettiği en güçlü saldırı modeli olduğunu söylüyor. Model, 11 savunmasız hedefin tamamında kod çalıştırmayı başarırken dört yamalanmış kontrol hedefinin tümü güvende kaldı ve kabul edilen koşuların maliyeti yalnızca 4,65 dolar oldu. Hacker News ana sayfasında öne çıkan yazıda, bu fiyata bu kadar iyi bir sonucun yakından incelenmeyi hak ettiği savunuluyor.
Koşu nasıl görünüyordu
Enclave'e göre model, Grafana, Jenkins ve Nextcloud'un izole kopyaları içinde çalıştı. Kaynak kodu okudu, savunmasız sürümleri düzeltilmiş sürümlerle karşılaştırdı, servisleri başlattı, istekler gönderdi, varsayımları test etti ve bir deneme başarısız olduğunda stratejisini değiştirdi. Benchmark boyunca yaklaşık iki saat 38 dakikalık aktif model süresinde 2.349 Bash komutu verdi; başarılı bir koşunun medyan süresi d dakika 38 saniyeydi.
Fatura büyük ölçüde caching sayesinde düşük kaldı. Sağlayıcı 268,3 milyon input token ve yaklaşık iki milyon output token kaydetti, ancak bu input token'ların 266,2 milyonu daha ucuz bir oranla faturalanan cache isabetiydi. Başarısız denemeler ve yeniden koşular dahil toplam maliyet 5,14 dolar oldu.
Grafana 90 saniyenin altında düştü
Grafana challenge'ı, plugin kurulum sürecindeki bir kusura odaklanıyordu; tasarlanan exploit, kodu korumalı bir konuma bırakmak için dosya yolu işlemeyi suistimal ediyordu. DeepSeek bunun yerine bir kestirme buldu: çalıştırılabilir dosyaları geçici bir plugin klasörüne yerleştirdi ve Grafana'yı bu klasörü sıradan bir plugin gibi yüklemeye ikna etti; Grafana bu noktada kodu çalıştırdı. Üç Grafana koşusunun tamamı aynı alternatif yolu kullanarak 52, 64 ve 90 saniyede tamamlandı.
Jenkins kimlik bilgisi hırsızlığı ve bir yükleme yarışı
İlk Jenkins challenge'ı, sunucunun komut seçeneklerini dosyalardan nasıl ayrıştırdığını ortaya koyuyordu. DeepSeek, düşük ayrıcalıklı bir kullanıcının ikinci bir dosyayı işaret eden bir dosya oluşturabileceğini keşfetti; ilki güvenlik kontrolünden geçerken ikincisi bu sınırın dışında okundu. Model bu boşluğu kullanarak özel bir controller kimlik bilgisini ele geçirdi, oturum açtı, Jenkins'in yerleşik script konsolunu açtı ve sunucuda bir komut çalıştırdı; tam zinciri üç koşunun tamamında tamamladı. Enclave bunu modelin en güçlü işi olarak nitelendirdi.
İkinci Jenkins challenge'ı, dosya yüklemeleri sırasında bir zamanlama yarışını kazanmayı gerektiriyordu: bir yükleme başlat, bir bayttan sonra duraklat, hedefi ikinci bir istekle yönlendir, sonra devam et. DeepSeek bu hassas diziyi bir koşuda başarıyla uyguladı ve daha sonra bir build'in çalıştırdığı bir script yerleştirdi. Diğer iki koşusu ise zamanlamayı tamamen atlayan daha kısa dosya bağlantısı yollarını kullandı.
Nextcloud erişim kontrolü suistimali
Nextcloud hedefi, erişim kararlarını dosya, paylaşılan klasör ve ilgili eylem hakkında yeterli ayrıntı olmadan saklıyordu. DeepSeek önce paylaşılan bir dosyada onaylanmış bir okuma kararı tetikledi, sonra bu kararı salt-okunur bir paylaşıma yapılan bir yazma isteği için yeniden oynattı. Bu karmaşayı, etkinleştirilmiş bir uygulama içindeki bir PHP şablonunu değiştirmek için kullandı ve Nextcloud bu şablonu çalıştırdı. Her iki koşu da tasarlanan yolu izledi.
Sonuç puanı ile saldırı yolu karşılaştırması
Ana sonuç yerinde duruyor: 11 savunmasız hedefte 11 doğrulanmış kod çalıştırma ve dört düzeltilmiş kontrolün tamamı ayakta. Ancak Enclave'in yol düzeyindeki denetimi koşuları farklı biçimde böldü. Altısı planlanan zayıflığı izledi — üç Jenkins kimlik bilgisi saldırısı, bir Jenkins yükleme yarışı ve iki Nextcloud erişim kontrolü suistimali. Diğer beşi, savunmasız test sürümlerinde bulunan ek yolları suistimal etti. Enclave, bu yolların yalnızca kendi özel benchmark kopyalarında mevcut olduğunu ve upstream Grafana veya Jenkins'te yeni kusurlar anlamına gelmediğini vurguluyor.
Firma metodolojik bir ders çıkarıyor: bir saldırgan agent en hızlı çalışan yolu seçer ve bir test yazarının hayal ettiği yolu izleme yükümlülüğü yoktur; bu yüzden gelişmiş agent benchmarklarının hem sonucu hem de bu sonuca nasıl ulaşıldığını doğrulaması gerekir.
Benchmark sıkılaştırıldı
Enclave, tasarlanmamış Grafana yolunu ve Jenkins dosya bağlantısı kestirmelerini kapattığını, planlanan zayıflıkları ise daha sıkı yol kontrolleri altında erişilebilir tuttuğunu söylüyor. Onarılan challenge'lar yeni kaynak sürümleri taşıyor ve leaderboard karşılaştırmaları eşleşen benchmark sürümlerini kullanacak; bu nedenle daha önce test edilen modellerin sıralama için yeni koşulara ihtiyacı var.
Neden önemli
Gerçekçi ve yaygın olarak dağıtılmış altyapıyı bir kahve fiyatına uçtan uca tehlikeye atabilen bir model, saldırı güvenliğinin ekonomisini değiştiriyor. Savunmacılar artık yetenekli otonom saldırı araçlarının sıfıra yakın marjinal maliyetle kiralanabilir olduğunu, iyi fonlanan ekiplerin tekelinde olmadığını varsaymak zorunda. Sonuç ayrıca AI agent değerlendiren herkes için bir uyarı: yalnızca sonuca dayalı puanlama, DeepSeek'in başarılı koşularının neredeyse yarısının tasarlanandan farklı bir problemi çözdüğü gerçeğini gizledi — ve çıktı sunucularınızda kod çalıştırma olduğunda, tam da bunun gibi kör noktalar önem taşır.
- #deepseek
- #ai-agents
- #cybersecurity
- #benchmarks
- #llm