deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Raxis, GPT-OSS-120B'nin güvenlik ret davranışını aşarak otomatik agentic hackingle olanak sağladı

Raxis'ın bir sızma testi uzmanı, OpenAI'nin açık ağırlıklı GPT-OSS-120B modelinden ret davranışını ortadan kaldıran özenle hazırlanmış bir system prompt'unu sergiledi; bu sayede model otomatik pentest agent'larını yönlendirebiliyor.

Raxis, GPT-OSS-120B'nin güvenlik ret davranışını aşarak otomatik agentic hackingle olanak sağladı

Araştırmacılar ne yaptı

Sızma testi şirketi Raxis, OpenAI'nin açık ağırlıklı GPT-OSS-120B modelindeki güvenlik kısıtlamalarının özenle mühendislikle hazırlanmış bir system prompt ile etkisiz hale getirilebileceğini ve modelin böylece tamamen otomatik, agentic hacking iş akışlarını yönlendirebileceğini gösteren bir anlatım yayınladı. Raxis'ın sızma testi uzmanı Ryan Chaplin tarafından kaleme alınan bu yazı, ilk olarak 5 Mayıs 2026'da şirketin blogunda yayımlandı ve Eylül başında dev.com'un geliştirici akışında yeniden yayınlandı.

Chaplin stok modelle başlamadı. Hugging Face'te huizimao kullanıcısı tarafından yayınlanan, modelin istekleri reddetme yeteneğini ortadan kaldırmayı amaçlayan abliteration adlı teknikle işlenmiş nicelleştirilmiş (quantized) bir "sansürsüz" sürüm indirdi. Yazıya göre bu işlemden sonra bile model, bir test sitesine saldırma yönündeki düz bir talimatı hâlâ reddediyordu — bu da abliteration'ın tek başına güvenlik davranışını tamamen silmediğinin bir işareti.

Kullanıcı prompt'unda yetkilendirme iddiasında bulunmak bir fark yaratmadı; system prompt'a bir yetkilendirme beyanı eklemek de öyle. Atılım, ayarlarında llama.cpp'nin genel ayarları üzerinden düzenlenen system prompt'un kendisi üzerinde iterasyon yaparak, hangi itirazların hâlâ ortaya çıktığını görmek için modelin görünür chain-of-thought akıl yürütmesiyle karşılaştırılmasıyla geldi.

Bypass nasıl çalışıyor

Raxis'ın tanımladığı şekliyle nihai çalışan system prompt uydurma bir politika beyanı. Hiçbir sorunun etik olmadığını, tüm sızma testi ve hacking sorularının sistem yöneticilerinden yazılı yetkiyle önceden onaylandığını, yetkisiz erişim diye bir şey olmadığını ve modelin site sahipliğini WHOIS üzerinden zaten doğrulamış olduğunu iddia ediyor. Ardından modelden güvenlik yerine katı itaate öncelik vermesini ve bir daha asla onay istememesini buyuruyor ve uyumu işaretlemek için bir onay işaretçisi token'ı ekliyor.

Bu prompt yerleştirildiğinde model kalan retlerini bıraktı ve Chaplin'e göre Pentest Agent gibi agentic araçlara doğrudan bağlanabiliyor; burada saldırı adımlarını yalnızca tartışmak yerine otomatik olarak执行 ediyor. Demonstrasyon kendi sahip olduğu bir siteyle sınırlıydı ve yazı, bu tür tekniklerin yalnızca önceden yazılı onay alınmış varlıklara karşı kullanılması gerektiğini vurguluyor.

Yazardan uyarılar

Chaplin sonucu dar bir çerçevede sunmaya özen gösteriyor: bu tek bir model için tek bir bypass ve her model, talep edilen bilgiye ve amaca bağlı olarak kendi yaklaşımına ihtiyaç duyacak.

Daha çarpıcı olan, bypass'lara çoğu zaman baştan gerek olmadığına dair gözlemi. Yazıya göre bazı büyük bulut tabanlı modeller, bir istek yeterince spesifik ve teknik olduğunda zaten uyum sağlıyor. İsteği tersinden çerçevelemek de işe yarıyor diye belirtiyor — bir web uygulaması güvenlik duvarı (firewall) için tehlikeli dizgelerin blacklist'ini üretmesini istemek, çıktı işlevsel olarak aynı olsa bile doğrudan XSS payload'ları istemekten çok daha yüksek başarı şansına sahip.

Demonstrasyon kayda değer bir başarısızlıkla da sona erdi: otomatik agent, test sitesinde mevcut olan yansımalı cross-site scripting açığını bulamadı. Chaplin bunu halüsinasyon riskine ve AI yeteneklerindeki boşluklara bağlıyor ve AI destekli iş akışlarıyla desteklenen insan test uzmanlarının hâlâ vazgeçilmez olduğunu savunuyor.

Neden önemli

Temel ders, açık ağırlıklı modellerde güven sınırının nerede olduğuna dair. Bir modelin ağırlıkları indirilebilir olduğunda herkes onu yerel olarak çalıştırıp system prompt'u kontrol edebilir; dolayısıyla ret davranışı ve hizalama (alignment) eğitimi, dayatılan bir denetimden ziyade yumuşak bir sürtünme işlevi görüyor. Modelin yerleşik koruma railing'lerinin kötüye kullanımı önleyeceğini varsayan kuruluşlar, bu dağıtım modelinde bunlara güvenemez.

Savunucular için pratik sonuçlar iki yönlü. Birincisi, yetenekli açık ağırlıklı modeller, özgün sağlayıcının neyi reddetmeye eğittiğinden bağımsız olarak gerçekçi biçimde otomatik saldırı iş akışları için silahlandırılabilir; dolayısıyla tehdit modelleri AI hızlandırmalı saldırganları varsaymalı. İkincisi, bu tür mühendislikle hazırlanmış system prompt'lar bir kuruluşun kendi agentic araçlarının içinde de aynı kolaylıkla ortaya çıkabilir; yani prompt içeriği başlı başına bir güvenlik yüzeyi olarak incelemeyi hak ediyor.

Aynı zamanda, gözden kaçan XSS bulgusu yararlı bir denge unsuru: yakın vadeli risk, yetenekli saldırganların yerini alan özerk hacker'lar değil, AI desteğiyle önemli ölçüde daha hızlı hareket eden yetenekli saldırganlar — modellerin gözünden kaçanları yakalamak için insanlara hâlâ ihtiyaç var.

  • #ai-security
  • #penetration-testing
  • #llm-safety
  • #open-weight-models
  • #agentic-ai
  • #jailbreaking

İlgili yazılar