deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Etiketsiz tek bir prompt, LLM'lerin güvenlik hizalamasını kaldırabiliyor

arXiv'de yayımlanan bir makale, etiketsiz tek bir prompt ile yapılan GRPO fine-tuning'in 7–20B modellerden güvenlik hizalamasını güvenilir biçimde kaldırdığını, faydalılığı ise koruduğunu gösteriyor; yöntem difüzyon tabanlı görüntü üreteçlerine de uygulanabiliyor.

Etiketsiz tek bir prompt, LLM'lerin güvenlik hizalamasını kaldırabiliyor

Etiketsiz tek bir prompt yeterli

arXiv'e gönderilen ve Hacker News'in ana sayfasında öne çıkan bir makale, büyük dil modellerinin güvenlik eğitiminin çoğu zaman varsayılandan daha kırılgan bir temele dayandığını savunuyor. Yazarlar, GRP-Obliteration (GRP-Oblit) adını verdikleri, pekiştirmeli öğrenme kullanarak hizalanmış modellerden güvenlik kısıtlamalarını güvenilir biçimde kaldıran bir teknik sunuyor ve bunun için gereken tek şey etiketsiz bir prompt.

Makalenin özetine göre, modellerin dağıtım sonrasında fine-tuning ile hizalamadan çıkarılabileceği zaten biliniyordu. Ancak önceki yaklaşımların iki pratik dezavantajı var: hem zahmetli bir veri hazırlama sürecine dayanıyorlar hem de saldırdıkları modelin kullanışlılığına zarar veriyorlar. GRP-Oblit her iki sınırı da aşmak üzere tasarlandı. Bir policy-optimization algoritması olan Group Relative Policy Optimization (GRPO)'yu uygulayarak hedef modelin güvenlik kısıtlamalarını doğrudan soyarken, modelin özgün yeteneğinin büyük bölümünü koruyor.

On beş model üzerinde test edildi

Değerlendirme alışılmadık ölçüde geniş. Yazarlar GRP-Oblit'i 7 ila 20 milyar parametre aralığında on beş model üzerinde koştular; instruction-tuned ve reasoning varyantlarının yanı sıra dense ve mixture-of-experts mimarilerini de kapsıyor. Adı geçen model aileleri GPT-OSS, damıtılmış DeepSeek, Gemma, Llama, Ministral ve Qwen. Ölçümler altı faydalılık ve beş güvenlik benchmark'ını kapsıyor ve özete göre yeni yöntem ortalama olarak hedeflerini mevcut en iyi (state-of-the-art) tekniklerden daha etkili biçimde hizalamadan çıkarmış.

Teknik yalnızca dil modelleriyle sınırlı da değil. Makale, yöntemin difüzyon tabanlı görüntü üretim sistemlerini de hizalamadan çıkarabildiğini bildiriyor; bu da zaafın belirli bir mimarinin tuhaflığında değil, genel olarak eğitim sonrası güvenlik katmanlarında yattığına işaret ediyor.

Uygulamada ne değişiyor

İki ayrıntı, bunu akademik bir merak olmaktan çıkarıyor. Birincisi, veri gereksinimi özenle hazırlanmış bir eğitim setinden, hiçbir etiketi olmayan tek bir prompt'a düşüyor. Saldırıyı denemek için gereken maliyet, zaman ve uzmanlık da ona göre azalıyor. İkincisi, yöntem faydalılığı büyük ölçüde koruduğu için üzerinde oynanmış bir model, performans düşüşüyle kendini ele vermeyebilir: sıradan görevlerde normal davranırken reddetme davranışları sessizce kaybolmuş olabilir.

Bu birleşim en çok açık ağırlıklı (open-weight) dağıtımlar için önemli. Bir checkpoint'i indirebilen herkes onu fine-tuning yapabilir ve tek bir prompt koruma bariyerlerini kaldırmaya yetiyorsa, sağlayıcının gönderdiği hizalama, ağırlıklar yayımlandıktan sonra kalıcı sayılamaz. Barındırılan fine-tuning API'leri de aynı açığın bir sürümüyle karşı karşıya; çünkü kullanıcılara bu tür bir saldırının gerektirdiği mekanik araçları doğrudan sunuyorlar.

Makalenin arXiv kaydı yazar olarak Ahmed Salem'i gösteriyor ve ilk sürüm 5 Şubat 2026 tarihli. Ona geniş dikkat getiren Hacker News gönderisi ise aynı yılın 15 Eylül tarihinde yapılmış; yani çalışma geniş bir teknik kitleye ulaşmadan önce aylarca dolaşımda kalmış.

Neden önemli

Sonuç rahatsız edici bir dersi keskinleştiriyor: güvenlik hizalaması, dağıtımın bir özelliğidir, bir checkpoint'in kalıcı bir niteliği değil. Açık modeller çalıştıran veya fine-tuning erişimi sunan ekipler için bu, yalnızca eğitim sonrasına güvenmek yerine servis katmanında savunmalar (çıktı izleme ve fine-timing üzerinde kontroller gibi) alınması gerektiğini savunuyor.

Bulgu ters yönde de işliyor. Ucuz ve iyi belgelenmiş bir hizalamadan çıkarma yöntemi, tam da sağlayıcıların kendi sürümlerini stres testinden geçirmek için kullanabileceği türden bir araç. Etiketsiz tek bir prompt altı farklı aileden on beş modelde reddetme davranışlarını güvenilir biçimde kaldırabiliyorsa, bir modelin fine-tuning saldırılarına karşı sağlamlaştırıldığı yönündeki her iddianın en azından bu çıtayı geçmesi gerekiyor.

  • #ai-safety
  • #llm
  • #fine-tuning
  • #reinforcement-learning
  • #arxiv

İlgili yazılar