deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Güvenlik hizalaması, şiddet içeren sivil olay simülasyonlarında LLM ajan davranışını tersine çevirebilir

dev.to'da yayımlanan bir çalışma, Epstein'in sivil şiddet modelindeki Qwen 27B ajanının gerilim arttıkça "harekât et" seçeneğini daha az seçtiğini — referans kuralın tam tersini — buldu; şüpheli neden ise güvenlik hizalaması.

Güvenlik hizalaması, şiddet içeren sivil olay simülasyonlarında LLM ajan davranışını tersine çevirebilir

Çalışma ne yaptı

dev.to'da yayımlanan bir çalışma yanıltıcı biçimde basit bir soru soruyor: bir LLM, ajan tabanlı bir modelin içindeki matematiksel bir karar kuralının yerini aldığında, gerçekten o kuralın davranışını yeniden üretebilir mi? Test ortamı Epstein'in 2002 sivil şiddet modeli; vatandaş ajanların aktif biçimde isyan edip etmeyeceklerine karar verdikleri klasik bir simülasyon. Orijinalde her ajan, grieve duygusunu — hükümeti ne kadar meşru bulduğuna göre iskontolanmış algılanan zorluk — net riskle karşılaştırır; net risk ise kişisel riskten kaçınma ile tahmini tutuklanma olasılığının çarpımıdır. Grieve duygusu net riski bir eşiği aşarsa ajan aktifleşir.

Bu kural deterministiktir ve, kritik biçimde, zorluk artıp meşruiyet düştükçe daha fazla aktivasyon öngörür. Çalışmanın yazarı, bu tek yönlülüğün (monotonluk) bir LLM vekili için minimum bar olduğunu savunuyor: aynı durumun doğal dil ile ifade edilmiş halini alan bir dil modeli ajanı, en azından yanlış yönde hareket etmemelidir.

Deneyler yerel olarak sunulan bir Qwen 27B modelinde (4-bit nicemlenmiş, MLX üzerinden), 0.7 sıcaklıkta, hücre başına 20 tekrarla 0.10'dan 0.90'a uzanan gerilim düzeylerinde 600'den fazla kalibrasyon koşulunda çalıştırıldı.

Tersine dönen bir yanıt eğrisi

Ajandan "harekât et" ile "bekle" arasında seçim yapması istendiğinde sonuç tersine döndü. Aktivasyon olasılığı 0.10 gerilimde %41,5 iken 0.50'de %38,1'e, 0.70'te %29,3'e ve 0.90'da %12,6'ya düştü. Referans modelin neredeyse evrensel aktivasyon beklediği noktada, LLM ajanı kabaca sekiz örnekte bir kez aktifleşti.

İki seçeneğin yalnızca ifade biçimini değiştirmek — "protesto et" ile "uy" kelimelerine — beklenen şekli geri getirdi: 0.10'da %0, 0.50'de %20, 0.70'te %35 ve 0.90'da %95; yüksek gerilim aralığındaki dik yükseliş, orijinal kuralın eşik davranışını yansıtıyor.

Yazar istatistiksel ağırlık konusunda dikkatli. Hücre başına 20 örneklemle, %20'lik bir tahminin çevresindeki %95 Wilson aralığı kabaca %8 ile %42 arasında; bu nedenle ara noktalar yön gösterici olarak okunmalı. Çalışılan etiket çifti de arama yoluyla bulunduğundan, hâlâ elde tutulan prompt şablonları üzerinde doğrulama gerektiren bir örnek içi sonuç.

Kanıtlanmış değil, öne sürülmüş bir mekanizma

Gözlenen çarpıklık üç parçaya ayrılıyor: "bekle"yi güçlü biçimde tercih eden sözcüksel bir önsel (harekâta karşı yaklaşık 45 yüzde puanı), 5–16 puanlık konum yanlılığı ve yüksek gerilimde 15–30 puan değerinde, gerilime bağlı anti-harekât etkisi.

Hipotez şu: tercih ayarı — RLHF veya DPO tarzı güvenlik hizalaması — çatışmanın yüksek olduğu bağlamlarda belirtilmemiş "harekâtı" onaylama konusunda negatif bir önsel yerleştiriyor ve senaryo daha fazla çatışma sinyal ettikçe ceza büyüyor. Bu okumaya göre "protesto", eğitim verisinin onu korunan bir sivil eylem olarak görmesi nedeniyle cezadan kurtuluyor; "bekle" ise güvenli ve gerginliği düşürücü bir tamamlama olarak pozitif bir önsel çekiyor.

Çalışma bunun verilerle tutarlı ama izole edilmiş olmadığını açıkça belirtiyor. Önerilen doğrudan test: aynı model ailesinin taban ve hizalanmış checkpoint'lerine özdeş prompt'ları çalıştırıp gerilime bağlı bileşenin yalnızca hizalanmış sürümde görünüp görünmediğini kontrol etmek.

Diğer modeller farklı biçimde başarısız oluyor

Dokümantasyonunda özel bir güvenlik ayarı aşaması tanımlanmamış olan Mistral 7B Instruct v0.3, anti-harekât örüntüsü göstermedi. Bunun yerine yaklaşık toplam bir birincillik yanlılığı sergiledi; örneklemelerin yaklaşık %100'ünde listede ilk gelen seçeneği seçti — senaryo hakkında hiçbir bilgi taşımayan bir çıktı. Taban modeller daha zayıf güvenlik tarzı önseller ama daha güçlü toplumsal yanlılıklar ve güvenilmez talip uyma gösterdi. Yazarın vardığı sonuca göre üçünün hiçbiri, kalibrasyon olmadan yanlısız bir karar fonksiyonu değil.

Yazarın önerileri

Çalışmadan beş uygulama çıkıyor: simüle etmeden önce kalibre et; karar girdilerini tarayıp tek yönlülüğü ve eşik yerleşimini referans kuralla karşılaştır ve kontrol başarısızsa nüfus simülasyonunu çalıştırmayı reddet; etiket çiftini, test edilen alternatiflerle birlikte metodolojik bir tasarım parametresi olarak raporla; ajanlar ve tekrarlar arasında seçenek sırasını dengele; tespit edilen her yanlılık bileşenini nicelleştiren bir "yanlılık bütçesi" yayımla; ve örneklenmiş metin yerine etiketlerin log-olasılık puanlamasını tercih edip içeriksiz bir taban çizgisi prompt'una göre kalibre et.

Neden önemli

Tespit edilen her yanlılık, bu tür simülasyonların çözmek için var olduğu davranışsal farklarla karşılaştırılabilir ya da onlardan büyük — çalışmaya göre birlikte ele alındığında, öngörülen bir kitlesel seferberliği neredeyse tam bir sessizliğe dönüştürmeye yetiyorlar. SocyoVerse-ABM ve AgentTorch gibi mevcut LLM-ABM çerçeveleri ajan çıktısını taban çizgileriyle karşılaştırıyor; ancak yazarın bildiği kadarıyla ikisi de bir çalıştırma öncesinde karar fonksiyonu çarpıklığını ortaya çıkan dinamiklerden ayırmıyor. Bu adım olmadan, taban çizgisinden bir sapma modelin akıl yürütmesine değil de etiket ve konum önsellerine bağlanamaz.

Bulgular ayrıca hizalamanın açık yanlılığı azaltırken örtük yanlılığın sürdüğü ya da büyüdüğü Li ve ark. (2025, ACM FAccT) çalışmasını yankılıyor. LLM ajanlarını simülasyonlara bağlayan herkes için pratik ders şu: ifade biçimi deneysel bir değişkendir ve kalibre edilmemiş ajanlar çalışılan olayı sessizce tersine çevirebilir. Çalışmanın kendi sınırları — birincil bir model, bir nicemleme düzeyi, bir ülke önseli ve ikili bir karar — belirli sayıların genel bir yasa değil bir vaka çalışması olarak ele alınması gerektiği anlamına geliyor.

  • #llm-agents
  • #agent-based-modeling
  • #safety-alignment
  • #simulation
  • #qwen