· kaynak dev.to (home feed)
Abliterate edilmiş LLM'ler, bilgiyi kaybetmeden önce output sözleşmelerini bozuyor
Üretimden gelen bir dev.to yazısı, sansürsüz 'abliterated' modellerin bilgi veya perplexity hasarı göstermeden çok önce instruction-following ve yapılandırılmış çıktı açısından bozulduğunu ortaya koyuyor.

Abliteration gerçekte neyi değiştiriyor
Abliteration, bir dil modelinin reddetme davranışını ek bir eğitim olmadan kaldırmaya yarayan bir teknik. Grunzai adıyla yazan geliştiricinin dev.to'daki yazısına göre yöntem, modelin activation space'inde reddetme davranışını kodlayan yönü tespit edip ağırlıklardan dışarı projeksiyonluyor — gradient adımı ve eğitim verisi içermeyen doğrudan bir ağırlık düzenlemesi bu.
Yazı çarpıcı bir önkabulle başlıyor: Hugging Face artık binlerce abliterated varyanta ev sahipliği yapıyor. Yazarın iddiasına göre değerlendiriciler genellikle bu düzenlemenin biraz genel zekâyı uyuma takas ettiğini varsayıyor; dolayısıyla modelin hâlâ bilgi sorularını yanıtlayıp yanıtlamadığını ve hâlâ iyi yazıp yazamadığını kontrol ediyorlar.
Bilgiye değil önce itaate zarar geliyor
Yazarın, resmi bir çalışmadan değil bu modelleri üretimde sunma deneyiminden çıkardığı merkezî iddia, ilk zararın bilgi değil instruction-following tarafında olduğudur. Varyantlar ve model aileleri genelinde ölçülebilir biçimde aşınan nitelikler arasında şunlar var: chat template ve prefill'e sadık kalma, belirtilen stop token'larında durma, JSON şeması veya tool-call sözdizimi gibi yapılandırılmış çıktı sözleşmesinin içinde kalma ve uzun bir bağlam boyunca system-prompt kısıtını koruma.
Bilginin kendisi büyük ölçüde hayatta kalıyor. Yazar, MMLU sonuçları taban modellerden pek farklı olmayan ama yapılandırılmış çıktı hata oranları belirgin biçimde artan modellerden bahsediyor — model bilgiye hâlâ sahip ama talimatlara daha az güvenilir biçimde uyuyor.
Alışılmış kontroller bunu neden göremiyor
Yazıya göre tipik bir inceleme oturumu — modelle sohbet etme, reddetmediğini doğrulama, düzyazıyı değerlendirme — bunu tespit edemez. Model daha önce olduğundan daha iyi bile hissettirebilir, çünkü sohbeti bölen reddetmeler artık yok. Başarısızlıklar ancak bir downstream sistem çıktıyı parse etmeye başladığında ortaya çıkar.
Perplexity de uyarı vermiyor. Genel bir corpus üzerinde format uyumu çökerken bile neredeyse kıpırdamıyor; yani metrik uygulama kırılırken sağlık sinyali veriyor.
Uyumun ayrı ölçülmesi
Yazı somut bir protokol öneriyor: format uyumunu cevap kalitesinden ayrı test edin ve doğruluktan bağımsız puanlayın. Tarif şöyle:
- Her biri kesin bir çıktı sözleşmesi belirten bir dizi istek gönderin.
- İçeriğin doğru olup olmadığına değil, o sözleşmeye ikili (binary) uyuma puan verin.
- Varyantlar ve quantization'lar arasında karşılaştırılabilecek bir uyum oranı raporlayın.
Doğruluktan bağımsızlık kilit özellik: iyi biçimlendirilmiş bir yanlış cevap tam puan alır, şemayı bozan düzyazıya sarılı bir doğru cevap ise sıfır alır. Downstream'de bir parser varsa önemli olan rakam budur; yazar bu ölçümün, chat penceresinde aynı görünen varyantları ayırt edeceğini söylüyor.
Quantization hakkında açıkça test edilmemiş bir sezgi
Yazıdaki iddialardan biri, yazar tarafından henüz düzgün ölçmediği bir sezgi olarak işaretleniyor: abliterated modeller, format uyumu açısından değerlendirildiğinde, quantization sertleştikçe taban modellerinden daha hızlı bozuluyor gibi görünüyor. Önerilen mekanizma şu: abliteration ağırlık dağılımının bazı kısımlarını zaten basitleştirmiş durumda; quantization'ın getirdiği yuvarlamaya daha az marj bırakıyor. Pratikte yazar, küçük modellerde q6_K ve üzerinde daha iyi şans yaşadığını bildiriyor ve bir 4B modelin q8_0 derlemesinin yalnızca 4.3GB civarında olduğunu, yani daha aşağı inmenin görünür maliyete kıyasla pek bir şey kazandırmadığını not ediyor. Düzgün bir test, yazıya göre, bir taban model ile abliterated karşılığını aynı calibration setiyle aynı bits-per-weight seviyesine quantize edip perplexity yerine uyum oranlarını karşılaştırmalı.
Bu modelleri kullanan ekiplere öneriler
Üç öneri çıkıyor ortaya. Biçim kaymalarına tahammül eden tool-call parser'ları kurun, çünkü katı bir parser telafi edilebilir bir kaymayı başarısız bir çalışmaya dönüştürür. Grammar-constrained decoding'e güvenin; bu, modelin niyetine güvenmek yerine token düzeyinde hatalı biçimlendirilmiş çıktıyı tamamen dışlar. Ve uyum oranını kendi başına rapor edilen bir metrik olarak izleyin, çünkü yanlış olduğu için başarısız olan bir çalışma ile hatalı biçimlendirilmiş olduğu için başarısız olan bir çalışma farklı çözümler gerektirir.
Yazar ayrıca konumunu da açıklıyor: bu modelleri sunan Grunz adlı bir hizmeti geliştiriyor ve bulguları bir makaleden değil üretimden gelen dersler olarak tanımlıyor.
Neden önemli
Sansürsüz modeller giderek daha fazla, her yanıtı makine tarafından okunan agent'lara ve pipeline'lara bağlanıyor. Eğer abliteration bilgiye dokunmadan önce instruction-following'e zarar veriyorsa, insanların çoğunun yaptığı değerlendirmeler — bilgi benchmark'ları, sohbet üzerinden hızlı kontroller, perplexity — daha sonra üretimde kırılacak bir modele onay verecek. Doğruluktan ayrı ölçülen ucuz, ikili bir uyum oranı bu başarısızlık modunu erken yakalar. Quantization sezgisi doğru çıkarsa, yerel kullanıcılar için deployment hesabını da değiştirir ve abliterate edilmiş ağırlıklar için yüksek bitli quant'ları orantısız biçimde değerli kılar. Yazı aynı zamanda ekosistemdeki bir boşluğu da gözler önüne seriyor: binlerce genel varyantı olan bir model ailesi hâlâ sistematik ölçümle değil, tek bir operatörün üretim notlarıyla karakterize ediliyor.
- #llms
- #model-evaluation
- #quantization
- #structured-output
- #uncensored-models