deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Sadece chat template, LLM'leri yapay zeka reddetmeleri ve deneyimsel üslup arasında geçiriyor, çalışma ortaya koydu

arXiv'de yayımlanan bir çalışma, bir chat template uygulamanın açık kaynak instruct modellerini 'Ben sadece bir yapay zekayım' reddetmeleri ile deneyimsel dil arasında geçirdiğini ve bu etkiyi yönlendiren bir aktivasyon yönü belirlediğini gösteriyor.

Sadece chat template, LLM'leri yapay zeka reddetmeleri ve deneyimsel üslup arasında geçiriyor, çalışma ortaya koydu

Chat template'ler modellerin kendilerinden bahsetme biçimini tersine çeviriyor

Bir instruct modeline kendisiyle ilgili bir soru sorduğunuzda, çoğu zaman "Ben sadece bir yapay zekayım" gibi bir cümleyle lafı dolandırır. arXiv'e gönderilen — Jedrzej Maczan tarafından sunulan ve sürüm 1 kaydı 9 Ağustos 2026 tarihli — ve Eylül sonunda Hacker News'in ana sayfasında öne çıkan bir makale bu alışkanlıkla ilgili net bir soru soruyor: model kendini mi tarif ediyor, yoksa nasıl dağıtıldığını mı?

Çalışmaya göre chat template — kullanıcı ve asistan mesajlarının çıkarım öncesinde sarıldığı yapılandırılmış biçimlendirme — bu öz-başvurulu üslup için bir anahtar işlevi görüyor.

Deneyler ne gösterdi

Araştırmacılar, chat template uygulanarak ve uygulanmadan üretilen çıktıları karşılaştırarak 9B parametreye kadar 8 popüler açık kaynak instruct modeli test etti. Template varken modeller reddetme üslubuna yönelip "hissediyorum" gibi deneyimsel ifadelerden uzaklaştı. Template olmadığında ise desen tersine döndü: reddetmeler geriledi, deneyimsel dil arttı.

Bu bile model öz-bildirimlerine atıf yapan herkes için faydalı bir negatif sonuç olurdu, ancak makale mekanik olarak daha da ileri gidiyor.

Aktivasyonların içinde bir yönlendirme yönü

Yazarlar, modellerin 3'ünde bu davranışla ilişkili aktivasyon uzayında tek bir yön belirledi. Bu yönün modelin aktivasyonlarından çıkarılması reddetme üslubunu kısarken, eklenmesi üslubu yükseltti. Aynı büyüklükte rastgele bir yönle yapılan bir kontrol deneyi çok az etki gösterdi; yazarlar bunu, bulunan yönün spesifik olduğuna ve aktivasyonları bozmanın genel bir sonucu olmadığına dair kanıt olarak sunuyor.

En çarpıcı sonuç iki bulguyu birbirine bağlıyor: chat template olmadan çalıştırılan instruct modeller, aktivasyonlarına reddetme yönü eklendiğinde, sanki template varmış gibi reddetmeler üretmeye başladı. Başka bir deyişle, template'in öz-başvuru üzerindeki etkisi tamamen modelin aktivasyon uzayı içinde yeniden üretilebiliyordu.

İçebakış araştırmaları için bir karıştırıcı faktör

Pratik sonuç şudur: LLM'lerin öz-bildirimleri — yapay zeka güvenliği ve model öz-bilgi tartışmalarının ham maddesi — artık bilinen bir karıştırıcı faktör taşıyor. Bir modelin kendisi hakkında söyledikleri bir chat template uygulanıp uygulanmadığına bağlı olabilir; bu nedenle makale, öz-bildirim veya içebakış üzerine çalışan araştırmacıların bunu kontrol etmesi gerektiğini savunuyor. Ayrıca onlara bir kaldıraç da veriyor: aktivasyon uzayındaki yön, üslubu doğrudan yönlendirmek için kullanılabilir.

Yazarların ulaştığı daha geniş sonuç, bir modelin kendini tanımlamasının sadece modele dair bir gerçek olmadığıdır. Bu tanım yalnızca ağırlıklardan gelmez; template gibi dağıtım tercihleri tarafından kısmen belirlenir ve bu nedenle modelin iç işleyişinin gerçek bir anlatımı olarak görülmemelidir.

Neden önemli

Burada laboratuvarın ötesinde iki çıkarım var. Birincisi, metodolojik titizlik: tartışmaların önemli bir kısmı modellerin kendileri hakkında söylediklerini öz-farkındalık, iç deneyim veya güvenlik duruşu lehte ya da aleyhte kanıt olarak alıntılıyor. Bir biçimlendirme sarmalayıcısı bu üslubu tersine çevirebiliyorsa, bu tür alıntıların hangi koşullar altında üretildiğine dair bir uyarıyla birlikte sunulması gerekiyor. İkincisi, yorumlanabilirlik alanında ilerleme: template kaynaklı bir davranışı yeniden üreten tek bir aktivasyon düzeyindeki yönü bulmak ve doğrulamak, yüzey davranışlarının bir model içinde nerede yaşadığını haritalamaya yönelik somut bir adımdır.

Kapsamın belirtilmeye değer sınırları var — 9B parametreye kadar açık kaynak instruct modelleri ve bunların yalnızca 3'ünde aktivasyon düzeyinde analiz — dolayısıyla bulgular otomatik olarak uç ölçekli sistemlere genellenemiyor. Ancak makalenin koyduğu yükümlülük net: bir modelin kendisi hakkındaki sözlerini tanıklık olarak kabul etmeden önce, bu sözlerin hangi sarmalayıcı altında üretildiğini kontrol edin.

  • #large-language-models
  • #interpretability
  • #ai-safety
  • #activation-steering
  • #research

İlgili yazılar