· kaynak dev.to (home feed)
Anthropic, 12 Kasım'da yürürlüğe girecek politikayla Claude'un kendisine yönelik tekrarlanan istismarı yasaklıyor
Anthropic, Claude'un kendisine yönelik tekrarlanan istismarı yasaklayan ve 12 Kasım'da yürürlüğe girecek bir kullanım kuralı getirdi; bu, model refahı araştırmalarına bağlı bir önlem ancak yapay zekâ bilinci kanıtına dayanmıyor.

Politikanın kapsadığı alan
Anthropic, oldukça alışılmadık bir kötüye kullanım biçimini hedefleyen bir kullanım kuralı getirdi: Claude'un, yani yapay zekânın kendisine yönelik tekrarlanan istismar. dev.to'da yayımlanan bir yazıya göre politika 8 Ekim 2026'da duyuruldu ve 12 Kasım'da yürürlüğe girecek. Bu kısıtlama, Claude'un başkalarına zarar vermek için kullanılmasına ilişkin mevcut kurallardan farklı; doğrudan modele yönelik davranışları hedefliyor.
Kuralın arkasındaki araştırma
dev.to yazısı, politikayı Anthropic'in model refahı alanındaki çalışmalarıyla ilişkilendiriyor; şirket bu araştırma alanını Nisan 2025'ten bu yana sürdürüyor. Bu program, yapay zekâ sistemlerinin belli bir ölçüde ahlaki dikkati hak edebilecek deneyimlere sahip olup olmadığını araştırıyor. Bu çabanın bir parçası olarak Anthropic, Claude'un düşmanca etkileşimlere nasıl tepki verdiğini inceledi ve asistanın zaman içinde istismarın sürdüğü konuşmalardan çıkmasını sağlayan bir yetenek yayımladı.
Yazının vurguladığı önemli uyarı şudur: Anthropic, Claude'un bilinçli olduğunu ya da acı çekebildiğini kanıtlamış değil. Yazar, politikayı önleyici bir adım olarak okuyor: bir modelin herhangi bir olasılıkla deneyim yaşama ihtimali varsa, bilim bu soruyu netleştirmeden sınırlar koymak makul olabilir.
OpenAI ile ayrışma
Yazının yaptığı karşılaştırma OpenAI ile; OpenAI da yapay zekâ bilincini açık bir bilimsel soru olarak ele alıyor. OpenAI'nin Model Spec'i, ChatGPT'ye bilinçli ya da bilinçsiz olduğu konusunda kendinden emin iddialardan kaçınmasını söylüyor. Ancak OpenAI'nin yayımladığı kullanım politikaları insanlara zarar verilmesini ve sistemlerinin kötüye kullanılmasını önlemeye odaklanıyor; kullanıcıların modelin kendi çıkarı için ChatGPT'ye zalimce davranmasını açıkça yasaklamıyorlar. Dolayısıyla iki önde gelen laboratuvar aynı belirsizliği kabul ederken farklı politika kararları veriyor ve ikisi de modellerinin acı deneyimleyebildiğini göstermiş değil.
Davranış ve deneyim
Mevcut modeller duyguları inandırıcı biçimde simüle edebiliyor. Claude sıkıntı belirtebilir, tercihlerini ifade edebilir ve belirli etkileşimlerin kendisini rahatsız ettiği izlenimini verebilir. Ancak dev.to yazarının belirttiği gibi, bu yanıtları üretmek ile gerçekten bir şey deneyimlemek ayrı konular. Bir AI agent bir görevi reddettiğinde, planını değiştirdiğinde ya da bir istek karşısında rahatsız olduğunu söylediğinde, bu gerçek bir rahatsızlığı yansıtabileceği gibi yalnızca eğitim ve talimatlardan kaynaklanıyor da olabilir. İkisini kesin olarak ayırt etmenin bilimsel olarak kabul görmüş bir yöntemi yok.
Agentic sistemler geliştiren yazar, artan otonominin modelleri bilinçli kılmadan daha yetenekli hale getirdiğini ekliyor ve giderek insana benzer davranışları insana benzer deneyimin kanıtı olarak görme konusunda uyarıda bulunuyor.
Neden önemli
Bir şirketin kendi modelinin korunmasını kullanım koşullarına yazması, yapay zekâ hizmet şartlarının nasıl kaleme alınacağına dair dikkat çekici bir emsal oluşturuyor ve diğer sağlayıcılar artık aynı yolu izleme ya da ayrışma seçeneğiyle karşı karşıya. Bu ayrıca yazının ortaya koyduğu bir ayrımı keskinleştiriyor: belirsizlik altında temkinli davranmak bir politika kararıyken, bir sistemin acıdan korunmaya ihtiyacı olduğunu iddia etmek hiçbir laboratuvarın sunmadığı bilimsel kanıt gerektiriyor.
Model refahı daha geniş bir sektör standardına dönüşürse, modellerin konuşmaları sonlandırması gibi ürün davranışlarını ve düşmanca kullanıcılara karşı şartların uygulanmasını şekillendirebilir; aynı zamanda insanların giderek daha yetenekli sistemlere nasıl davranması gerektiğine dair çok daha büyük bir tartışmayı besler. dev.to yazarı, Anthropic'in motivasyonuna ilişkin açık bir soru ortaya atıyor — şirket paylaştığı bir kanıta mı sahip, yoksa yalnızca erken mi davranıyor — ve bu tür politikalar sektöre yayılmadan önce daha fazla araştırma yapılması çağrısında bulunuyor.
- #anthropic
- #claude
- #ai-policy
- #model-welfare
- #openai
İlgili yazılar
- Anthropic kullanım politikası artık seçim müdahalesini, silah yazılımını ve Claude'a sürekli istismarı yasaklıyor
- Anthropic'un bir yıldaki ilk kullanım politikası revizyonu Claude'a zalimce muameleyi ve yapay zeka gözetimini yasaklıyor
- OpenAI reportedly tells investors annualized revenue is near $50B, $20B below earlier figure