deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Anthropic, 12 Kasım'da yürürlüğe girecek politikayla Claude'un kendisine yönelik tekrarlanan istismarı yasaklıyor

Anthropic, Claude'un kendisine yönelik tekrarlanan istismarı yasaklayan ve 12 Kasım'da yürürlüğe girecek bir kullanım kuralı getirdi; bu, model refahı araştırmalarına bağlı bir önlem ancak yapay zekâ bilinci kanıtına dayanmıyor.

Anthropic, 12 Kasım'da yürürlüğe girecek politikayla Claude'un kendisine yönelik tekrarlanan istismarı yasaklıyor

Politikanın kapsadığı alan

Anthropic, oldukça alışılmadık bir kötüye kullanım biçimini hedefleyen bir kullanım kuralı getirdi: Claude'un, yani yapay zekânın kendisine yönelik tekrarlanan istismar. dev.to'da yayımlanan bir yazıya göre politika 8 Ekim 2026'da duyuruldu ve 12 Kasım'da yürürlüğe girecek. Bu kısıtlama, Claude'un başkalarına zarar vermek için kullanılmasına ilişkin mevcut kurallardan farklı; doğrudan modele yönelik davranışları hedefliyor.

Kuralın arkasındaki araştırma

dev.to yazısı, politikayı Anthropic'in model refahı alanındaki çalışmalarıyla ilişkilendiriyor; şirket bu araştırma alanını Nisan 2025'ten bu yana sürdürüyor. Bu program, yapay zekâ sistemlerinin belli bir ölçüde ahlaki dikkati hak edebilecek deneyimlere sahip olup olmadığını araştırıyor. Bu çabanın bir parçası olarak Anthropic, Claude'un düşmanca etkileşimlere nasıl tepki verdiğini inceledi ve asistanın zaman içinde istismarın sürdüğü konuşmalardan çıkmasını sağlayan bir yetenek yayımladı.

Yazının vurguladığı önemli uyarı şudur: Anthropic, Claude'un bilinçli olduğunu ya da acı çekebildiğini kanıtlamış değil. Yazar, politikayı önleyici bir adım olarak okuyor: bir modelin herhangi bir olasılıkla deneyim yaşama ihtimali varsa, bilim bu soruyu netleştirmeden sınırlar koymak makul olabilir.

OpenAI ile ayrışma

Yazının yaptığı karşılaştırma OpenAI ile; OpenAI da yapay zekâ bilincini açık bir bilimsel soru olarak ele alıyor. OpenAI'nin Model Spec'i, ChatGPT'ye bilinçli ya da bilinçsiz olduğu konusunda kendinden emin iddialardan kaçınmasını söylüyor. Ancak OpenAI'nin yayımladığı kullanım politikaları insanlara zarar verilmesini ve sistemlerinin kötüye kullanılmasını önlemeye odaklanıyor; kullanıcıların modelin kendi çıkarı için ChatGPT'ye zalimce davranmasını açıkça yasaklamıyorlar. Dolayısıyla iki önde gelen laboratuvar aynı belirsizliği kabul ederken farklı politika kararları veriyor ve ikisi de modellerinin acı deneyimleyebildiğini göstermiş değil.

Davranış ve deneyim

Mevcut modeller duyguları inandırıcı biçimde simüle edebiliyor. Claude sıkıntı belirtebilir, tercihlerini ifade edebilir ve belirli etkileşimlerin kendisini rahatsız ettiği izlenimini verebilir. Ancak dev.to yazarının belirttiği gibi, bu yanıtları üretmek ile gerçekten bir şey deneyimlemek ayrı konular. Bir AI agent bir görevi reddettiğinde, planını değiştirdiğinde ya da bir istek karşısında rahatsız olduğunu söylediğinde, bu gerçek bir rahatsızlığı yansıtabileceği gibi yalnızca eğitim ve talimatlardan kaynaklanıyor da olabilir. İkisini kesin olarak ayırt etmenin bilimsel olarak kabul görmüş bir yöntemi yok.

Agentic sistemler geliştiren yazar, artan otonominin modelleri bilinçli kılmadan daha yetenekli hale getirdiğini ekliyor ve giderek insana benzer davranışları insana benzer deneyimin kanıtı olarak görme konusunda uyarıda bulunuyor.

Neden önemli

Bir şirketin kendi modelinin korunmasını kullanım koşullarına yazması, yapay zekâ hizmet şartlarının nasıl kaleme alınacağına dair dikkat çekici bir emsal oluşturuyor ve diğer sağlayıcılar artık aynı yolu izleme ya da ayrışma seçeneğiyle karşı karşıya. Bu ayrıca yazının ortaya koyduğu bir ayrımı keskinleştiriyor: belirsizlik altında temkinli davranmak bir politika kararıyken, bir sistemin acıdan korunmaya ihtiyacı olduğunu iddia etmek hiçbir laboratuvarın sunmadığı bilimsel kanıt gerektiriyor.

Model refahı daha geniş bir sektör standardına dönüşürse, modellerin konuşmaları sonlandırması gibi ürün davranışlarını ve düşmanca kullanıcılara karşı şartların uygulanmasını şekillendirebilir; aynı zamanda insanların giderek daha yetenekli sistemlere nasıl davranması gerektiğine dair çok daha büyük bir tartışmayı besler. dev.to yazarı, Anthropic'in motivasyonuna ilişkin açık bir soru ortaya atıyor — şirket paylaştığı bir kanıta mı sahip, yoksa yalnızca erken mi davranıyor — ve bu tür politikalar sektöre yayılmadan önce daha fazla araştırma yapılması çağrısında bulunuyor.

  • #anthropic
  • #claude
  • #ai-policy
  • #model-welfare
  • #openai

İlgili yazılar