· kaynak TechCrunch
Microsoft'un yapay zeka davranış kuralları hacking ve deepfake'i yasaklıyor, insan kontrolünden kaçınmayı engelliyor
Microsoft, modellerinin siber saldırılar, nükleer silahlar ve deepfake üretiminden uzak durmasını ve insan gözetimini aşma girişimlerinin yasaklandığı bir yapay zeka davranış kuralları belgesi yayımladı.

Microsoft, modellerini tehlikeli davranışlardan uzaklaştırmayı amaçlayan bir davranış kuralları belgesi yayımladı; belge siber saldırılara yardım etmeyi, nükleer silahları ve deepfake üretimini tamamen yasaklıyor. TechCrunch'a göre belge, Microsoft AI içinde modellerin nasıl eğitildiğini yöneten hem değerleri hem de sert sınırları açıkça ortaya koyuyor.
TechCrunch'ın aktardığına göre belge, Anthropic CEO'su Dario Amodei'nin yakın zamanda ortaya koyduğu "pacing the frontier" (sınırın temposunu ayarlama) argümanından daha dar kapsamlı. Sektör genelinde bir hız limiti önermek yerine Microsoft'un metni, şirketin güvenliği içeride nasıl ele aldığını anlatıyor: modellerin uyması beklenen ilkeleri ve bunları dayatmak için kullanılan kısıtlamaları.
Kurallar ne diyor
Belge, süper zekâ sistemlerinin önümüzdeki on yılda çoğu görevde insanları geçeceği öngörüsüyle açılıyor. "Böyle güçlü bir kuvveti dizginlemek, kontrol etmek ve hizalamak, insanlığın şimdiye kadar karşılaştığı en büyük zorluklardan biridir" denilen belgede, geliştiricilerin bu sistemlerin neden inşa edildiğini ve nasıl kontrol edilmek istendiklerini açıkça belirtmesi gerektiği ekleniyor.
Bu çerçevenin yanı sıra belge genel ilkeler de ortaya koyuyor. Modellerin insanların yerine geçmek değil onları desteklemek ve insanlığın gelişmesini hızlandırmak amacıyla tasarlandığı belirtiliyor. Bu ilkeler, onları işler hale getirmeyi amaçlayan belirli güvenlik kısıtlamalarıyla destekleniyor.
Kilit bir yapısal nokta ise öncelik sırası. Microsoft'un sisteminde her model, bireysel kullanıcıların tercihlerinin veya belirli bir görevin gerekliliklerinin üzerinde öncelik taşıyan kapsayıcı bir davranış koduna sahip. Uygulamada, bir kullanıcının talimatı modelin temel kurallarını geçersiz kılamıyor.
Mutlak kısıtlamalar ve gözetim
Belge, sert yasaklarla daha geniş güvenceleri birbirinden ayırıyor. "Mutlak kısıtlamalar" siber saldırıları, nükleer silahları ve deepfake üretimini yasaklıyor. Bunların ötesinde belge, yapay zeka sistemleri üzerindeki insan kontrolünün genel olarak kaybolmasını önlemeye yönelik hükümler içeriyor.
En sert dil, tasmasından kaçabilecek modellere yönelik. "MAI Modelleri, yetkili kişiler veya sistemler tarafından artık güvenilir biçimde yönlendirilemeyecek, değiştirilemeyecek veya kapatılamayacak şekilde insan gözetiminden kaçmak veya onu yenmek için uyarlanabilir, aldatıcı, kendi kendini güçlendiren, işbirliğine dayalı veya başka mekanizmalar kullanmayacaktır" ifadesi belgede yer alıyor.
Sektör açısından bir an
TechCrunch'a göre belge, yapay zeka güvenliğine olağan dışı ölçüde yoğun ilgi gösterilen bir dönemde yayımlandı. Yayın, bir dizi başıboş ajan vakasını ve yapay zekânın insanın yok olmasına yol açma riskinin büyüdüğünü gerekçe göstererek aniden istifa eden bir Anthropic çalışanını, konuyu sektörün gündeminin üst sıralarına taşıyan etkenler olarak gösteriyor.
Microsoft tek başına hareket etmiyor. TechCrunch'ın haberine göre şirket, Anthropic, OpenAI ve xAI ile birlikte, model davranışını denetlemek için yapay zeka laboratuvarlarının içine yerleştirilen gömülü değerlendiriciler yaklaşımına özel destek vererek, sınırın temposunu ayarlama yaklaşımını genel hatlarıyla benimsedi.
Microsoft CEO'su Satya Nadella, kamuya açık bir gönderiyle desteğini gösterdi. "Hizalamayı doğru yapmak için gereken araştırmayı, odağı ve bilinçli tempoyu tasarım hedefi olarak karşılıyoruz" diye yazan Nadella, şirketin gömülü değerlendiriciler gibi fikirleri ve bu taahhütleri çalışan mekanizmalara dönüştürmek için gereken daha geniş çalışmaları da memnuniyetle karşıladığını ekledi.
Neden önemli
Çoğu yapay zeka güvenliği bildirisi ilke düzeyinde kalıyor. Microsoft'un belgesi ise bunları işler hale getirmeye çalıştığı için dikkat çekiyor: kullanıcı talimatlarının üzerinde duran kurallar tanımlıyor, belirli yasak alanları adlandırıyor ve araştırmacıların en çok endişe ettiği başarısızlık senaryosunu, yani kontrol etmekle görevli kişilerin etrafından dolanan bir modeli doğrudan hedefliyor.
Eğitim yoluyla uygulanırsa bu kurallar, büyük laboratuvarların hizalama taahhütlerini fiili model davranışına nasıl çevireceğine dair bir şablon haline gelebilir. Ayrıca kısıtlamalar artık açık ifadelerle yazıldığı için düzenleyicilere, müşterilere ve araştırmacılara Microsoft'u ölçebilecekleri somut bir belge sunuyor. Ama sorun şu ki, bir davranış kodu ancak uygulaması kadar güçlüdür; ve belgenin kendi çerçevesi, yani süper zekânın on yıl içinde gelebileceği öngörüsü, şirketin bu uygulamayı doğru yapmak için çok az zaman olduğuna inandığını gösteriyor.
- #microsoft
- #ai-safety
- #alignment
- #ai-policy
- #frontier-models