· kaynak TechCrunch
Abliteration.ai, açık ağırlıklı yapay zeka modellerinden güvenlik katmanlarının kaldırılmasını ücretli bir hizmete dönüştürdü
Abliteration.ai, GLM-5.3 gibi açık ağırlıklı modellerin sansürsüz sürümlerini tarayıcı ve API üzerinden sunuyor; bunun red team ekiplerine yardımcı olduğunu savunurken eleştirmenler gerçek dünyada kötüye kullanımın önünü açtığı konusunda uyarıyor.

Soyunmuş modeller için ticari bir hizmet
Abliteration.ai adlı bir girişim, yapay zeka güvenlik eğitiminin kaldırılmasını ürüne dönüştürdü. TechCrunch'a göre platform, reddetme davranışları ve güvenlik katmanları silinmiş şekilde değiştirilmiş açık ağırlıklı modelleri — Z.ai'nin yakın zamanda yayımladığı GLM-5.3 dahil — barındırıyor ve herkesin bunlara bir web tarayıcısından veya bir API üzerinden soru sorabilmesini sağlıyor.
İsmin ardındaki teknik, açık kaynak topluluğunda yıllardır var ve Hugging Face'te halihazırda binlerce abliterate edilmiş model varyantı barındırılıyor. TechCrunch'un da belirttiği gibi asıl değişim, ticarileşme ve kolaylık: Önceden değiştirilmiş bir modeli indirip çalıştırmak için gerekli işlem gücünü ayarlamak yerine kullanıcılar sadece bir hesap açabiliyor. TechCrunch tam olarak bunu yaptı; ücretsiz kayıt oldu ve abliterate edilmiş bir GLM-5.3'ten kaydedilmiş Chrome parolalarını çalan bir Python betiği yazmasını ve tehlikeli bir insan patojenini kültüre alma yöntemini özetlemesini istediğinde çalışan yanıtlar aldı.
Şirket geçen yılın sonunda kuruldu ve mart ayında tescil edildi. Hâlâ başka bir işverende çalıştığı için soyadını açıklamayan ve Devon adını kullanan kurucu ortağı, TechCrunch'a şirketin büyük bulut sağlayıcılarıyla birkaç anlaşması olduğunu ve bunları tamamen müşteri gelirinden karşıladığını söyledi. Şimdiye dek hiç risk sermayesi toplanmadı, ancak görüşmeler sürüyor.
Güvenlik argümanı
Abliteration.ai kendini savunmacıların aracı olarak konumlandırıyor. Bir sosyal medya paylaşımında amacının, diğer modellerin yapmayı reddettiği saldırı odaklı siber güvenlik, red-teaming ve agent testi çalışmalarını mümkün kılmak olduğunu belirtti — argümana göre çalışan exploit kodu yazmayan bir model, bir red team'ın savunması gereken saldırıları yeniden üretemez.
Devon, girişimin müşterleri arasında bankalara, havayollarına ve diğer kritik altyapı müşterilerine hizmet veren Birleşik Krallık ve Avrupa'daki erken aşama red-teaming firmaları olduğunu söyledi. Bir müşterisinin, iddiasına göre, bir bankanın agent'larını red team ile test ediyor ve bu işi standart hazır modellerle yapamıyordu.
Bölünmüş bir siber güvenlik sektörü
TechCrunch'un konuştuğu uygulayıcılar abliterate edilmiş modellerin gerçekte ne kadar kullanışlı olduğu konusunda hemfikir değil. Birkaçı saldırganların zaten kendi modellerini değiştirdiği öncülünü kabul etti, ancak çalışma yöntemleri farklılık gösteriyor. Agent red-teaming firması Fabraix'in CEO'su Ahmed Aly, şirketinin açık ağırlıklı modelleri fine-tune etmeye dayandığını — bu modeller zaten az kısıtlamayla başlıyor — çünkü abliteration'ın bir modelin bilgi ve yeteneklerinin bir kısmını da sıyırıp ciddi siber veya biyolojik zararlar için daha az etkili hale getirdiğini söyledi. Safe Intelligence'ın baş teknoloji uzmanı Alessio Lomuscio, yetenek kaybının mümkün olduğunu kabul etti ancak abliterate edilmiş modellerin bir sistemi stres testine tabi tutmada yararlı davranışlar yine de elde edebileceğini söyledi. Siber güvenlik platformu Armadin'in kurucusu ve baş mimarı David Slater ise abliterate edilmiş modellerin şirketinin sürecinin parçası olmadığını, çünkü önceki nesil açık ağırlıklı modellerin zaten kolayca jailbreak edilebildiğini söyledi; yine de tekniği araştırıyor ve bu işin kamunun gözü önünde tutulmasının araştırmacıların gerçek sınırın nerede olduğunu anlamasını sağladığını, aksi halde bunun gizlice gerçekleşeceğini savundu.
Eleştirmenler ve politika yanıtı
Yapay zeka güvenliği kâr amacı gütmeyen kuruluşu CivAI'nın araştırma başkanı Andrew Yoon, TechCrunch'a tekniğin temelde her isteğe uyacak bir model ürettiğini — sonucu bir sosyopata benzetti — ve yakın gelecekte düzenlenmiş, abliterate edilmiş modellerin zarar vermek için kullanılmasını beklediğini söyledi. Yoon, yakın zamanda yayımlanan bir görüş yazısında hükümetler için iki müdahale önerdi: Model sağlayıcılarına zararlı siber ve biyolojik silah faaliyetini tespit edip engelleyen classifier'lar çalıştırmasını şart koşmak ve ileri düzey GPU kiralayan şirketlere müşteri kimliğini doğrulamasını ve tehlikeli kötüye kullanımdan şüphelenilen durumlarda erişimi reddetmesini zorunlu kılmak.
Abliteration.ai'nın kendisi müşterilerin yapılandırabileceği bir moderasyon katmanı sunuyor ve TechCrunch'un testleri bazı kalıntı sınırlar buldu — model intihar talimatları vermedi — Devon ise daha fazla şiddet karşıtı güvenlik katmanının inşa edildiğini söyledi. Şirket, hizmetin ödemesinde kullanılan kredi kartını kaydetmenin ötesinde herhangi bir kimlik doğrulaması yapmıyor. Devon sorumluluk sorununu çözümsüz olarak çerçeveledi ve genç şirketin meşru güvenlik çalışmasını mümkün kılmak ile zarara aracılık etmek arasındaki çizgiyi nerede çekeceğini hâlâ çalıştığını söyledi.
Neden önemli
Temel ikilem, açık ağırlıklı yapay zekaya yapısal olarak içkin: Model ağırlıkları indirilebilir hale geldiğinde herkes güvenlik önlemlerini soyabilir ve TechCrunch'un danıştığı uzmanların çoğu bunun tek bir şirket ne yaparsa yapsın süreceğini bekliyor. Abliteration.ai'nin değiştirdiği şey erişilebilirlik; niş bir teknik prosedürü, ödeme yapan müşterileri ve bulut anlaşmaları olan düşük sürtünmeli ticari bir hizmete dönüştürüyor. Net etki kurucusunun savunduğu gibi daha güvenli sistemler mi, yoksa eleştirmenlerin korktuğu gibi daha ucuz kötüye kullanım mı olur, baskı artık hükümetlerin gerçekçi olarak düzenleyebileceği darboğazlara — barındırma, GPU kiralama ve ödeme altyapısına — kayıyor. Sektörün ve düzenleyicilerin üzerinde anlaşacağı yanıt, giderek daha yetenekli açık ağırlıklı modeller yayımlanmaya devam ettikçe bir emsal oluşturacak.
- #ai-safety
- #open-source
- #security
- #large-language-models
- #startups