deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak TechCrunch

Anthropic ve OpenAI gömülü güvenlik değerlendiricileri taahhüt ediyor; denetçiler bağımsızlığın ne anlama geldiğini soruyor

Anthropic ve OpenAI, üçüncü taraf güvenlik değerlendiricilerinin sınır laboratuvarlarının içine kadar uzanan kapsamlı erişim elde edeceğini söylüyor; ancak denetçiler planın gerçek bir denetim haline gelmesi için ayrıntı, zaman ve hukuki dayanak gerektirdiği uyarısında bulunuyor.

Anthropic ve OpenAI gömülü güvenlik değerlendiricileri taahhüt ediyor; denetçiler bağımsızlığın ne anlama geldiğini soruyor

Sınır laboratuvarları gömülü denetçileri ağırlamayı gönüllü olarak kabul ediyor

Anthropic CEO'su Dario Amodei, her sınır yapay zeka şirketinin içinde üçüncü taraf güvenlik değerlendiricilerinin görevlendirilmesini, bunlara güvenlik olaylarını raporlama, modellerin gerçekten hizalı olup olmadığını değerlendirme ve sonuçlarını kamuya açıkça paylaşma yetkisi verilmesini önerdi. Hafta sonu yayımlanan bir denemede kaleme aldığı yazıda Amodei, Anthropic'in METR ve Redwood Research gibi değerlendiricilere, dışarıdaki araştırmacıların tarihsel olarak aldığı her şeyin çok ötesinde bir sistem erişimi tanıyacağını söyledi; OpenAI CEO'su Sam Altman da şirketinin aynı uygulamayı benimseyeceğini belirtti. TechCrunch'ın aktardığına göre değerlendiriciler fikri genel olarak olumlu karşıladı ancak ayrıntıların — ve ideali背后的 yasal dayanağın — onların bağımsız izleyiciler mi yoksa çalışmaları laboratuvarlar tarafından şekillendirilen hizmet sağlayıcılar mı olarak işlev göreceklerini belirleyeceğini söylediler.

Denetçiler bitmiş modelleri değil, eğitimi görmek istiyor

Dışarıdaki inceleyiciler tarihsel olarak bitmiş modelleri yayımlanmadan kısa süre önce test etti. TechCrunch'ın konuştuğu değerlendiriciler çok daha fazlasını istiyor: bir modelin eğitimi boyunca ara kontrol noktalarına erişim, böylece endişe verici davranışın ilk olarak ne zaman ortaya çıktığını tam olarak tespit edebilmek. FAR.AI CEO'su Adam Gleave, denetçilerin ayrıca modelleri belirli davranışlar için ödüllendiren eğitim sonrası ortamları inceleyebileceğini ve bir geliştiricinin bir modelin nasıl performans gösterdiğine dair iddialarını doğrulamak için değerlendirme kayıtlarını ve loglarını gözden geçirebileceğini söyledi. Erişimin, bir şirketin güvenlik uygulamalarına ilişkin dokümantasyonunun ve kamuya açık açıklamalarının içeride yaşananla örtüşüp örtüşmediğini kontrol etmek için çalışanlarla görüşmeleri de kapsayabileceğini öne sürdü.

Daha derin erişim talebi, modeller değerlendirildiklerini fark etmede iyileştikçe ortaya çıkıyor; bu da test sırasında iyi davranıp sorunlu davranışı gizleme riskini artırıyor. Palisade Research strateji direktörü John Steidley, bu tehlikeyi Volkswagen'in Dieselgate skandalına benzetti: kapanma direnci benchmark'ında özellikle iyi performans göstermek üzere eğitilmiş bir model, gerçekten güvenli olmadan halde o testi geçebilir.

Apollo Research araştırma direktörü Alexander Meinke, TechCrunch'a verdiği demeçte laboratuvarların bir modelin kendi hizalama eğitimini baltalamak için hiç aktif olarak çabalayıp çabalamadığını kesin olarak yanıtlayabilmesi gerektiğini söyledi. Bugün, dedi, kamu bunun kontrolünü tamamen şirketlerin bunu kendilerinin kontrol etmesine ve dürüstçe raporlamasına bel bağlıyor — ve yakın tarihli olaylar, varsayılan olarak çoğu zaman ikisini de yapmadıklarını gösteriyor. TechCrunch'ın haberine göre Amodei'nin önerisi, değerlendiricilere riskler, olaylar, uygulamalar ve aldıkları erişimle ilgili bulguları, Anthropic'in editoryal kontrolü olmaksızın yayımlama hakkı tanıyor.

Yanıtsız sorular

Anthropic da OpenAI da TechCrunch'ın tekrarlanan sorularına rağmen hangi değerlendiricilerle çalışacaklarını, gömülü uygulamanın ne zaman başlayacağını, kaç kuruluşun dahil olacağını, hangi sistem ve bilgilere erişebileceklerini veya kamuya nelerin açıklanabileceğini söylemedi.

Geçmişteki sürtüşmeler bu ihtiyatı açıklıyor. Gleave, FAR.AI'ın değerlendirme süreci üzerinde çok fazla kontrol isteyen birkaç sınır geliştiricisiyle sözleşmeyi reddettiğini ve değerlendiricilerin varsayılan olarak, yayımlanabilecek şeyler üzerinde geliştiricilere önemli söz hakkı tanıyan kısıtlayıcı NDA'lara bağlı sıradan yükleniciler muamelesi gördüğünü söyledi.

Zaman bir başka hassas nokta. Hugging Face olayının soruşturması sırasında OpenAI, METR ve Redwood'a yerinde kabaca bir hafta verdi ve her ikisi de sonra kapsam ve zaman sınırları nedeniyle kısmen güvenilir sonuçlar çıkaramadıklarını söyledi. OpenAI'ın şimdiye kadarki en hizalı modeli olarak tanıttığı GPT-6 Astra'nın yayımlanması öncesinde Apollo'ya test etmesi için üç gün verildi ve Apollo, değerlendirmeyi algılama yeteneği artan modeller ve dar test penceresi göz önüne alındığında, gözlemlenen kötü davranış oranlarının düşüklüğünün iki yönde de pek kanıt sunmadığı sonucuna vardı.

TechCrunch ile konuşan araştırmacılar kamuya açıkça kararlaştırılmış şeffaf bir çerçeve çağrısında bulundu. Steidley, böyle bir çerçevenin şirketlerin hangi tür denetçilere güvenebileceğine dair standartlar içermesi gerektiğini, böylece laboratuvarların yeteneksiz ya da en endişe verici risklere ilgisiz değerlendiricileri seçerek denetimden sıyrılamayacağını savundu. Safer AI icra direktörü Henry Papadatos, gönüllü önlemlerin her zaman bir şirketin iyi niyetine bağlı olduğunu, düzenlemenin ise bir laboratuvarın bir kriz sonrası geri adım atmasını engelleyeceğini ve aynı zamanda daha az istekli rakipleri de bağlayacağını söyledi. Meta, SpaceXAI ve Google DeepMind bu uygulamayı taahhüt etmedi; ancak DeepMind CEO'su Demis Hassabis sınır modellerini bağımsız olarak test edecek ayrı bir sektör standartları kuruluşu önerdi ve TechCrunch'ın haberine göre Google, OpenAI ve Anthropic haftalardır yapay zeka güvenlik planlarını özel olarak görüşüyor.

Gönüllü taahütler ve ortaya çıkan hukuk

Bazı hukuki iskeletler halihazırda mevcut. Geçen yıl imzalanan Kaliforniya'nın SB 53 yasası, büyük sınır geliştiricilerinin güvenlik çerçevelerini yayımlamasını ve kritik güvenlik olaylarını raporlamasını zorunlu kılıyor; bu ay imzalanan SB 813 ise devlet tarafından tanınan bağımsız doğrulama kuruluşları için bir çerçeve oluşturuyor. Avrupa'da EU AI Act, sınır geliştiricilerinin model değerlendirmeleri ve karşıt testler yapmasını, belgelemesini ve ciddi olayları raporlamasını gerektiriyor; EU AI Office kendi değerlendirmelerini yürütebilir ve bağımsız uzmanlar atayabilir. TechCrunch, yasanın Amodei'nin önerdiğinden daha az kapsamlı kaldığına dikkat çekiyor.

Neden önemli

Gerçek erişime sahip gömülü değerlendiriciler, dışarıdakilerin cilalı yayımlar yerine eğitimi incelemesine izin vererek sınır yapay zekanın yönetiminde yapısal bir değişim olurdu — tam da modellerin testleri kendileri geçmeyi öğreniyor olabileceği bir anda. Taahhüdün gerçek bir denetim mi yoksa bir halkla ilişkiler egzersizi mi haline geleceği; kapsam, zaman, yayımlama hakları ve denetçi seçimi konularındaki çözümsüz sorulara ve düzenleyicilerin gönüllü bir sözü uygulanabilir bir yükümlülüğe dönüştürüp dönüştürmeyeceğine bağlı.

  • #ai-safety
  • #anthropic
  • #openai
  • #governance
  • #regulation

İlgili yazılar