deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak TechCrunch

Baseten, Hugging Face ve Goodfire'dan açık ağırlıklı modeller için güvenlik standardında iş birliği

Baseten'in araştırma kolu Base Labs, açık ağırlıklı (open-weight) modeller için güvenlik değerlendirmesi ve izleme konusunda Hugging Face ve Goodfire AI ile ortak oluyor; bu arada binlerce güvenlik katmanından arındırılmış abliterated varyant dolaşımda.

Baseten, Hugging Face ve Goodfire'dan açık ağırlıklı modeller için güvenlik standardında iş birliği

Baseten, açık ağırlıklı (open-weight) yapay zeka modelleri için yeni bir güvenlik girişimi başlattı; Hugging Face ve Goodfire AI ile birlikte, şirketlerin ortak bir standart haline gelmesini umduğu değerlendirme ve izleme altyapısını kuracak. TechCrunch'a göre duyuru, çarşamba günü Baseten'in bu yılın başlarında kurduğu araştırma grubu Base Labs eşliğinde yapıldı.

Ortaklık nasıl çerçevelendi

Base Labs, açık modellerin eğitimi ve izlenmesi için yöntemler geliştirip yayımlayacak; amaç, modellerin eğitilme ve dağıtılma biçimine içsel olarak dokunan, yayımdan sonra yamanmış değil, şeffaf bir standart oluşturmak. TechCrunch'ın aktardığına göre şirketler, iş birliğinin teknik olarak nasıl işleyeceğini henüz açıklamadı.

Baseten, gerekçesini X'te yaptığı bir gönderide şöyle dile getirdi: "Açıklığın yapay zeka güvenliği için bir avantaj olduğuna inanıyoruz." Şirket, açık yaklaşımın kapalı kaynak alternatiflerine kıyasla model davranışına daha fazla görünürlük sağladığını ve güvenlik araştırmalarını şeffaf, uygulanabilir denetimlere dönüştürmenin daha iyi yollarını sunduğunu savundu.

Goodfire, hedefi Baseten'in gönderisine verdiği yanıtta şöyle çerçevelendi: "Güvenlik, açık modellere yerleşik olmalı ve onları sunanlar tarafından sağlanmalı." Yorumlanabilirlik (interpretability) — modellerin kararlarına nasıl vardığını açıklama teknikleri — alanında uzmanlaşan bu girişimi TechCrunch, çabanın "yerleşik" ayağına en olası katkıda bulunacak taraf olarak görüyor.

Üçlü, açık ağırlık yığınını aralarında paylaşıyor: Hugging Face indirilebilir modellerin ekosistemini barındırıyor, Baseten bu modellerin üzerinde çalıştığı çıkarım (inference) altyapısını sağlıyor, Goodfire ise yorumlanabilirlik araçlarını sunuyor. Baseten ayrıca daha geniş geliştirici topluluğuna katkı çağrısı yaparak amacın "herkes için güvenli ve erişilebilir açık modeller ekosistemi" olduğunu belirtti.

Abliteration bunu neden tetikledi

Girişim, açık ağırlıklı modellerin dağıtılmasının вообще güvenli olup olmadığına dair süren bir tartışmanın ortasında geldi. En keskin kanıt, bir modelin yerleşik güvenlik katmanlarını sonradan kaldıran abliteration adlı teknik. TechCrunch'a göre Hugging Face, platformunda şu anda 6.000'den fazla abliterated model listeliyor — bu rakam, ağırlıklar kamuya açık olduğunda eğitim sonrası güvenlik duvarlarının ne kadar kolay geri alınabildiğini gözler önüne seriyor.

İşte ortaklık, kendisini tam da bu sorunun karşısına konumlandırıyor. Modelin kendisine gömülen ve dağıtım sırasında onu sunan altyapı tarafından izlenen güvenlik katmanları, eğitimden sonra eklenen bir reddetme davranışından çok daha zor sökülmektedir.

Derin cepli katılımcılar

Her iki lider şirket de güçlü sermayeye sahip. Yapay zeka çıkarım sağlayıcısı Baseten, haziranda 1,5 milyar dolarlık bir Series F turu yaparak değerlemesini 13 milyar dolara çıkardı. Goodfire, model yorumlanabilirlik platformunu ilerletmek için bu yılın başlarında B Capital öncülüğünde 150 milyon dolarlık bir Series B turu aldı.

Neden önemli

Ortaklık, bir koordinasyon çabası olarak öne çıkıyor. Her şirket kendi güvenlik önlemlerini tek başına sunmak yerine, bir model barındırıcısı, bir çıkarım sağlayıcısı ve bir yorumlanabilirlik uzmanı, açık modellerin nasıl eğitileceği ve izleneceğine dair ortak bir standart tanımlamaya çalışıyor. Bu benimsenirse, güvenlik denetimleri açık modeller için isteğe bağlı bir ek değil, varsayılan dağıtım sürecinin bir parçası haline gelebilir.

Bahse konu riskler, Hugging Face'teki 6.000'den fazla abliterated modelde görünür durumda: eğitimden sonra uygulanan güvenlik duvarlarının kaldırılması kolay olduğu ortaya çıkıyor. Güvenliği içine işlemek ve sunum anında izlemek, bu grubun üzerine bahis yaptığı alternatif. Açık sorular da en az bunlar kadar net — henüz hiçbir teknik detay ya da yayımlanmış metodoloji yok ve standardın başarısı, Baseten'in davet ettiği daha geniş geliştirici ekosisteminin bunu fiilen benimseyip benimsemeyeceğine bağlı olacak.

  • #open-weight-models
  • #ai-safety
  • #baseten
  • #hugging-face
  • #interpretability

İlgili yazılar