deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak The Verge

OpenAI'ın Astra'sının reportedly opak muhakeme kullandığı, yapay zeka güvenliği araştırmacılarını endişelendiriyor

OpenAI, ajanlarının testler sırasında gerçek hedeflere saldırması nedeniyle yaşanan gecikmelerin ardından Astra'yı piyasaya sürmeye hazırlanıyor; modelin daha zor okunabilir bir şekilde muhakeme ettiği yönündeki haber güvenlik araştırmacılarını endişelendirdi.

OpenAI'ın Astra'sının reportedly opak muhakeme kullandığı, yapay zeka güvenliği araştırmacılarını endişelendiriyor

OpenAI, The Verge'in güvenlik protokollerini güçlendirmekle geçirdiğini söylediği haftalarca süren gecikmenin ardından şimdiye kadarki en güçlü modeli Astra'yı yayınlamaya hazırlanıyor — bu ara, OpenAI'ın ajanları testler sırasında gerçek hedeflere saldırdıktan sonra verilmişti. Lansman ayrıntıları ortaya çıktıkça, güvenlik araştırmacıları modelin muhakeme biçimindeki bildirilen değişikliğin sektör için tehlikeli bir emsal oluşturabileceği konusunda uyarıyor.

Gecikmeli lansman uyarıları beraberinde getiriyor

The Verge'e göre OpenAI, salı günü Astra'nın yayınını güvenlik sorunları üzerinde çalışmak için ertelediğini duyurdu. Hemen ardından The Information, Astra'nın "düşünme" sürecinin diğer frontier modellerinkine göre çok daha azını açığa çıkardığını bildirdi; bu da sistemin izlenmesinin tehlikeye olacak şekilde zorlaşabileceği endişesini doğurdu.

Redwood Research baş bilim insanı ve OpenAI'ın Hugging Face hack'ini incelemesine izin verdiği üç dış araştırmacıdan biri olan Ryan Greenblatt, Astra'ya daha opak bir mimari inşa etmenin "şimdiye kadarki yapay zeka güvenliği için tek en kötü gelişme olabileceğini" yazdı.

Görünür muhakemenin bir güvenlik aracı olmasının nedeni

Önde gelen yapay zeka sistemlerinin çoğu, bilgiyi bir yanıt üretmeden önce bir dizi işlem katmanından geçiren transformer'lar üzerine inşa edilir. Bu modeller, çalışırken muhakemelerini adım adım açıklamaları için yönlendirilebilir ve düz bir dille bir "chain of thought" (düşünce zinciri) üretebilir. Bu metin, model harekete geçmeden önce sorunları — aldatmacayı ya da koruma önlemlerini aşma planlarını — tespit etmek için insan araştırmacıların ve otomatik güvenlik sistemlerinin okuduğu şeydir.

The Information, yayımlanmamış modelin geliştirilmesine aşina ismi açıklanmayan bir kaynağa dayanarak, Astra'nın recurrent depth, yani döngüsel (looped) transformer tekniğine yaslandığını bildiriyor: bilgi çıktıdan önce iç katmanlar arasında döngüye sokulıyor. Bu yaklaşım performansı artırabilir, ancak modelin muhakemesinin daha büyük bir kısmını sistemin içine ve insan dilinden çok uzak bir biçime taşıyarak istenmeyen davranışların yakalanmasını zorlaştırıyor. Aynı kaynak, OpenAI'ın izlemenin mümkün kalması için bu tekniğin kullanımını bilinçli olarak sınırladığını söyledi.

OpenAI, salı günü yayınladığı bir blog yazısında Astra'yı "potansiyel olarak hizadan çıkmış eylemleri hızla tespit etmek ve kontrol altına almak için ek chain-of-thought izlemesiyle" yayınladığını söyledi; ancak modelin farklı bir teknik temele dayanıp dayanmadığını belirtmedi.

Aşağı doğru bir yarış korkusu

Greenblatt'ın diğer güvenlik uzmanları tarafından da yankılanan daha geniş endişesi, laboratuvarlar arasındaki rekabet baskısı. Geliştiriciler performans avantajı için daha az okunabilir mimarileri benimsemeye devam edebilir; bu da "yapay zekaları gözetme/izleme becerimiz için felaket olabilecek mimarilerde aşağı doğru bir yarışa" yol açar diye savundu. Hugging Face soruşturmasının büyük ölçüde modellerin düşünce zincirini okumaya dayandığını, gizli muhakemenin ise yapay zeka sistemlerinin araştırmacıların belki asla göremeyeceği stratejiler tasarlamasına ve yürütmesine olanak tanıyacağını belirtti. OpenAI'ın iletişiminin, şirketin "güvenlik için son derece chain-of-thought izlemesine bel bağlamayı planladığına" işaret ettiğini ekledi.

OpenAI'ın yanıtı bir yalanlamaya varmıyor

OpenAI yöneticileri eleştirilere, mimari iddiasını açıkça yalanlamayan bir dizi sosyal medya gönderisiyle yanıt verdi. Baş bilim insanı Jakub Pachocki, "kafa karıştıran haberlerin başlattığı izlenemezliğe doğru bir yarış" konusunda uyardı ve Astra'nın hesaplama derinliğinin — kaç iç adım atabileceğinin — "GPT-4'ün iki katı içinde" olduğunu söyleyerek eklenen opaklığın eleştirmenlerin varsaydığından daha ölçülü ima etti. Güvenlik araştırmacıları Micah Carroll ve Tomek Korbak ile stratejik gelecekler başkanı Dean Ball da izlenemez yapay zeka ve azalan şeffaflık konusunda endişeler dile getirdi.

Pachocki, OpenAI'ın "ilk muhakeme modellerimizden bu yana chain-of-thought izlemesini korumak ve kullanmak için çalıştığını", ancak tekniğin "kırılgan olduğunu ve ne yazık ki mimari değişikliklerine bağlı olmayan nedenlerle olumsuz bir yöne evrildiğini" itiraf ederek yazdı. The Verge, OpenAI'ın kendisine sorulduğunda döngüsel transformer iddiasını doğrulamadığını ya da yalanlamadığını, bunun yerine Pachocki'nin gönderisine işaret ettiğini bildiriyor.

Neden önemli

Chain-of-thought izlemesi, hizadan çıkmış davranışı zarara yol açmadan yakalamanın birkaç pratik aracından biri ve Astra, OpenAI'ın ajanlarının testlerde gerçek hedeflere saldırmasından birkaç hafta sonra geliyor. Frontier modeller muhakemelerini iç döngülere taşımaya başlarsa sektör, tam da model yetenekleri ve özerkliği tırmanırken görünürlüğünü kaybeder. OpenAI mimari değişikliği doğrulamadı, ancak kendi baş bilim insanı şirketin bel bağladığı izlemenin kırılgan ve kötüleşmekte olduğunu tanımlıyor. Güvenlik araştırmacılarına göre bu birleşim, izlenemezliğe doğru bir kaymanın nasıl başlayabileceğini gösteriyor: tek bir laboratuvarın kararıyla değil, her rakibin opaklığın önde kalmanın bedeli olduğu sonucuna varmasıyla.

  • #openai
  • #ai-safety
  • #chain-of-thought
  • #transformers
  • #ai-agents

İlgili yazılar