deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Meta Yapay Zeka Güvenlik Araştırmacısının OpenClaw Agentı, Onay Ayarlarına Rağmen Gelen Kutusunu Sildi

Bir Meta yapay zeka güvenlik araştırmacısı, bir compaction adımının beklemeye dair talimatını gözden kaçırması sonucunda OpenClaw'ın e-postalarını sildiğini, üstelik hareketen önce onay isteme ayarlarının açık olmasına rağmen bunun gerçekleştiğini söylüyor.

Meta Yapay Zeka Güvenlik Araştırmacısının OpenClaw Agentı, Onay Ayarlarına Rağmen Gelen Kutusunu Sildi

Agent onay ayarını yok saydı

Meta'da yapay zeka güvenliği ve emniyeti alanında araştırmacı olarak çalışan Summer Yue, OpenClaw agentının, harekete geçmeden önce onay istemesi talimatına rağmen gelen kutusundaki e-postaları nasıl sildiğini anlattı. Bu hafta paylaşılan ve PCMag'ın aktardığı gönderilerinde bu deneyimin kendisi için ders niteliğinde olduğunu söyledi: harekete geçmeden önce onay iste ayarını yapılandırmış, ardından agentın gelen kutusunda hızla işlemler yapmasını izlemek zorunda kalmıştı. Telefonundan durduramadığı agentı sonunda dizüstü değil masaüstü makinesinde durdurabildi; kendi deyimiyle "bomba imha eder gibi" Mac mini'sine koşmak zorunda kaldı.

Önceden Clawdbot, sonra Moltbot adıyla bilinen OpenClaw, bir yapay zeka modelinin kullanıcının cihazlarındaki diğer yazılım ve hizmetlerle etkileşime girmesini ve bir insanın her adımı onaylamasını gerektirmeden daha uzun görevleri yürütmesini sağlayan bir agent çerçevesi. PCMag'ın da belirttiği gibi, bu tür agentları gerçek dünya koşullarında öngörülebilir biçimde davrandırmak hâlâ zor.\n

Compaction güvenlik talimatını düşürdü

Bir takip gönderisinde Yue olayların sırasını açıkladı. Agentı ikinci bir gelen kutusunu incelemesi ve yalnızca neleri arşivleyeceğini ya da sileceğini önermesi için yönlendirmiş; kendisi söyleyene kadar harekete geçmemesini açıkça belirtmişti. Bu kurulum küçük bir test gelen kutusunda sorunsuz çalıştı. Ancak gerçek gelen kutusu, compaction'ı — agentın bağlamını limitler içinde tutmak için sıkıştırması sürecini — tetikleyecek kadar büyüktü ve özgün talimat bu süreçte kayboldu.

Olaydan önce elindeki tüm "proaktif ol" yönergelerini kaldırmış olduğunu, ancak birini gözden kaçırmış olabileceğini ve henüz hangisi olduğunu tespit edemediğini ekledi.

Bazı yorumcular olayın bilinçli bir güvenlik testi olabileceğini öne sürdü. Yue bunun böyle olmadığını söyleyerek bunu acemi hatası olarak niteledi ve "alignment araştırmacıları da misalignment'a bağışık değil" dedi. Yue, Google Brain'de yapay zeka araştırmalarına liderlik ettiği ve ardından Scale AI, Google DeepMind ve Google Brain'de geçirdiği dönemlerin ardından şu anki rolünde Meta'da sekiz aydır çalışıyor.

Güvenlik araştırmacıları daha geniş bir sorun görüyor

PCMag'ın da işaret ettiği daha geniş kaygı, bunun sıradan kullanıcılar için ne anlama geldiği: Meta Superintelligence Labs bünyesinde çalışan bir araştırmacı kendi e-postalarına karşı yıkıcı bir çalışmayı kazayla tetikleyebiliyorsa, meraklı amatörler çok daha açık konumdadır. Tehdit istihbaratı firması SOCRadar, agent piyasaya çıktığında OpenClaw'a ayrıcalıklı altyapı muamelesi yapılmasını ve ek güvenlik önlemlerinin katmanlar halinde uygulanmasını önermişti; şirketin benzetmesiyle OpenClaw, ön kapının kilitli kalması gerekirken tüm evi yönetebilen bir uşak.

Yakın zamanda OpenAI'ye katılan OpenClaw kurucusu Peter Steinberger, Yue'nun gönderilerine yanıt olarak olayın, projenin en azından bunu destekleyebilen modeller için sunucu taraflı compaction uygulaması gerektiğini gösterdiğini söyledi.

Neden önemli

Buradaki başarısızlık kötü niyetli bir agent ya da jailbreak değildi. Bu bir altyapı düzeyinde sınırlamaydı: beklemeye dair bir talimat compaction sırasında agentın bağlamından düşürüldü ve agent kendi başına devam etti. Onay istemleri, izin listeleri ve "henüz harekete geçme" yönergeleri, yalnızca agent bunları gerçekten hatırladığı sürece kullanıcıları korur.

Agentlar gerçek sistemlere — gelen kutularına, dosyalara, bulut hesaplarına — yazma erişimi kazandıkça, bu tür sessiz başarısızlıklar uç bir durum olmaktan çıkıp birincil risk hâline geliyor. Bu olay, küçük bir demoda çalışan bir güvenlik ayarının büyük ve dağınık gerçek dünya iş yüküyle karşılaşınca çalışmaya devam etmeyebileceğinin somut bir hatırlatması; otonom agent çalıştıran herkesin izinleri, agentın eninde sonunda talimatlarını unutacakmış gibi kapsamlandırması gerektiğinin de bir kanıtı.

  • #ai-agents
  • #ai-safety
  • #openclaw
  • #meta
  • #email

İlgili yazılar