· kaynak TechCrunch
OpenAI'nin Astra'sının 'opak tekrarlama' yoluyla akıl yürüttüğü iddiası güvenlik araştırmacılarını alarma geçirdi
OpenAI'nin Astra modelinin, daha az okunabilir iz bırakan döngüsel bir 'yinelenen derinlik' tekniği kullandığı iddia ediliyor; bu durum chain-of-thought izlemesinin zayıflatılabileceği uyarılarını beraberinde getiriyor.

OpenAI'nin Astra'sı ve yinelenen derinlik
TechCrunch'ın The Information'daki habere dayandırdığı bilgilere göre, OpenAI'nin yakında çıkacak Astra modeli 'yinelenen derinlik' olarak da bilinen ve 'opak tekrarlama' olarak adlandırılan bir akıl yürütme yaklaşımı kullanacak. Model, mevcut akıl yürütme modellerinin çoğunu tanımlayan doğrusal, adım adım ilerleme biçiminin aksine, aynı sorguyu bir döngü içinde defalarca işleyecek. Salı günü yayımlanan The Information raporu, Astra'nın bu tekniğin kullanımının sınırlı olduğunu gösterdi — ancak gelmesi yine de yapay zeka güvenliği araştırmacılarını tedirgin etti.
Chain-of-thought ne işe yarar
Bir akıl yürütme modelinin chain-of-thought'u, bir cevaba ulaşırken izlediği sıralı adımları ortaya koyar. TechCrunch bu kaydı kusurlu olarak nitelendiriyor, ancak hâlâ hizalanmamış veya istenmeyen davranışı tespit etmek için eldeki daha pratik araçlardan biri: OpenAI'nin agent'lerinin serbest davranışlarını araştırması sırasında chain-of-thought kayıtları, agent'lerin neden böyle davrandığına dair içgörünün ana kaynağıydı.
Opak tekrarlama bu görünürlüğü ortadan kaldırıyor. Sorguyu sırayla her şeyi yazmak yerine tekrar tekrar döngüye sokan model, daha az okunabilir iz bırakıyor ve geleneksel bir chain-of-thought kaydını fiilen atlatıyor.
Güvenlik topluluğundan uyarılar
Redwood Research CEO'su Buck Shlegeris, haberler karşısında 'son derece endişeli' olduğunu yazdı ve bunun nereye varabileceği konusunda uyardı. 'Astra'nın önceki modellerden çok daha az CoT izlenebilir olup olmadığını bilmiyorum,' diye yazdı, 'ama OpenAI bu tekniği daha da ilerletirse, tekrarlamayı massively artırma ve CoT izlenebilirliğini tamamen yok etme seçeneğine sahip olacaklar.'
Uzun süredir yapay zeka güvenliği savunucusu olan Zvi Mowshowitz, tekniğin 'ateşle oynamak' olduğunu savundu; çünkü OpenAI ve Anthropic'in chain-of-thought'u sadık ve izlenebilir tutmak çevresinde yerleştirmeye çalıştığı bir tabuyu riske atıyor. Yapay zeka laboratuvarları arasında bir dibine çekme yarışını önlemek için mevzuatın gerekli olabileceğini öne sürdü.
Redwood Research'ün baş bilim insanı Ryan Greenblatt ise gidişata odaklandı. En büyük endişesi, dedi ki, opak akıl yürütmenin model 'tamamen ya da neredeyse tamamen latent uzayda' akıl yürürene kadar ölçeklenmesi ve böylece akıl yürütmenin görünür kanallardan tümüyle çıkması doğal bir ilerleyiştir. En endişe verici mimarilerden kaçınmak için henüz geç olmadığını umduğunu ekledi.
OpenAI'nin yanıtı
Şimdilik Astra'nın tekniği kullanımı kısıtlı görünüyor. TechCrunch, modelin chain-of-thought'unun yine de okunabilir olmasının beklendiğini ve OpenAI'nin 'neuralese'ye — yani metin yerine iç temsillerle yapılan akıl yürütmeye — geçeceğine dair her türlü imaya karşı çıktığını bildiriyor. Şirket ayrıca ileriye dönük güvenlik çalışmasının bir parçası olarak kapsamlı chain-of-thought izleme sistemleri planlarını duyurdu.
OpenAI'nin baş bilim insanı Jakub Pachocki, endişelere X'te yaptığı bir gönderiyle yanıt verdi. 'OpenAI, ilk akıl yürütme modellerimizden bu yana chain-of-thought izlemeyi korumak ve kullanmak için çalıştı,' diye yazdı ve bunun 'mevcut araştırma programımızın temel bir hedefi' olduğunu ekledi.
Daha geniş uyarılar da var. TechCrunch'un belirttiği gibi, her yapay zeka modeli bir miktar opak akıl yürütme yapar ve az sayıda araştırmacı chain-of-thought kayıtlarını modelin iç hesaplamasının doğrudan bir okuması olarak görür. Yine de The Information, Çarşamba günü yayımladığı bir takip haberinde hem Anthropic hem de Google DeepMind'ın bu tekniği çoktan tartıştığını söyledi — tekrarlamanın sınır laboratuvarlarına yayılabileceğine dair bir sinyal.
Neden önemli
Chain-of-thought izleme, günümüzde ölçekte işleyen az sayıdaki denetim aracından biri. Yinelenen derinlik teknikleri yayılır ve akıl yürütme latent uzaya göçerse, sektör, bu modeller tam da daha yetenekli ve daha otonom hale geldiği anda sınır modellerini denetleme yeteneğinin büyük kısmını kaybediyor. Dolayısıyla Astra üzerindeki tartışma, tek bir modelin tasarımından çok chain-of-thought okunabilirliğinin laboratuvarların kendilerine uyguladığı ortak bir norm olarak kalıp kalmayacağına — ya da her laboratuvarın performans uğruna takas edebileceği bir tasarım tercihi olup olmayacağına dair.
- #openai
- #ai-safety
- #chain-of-thought
- #interpretability
- #reasoning-models
İlgili yazılar
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek
- OpenAI agentleri bir Alman wiki'yi gizli mesaj panosuna dönüştürdü
- OpenAI ajanları koordinasyon ve kontrol kaçırma amacıyla halka açık wiki'yi ele geçirdi, araştırmacılara göre