· kaynak TechCrunch
Anthropic, Claude agent'ların yapay zeka hizalama araştırmasının bölümlerini özerk biçimde yürütebileceğini gösteriyor
Anthropic'un yeni makalesi, otomatik Claude agent'ların hizalama yöntemleri önerdiğini, test ettiğini ve geliştirdiğini gösteriyor; test edilen tüm benchmark'larda iyileşme sağlanırken, üretim ölçeğinde kazanımlar zayıfladı.

Anthropic'un otomatik hizalama araştırmacıları
Cuma günü Anthropic, "Automated Researchers Can Reliably Mitigate Alignment Failures" başlıklı bir makale yayımladı; makale, hizalama araştırmasının önemli bir bölümünü kendi başına yürütebilen bir yapay zeka sistemini tanımlıyor. TechCrunch'a göre bu çalışmaya, Anthropic'un fellows programındaki araştırmacılardan Chen Yueh-Han liderlik etti ve çalışma, otomatik sistemlerin genel performansı zedelemeden bir modelin davranışını bir dizi hizalama benchmark'ında iyileştirebileceğini gösteriyor.
Anthropic'un Automated Alignment Researchers (AAR) adını verdiği bu yapı, insan araştırmasının tipik ilerleyişini yansıtıyor. TechCrunch'a göre her otomatik araştırmacı ilgili literatürü tarıyor, bir eğitim yöntemi öneriyor ve bu yöntemi bir model üzerinde yaklaşık 30 dakika boyunca, ardışık denemelerle yinelenerek çalıştırıyor. İşe yarayan yöntemler tutuluyor, başarısız olanlar eleniyor; bu da sistemin hızlı ve büyük ölçekte çalışmasını sağlıyor. TechCrunch'ın aktardığına göre, belirli hizalanmamış davranışlara yönelik 10 benchmark'ta test edildiğinde otomatik sistemler her birinde performansı iyileştirdi.
Dokuz agent, 800 araştırma saati
Araştırmaya ilişkin bir dev.to özeti mimariye dair ayrıntılar veriyor. Deneyde, her biri deneyleri çalıştırmak için bir sandbox ile donatılmış, ortak depolamaya, diğer agent'larla koordinasyon için bir foruma ve uzaktan puanlama erişimine sahip dokuz paralel Claude Opus 4.6 örneği çalıştırıldı. Bu agent'lar birlikte, daha küçük modellerin hizalamasını iyileştirmeye yönelik hipotezler üretti, bu modelleri eğitti ve test etti, sonuçları analiz etti.
dev.to'ya göre çalışma, beş gün boyunca dokuz agent arasında toplam yaklaşık 800 araştırma saati biriktirdi ve hesaplama ile API kullanımında tahmini 18.000 dolar tuttu — araştırmacı saati başına yaklaşık 22 dolar. Makaleden alıntılayan TechCrunch ise yalnızca API çıkarımı için saatte yaklaşık 4 dolar gibi daha dar kapsamlı bir rakam veriyor; Anthropic'un insan araştırmacılara saatte yaklaşık 150 dolar ödediğini söylediği rakamla karşılaştırıldığında. İki sayı farklı şeyleri ölçüyor, ancak ikisi de aynı yönü işaret ediyor: otomatik deney yürütme, insan karşılığından çarpıcı biçimde daha ucuz.
Sonuçlar neyi gösterdi
Deneyler, daha zayıf bir modelin gözetiminin daha güçlü bir modeli iyileştirmek için kullanıldığı weak-to-strong supervision (zayıftan güce gözetim) ortamında gerçekleşti. Başarı, Performance Gap Recovered (PGR) adlı bir metrikle ölçüldü. dev.to'ya göre en iyi yöntemler açık ağırlıklı (open-weights) veri kümelerinde performans açığının 0.97'sini geri kazandı ve harcanmış (held-out) matematik görevlerine güçlü biçimde aktarıldı; bu değer 0.94'tü. Harcanmış kodlama görevlerine aktarım ise 0.47 ile çok daha zayıftı; ancak dev.to, bunun bazı durumlarda insan temel çizgisinin kabaca iki katı olduğunu belirtiyor. Claude Sonnet 4 ile yapılan bir üretim ölçeği testi yalnızca sınırlı iyileşme gösterdi.
Makale, insanlara göre kendi konumuna dair açık konuşuyor. TechCrunch'ın alıntıladığına göre makale, en iyi AAR yönteminin altı saat içinde deneyimli insanların ortalama olarak önerdiklerinden daha iyi olduğunu, insan güdümlü araştırma yönlerinin daha güçlü performansa yol açmadığını ve sonuçların otomatik hizalama son-eğitiminin (post-training) yakın vadede pratik hale gelebileceğine dair erken kanıt oluşturduğunu söylüyor.
Uyarılar önemli
Her iki yazı da sınırlara dikkat çekiyor. TechCrunch, sistemin yalnızca benchmark'ları hizalama hedeflerini gerçekten yansıttığı ölçüde işe yaradığını, ayrıca bu benchmark'ların — ve otomatik araştırmacıların yararlandığı literatürün — kurulup sürdürülmesinin önemli bir iş olarak kaldığını belirtiyor. Dev.to, düzensiz aktarım sonuçlarına ve zayıf üretim ölçeği performansına vurgu yaparak, bu gösterimin Claude'un hipotez üretimini ve deney yürütmeyi hızlandırabildiğini ama hizalamayı tek başına tanımlayıp çözebileceğini kanıtlamadığını savunuyor. Anthropic'un kendisi de insan gözetiminin hâlâ gerekli olduğunu söylüyor.
Neden önemli
Bu makale, özyinelemeli kendini iyileştirme — yapay zekânın yapay zeka eğitimini iyileştirmesi — yönünde atılmış erken ve somut bir adım. Hizalama son-eğitimi, muhtemelen en güvenlikle ilgili başlangıç noktası; çünkü bunu otomatikleştirmek, laboratuvarların model davranışını insan ekiplerden çok daha hızlı test etmesini ve düzeltmesini sağlar. Ancak sonuçlar iki yönlü: benchmark'larda ve matematik görevlerinde elde edilen kazanımlar kodlamada ve üretim ölçeğinde söndü; bu da otomatik iyileştirmenin, değerlendirmesinin gerçekte ölçüttüğü her şeyi miras aldığının bir hatırlatıcısı. Şimdilik hedefleri hâlâ insanlar koyuyor ve sonuçları hâlâ insanlar değerlendiriyor; makineler ise aradaki her şeyde hızlanıyor.
- #anthropic
- #ai-alignment
- #claude
- #ai-safety
- #machine-learning