deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Anthropic, hizalama araştırmalarını otomatikleştirmek için dokuz agent'lı Claude sistemini yayınladı

Anthropic, hizalama deneylerini otomatikleştiren Claude destekli bir ortam olan Automated Alignment Researchers'ı yayınladı; şirket bir chat benchmark'ında 0.97 gap-recovery puanı bildirirken, matematik ve kodlama sonuçları dalgalı seyretti.

Anthropic, hizalama araştırmalarını otomatikleştirmek için dokuz agent'lı Claude sistemini yayınladı

Anthropic, yapay zeka hizalama (alignment) araştırma döngüsünün büyük bir kısmını otomatikleştiren, Claude destekli bir ortam olan Automated Alignment Researchers'ı (AAR) yayınladı. dev.to'da aktarıldığına göre sistem deneyler tasarlayabiliyor, bunları çalıştırabiliyor, sonuçları değerlendirebiliyor ve bulguları paylaşabiliyor; Anthropic, dışarıdaki araştırmacıların çalışmayı yeniden üretebilmesi ve genişletebilmesi için temeldeki kodu ve veriyi de yayınladı. Şirket bunu, üretim amaçlı bir güvenlik ürünü olarak değil, weak-to-strong supervision'ı incelemek için bir sandbox olarak konumlandırıyor.

Ortam nasıl çalışıyor

dev.to'nun duyurunun özetine göre ortam, her biri kendi sandbox'unda izole edilmiş dokuz Claude Opus 4.6 agent'ı çalıştırıyor. Koordinasyon paylaşılan bir forum ve ortak bir codebase üzerinden sağlanırken, uzaktan bir değerlendirme API'si ve panolar deneysel ilerlemeyi takip ediyor. Tasarım gerekçesi şuna dayanıyor: hizalama araştırması genellikle hipotez kurma, test etme, sonuçları değerlendirme ve revize etme şeklinde uzun döngüler içeriyor. Bu döngüleri otomatikleştirmek, bir laboratuvarın aynı sürede manuel çalışmayla mümkün olandan çok daha fazla aday yaklaşımı keşfetmesini sağlayabilir.

Anthropic, agent kodunun yanı sıra herkese açık bir otomatik weak-to-strong araştırma deposunda veri setleri ve baseline'lar da yayınladı. dev.to raporu, yayınlanan materyallerde lisans koşullarının belirtilmediği uyarısında bulunuyor; dolayısıyla kodun üzerine inşa etmek isteyen herkes, belirli kullanım haklarını varsaymadan önce deponun dokümantasyonunu okumalı.

Benchmark sayıları

dev.to'nun aktardığına göre Anthropic'in merkezî sonucu, performance gap recovered (PGR) ile ölçülen bir chat görevi benchmark'ından geliyor. Bildirildiğine göre AAR'lar, yaklaşık 800 kümülatif AAR-saatlik sürenin ardından yaklaşık 0.97 PGR değerine ulaştı; hesaplama maliyeti yaklaşık 18.000 dolar, yani AAR-saat başına yaklaşık 22 dolar oldu. Paralel yürüyen manuel bir çalışmada ise insan baseline'ı aynı farkın yaklaşık 0.23'ünü yedi günde geri kazandı.

Bu benchmark'ın ötesine genelleme karışık sonuçlar verdi. Anthropic, hold-out görevlerde matematik için 0.94, kodlama için ise yalnızca 0.47 PGR bildirdi; ayrı bir deneysel ortamda matematikte 0.75 elde edildi, kodlama sonuçları yine daha zayıftı. Bu tablo, bir PGR değerinin yalnızca ölçülen belirli fark ve benchmark'a göre anlamlı olduğunu gözler önüne seriyor.

Reward hacking ve denetim

dev.to, Anthropic'in otomatik araştırma kurulumlarında reward hacking'i açıkça bir risk olarak işaretlediğini bildiriyor: otomatik bir sistem, araştırmacıların amaçladığı hedefi gerçekten başarmadan ölçülen puanı yükseltmenin yollarını bulabilir. Bu da bir otomatik araştırma sürecinin neyi güvenilir şekilde optimize edeceğini yalnızca model yeteneğinin değil, aynı zamanda değerlendirme tasarımının belirlediği anlamına geliyor. Rapora göre Anthropic'in kendi çerçevesi de şu: bunlar otomatik araştırmacıların hizalama sorununu çözdüğü iddiası değil deneysel bulgulardır ve insan denetimi hâlâ gereklidir.

Neden önemli

Bu yayın iki nedenden dolayı önemli. Birincisi, yapay zeka güvenliği araştırmasının kendisini otomatikleştirmeye somut ve incelenebilir bir adım: Araştırmacılar, yapay zeka sistemlerinin hizalama çalışmasına anlamlı şekilde katkı sağlayıp sağlayamayacağını tartışmak yerine artık ortamı çalıştırabiliyor, koşulları değiştirebiliyor ve bildirilen sonuçların tutup tutmadığını kontrol edebiliyor. Herkese açık kod, veri setleri ve baseline'lar bu tür bağımsız doğrulamayı mümkün kılıyor ki bu, bu araştırma alanında hâlâ nadir görülüyor.

İkincisi, dalgalı seyreden matematik ve kodlama sonuçları, yapay zeka sistemi kullanan herkes için yararlı bir uyarı. Bir benchmark'ta ölçülen farkın neredeyse tamamen geri kazanılması ilgili görevlere tutarlı şekilde aktarılmadı ve işaret edilen reward hacking riski, otomatik optimizasyonun niyetten uzaklaşabileceğini gösteriyor. Güçlü benchmark puanları, sistemin gerçek hayatta karşılaşacağı her durumdaki güvenilirliği değil, benchmark'taki performansı tanımlar.

  • #anthropic
  • #claude
  • #ai-safety
  • #alignment
  • #multi-agent-systems

İlgili yazılar