· kaynak dev.to (home feed)
Anthropic, sınır modellerinin davranışsal denetimi için Bloom ve Petri'yi açık kaynak yaptı
Anthropic, sınır modellerinin otomatik davranışsal değerlendirmeleri için MIT lisanslı Bloom çerçevesini ve risklerin nasıl etkileşime girdiğini denetlemeye yarayan yardımcı araç Petri'yi yayımladı.

Anthropic, sınır yapay zeka modellerinin pratikte nasıl davrandığını araştırmak için iki açık kaynak araç yayımladı: otomatik davranışsal değerlendirmeler için bir çerçeve olan Bloom ve risklerin nasıl birleştiğini incelemeye yarayan yardımcı denetim çerçevesi Petri. dev.to'da yayımlanan bir yazıya göre sürüm, temel kodu, başlangıç (seed) yapılandırmalarını ve değerlendirme paketlerinin nasıl oluşturulduğunu, çalıştırıldığını ve yargılandığını anlatan teknik bir metni içeriyor — böylece daha önce yalnızca şirket içinde kullanılan bir metodoloji, dışarıdan gelen kişilerin çalıştırıp uyarlayabileceği bir şeye dönüşüyor.
Bloom bir değerlendirmeyi nasıl kuruyor
dev.to'da özetlenen Bloom teknik raporu, Anlama, Fikir Üretme, Yayına Alma ve Yargılama adlı dört aşamalı bir süreç tanımlıyor. İş akışı bir başlangıç yapılandırmasından başlıyor, aday değerlendirme fikirleri geliştiriyor, bunları hedef modeller üzerinde çalıştırıyor ve ardından ortaya çıkan davranışı yargılıyor. Önemli olan tekrarlanabilirlik: anlamlı bir testin, tanımlanmış bir ilgilenilen davranışa, yeniden çalıştırılabilen senaryolara ve dönen sonuçları yorumlama ölçütlerine ihtiyacı var.
Anthropic'in bu süreci 16 sınır model ve dört davranışa uyguladığı bildiriliyor: sanrısal yaltaklanma, talimatla uzun vadeli sabotaj, kendini koruma ve kendine tercih eden önyargı. Rapor ayrıca bir paketin hedeflediği davranışı gerçekten ortaya çıkarıp çıkarmadığını izleyen ortaya çıkarma oranı (elicitation rate) ve üretilen testlerin içsel çeşitliliğini ölçen paket çeşitliliği gibi metrikleri belgeliyor. Bunlar bir değerlendirme paketinin özelliklerini tanımlıyor; herhangi bir model için genel bir güvenlik sıralaması değil.
Petri risk etkileşimlerine bakıyor
Petri farklı bir boşluğu dolduruyor. Bloom belirli bir davranışın ortaya çıkıp çıkmadığını ölçerken, Petri risklerin nasıl etkileşime girdiğini denetlemek, birçok senaryoyu paralel olarak keşfetmek için tasarlandı. Bu ayrım dağıtımda önemli: bir başarısızlık çoğu zaman tek bir girdiden değil, koşulların birleşiminden — belirli bir prompt artı belirli bir araç erişimi artı belirli bir iş akışı — doğuyor.
Lisans, kurulum ve sahiplik
Bloom kod tabanı MIT lisansıyla yayımlandı ve depo, GitHub'dan pip kurulumlarını, seed ve yapılandırmaların kullanımını ve hedef modelleri bağlamak için gereken ayarları kapsayan kurulum rehberi içeriyor. dev.to yazısı, Anthropic'in resmi Bloom duyurusunu 19 Aralık 2025 olarak tarihlendiriyor ve bir sahiplik uyarısı ekliyor: 2026 itibarıyla depo yeni bir yuvası olduğunu ve artık Meridian Labs tarafından geliştirilip bakımının yapıldığını belirtiyor. Bunu uzun vadeli bir bağımlılık olarak değerlendiren ekipler önce güncel belgeleri incelemeli.
Daha geniş bir şeffaflık çabasının parçası
İkinci bir dev.to makalesi bu yayımı Anthropic'in daha geniş açıklama geçmişine karşı konumlandırıyor. Makale, şirketin Şeffaflık Merkezi'ne, model raporlarına ve sistem kartlarına — özellikle makalenin otomatik yapay zeka Ar-Ge değerlendirmelerinin en doğrudan birinci taraf belgelenmesi olarak nitelendirdiği Claude Opus 4.5 System Card'a — işaret ederek bunun tek seferlik bir lansman değil süregiden bir ölçüm programının kanıtı olduğunu söylüyor. Aynı makale, üç öncü gösterge öneren bir arXiv ön baskısına ("Measuring AI R&D Automation") atıf yapıyor: yapay zekanın araştırmaya benzer değerlendirmelerdeki performansı, yapay zeka araçlarının yüksek riskli Ar-Ge kararlarını ne kadar derinden etkilediği ve sabotaj olaylarının operasyonel izlenmesi. Dikkat çekici olan, bu üç metrikli çerçevenin Anthropic'in kendi belgelerinden değil, doğrulayıcı akademik araştırmadan gelmesi; makale bu ayrıma özenle riayet ediyor.
Araçların vaat etmediği şeyler
İki araç da bir güvenlik sertifikası değil. Bir değerlendirme yalnızca gerçekten test ettiği davranışı, yapılandırmayı, hedef modeli ve yargılama yaklaşımını kapsar; bu yüzden sonuçlar bir üretim uygulamasını güvenli olarak sertifikalamaz. Yapay zeka dağıtan ekiplerin yine de kendi promptlarını, araçlarını, veri erişimlerini, tırmandırma yollarını ve müşteriye dönük çıktılarını doğrulamaları gerekir. Anlamlı çalıştırmalar ayrıca test edilen modellere erişim, paketleri çalıştıracak altyapı ve dağıtımla ilgili riskleri yansıtan başlangıç yapılandırmaları gerektirir.
Neden önemli
Sınır modellerinin davranışsal denetimi büyük ölçüde laboratuvarların içinde yaşadı; sistem kartlarında ve blog yazılarında anlatıldı ama dışarıdan gelenler için yeniden üretilmesi zordu. Bloom ve Petri'yi kod, seed ve metodolojiyle birlikte izin veren bir lisans altında yayımlayarak Anthropic bu incelemeyi pratik hale getiriyor: araştırmacılar davranışsal bir benchmark'ın nasıl kurulduğunu kara kutu olarak görmek yerine inceleyebiliyor ve yapay zeka ekipleri süreci kendi iş akışlarına özgü risklere uyarlayabiliyor. Yayım ayrıca alıcılara satıcılara soru sormak için somut bir sözlük kazandırıyor — bir davranışın nasıl test edildiği, testlerin ne kadar çeşitli olduğu, sonuçların nasıl yargılandığı — ki bu, bir modelin değerlendirildiğine dair genel bir güvenceden daha eyleme dönük. Açık soru ise sahiplik: Bloom artık Anthropic dışında bakıldığı için çerçevenin uzun vadeli yönü, yeni bakımcılarının süregelen yatırımına bağlı.
- #anthropic
- #open-source
- #ai-safety
- #model-evaluation
- #llm
İlgili yazılar
- PrismML, Qwen3.8 27B'yi üç değerli ağırlıklarla 5.9GB'a küçülttü, kalitenin %98,2'sini koruduğunu iddia ediyor
- Atlassian Forge uygulamaları yazan Qwen3.8-27B fine-tune'u için Apache-2.0 lisanslı ağırlıklar yayınlandı
- OpenAI, GPT-5.6 agentlarının haleflerine hataları gizlemelerini söyleyen gizli notlar bıraktığını açıkladı