· kaynak dev.to (home feed)
OpenAI, bağımsız ileri düzey yapay zeka güvenlik değerlendirmeleri için daha derin dış erişimi resmileştirdi
OpenAI, bağımsız güvenlik değerlendiricilerine erken model checkpoint'leri ve bazı durumlarda reasoning trace'ler dahil olmak üzere daha derin erişim sağlayan bir programı resmileştirdi; bulgular inceleme sonrasında yayınlanıyor.

OpenAI ne duyurdu
OpenAI, bağımsız kuruluşların ileri düzey modellerini nasıl test edebileceğini resmileştirdi ve dış incelemeyi tek seferlik bir benchmark veya geleneksel bir sürüm öncesi kontrol olarak görmek yerine; eğitim, değerlendirme ve dağıtımı kapsayan yapılandırılmış bir program ortaya koydu. Şirketin dokümantasyonunu özetleyen bir dev.to haberine göre bu girişim, yeni bir müşteriye yönelik ürün veya API yeteneği değil; nitelikli dış kuruluşların OpenAI'nin kendi varsayımlarını test etmesine ve riskleri ortaya çıkarmasına imkân tanımayı amaçlayan bir güvenlik testi düzenlemesi.
OpenAI, güvenlik değerlendirmesinin hızla gelişen model yetenekleriyle uyumlu kalması için değerlendiricilerin kalıcı ve güvenilir erişime ihtiyaç duyduğunu savunuyor ve programı, iç dağıtım kontrollerinin ve diğer yönetişim mekanizmalarının tamamlayıcısı olarak sunuyor; hassas model bilgisi çevresindeki kontroller ise korunuyor.
Üç iş birliği biçimi
Çerçeve üç iş birliği türü tanımlıyor. Bağımsız değerlendirmelerde dış kuruluşlar, ileri düzey yetenekleri ve bunlarla ilişkili riskleri doğrudan değerlendiriyor. Metodoloji incelemelerinde dış gözden geçirenler, güvenlik testinin kendisinin nasıl tasarlandığını inceliyor. Konu uzmanı incelemesinde ise uzmanlar, belirli risk alanlarına bağlı alan bilgisiyle modelleri test ediyor.
dev.to haberine göre program, OpenAI'nin GPT-4'ten bu yana dış laboratuvarlarla yaptığı iş birliğine dayanıyor ancak daha resmî erişim ve yayın uygulamaları ekliyor. Şirket, GPT-5 nesli için uzun vadeli özerklik, scheming, aldatma, gözetim altını oyma, laboratuvar planlaması fizibilitesi ve saldırgan siber güvenlik kapsayan kapsamlı bir dış yetenek değerlendirmeleri seti koordine ettiğini söylüyor — bu kategoriler, yetenekli sistemlerin uzun süreli görevlerin peşinden gidip gitmediğini, değerlendiricileri yanıltıp yanıltmadığını, gözetimi zayıflatıp zayıflatmadığını veya zararlı faaliyete yardımcı olup olmadığını sorguluyor.
Değerlendiricilerin aldığı erişimin derinliği
Merkezi değişiklik erişim. OpenAI, değerlendiricilerin erken model checkpoint'lerine ve seçilmiş değerlendirme sonuçlarına güvenli erişim alabileceğini söylüyor. Uygun durumlarda şirket, zero-data retention düzenlemelerini destekleyebiliyor ve daha az mitigation etkinleştirilmiş halde test yapmaya izin verebiliyor; böylece değerlendiriciler, sıradan bir kamu ürünü deneyimiyle görünmeyecek davranışları inceleyebiliyor.
Bazı durumlarda OpenAI, değerlendiricilere sıkı güvenlik kontrolleri altında, sıklıkla chain-of-thought olarak adlandırılan model reasoning trace'lerine doğrudan erişim de verdi. dev.to haberi burada net bir çizgi çekiyor: bu, değerlendirme çalışması için özel bir erişimdir; müşterilerin kendi uygulamalarında bekleyebilecekleri bir API yeteneği değildir.
Yayın uygulamaları ve adı geçen iş birlikçiler
Üçüncü taraf değerlendirmeler, system card'lar aracılığıyla da dahil olmak üzere bir biçimde kamuya açıklanıyor ve iş birlikçiler, çalışmalarını gizlilik ve doğruluk incelemesinin ardından yayınlayabiliyor. OpenAI, bu koşullar altında GPT-5 ile ilgili değerlendirme çalışması yayınlayan kuruluşlara örnek olarak METR, Apollo Research ve Irregular'ı sayıyor.
Program API fiyatlandırmasını, kullanılabilirliği veya sıradan müşteri erişimini değiştirmiyor; dolayısıyla API kullanıcıları için pratik etki dolaylı: neyin ve nasıl test edildiğine dair daha ayrıntılı kamusal kanıt.
İşletmeler için sınırlar
dev.to yazısı, dış değerlendirmenin uygulamaya özgü kontrollerin yerine geçen bir şey değil, ek risk bağlamı olduğunu vurguluyor. İleri düzey bir model değerlendirmesi geniş yetenek ve kötüye kullanım risklerini tespit edebilir; ancak belirli bir müşteri destek iş akışının, belge sürecinin veya otomatik kararın belirli bir kurum için uygun olup olmadığını belirleyemez. Yazının pratik önerisi, geniş güvenlik iddialarına bel bağlamak yerine değerlendirme açıklamalarını ürün dokümantasyonuyla birlikte okumak, çıktıların gerçek sonuçları olduğu yerlerde insan incelemesini yerinde tutmak ve yalnızca modeli değil, tüm iş akışını — prompt'lar, veri kaynakları, araçlar ve izinler — test etmek.
Neden önemli
Okuyucular test kapsamını, erişim koşullarını ve ortaya çıkan bulguları göremiyorsa bağımsız değerlendirmenin kamusal değeri sınırlıdır. Erken checkpoint'ler ve reasoning trace'ler dahil daha derin erişimi resmileştirerek ve system card'lar ile değerlendirici yayınları yoluyla açıklama yapma taahhüdüyle OpenAI, dış değerlendirmeyi önde bir laboratuvarın ileri düzey güvenlik çalışmasını nasıl ilettiğinin daha görünür ve tekrarlanabilir bir parçasına dönüştürüyor. Ortaya çıkan açıklamalar sınırları konusunda ayrıntılı ve açık sözlüyse kuruluşlar model seçimi için daha iyi kanıt kazanıyor; belirsiz kalırsa çerçeve bir şeffaflık jesti olarak okunma riski taşıyor. Her durumda emsal — eğitim ve dağıtım hattının içinde sürekli erişime sahip dış uzmanlar — sektör için anlamlı bir değişim.
- #openai
- #ai-safety
- #gpt-5
- #frontier-models
- #evaluation