deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

livenerf: açık ve yalnızca-eklemeli benchmark, Claude Opus 5.5'in lansman sonrası performansta düşüp düşmediğini test ediyor

Yeni bir açık kaynak benchmark, yinelenen 'nerf' iddialarını ölçülebilir veriye dönüştürmeyi amaçlayarak Claude Opus 5.5'in lansshaf haftası taban çizgisine karşı kalibre edilmiş 78 soruluk bir paneli her gün çalıştırıyor.

livenerf: açık ve yalnızca-eklemeli benchmark, Claude Opus 5.5'in lansman sonrası performansta düşüp düşmediğini test ediyor

Nerf tartışması için lansman günü saati

livenerf adlı açık kaynak bir proje, repoya göre 22 Eylül 2026'da yayımlanan Anthropic'in Claude Opus 5.5'ine karşı 30 günlük bir ölçüm kampanyası başlattı. Tek amacı: bir modelin yeteneklerinin yayımlandıktan sonra kayıp gösterip göstermediğini belirlemek. GitHub'da barındırılan ve Hacker News'in ön sayfasında öne çıkan proje, aylardır süren topluluk iddialarından motivated; bu iddialara göre Anthropic, yayımlanmış modelleri quantization ile, aynı adın arkasına yerleştirilmiş daha küçük bir modelle, azaltılmış inference çabasıyla veya routing değişiklikleriyle sessizce kötüleştiriyor. README, rakip açıklama konusunda da dürüst — hiçbir şey olmadı ve kullanıcılar gürültüdeki örüntüleri görüyor — ve lansmanda temiz bir taban çizgisi kaydedilmeden bu tartışmanın her iki taraftan da doğrulanamayan iddialardan oluştuğunu belirtiyor.

Harness nasıl dürüst kalıyor

İlk çalıştırma 24 Eylül 2026'da, lansmandan yaklaşık iki buçuk gün sonra yapıldı ve aynı panel 30 gün boyunca günde bir kez çalışıyor. 1–10. günler taban çizgisini oluşturuyor, ardından iki 10 günlük karşılaştırma penceresi geliyor; dolayısıyla en erken hüküm 24 Ekim civarında çıkabilir; ilk sonuç satırı 20. günden sonra görünüyor.

Modelin kendisi deterministik hale getirilemediği için — sampling parametreleri mevcut değil ve thinking kapatılamıyor — livenerf bunun çevresindeki her şeyi sabitliyor: donmuş prompt'lar, sabitlenmiş bir CLI sürümü, kesin graders ve kalıcı olarak saklanan ham loglar. Kayıp ardından binlerce örnek üzerinden istatistiksel olarak değerlendiriliyor. Harness, İngiltere AI Güvenlik Enstitüsü'nün açık kaynak değerlendirme çerçevesi Inspect üzerine inşa edilmiş ve istatistikler Anthropic'in kendi "Adding Error Bars to Evals" rehberini takip ediyor; yani metodoloji özel tercihler yerine yerleşik uygulamalara dayanıyor.

Panel elle değil, kalibre edilerek oluşturuldu. Repoya göre GPQA Diamond, MMLU-Pro, yarışma matematik ve AIME 2025–26 kaynaklarından alınan 2.336 sorunun her biri dört kez örneklendi; Opus 5.5 ilk denemede soruların yaklaşık %93'ünü doğru cevapladı ve soruların %97'si ya hep doğru ya hep yanlıştı. Tutarsız cevaplanan 78 soru panele dönüştü. Proje kendi seçim yanlılığını da nicelleştirdi — taze örneklerde geçiş oranı %54,7'den %62,0'ya yükseldi — ve güç hesapları için taze rakamları kullandı.

Alışılmadık biçimde v0, bir API anahtarı yerine başsız (headless) Claude Code aracılığıyla bir Claude Max aboneliğinde çalışıyor ve bütçeler planın haftalık kullanım ölçerinin bir payı olarak ifade ediliyor. Panelin tamamının günde bir kez çalıştırılması, haftalık planın yaklaşık %3,6'sını tüketirken 10 günlük pencere başına kabaca 7,5 puanlık bir doğruluk değişimini tespit edebilir.

Neleri tespit edip neleri edemez

29 Eylül itibarıyla 30 günün altısı hiç atlamadan toplanmıştı; hepsi aynı harness hash'i ve sabitlenmiş CLI 2.1.280 üzerinde 90 örneğin tamamını çalıştırdı ve beşinci gün için tek bir bütçe-koruması geçersiz kılma kayda geçti.

Doğrulama, önceden kaydedilmiş kriterini geçti ve performans düşüşünün ilk nerede görünür hale geldiğini gösterdi: token sayıları. Düşük effort ile çalıştırmak çıktı token'larını %62 azaltırken doğruluktan 8,3 ± 4,5 puan götürdü; orta effort token'ları %26 azalttı ve 4,2 ± 3,9 puana mal oldu. Örnek başına medyan çıktı token sayısı ikincil bir sinyal olarak izleniyor; çünkü sessizce azaltılmış thinking büyük olasılıkla doğruluk hiç kıpırdamadan önce tam orada kendini gösterirdi.

Belirtilen sınırlar vaatler kadar önemli. Opus 5.5 yerine Opus 5'i yerleştiren bir doğrulama −3,8 ± 6,3 puan ve −%23 token farkı üretti — %99 güvenle ayırt edilebilir değil. Dolayısıyla ölçüm aracı, doğrulama örneklem büyüklüklerinde bu ölçekteki bir aynı aileden model değişimini dışlayamıyor; tam bir 10 günlük pencere kabaca 2,5 kat fazla örnek içeriyor, ancak repo bunun yeterliliğinin kanıtlanmadığını söylüyor.

Panel sorularının denetiminde, incelenen 80 soru arasından 8 yanlış cevap anahtarı ve 30 belirsiz madde bulundu. Hiçbir şey çıkarılmadı; önceden kaydedilmiş bir duyarlılık analizi sonuçları bunlar olmadan yeniden çalıştırıyor. Anthropic'in serving yolu bazı örneklerde Opus 5 ile cevap verdiği veya belirli biyoloji ve matematik sorularını reddettiği durumlarda bu örnekler reddedilip sayıldı ve etkilenen sorular hariç tutuldu.

Neden önemli

Yayımlanmış modellerin sessizce kötüleştiği iddiaları artık frontier model söyleminin yinelenen bir özelliği ve bir lansman günü taban çizgisi olmadan fiilen yanlışlanamaz durumda. livenerf'in katkısı teknik olduğu kadar prosedürel: kamuya açık bir git zaman damgasına bağlanmış ön kayıt, yalnızca-eklemeli bir sonuç logu, kümelendirilmiş standart hatalar ve iyileşmeleri gerilemelerle aynı görsellikte raporlama taahhüdü. Boş bir sonuç bile bilgilendirici olurdu ve tespit sınırlarının — mütevazı bir aynı aileden değişimin gözden kaçabileceği dahil — dürüstçe açıklanması, diğer değerlendiricilerin nadiren ulaştığı bir standart belirliyor. Tasarım klonlanabilir ve bütçe-farkındar olduğu için, geliştiricilere yalnızca bu modele değil, bağımlı oldukları herhangi bir modelin bağımsız izlenmesi için yeniden kullanılabilir bir şablon da sunuyor.

  • #anthropic
  • #claude
  • #llm-evals
  • #benchmarks
  • #open-source

İlgili yazılar