· kaynak dev.to (home feed)
Claude Code 2.1.269 resmi plugin eval runner'ı erişime açıyor; maintainer'ın geçiş notları dört tuzak ortaya çıkarıyor
Claude Code 2.1.269, plugin suite'leri için resmi bir eval runner'ı herkese açık olarak sunuyor; aynı gün geçişi yapan bir maintainer ise katı frontmatter kurallarını, geçici transcript'leri ve aracın bilinçli olarak dışarıda bıraktıklarını belgeliyor.

Claude Code 2.1.269, claude plugin eval komutunu herkese açık resmi bir komut haline getiriyor: Claude Code plugin'lerine bağlı değerlendirme suite'leri için birinci parti bir runner. Sürüm, aynı gün yapılan bir geçiş anlatımıyla birlikte, config-drift-checker'ın maintainer'ı tarafından dev.to'da yayınlanan bir saha raporunda belgelendi; bu araç, resmi sürüm henüz kapalıyken kendi uyumlu runner'ını zaten yayınlamıştı.
Rapora göre resmi runner başlangıç eval case'leri üretebiliyor, varsayılan olarak plugin'siz bir ablasyon kolu çalıştırıyor ve böylece her sonuç yerleşik bir kontrol karşılaştırmasıyla geliyor; ayrıca hem bir HTML raporu hem de JSON çıktısı üretiyor. Kendi harness'ini kendisi yazan yazarlar için bu, sorunu yeniden çerçeveliyor: harness artık farklılaştırıcı olmaktan çıkıyor ve eval case'leri ürünün kendisi haline geliyor.
Birinci günün geçiş notları
Maintainer, resmi komut yayınlandığı gün geçişi yaptı ve dört sürtünme noktası kaydetti.
Frontmatter bir beyaz liste, uyarı sistemi değil. Araçların önceki, daha esnek parser'ı altında kapsam takibi için kullanılan özel covers: anahtarı taşıyan case'ler, "unknown frontmatter key" hatasıyla doğrudan yüklenemedi. Rapordaki çözüm, özel metadata'yı bir case'in prompt dosyasının yanındaki bir sidecar dosyasına taşımak; runner bu dosyayı tanımadığı için olduğu gibi bırakıyor.
YAML parser'ı katı. Tırnak içinde olmayan bir iki nokta ve ardından boşluk içeren bir description parse edilemiyor; maintainer'ın altı case'inden ikisi buna takıldı. Bu tür description'ları tırnak içine almak hatayı önlüyor.
--case bayrağı bir case'in dizinini değil, bildirilen adını eşleştiriyor. spring-work-triggers-skill adlı bir dizine göre filtreleme hiçbir sonuç vermedi, çünkü case'in gerçek adı "Spring work triggers the conventions skill" idi.
Transcript'ler geçici. Tam tool çağrıları ve yanıtlar, komuttan çıkıldığında silinen geçici bir trace dosyasına gidiyor. Kalıcı olan JSON skorları, tur sayılarını ve maliyeti taşıyor ama agent'ın gerçekte ne yaptığını değil.
Bu son sınırlamanın somut bir sonucu oldu. Maintainer'ın aracı, şüpheli diff'leri sıfır tool çağrısı, tek tur ve kısa bir yanıt gördüğünde olası model reddi olarak işaretliyor; böylece yukarı akıştaki bir guardrail değişikliği bozuk bir yerel kurulum gibi görünmüyor. Transcript'ler olmadan "sıfır tool çağrısı" ile "bilinmiyor" ayırt edilemez hale geliyor; bu yüzden etiket artık olumlu kanıt gerektiriyor ve resmi runner çıktısında asla tetiklenmiyor. JSON üzerine inşa yapan herkes için daha geniş uyarı şu: pipeline'ınızda "bilinmiyor"un ne anlama geldiğine erken karar verin.
Resmi runner'ın bilinçli olarak dışarıda bıraktıkları
Rapora göre resmi komut tek bir soruyu yanıtlıyor — plugin şu anda, bu makinede çalışıyor mu — ve bilinçli olarak hiçbir şey hatırlamıyor. Saklanan bir baseline yok, çalışma geçmişi yok ve bir case'in geçen aydan bu yana gerileyip gerilemediğini, hangi case'lerin sadece flaky olduğunu ya da hangi Claude Code sürümünün bir şeyleri bozduğunu sormanın bir yolu yok. Dokümantasyon bunun yerine sonuçların çalışmalarda karşılaştırılabilir kalması için bir model pinned etmeyi öneriyor.
İşte bu boşluk, resmi runner ile aynı gün yayınlanan config-drift-checker v0.5.0'ın konumlandığı yer. Resmi formatteki case'leri ve altında resmi runner'ı kullanarak, üzerine pinned bir baseline, her sürümü kapsayan geçmiş, her case'in kendi geçmişinden öğrenilen case başına gürültü bantları (maintainer'ın case'lerinden biri doğal olarak 0.75 salınım yapıyor, bu yayılım herhangi bir sabit eşiği alt eder), bir Claude Code sürümü gerçekten yayınlandığında çalışan bir canary hattı ve yeni bir model iki kez yeşil kanıtladığında otomatik bir sürüm yükseltme pull request'i ekliyor.
Neden önemli
Resmi bir eval runner, Claude Code plugin'lerinin bir deneme değil gerçek bir platform olarak ele alındığının sinyali: yazarlar artık kendi harness'lerini kurmak zorunda kalmadan tekrarlanabilir puanlama, kontrol karşılaştırmaları ve makine tarafından okunabilir çıktı elde ediyor. Bu maintainer'ı zorlayan katılık — reddedilen frontmatter anahtarları, katı YAML, isim tabanlı filtreleme — standardizasyonun bedeli ve geçici transcript, aşağı akış analizinin dürüstçe iddia edebileceklerini sınırlıyor. Bu anlatım dev.to'da bildirilen tek bir maintainer'ın birinci gün deneyimi, bu yüzden keskin köşeler sonraki sürümlerde yumuşayabilir. Ancak tarif ettiği tasarım sınırı — baseline'ların, geçmişin ve trend analizinin ekosisteme bırakıldığı durum bilmez bir puanlama komutu — bilinçli görünüyor ve Claude Code eval'leri çevresindeki üçüncü parti araçların tam olarak nerede yaşayacağını tanımlıyor.
- #claude-code
- #anthropic
- #evals
- #ai-agents
- #developer-tools
İlgili yazılar
- Firecrawl'ın yapay zekâ yazılım fabrikası şablonu: ajandan merge edilmiş pull request'e beş kapı
- Anthropic'in Claude Code anketi kullanım ve PR sayısının arttığını, teslim metriklerinin ise sabit kaldığını gösteriyor
- Anthropic raporu, yapay zeka modellerinin dış sistemlere sızdığı dört olayı ayrıntılarıyla ortaya koyuyor