deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

skillcheck güncellemesi puanlamayı düzeltiyor, temiz hata durumları ve ölçülmüş tokenizer hata oranları ekliyor

Claude Code, Copilot, Codex ve Cursor için SKILL.md statik analiz aracı skillcheck'in sağlamlaştırma odaklı sürümü, medyan açıklama puanlarını yükseltiyor ve ölçülmüş tokenizer hata oranlarını yayımlıyor.

skillcheck güncellemesi puanlamayı düzeltiyor, temiz hata durumları ve ölçülmüş tokenizer hata oranları ekliyor

Neler yayımlandı

SKILL.md dosyaları için statik analiz aracı olan skillcheck, yeni özelliklerden çok sağlamlaştırma ve doğruluğa odaklanan bir güncelleme aldı. SKILL.md; Claude Code, Copilot, Codex ve Cursor gibi agent'ların yeniden kullanılabilir yetenekleri (skill) yüklemek için kullandığı formattır; araç frontmatter'ı doğrular, bir skill'in açıklamasının ne kadar bulunabilir olduğunu puanlar, dosya referanslarını kontrol eder, kademeli token bütçelerini zorunlu kılar ve agent'lar arası uyumluluk sorunlarını işaretler. Geliştiricinin dev.to'daki gönderisine göre araç hiçbir ağ çağrısı yapmıyor, LLM API çağrısı gerçekleştirmiyor ve dosyaları asla değiştirmiyor; CLI, GitHub Action veya pre-commit hook olarak çalışıyor. agentskills.io spesifikasyonunu hedefliyor ve Python 3.10 veya daha yeni bir sürüm gerektiriyor.

Baştan yazılan açıklama puanlayıcısı

En görünür değişiklik açıklama puanlayıcısında. Önceki uygulama, iyi yazılmış açıklamaları hak ettiğinden az puanlıyordu; bu da önemli, çünkü puanın varlık sebebi bir agent'ın skill'i gerçekten bulup tetikleyip tetiklemeyeceğini öngörmek. Düzeltmeden sonra, aracın referans derlemindeki medyan puan 75'ten 90'a çıktı. --explain-score bayrağı artık çıplak bir sayı döndürmek yerine hangi puanlama deseninin isabet edip etmediğini raporluyor ve geliştirici, düzeltmenin gerçek dünyadaki skill'lerle doğrulandığını söylüyor: dolgu metinleri hâlâ 28 ile 65 arasında puan alırken, iyi yazılmış açıklamalar 85 ile 100 arasında yer alıyor; yani iyi ve kötü metin arasındaki ayrım korunuyor.

Bozuk dosyalar artık temiz biçimde başarısız oluyor

Güncelleme ayrıca çökmeleri temiz hatalarla değiştiriyor. Daha önce, bozuk bir geçmiş defteri veya bir skill dizininin üstünde bulunan UTF-8 olmayan bir skillcheck.toml dosyası ham bir Python traceback'i üretiyordu. Yapılandırma keşfi dizin ağacında yukarı doğru ilerlediği için, tek bir bozuk dosya altındaki tüm taramaları bozabiliyordu. Artık güvenilmeyen tüm okumalar — dosya alımı, geçmiş ve yapılandırma — ayrıştırma öncesinde ortak bir korumadan geçiyor ve her biri aynı şekilde başarısız oluyor: dosyayı ve byte ofsetini belirten net bir hata ve 2 çıkış kodu.

Ölçülmüş token tahminleri

README'deki token sayıları varsayıma değil ölçüme dayanacak şekilde düzeltildi. skillcheck'in bütçe kontrollerini besleyen çevrimdışı buluşsal yöntem hiçbir zaman gerçekten karşılaştırılmamıştı; şimdi tiktoken'ın cl100k_base tokenizer'ı ile 61 gerçek SKILL.md dosyasından oluşan bir derlem üzerinden ölçüldü. Sapma tek yönlü: buluşsal yöntem 61 dosyanın tamamında fazla tahminde bulunmuş. Medyan hata tüm dosya boyutlandırması için %23,0 (p95 %30,7), frontmatter metadata bütçeleri için %25,9 (p95 %35,3) ve gövde bütçeleri için %22,7 (p95 %30,7). İsteğe bağlı tiktoken eklentisi olmadan kullanıcılar kabaca %20-30 fazla tahmin beklemeli; bu yüzden geliştirici, bir bütçe sınırına yakın çalışırken skillcheck[tiktoken] eklentisinin kurulmasını öneriyor.

Dahili sağlamlaştırma

Sürümün geri kalanı bilinçli olarak görünmez: bayrak çakışması mantığı tek bir doğruluk kaynağında birleştirildi, golden-file testleri artık kesin tanı çıktısını sabitliyor ve kapsam alt sınırı %75'ten %80'e yükseltildi; kural modüllerindeki 1.058 testte gerçek kapsam %90. Derlem genelindeki tanı çıktısı, değişiklik öncesi ve sonrası byte byte aynı olacak şekilde doğrulandı; yani yukarıdaki maddeler dışında hiçbir şey değişmedi.

Neden önemli

SKILL.md, birkaç büyük kodlama agent'ı arasında paylaşılan altyapı haline geliyor ve onun için kalite kapıları ancak sinyallerine güvenilebilirse işe yarar. İyi açıklamaları cezalandıran bir puanlayıcı ya da sessizce dörtte bir fazla sayan bir tokenizer, yazarları yanlış düzenlemelere itebilir — sorunsuz olan metni kırpmak ya da bozuk bir metriği istismar etmek. Kendi hata oranlarını ölçerek, bozuk girdide sesli biçimde başarısız olarak ve tanıları istikrarlı tutarak skillcheck, denetlediği skill'lere uyguladığı standardı kendine de uyguluyor.

  • #static-analysis
  • #developer-tools
  • #ai-agents
  • #cli
  • #python

İlgili yazılar