· kaynak dev.to (home feed)
CauterRule v0.3.0 PyPI'de: alan bazlı replay ile recall iki kattan fazla arttı
Açık kaynak agent-rule aracı CauterRule v0.3.0 artık GitHub ve PyPI'de. Sürümün başlıca değişikliği, replay değerlendirmesini kuralın kendi alanına göre sınırlayarak metriğin paydasını düzeltmesi ve recall'ü 2,2 ile 2,7 kat arasında artırması.

Neler yayınlandı
CauterRule v0.3.0 artık GitHub ve PyPI'de kullanılabilir. dev.to'daki sürüm yazısına göre paket, yapay zeka agent'ları için açık kaynaklı bir sidecar olup yürütme trajectory'lerinden tekrarlayan hataları çıkarır, bunları önleyecek kalıcı kurallar önerir ve her adayı terfi ettirmeden önce referans çalışmalara karşı replay ederek doğrular. Sürüm, eksiksiz bir CLI, framework adapter'ları, bir kural yaşam döngüsü ve resmi rule pack'lerle birlikte bir pack ekosistemi içeriyor.
Sürümün öne çıkan değişikliği ise yeni bir özellik değil, bir değerlendirme düzeltmesi.
İyi kuralları gizleyen metrik
Arka arkaya iki saha testinde bir rakam yerinden kıpırdamıyordu: 0,087'lik golden recall. Her iki rapor da matcher kalibrasyonunu en yüksek değerli mühendislik hedefi olarak işaret ediyordu. v0.3.0 çalışması, sorunun matcher olmadığı sonucuna vardı — sorun referans havuzundaydı.
Recall, bir aday kuralın önlediği hataların, corpus'taki tüm hatalara (yaklaşık 200 tane) bölünmesiyle hesaplanıyordu. Üç gerçek git hatasını durduran gerçekten yararlı bir kural 200 üzerinden 3, yani 0,015 puan alıyordu. Hiçbir kabul eşiği bu kadar düşük bir puanı gürültüyü de kabul etmeden kabullenemez; dolayısıyla iyi kurallar her yerde reddediliyordu. dev.to yazısının deyişiyle temel varsayım, havuzdaki her hatanın her aday için adil bir test vakası olduğu yönündeydi — bu, kurallar alana özgü olduğu sürece yanlıştır ve gerçek bir kural motoru için her zaman öyledir.
Replay'i alana göre sınırlamak
v0.3.0, puanlamadan önce referans kümesini, adayın kaynak alanını paylaşan trajectory'ler olacak şekilde filtreliyor. Genel havuz aslında 230 referanstan 444'e büyüdü, ancak her aday artık küçük bir alan içi dilime göre değerlendiriliyor: git için 19, python ve docker için 30'ar referans. 0,015 puan alan aynı üç hatalık git kuralı şimdi yaklaşık 0,11 puan alıyor.
Yanında bir değişiklik daha yayınlandı: geçiş eşiği 0,8'den 0,5'e düştü. Yazar bunun bir düzeltme değil, dürüst bir ölçeğe yeniden kalibrasyon olduğunu açıkça belirtiyor ve iki değişikliği birlikte çıkarmış olmanın atıfı bulanıklaştırdığını kabul ediyor — recall kazanımları sınırlamaya aitken, geçiş oranındaki hareket ikisini de yansıtıyor.
Rakamlar
v0.3.0 saha testi, iki bulut modelini (gpt-4o-mini ve llama-3.1-8b) 40 corpus ve 4.768 trajectory çalışmasında değerlendirdi. Modellerde, prompt'larda veya çekirdek matcher puanlamasında hiçbir değişiklik yapılmadan gpt-4o-mini için golden recall 0,068'den 0,170'e (2,5 kat), llama-3.1-8b için 0,104'ten 0,228'e (2,2 kat) yükseldi. Failures-positive ölçütünde iki model sırasıyla 0,068'den 0,182'ye ve 0,104'ten 0,277'ye çıktı; ikisi de 2,7 kat. Golden geçiş oranları sırasıyla yüzde 40 ve yüzde 50'ye ulaştı. Yazıya göre iyileşmenin her iki modelde de tutması, bir yetenek tavanı değil, bir değerlendirme hatasının imzasıdır.
Hâlâ bozuk olanlar
Düzeltme açık sözlü bir şekilde kısmi olarak tanımlanıyor. 0,170 ile 0,228 arasındaki recall, kabaca 0,70'lik hedefin çok altında ve küçük bir sayıyı iki katına çıkarmak yine küçük bir sayı bırakıyor. Matcher'ın parafraz açığı dokunulmamış durumda: semantik eşleştirme 0,2 karışım ağırlığında çalışırken, "non-fast-forward" ile "Updates were rejected because the remote contains work that you do not have locally" ifadelerini — aynı olayın farklı token'larla ifade edilişini — bağlayamıyor. Sınırlama ayrıca referans bakımından zengin alanları kayırırken zayıfları cezalandırabilir; bu ölçülmemiş durumda. Açık sorular arasında daha yüksek bir semantik ağırlığın yardımcı olup olmayacağı, doğru kapsamın alan yerine hata sınıfı olup olmadığı, sınırlamanın kaç referansta yardımı kesmeye başladığı ve etiketsiz adayların orijinal hatayı geri getirmeden nasıl ele alınacağı yer alıyor.
Neden önemli
Bu sürümün dikkati hak etmesinin iki nedeni var. Birincisi aracın kendisi: tek seferlik agent hatalarını kalıcı, replay ile test edilmiş kurallara dönüştürmek, yeniden eğitim veya prompt cerrahisi gerektirmeyen, pragmatik bir agent güvenilirliği yoludur ve artık bir pip install uzağınızda.
İkincisi, ders bu projenin çok ötesine genellenebilir. Her model bir metrikte aynı şekilde kötü puan aldığında, dev.to yazısının savunduğu gibi, önce modele değil paydaya şüpheyle yaklaşın. Değerlendirme kümesinin bileşimi bir detay değil, bir ürün kararıdır — "tüm hatalara karşı recall" titiz kulağı çalabilir ama gerçekte umursadığınız sorudan farklı bir soruyu yanıtlar ve recall her zaman, her eklenen referansla küçülen bir alt sınır olarak okunmalıdır.
- #ai-agents
- #open-source
- #python
- #evaluation
- #llm