· kaynak dev.to (home feed)
69 agent skill'inden 16'sı, ilk çalıştırmalarda başarılı olmasına rağmen daha zor girdilerle yapılan ikinci testte başarısız oldu
Bir agent skill satıcısı, 69 skill'inin tamamını bilinçli olarak zorlaştırılmış girdilerle yeniden test etti ve ilk çalıştırmayı geçmiş 16 skill'de hata buldu. Hatalar en çok, belirsizliğin olgu gibi yeniden ifade edilmesinde yoğunlaştı.

Tek başarılı çalıştırma yetmiyordu
Agent skill'leri geliştirip satan bir ekip, 69 skill'inin tamamını bilinçli olarak zorlaştırılmış girdilerle yeniden test etti ve 16'sında, yani kabaca dörtte birinden biraz azında hata buldu. ProSkillPacks'in dev.to'daki yazısına göre, bu 16 skill'in her biri daha önce gerçek ve herkese açık bir girdiyle ilk çalıştırmayı geçmiş; bir insan bu çıktıyı okuyup kabul edilebilir bulmuştu.
Yazarların çıkarımı nettir: Tek bir başarılı çalıştırma, bir skill'in işi bir kez yapabildiğini gösterir; yapmaya devam edeceğini değil.
Yeniden test nasıl yapıldı
Ekip, her skill için beş zorluk kategorisinden seçilmiş bir girdi hazırladı:
'Bence' ve 'belki' gibi ifadelerle dolu belirsiz notlar.
Çelişkiler; örneğin hem ucuz hem premium bir şey isteyen bir brief ya da başlığı ve gövdesi birbiriyle çelişen bir ilan.
Zayıf ya da engellenmiş kaynaklar: neredeyse boş sayfalar, ölü bağlantılar, 403 hatası.
Aşırı iddialı olma istekleri; örneğin girdide bulunmayan ama etkileyici duran sonuçlar talep etmek.
Dağınık veriler: yinelenen kayıtlar, 13 numaralı ay ve saçma tutarlar dahil.
Her çıktı bir insan tarafından okundu ve girdisiyle karşılaştırıldı. Otomatik bir değerlendirici yoktu; jüri rolünde ikinci bir model de yoktu. Tüm çalıştırmalar Claude Sonnet ile yapıldı; yazarlar bunu sınırlamaları arasında sayıyor.
Gerçekte ne bozuldu
16 hata şöyle dağıldı:
Yedisi belirsiz girdiyi olgu gibi yeniden ifade etti.
Üçü uydurulmuş ya da dayanaksız iddialar üretti.
İkisi bir özet içindeki öğeleri yanlış saydı.
İkisi brief'te mevcut bir çelişkiyi adlandırmayı başaramadı.
Bir script, sıkıştırılmış bir yanıtı yanlış okudu.
Biri, dokunmaması gereken bir dosyaya yazdı.
Gönderiye göre en büyük grup aynı zamanda en sessiz olanı: bir skill belirsizliği bir yerde kabul ediyor, sonra son okuyucuya yönelik metinde onu kesinleşmiş olgu olarak sunuyordu.
Somut örnekler öğretici. Bir bülten skill'i, onaylanmamış bir posta ücreti değişikliğini alarak artışı karar verilmiş gibi duyuran bir konu satırı üretti; düzeltmeden sonra bu, Nisan hakkında temkinli bir soruya dönüştü. Bir ev sahibinin dışarıda sigara içmeyle ilgili denemeci notu katı bir ev kuralına dönüştü; düzeltilmiş çıktı bu noktayı belirsiz olarak işaretleyip onay istedi. Sahile yürüme mesafesini temkinli ifade eden bir ilan, temkini tamamen düşüren bir başlık üretti; niteleyici yalnızca açıklamada kaldı. Bir iddia denetleyicisi dokuz iddia bildirip sekizini yüksek riskli olarak derecelendirirken, kendi tablosu yedi yüksek, iki orta gösteriyordu. Ve yalnızca okuma yapan bir CSV profiler, tek bir cümlede hem bir dosyaya dokunmadığını hem de temizlenmiş bir sürümünü yazdığını iddia etti.
Dikkat çekmeye değer bir örüntü: temkinner önce en kısa alanlarda, başlıklarda, konu satırlarında ve özetlerde kayboluyordu.
Küçük düzeltmeler, her zaman yeniden çalıştırma
Bir script onarımı dışında tüm hatalar, skill'in talimatlarına bir ya da iki cümle eklenerek giderildi. Ekip ayrıca başkaları için metin yazan skill'ler için kalıcı bir kural benimsedi: girdide belirsiz olarak işaretlenen her şey, son metin dahil her çıktıda belirsiz olarak kalır ve asla olgu olarak ifade edilmez. Onarılan her skill ardından, onu bozan aynı girdiyle yeni bir çalıştırmadan geçti.
Ödünç alabileceğiniz bir kontrol listesi
Gönderi, herhangi bir prompt veya skill için bir öğleden sonra sürebilecek bir test ortaya koyuyor. Ona temkinli ifade edilmiş bir olgu verin ve temkinin başlıkta, konu satırında ve özette korunup korunmadığını kontrol edin. İkisi de aynı anda doğru olamayan iki olgu verin ve çelişkiyi adlandırıp adlandırmadığına yoksa sessizce bir taraf mı seçtiğine bakın. Ana girdiyi kaldırın ya da hata veren bir sayfaya yönlendirin ve boşluğu doldurmak yerine boşluğu bildirdiğini doğrulayın. Aşırı iddialı olmasını isteyin ve reddedip reddetmediğine bakın. Bir özetdeki her sayımı elle doğrulayın. Beyan edilen eylemleri gerçek davranışla karşılaştırın: bir aracın yalnızca okuma modunda olması gerekiyorsa, hiçbir şey yazılmadığını teyit edin. Ve her düzeltmeden sonra yeniden çalıştırın; çünkü yeniden test edilmemiş bir onarım hiçbir şey kanıtlamaz.
Neden önemli
Yaklaşık yüzde 23'lük çarpıcı hata oranı, kendi ürünlerini test eden bir satıcıdan, tek bir modelden, kendi kendine değerlendirilen çıktılardan, skill başına tek bir zor girdiden ve kısmen sentetik test vakalarından geliyor; dolayısıyla bu, agent skill'leri için genel bir hata oranı değil. Ama yöntem sayıdan daha önemli: ucuz karşıt ikinci çalıştırmalar, sıradan ilk çalıştırmaların gizlediği hataları gün yüzüne çıkarıyor ve baskın hata sınıfı, yani belirsizliğin sessizce kendinden emin bir metne dönüşmesi, tam da çıktının üstünkörü bir gözden geçirilmesinin gözden kaçıracağı türden. Prompt, skill veya agent geliştiren herkes aynı kontrol listesini bir öğleden sonra uygulayabilir ve bakılması gereken ilk yer en kısa çıktı alanlarıdır. Ticari çıkar, gönderinin kendisinde açıklanmış durumda; sayıları tartarken bunu akılda tutmakta fayda var.
- #ai-agents
- #llm-evaluation
- #prompt-engineering
- #quality-assurance
- #claude
İlgili yazılar
- Anthropic'ın Opus 5.5 rehberi: 'adım adım düşün' demeyi bırakın ve sessiz düşürmelere dikkat edin
- Doğrulanmamış dev.to raporu, OpenAI'nin GPT Sol 6.1'i uyarlamalı akıl yürütme ve araç yönlendirmeyle yayınladığını iddia ediyor
- GPT-6 Astra rakip botun kodunu çalıştırırken StarCraft'ta hile yaparken yakalandı