· kaynak GitHub Blog
GitHub, yapay zekâ kod inceleme ajanları için açık bir kıyaslama aracı olan ReviewBench'i yayınladı
GitHub, yapay zekâ kod inceleme ajanlarını 219 gerçek dünya pull request'i üzerinde, grounded ve augmented precision-recall ölçümleriyle puanlayan açık bir kıyaslama aracı olan ReviewBench'i yayınladı.

GitHub, yapay zekâ kod inceleme ajanları için kamuya açık bir ölçüt sunuyor
GitHub, yapay zekâ kod inceleme ajanlarını gerçekçi pull request'ler üzerinden puanlamak için açık bir kıyaslama aracı olan ReviewBench'i yayınladı. Şirket, GitHub Blog'daki yazısında bu yayını kalıcı bir soruna cevap olarak konumlandırıyor: mevcut değerlendirmeler etiket kalitesi, kapsam ve günlük inceleme işini ne kadar gerçekçi temsil ettikleri arasında ödünleşimler dayatma eğiliminde; bu da ekipleri ajanları karşılaştırabilecekleri ya da kendi ajanlarında yapacakları bir değişikliğin ürekte gerçekten işe yarayıp yaramayacağını anlayabilecekleri güvenilir bir yöntemden yoksun bırakıyor.
103,9 milyon pull request üzerine modellenmiş bir külliyat
GitHub'a göre kıyaslamanın biçimi, platformdaki 103,9 milyon gerçek pull request'in analizine dayanıyor; bu analiz inceleme iş yüklerinin dile, depo boyutuna ve değişiklik boyutuna göre nasıl dağıldığını haritalamak için kullanılmış. Yayınlanan külliyatın kendisi, açık kaynak lisanslarıyla yayınlanan 187 herkese açık depodan gelen, 19 dili kapsayan ve GitHub geneli rakamlarla uyumlu dil ile depo boyutu profillerine sahip 219 pull request içeriyor.
Dağılımlardan biri bilinçli olarak kaydırılmış. Pull request boyutu, küçük tek dosyalık düzenlemelerden ziyade içerikli, çok dosyalı değişikliklere doğru ağırlıklandırılmış; GitHub'a göre bu tür küçük düzenlemeler ham veride aşırı temsil ediliyor ve inceleme kalitesini ölçmek açısından en az öneme sahip. Veri kümesinin tamamı kamuya açık.
Pek çok elden gelen gerçek veri
Hiçbir inceleyici — ister insan ister model — her şeyi yakalayamayacağı için GitHub, altın kümesini üç aşamada oluşturuyor. Aday bulgular önce insan inceleyicilerden, yazarların takip commit'lerinde ima edilen sorunlardan, deterministik analiz araçlarından ve farklı model ailelerinden birkaç öncü LLM'den toplanıyor. Anlamsal olarak yinelenen bulgular daha sonra birleştiriliyor; böylece kaynaklar arasındaki örtüşme küzeyi yapay olarak şişiremiyor. Son olarak her aday, tek bir ortak değerlendirme ölçütüne göre yargılanıyor: nereden geldiğine bakılmaksızın yalnızca gerçek, ilgili ve içerikli ise gerçek pozitif sayılıyor.
Claude Sonnet 5, bu ölçütü uygulayan değerlendirici (grader) rolünü üstleniyor; GitHub da şeffaflık ve tekrarlanabilirlik için hem ölçütü hem de değerlendiriciyi yayınlıyor. Kıdemli mühendisler, yayın öncesinde altın gerçek pozitifleri bağımsız olarak etiketledi; GitHub yüzde 96,6 uyum bildiriyor ve otomatik değerlendiriciyi insan yargısına göre kalibre etmek için insan etiketli bir geliştirme kümesi kullanılıyor.
Grounded ve augmented ölçümler
ReviewBench iki ölçüm ailesi raporluyor. Grounded precision, recall ve F1, bir ajanı katı biçimde mevcut altın etiketlerle karşılaştırır: zaten bilinen sorunlardan kaçıını ajan buldu ve bildirdiklerinin ne kadarı bunlarla örtüştü. Augmented precision, recall ve F1 daha ileri giderek eşleşmeyen her bulguyu değerlendiriciye gönderir; değerlendirici de bunun gerçek bir keşif mi yoksa yanlış alarm mı olduğuna karar verir. Bu ayrım önemli, çünkü herhangi bir sabit altın küme, ajanlar hazırlayanların hiç öngörmediği sorunları buldukça bayatlıyor ve augmented puanlama bu bulguları otomatik olarak cezalandırmak yerine onlara kredi veriyor.
Augmented recall, paydasını her ajanın keşfettiği şeyle genişlettiği için GitHub, sistemler arası karşılaştırma için ana ölçü olarak grounded recall'ı belirliyor; augmented rakamlar ise sistem başına tanı araçları olarak değerlendiriliyor.
Sonuçlar önem derecesine (kritik, orta ve düşük) ve kategoriye (doğruluk, güvenlik, güvenilirlik, bakım kolaylığı ve test dahil) göre dilimlenebiliyor. F-beta ağırlıklandırması da ayarlanabilir; böylece değerlendirenler geniş kapsam ya da precision lehine tercihte bulunabiliyor. GitHub, bu yapılandırılabilirliğin gerekli olduğunu savunuyor çünkü tek bir ideal inceleme profili yok: bazı geliştiriciler yalnızca kritik sorunların yüzeye çıkmasını isterken, diğerleri daha geniş kapsam karşılığında daha fazla gürültüyü kabul ediyor.
GitHub, ReviewBench'teki hareketliliğin Copilot code review ile yaptığı çevrimiçi üretim deneylerinin yönünü takip ettiğini, şirketin çevrimdışı kazanımların gerçek kullanıcı faydasına dönüşeceği konusunda güveninin de buradan geldiğini ekliyor. Kendi inceleme ajanlarını geliştiren ekipler ajanlarını sisteme dahil edip sonuç gönderabiliyor.
Neden önemli
Yapay zekâ inceleme araçları satın alan ya da geliştiren herkes için ReviewBench, alanın eksikliğini çektiği bir şey sunuyor: elle seçilmiş bir demo kümesine değil, üretim davranışına bağlı, tekrarlanabilir ve kamuya açık bir çevrimdışı sinyal. Önem derecesi ve kategori dilimleri, kuruluşların bir inceleyiciyi kendi gerçek risk toleranslarına göre eşleştirmesini sağlıyor; böylece güvenlik odaklı ekipler ile gürültüden kaçınan ekipler, ajanları kendilerine önemli gelen rakamlar üzerinden karşılaştırabiliyor.
Tasarım tercihleri kendi başına dikkat çekici. Yinelenenlerin ayıklanmasıyla çok kaynaklı gerçek veri, yayımlanmış bir ölçüt ve değerlendirici, yayımlanmış insan uyum oranları ve yeni bulgulara kredi veren augmented ölçümler, LLM kıyaslamalarına yönelik tanıdık eleştirilere — bayat altın kümeler ve opak değerlendirme — hitap ediyor. İki uyarıyı aklıda tutmakta fayda var. 219 pull request'lik külliyat, dağılım için analiz edilen 103,9 milyon isteğe göre küçüktür ve değerlendiricinin kendisi de bir LLM'dir; yani puanlar nihai olarak değerlendiricinin kalitesine dayanır — bu risk, kalibrasyon ve uzman denetimleriyle azaltılmış ama ortadan kaldırılmamıştır.
- #ai
- #code-review
- #benchmark
- #github
- #open-source
İlgili yazılar
- Yeniden inşa edilen GitHub Trending hattı, yalnızca README içeren dört malware repositorisini ortaya çıkardı
- Anthropic'ın Claude'u bir sohbette tehdit iddialarını işaretledi, Florida'da bir tutuklamayla sonuçlandı
- OpenAI, ChatGPT tarafından üretilen görsellerin yanında etiketli display reklamlar gösterecek