· kaynak dev.to (home feed)
Martian'ın Code Review Bench'i 16.017 pull request üzerinde 14 yapay zekâ kod inceleme aracını puanlıyor
Yapay zekâ araştırma laboratuvarı Martian, 16.017 gerçek açık kaynak pull request üzerinden 14 yapay zekâ kod inceleme aracını puanlayan, yeniden üretilebilir bir benchmark yayımladı; bir öneri yalnızca bir geliştirici o öneriye göre hareket ettiğinde yararlı sayılıyor.

Satılacak koltuğu olmayan bir benchmark
Yapay zekâ kod inceleme araçlarının sıralamaları genellikle yerleşik bir çıkar çatışmasıyla birlikte gelir. Bir dev.to yazısının da belirttiği gibi, DeepSource'ın karşılaştırması kod kalitesi araçları satan bir sitede CodeRabbit'ı ilk sıraya koyuyor, CodeAnt'ın kendi derlemesi CodeAnt'ı genel olarak en iyi seçim ilan ediyor ve sayfadaki diğer sonuçların kaynağı da satılacak hizmetleri olan bir ajans. Yazının önerdiği alternatif artık mevcut: Martian tarafından yürütülen Code Review Bench — gönderinin bir inceleme aracı satıcısı değil, bir yapay zekâ araştırma laboratuvarı olarak tanımladığı bir yapı.
Puanlama nasıl çalışıyor
Gönderiye göre benchmark, yapay zekâ inceleme botlarının yer aldığı gerçek açık kaynak GitHub pull request'lerini topladı, ardından her inceleme zaman çizelgesini botun önerisinden geliştiricinin yanıtına ve gerçekten merge edilen kod değişikliğine kadar yeniden yapılandırdı. Bir öneri yalnızca bir geliştirici o öneriye göre hareket ettiğinde isabet olarak sayılıyor. Her araca bir precision, bir recall ve bir F1 puanı veriliyor ve tüm kurulum yeniden üretilebilir: code-review-benchmark deposu GitHub'da MIT lisansıyla sunuluyor ve girdi seti bir giriş duvarının arkasına saklanmadan açıklanıyor. Yazıya göre bir yöntem olmadan yayımlanan sayı, bir sonuç değil bir iddiadır.
Liderlik tablosu ne gösteriyor
Canlı liderlik tablosu 16.017 pull request ve 14 aracı kapsıyor. Genel F1'de tablonun zirvesi oldukça sıkışık:
- Cubic Dev AI: 65,7 (precision 72,9, recall 59,8)
- GitHub Copilot: 63,9 (precision 68,8, recall 59,6)
- Claude: 62,5 (precision 70,4, recall 56,2)
- Greptile: 61,9, grupta en yüksek precision olan 80,3'e sahip ancak recall 50,4
- CodeRabbit: 60,8 (precision 66,8, recall 55,8)
- Qodo Code Review: 58,9
- CodeAnt AI: 50,0 (precision 72,3, recall 38,2)
dev.to yazarının tavsiyesi, F1'den önce precision ve recall sütunlarını okumak; çünkü bunlar her aracın kapsamlılık ile gürültü arasında nasıl bir denge kurduğunu ortaya koyuyor. Greptile'ın yorumları en sık üzerinde işlem yapılan yorumlar, ancak liderler arasında en çok sorunu kaçırıyor. CodeAnt bu örneklemde karşı uçta duruyor: yorumları isabetli, ancak 38,2'lik recall, bir inceleyicinin işaretleyeceği şeylerin çoğunun raporlanmadığı anlamına geliyor. Copilot ve CodeRabbit her iki eksende de ortaya yakın konumlanıyor.
Örneklem büyüklükleri hem yöntemin hem de karşılaştırmanın bir parçası. Gönderi, Copilot'ın 767 pull request, CodeRabbit'ın 2.109 ve Qodo'nun 2.208 pull request üzerinden puanlandığını bildiriyor. Zayıf bir örneklemle tepede duran bir araç bir başlık değil, bir uyarı işareti olarak okunmalı; yazar, örneklem büyüklüğüne direnebilen bir konumu tercih etmeyi öneriyor.
Hiçbir satıcının size göstereceğinden daha geniş bir alan
Sıralanan alan; Copilot ve Cursor gibi platforma özgü araçları, CodeRabbit, Greptile ve Qodo gibi bağımsız inceleyicileri ve inceleme çıktıları da puanlanan Claude ve Devin gibi kodlama ajanlarını kapsıyor. Tablo genelinde precision değerleri 80,3'ten 63'e kadar uzanıyor ve en üst ile en alt F1 puanları arasındaki fark yaklaşık 15 puan. Hiçbir araç domine etmiyor; yazı bunu bu pazarın dürüst şekli olarak nitelendiriyor — ve yalnızca kendi satırını gösteren hiçbir satıcının pazarlama sayfası bunu asla sergilemeyecek.
Neden önemli
Benchmark'ın değeri, bir kazananı taçlandırmaktan çok kanıtı kimin kontrol ettiğini değiştirmesinde yatıyor. Bir satıcı kendi listesinde kendini ilk sıraya koyduğunda bu kanıt değildir; alakasız bir taraf 14 aracı kapsayan açık ve yeniden üretilebilir bir skor tablosu yayımladığında, bu en azından alıcılara denetlenebilir bir başlangıç noktası verir. Yazı sınırlar hakkında da aynı derecede açık. Örneklem, geliştiricilerin önerileri benimseyip benimsemediğine göre ağırlıklandırılmış açık kaynak pull request'lerinden oluşuyor; bu sizin kapalı kod tabanınız, uyum kurallarınız veya inceleme kültürünüz değil — ve platform uyumu, koltuk başına maliyet ile hacim arasındaki denge ve self-hosting gibi boyutlar bir F1 puanında hiç görünmüyor. Önerilen pratik adım şu: liderlik tablosunu, precision ve recall değerleri gürültü toleransınıza uyan iki veya üç aracı kısa listeye almak için kullanın, bu araçları kendi pull request'lerinizin tanımlı bir diliminde iki hafta boyunca çalıştırın ve inceleyicilerinizin yapacağı önerileri sayın. Sizin kodunuzu gerçekten tanımlayan benchmark, herkese açık tablo değil, o sayımdır.
- #ai
- #code-review
- #benchmarks
- #developer-tools
- #open-source
İlgili yazılar
- Cua, computer-use agent yığınını açık kaynak yaptı: bulut masaüstleri, driver, System 1 modelleri ve benchmark'lar
- Union Alpha'nın perde arkasında unbiased.ai'nin Pareto olduğu ortaya çıktı, ücretsiz dönem bir gün sürdü
- ROCmFix ve InferBench, AMD GPU Kurulumunu ve Yerel LLM Backend Karşılaştırmalarını Otomatikleştiriyor