· kaynak dev.to (home feed)
Ajan PR'leri satıcıya göre yüzde 6,1 ile 14,5 arasında geri alınıyor; 37.623 PR'lik çalışma ortaya koydu
2.807 GitHub deposundaki 37.623 pull request'i kapsayan bir ön baskı (preprint), birleşme sonrası geri alma oranlarının OpenAI Codex için yüzde 6,1'den Devin için yüzde 14,5'e kadar uzandığını, insan temel oranının ise yüzde 11,5 olduğunu buldu.

Satıcı bazlı etiketlerle büyük bir veri kümesi
Dev.to'da yayımlanan bir yazıya göre, Texas Tech'ten Obada Kraishan'ın "Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild" başlıklı ön baskısı, Aralık 2024 ile Temmuz 2025 arasında 2.807 herkese açık GitHub deposundaki 37.623 pull request'i inceledi. Bunların 33.596'sı beş ticari kodlama ajanı — OpenAI Codex, Devin, GitHub Copilot, Cursor ve Claude Code — tarafından açıldı; 4.027'si ise aynı depolarda aynı zaman diliminde çalışan, eşleştirilmiş bir insan temel grubundan geldi. Pipeline, 58.792 önbelleğe alınmış GitHub API yanıtına dayanıyordu ve birleştirilen her değişikliği birleşmeden sonra 90 gün boyunca takip etti.
Her PR satıcı etiketini koruduğu için analiz, ajanları tek bir kategori olarak ele almak yerine ürünleri tek tek ayırabiliyor. Çalışma üç şeyi ölçüyor: 8.933 PR ve 1.348.822 eklenen satırı kapsayan, Python, JavaScript ve TypeScript'te sekiz CWE sınıfı genelinde güvenlik kokularını ve TODO/FIXME yoğunluğu, aşırı uzun satırlar, yorum oranı ve iç içe geçme derinliği gibi bakım kolaylığı sinyallerini puanlayan yama düzeyinde bir inceleme; boyuta göre normalize edilmiş churn ve geri alma tespitini kapsayan 26.283 birleştirilmiş PR üzerinde birleşme sonrası bir çalışma; ve PR başına insan ve bot incelemeleri ile değişiklik taleplerinin sayımı.
Tasarım gözlemsel; dev.to yazarının da belirttiği gibi hiçbir şey rastgeleleştirilmedi ve örneklem 100'den fazla yıldıza sahip herkese açık depolardan oluşuyor. Bu da onu açık kaynak çalışmalarının bir dilimi yapıyor, herhangi bir şirketin iç monorepo'su hakkında kanıt değil.
Geri almalar satıcıya göre keskin biçimde ayrıştı
Birleşmeden sonraki 90 gün içinde insan temel grubu PR'lerinin yüzde 11,5'ini geri aldı. Ajanlar bu çizginin iki tarafına düştü. OpenAI Codex PR'leri 17.756 gözlemde yüzde 6,1 oranında geri alındı ve odds oranı 0,50 idi (yüzde 95 GA 0,44–0,57). Devin 2.185 PR'de yüzde 14,5 geri alındı (OO 1,31, GA 1,11–1,54). GitHub Copilot yüzde 12,5'te (n = 2.094), Cursor yüzde 11,4'te (n = 946) ve Claude Code yüzde 10,5'te (n = 267) kaldı.
Dev.to özetine göre bu satırlardan yalnızca ikisi insan temel grubundan istatistiksel olarak ayırt edilebilir. Codex'in güven aralığı tamamen altında, Devin'inki tamamen üstünde yer alıyor. Copilot'un aralığı 1'i kesiyor (p = ,457), Cursor'un odds oranı tam olarak 1,00 ve Claude Code'un 0,60 ile 1,36 arasındaki aralığı yalnızca 267 PR'ye dayanıyor — buradaki dürüst okuma "güvenli" değil, "tespit edilebilir bir fark yok".
Dev.to yazarının çıkardığı daha geniş ders, bu araçları havuzlamak neredeyse hiçbir şeyi tanımlamayan bir sayı üretmesi. Ajan kategorisinin içindeki yayılım — en iyi ile en kötü arasındaki geri alma oranında 2,4 kat fark — en iyi ajan ile insanlar arasındaki boşluğu aşıyor ve havuzlanmış ortalama hiçbir aracın gerçekte bulunmadığı bir yere denk geliyor.
Güvenlik kokuları ve inceleme yükü
Yama düzeyi metriklerde, havuzlanmış ajan kodunun insan koduna göre güvenlik koku içermesi daha olasıydı (OO 0,63); bu etki daha az sabit kodlanmış kimlik bilgisi ve eval tarzı yapılardan kaynaklanıyordu. Boyuta göre katmanlandırılmış bir kontrol iddiayı daha da daraltıyor: Etkinin tamamı en büyük PR grubunda görünüyor (delta -0,08, p = ,025), dört küçük grupta fark yok. Savunulabilir ifade, çok büyük diff'lerde ajanların daha az sır sabit kodladığı — bu da "ajan kodu daha güvenli" cümlesinden epey uzak.
İnceleme dinamiği de değişkendi. Copilot PR'leri en çok insan incelemesini ve değişiklik talebini çekti. Claude Code PR'leri ilk insan incelemesini en uzun bekledi (medyan 12,6 saat) ve açık farkla en büyüğüydü: medyan 495 değiştirilmiş satır, medyan dört seviye derinlikte iç içe geçme ve satır başına 0,063 ile en yüksek dal yoğunluğu. Daha büyük PR'ler daha uzun bekliyor; bu da inceleme gecikmesini, ekiplerin elindeki araçlarla ölçebileceği bir yönlendirme sorunu olarak çerçeveliyor.
Uyarılar ve tekrarlanabilirlik
Örneklem büyüklükleri dengesiz: Codex, 33.596 ajan PR'sinin 17.756'sını oluşturuyor; yani havuzlanmış herhangi bir ajan rakamı büyük ölçüde Codex'in davranışını yansıtıyor. Oturum uzunluğu da kontrol edilmemiş ve dev.to yazarı, tur başına talimat uyumunun daha uzun ajan oturumlarında bozulma eğiliminde olduğunu belirtiyor — bu yüzden kullanıcıları daha uzun oturumlar çalıştıran bir satıcı, kimsenin ölçmediği bir değişkenden dolayı cezalandırılmış ya da överilmiş görünebilir. Pipeline kodu, istatistiksel raporlar ve grafikler tekrarlanabilirlik için herkese açık şekilde yayımlandı.
Yazı, kendi depolarını ölçümleyen ekipler için pratik bir kontrol listesiyle kapanıyor: PR'leri sonradan etiketlemek yerine oluşturma anında yazar türüne göre (ajan, insan, karışık) etiketleyin; gözlem penceresini sabitleyin ve PR havuzunu sabit tutun; geri alma oranı, boyuta göre normalize edilmiş churn, ilk inceleme gecikmesi ve PR başına değişiklik taleplerini takip edin; her metriği "AI"ya göre değil ajana göre bölün; ve kalite farklarını yönlendirme farklarından ayırt edebilmek için oturum uzunluğunu ya da PR boyutunu kovaryant olarak kaydedin.
Neden önemli
Ajan tarafından yazılan PR'ler birleştirilen kodun önemli bir payı haline geliyor ve ekiplerin bu kodun üretime temas ettiğinde hayatta kalıp kalmadığını bilmesi gerekiyor. Bu ön baskının merkezi bulgusu, sorunun tek bir yanıtı olmadığı: diff'i hangi satıcının yazdığı, birleşme sonrası sonuçlarını ajan-insan ayrımının kendisinden daha güçlü öngörüyor. Dev.to yazarının pratik kuralı benimsenmeye değer — "AI" için tek bir sayı raporlayan her benchmark'ı eksik olarak görün ve sonuç çıkarmadan önce kendi depo geçmişinizde araç bazında geri alma oranlarını, churn'u ve inceleme gecikmesini ölçün.
- #ai-agents
- #code-review
- #open-source
- #github
- #software-quality