deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Agent tarafından üretilen PR'ler GitHub pull request'lerinin %1 altından %27,6'sına yükseldi

dev.to analizine göre agent tarafından üretilen pull request'ler on dört ay içinde GitHub PR'lerinin %1 altından %27,6'sına ulaştı; analiz, insanlar için tasarlanmış inceleme süreçlerinin gözden kaçırdığı hata modlarını da haritalıyor.

Agent tarafından üretilen PR'ler GitHub pull request'lerinin %1 altından %27,6'sına yükseldi

Agent PR'leri göz ardı edilebilir bir orandan GitHub'ın dörtte birinden fazlasına evrildi

Max Quimby'nin dev.to'daki analizine göre agent tarafından üretilen pull request'ler yaklaşık on dört ay içinde GitHub PR'lerinin %1 altından %27,6'sına yükseldi. Yazıda ayrıca Anthropic'in 2026 Agentic Coding Trends Report'una atıf yapılıyor; rapor, yeni yazılan koddaki yapay zekâ payını %41 olarak veriyor ve Claude Code'un işyerlerindeki benimsenmesinin bir yıldan kısa sürede altı kat arttığını bildiriyor.

Merkezî argüman, ham kod kalitesinin asıl sorun olmadığı. Yazıda atıf yapılan 33.000 agent yazımı PR üzerinde yapılan adli bir inceleme, agentların %83,77 kabul oranına ulaştığını, insanlarda bu oranın %91,01 olduğunu ortaya koyuyor — aradaki fark zararsız görünecek kadar küçük. Farklı olan, hataların nerede ortaya çıktığı: agentlar nadiren yazım hatası ya da sözdizimi hatası yapıyor; bunun yerine derlenmesi kusursuz ama API sözleşmelerini ihlal eden, servisler arası bağımlılıkları bozan ya da mimari kararları geri alan kod üretiyor.

Yazar, tekrarlayan sorunları dört hata modunda grupluyor; bunlardan üçü metinde ayrıntılı olarak ele alınıyor.

Agent tüm sistemi göremediğinde

İlk mod bağlamsal. Yazı, 2026'nın verimlilik paradoksuna ilişkin bir FeatBit analizine atıf yaparak eksik bağlamı dört türe ayırıyor: işin gerçekte neye ihtiyacı olduğu, kod tabanının birbirine nasıl oturduğu, önceki incelemecilerin neleri işaretlediği ve bir ekip içindeki yazılı olmayan kurallar.

Zarar ölçülebilir boyutta. Yazıda atıf yapılan MSR 2026 ampirik çalışması, reddedilen agent PR'lerinin %23'ünün yinelenen olduğunu — yani başka bir katılımcının aynı sorun üzerinde zaten çalıştığı sırada gönderildiğini — ortaya koydu. Yazıya göre Stack Overflow'un mühendislik blogu, yapay zekâ tarafından üretilen kodun insan koduna kıyasla 1,7 kat daha fazla hata taşıdığını, mantık ve doğruluk hatalarının 1,75 kat, güvenlik bulgularının ise 1,57 kat daha sık olduğunu bildiriyor — yazar bu örüntüyü zayıf yetenekten değil, eksik bağlamdan kaynaklıyor.

Önerilen savunmalar arasında Pact ya da Specmatic gibi araçlarla CI kapılarında sözleşme testleri, ArchUnit tarzı zorunlu kılınan mimari kuralları ve agentlara tek dosyalar yerine bağımlılık grafiklerinin beslenmesi yer alıyor. Yazıda atıf yapılan Greptile verileri, Codex'i %10'luk insan tabanına karşı %5–6'lık yeniden işleme oranıyla gösteriyor. Dikkat çekici biçimde, MSR çalışması ayrıca agent PR'lerinin yaklaşık %28'inin neredeyse anında birleştirildiğini buldu: küçük, iyi sınırlandırılmış değişiklikler güvenli bölgeyi oluştururken, servis ya da mimari sınırları aşan her şey agentların sendelediği yer oluyor.

Cilalı diff'ler, kırılgan dağıtımlar

İkinci mod bir sunum paradoksu. Yazıda atıf yapılan New Relic'in 2026 State of AI Coding raporu, mühendislik liderlerinin %94'ünün yapay zekâ tarafından üretilen kodu inceleme anında insan kodundan daha yüksek kaliteli bulduğunu ortaya koyuyor. Ne var ki aynı katılımcıların %78'i kod yayına girdiğinde daha fazla olay yaşandığını, %82'si altı ay içinde yapay zekâ koduna bağlı en az bir üretim hatasıyla karşılaştığını ve %74'ü bir yıl içinde bunun en az dörtte birinin önemli ölçüde yeniden işlenmesi gerektiğini bildiriyor. Bu arada ekiplerin %62'si artık yapay zekâ kodunu satır satır elle doğrulamadan yayınlıyor.

Sunulan yapısal açıklama şu: agentlar iyi yazılmış kodun sayfada nasıl göründüğünü özümsemiş durumda; eşzamanlı yük, bayat önbellekler, kısmi ağ arızaları ya da üçüncü taraf bir API'nin başarı yanıtları yerine hata döndürmesi karşısında doğru davranışın nasıl korunacağını değil. Yazıda alıntılanan Addy Osmani bunu şöyle özetliyor: "Kod üretimi ucuzladı, anlamak ise pahalı kaldı."

Önerilen karşı önlemler arasında, sabit girdi-çıktı çiftleri yerine değişmezleri sınayan ve agentların kolayca ezberleyebileceği bu çiftlerin yerine geçen Hypothesis ya da fast-check gibi araçlarla özellik tabanlı test etme; üretim trafiğine davranışı yargılatan canary dağıtımları; ve metinsel değil davranışsal değişiklikleri yüzeye çıkaran anlamsal diff'leme yer alıyor.

İnceleme kuyrukları incelemecileri geride bırakırken

Üçüncü mod aritmetik. Yazıda atıf yapılan Faros AI telemetrisi, yapay zekâ benimsenmesinin %98 daha fazla ve %154 daha büyük PR ile ilişkili olduğunu, inceleme sürelerinin %91 arttığını ve incelemesiz birleştirmelerin %31 yükseldiğini gösteriyor. Yazıya göre insan yazımı diff'ler üzerinde eğitilmiş incelemeci içgüdüleri agent kodunda başarısız oluyor; çünkü hatalar uygulamada değil varsayımlarda gizli ve incelemecilerin yeni içgüdüler edinmeye zamanları olmadı.

Yazıda ayrıca agent üretimi "slop" PR'ler üzerine ThePrimeagen ile Theo arasında süregelen tartışmaya, her şeyi agenta bırakarak hiç içgüdü geliştirmeyen genç mühendislere ve insan kapısını atlayan otomatik birleştirme araçlarına değiniliyor — şikâyetleri Theo büyük ölçüde kabul ediyor.

Neden önemli

PR'lerin dörtte birinden fazlası makine tarafından yazılmışsa ve oran tırmanıyorsa, kod incelemesi hem darboğaz hem de son savunma hattıdır. Belgelenen hata modları beceri eksikliği değil yapısal sorunlar ve bunlar, daha iyi prompt yazma çağrıları yerine CI kapılarında, dağıtım pratiğinde ve incelemeci eğitiminde değişikliğe işaret ediyor. Agent PR'lerini arkasında bir insanın muhakemesi varmış gibi incelemeye devam eden ekipler, bu anketlerin ölçümlediği olay ve yeniden işleme maliyetlerini üstlenenler oluyor.

  • #ai
  • #github
  • #code-review
  • #llm-agents
  • #developer-productivity

İlgili yazılar