· kaynak dev.to (home feed)
METR deneyi: deneyimli geliştiriciler AI araçlarıyla %19 yavaşladı ama kendilerini %20 daha hızlı hissettiler
2025 METR randomize deneyinde, deneyimli açık kaynak geliştiricileri AI araçlarının kendilerini yaklaşık %20 hızlandırdığına inandı; ancak kronometre verileri %19 yavaşladıklarını gösterdi.

Deney neyi ölçtü
dev.to'da yayımlanan bir yazıya göre, yapay zekâ sistemlerini benchmark'lar yerine gerçek koşullarda inceleyen bir kuruluş olan METR'nin 2025'te yürüttüğü randomize kontrollü bir deney, on altı deneyimli açık kaynak geliştiricisinden kendi olgun repolarındaki gerçek sorunları çözmelerini istedi. Her görev için katılımcılar rastgele olarak ya AI araçlarıyla ya da onsuz çalışacak şekilde atandı ve tamamlama süreleri kendi beyanları yerine saat ile kaydedildi.
Burada katılımcı kitlesi önemli. Bunlar alıştırmalar üzerinden ilerleyen yeni başlayanlar değildi; değiştirdikleri sistemler hakkında yılların birikmiş bağlamına sahip maintainer'lardı.
İnanç ile kronometre arasındaki 39 puanlık fark
Başlamadan önce katılımcılar, AI yardımıyla tamamlama sürelerinin yaklaşık %24 kısalacağını öngördü. Bitirdikten sonra ise destekli görevlerde kendilerini hâlâ yaklaşık %20 daha hızlı değerlendirdiler. Ölçülen süreler ters yönü işaret ediyordu: bu görevler, desteksiz olanlara kıyasla yaklaşık %19 daha uzun sürdü. dev.to yazısı bunu, yetenekli profesyonellerin gerçekleştiğini sandıkları ile kronometrenin gerçekte kaydettiği arasında 39 yüzde puanlık bir fark olarak özetliyor.
Aşinalık yavaşlamayı daha da kötüleştirdi
Yavaşlama eşit dağılmadı. Geliştiricilerin en iyi bildikleri codebase'lerde en sert vurdu — derin uzmanlık ile AI yardımlaşmasının birleşip daha büyük kazançlar doğuracağı sezgisel varsayımın tam tersine.
Yazıda sunulan açıklama şu: uzun deneyim, bir sistem hakkında hızlı ve kişisel bir zihinsel model oluşturur — hangi alanları değiştirmenin riskli olduğu, hangi arayüzlerin güvenilmez olduğu, sorunların nerede kümelenme eğiliminde olduğu. Bu modele danışmak neredeyse hiçbir şeye mal olmaz. Bir AI asistanı bu modeli paylaşmaz; bu yüzden her öneri modele karşı doğrulanmak zorundadır ve bu doğrulama süresi, geliştirici aracın o anda nasıl hissettirdiğini değerlendirirken asla kayda geçmez.
Yazı, her geliştiricinin erken kariyerinde karşılaştığı bir tuzağa benzetme yapıyor: ikili kayan noktada (binary floating point) 0.1 ile 0.2'yi toplamak 0.30000000000000004 sonucunu verir. Hiçbir şey arıza değildir; ondalık aritmetik hakkındaki insan sezgisi, makinelerin sayıları saklama biçimiyle basitçe uyumsuz kalibre edilmiştir. Yazar, METR sonucunun aynı biçimde olduğunu savunuyor. Kişinin kendi hızına dair içsel hissi bir modeldir — genellikle yeterince iyi, ara sıra ve kendinden emin biçimde yanlış, ve yalnızca duyguya güvenmek yerine gerçek veriyle karşılaştırılarak düzeltilebilir.
Gerçekte işe yarayan neydi
Yazıya göre yavaşlamadan kaçınan geliştiriciler, AI araçlarını büsbütün reddedenler değildi. Ölçenlerdi — kendi görevlerinde kendilerini tekrar tekrar süre tutanlar ve bir aracın yardım edip etmediği sorusunu izlenimle değil, ampirik olarak kurulacak bir mesele olarak ele alanlar.
İkinci bir alışkanlık da işe yaradı: o akıl yürütme tek bir kişinin kafasında yaşamaya başlamadan önce, kodun neden böyle göründüğünü yazıya dökmek. On yıllık deneyim, büyük ölçüde bir sistemin belgelenmemiş modelidir. AI araçları hızlı bir şekilde ikna edici kod üretebilir, ama o modelin yerine geçmez — ve onu model sanmak, yazının çerçevesiyle, bir veteranın zaman kazandığına inanırken zaman kaybetmesinin yoludur.
Neden önemli
AI kodlama asistanları çevresindeki heyecanın büyük kısmı, geliştiricilerin araçların kendilerine nasıl hissettirdiği hakkındaki ifadelerine dayanıyor. Bu deney — küçük, on altı katılımcılı ve tek bir belirli senaryoya, yani içinden geçenlerini bildikleri codebase'leri değiştiren uzmanlara odaklı — bu izlenimlerin yaklaşık kırk yüzde puanla ve yanlış yönde sapabildiğini öne sürüyor.
Sonuç otomatik olarak genellenemez. Aşina oldukları, olgun kod üzerinde çalışan deneyimli maintainer'ları kapsadı ve sıfırdan başlanan projelere, tanınmayan codebase'lere ya da daha az deneyimli geliştiricilere aktarılmayabilir. Ama ispat yükünü kaydırıyor: AI araçlarından gelen üretkenlik kazanımlarına dair iddialar, verimli hissedilen bir oturumun hemen ardından toplanan izlenimlerle değil, gerçek iş üzerinde ölçülen görev süreleriyle doğrulanmayı hak ediyor.
Yazının önerdiği çare gösterişsiz ve ucuz: sonuçlar çıkarmadan önce karşılaştırmayı kendin yap, araçla ve araçsız birkaç gerçek görevini süre tutarak. Hız hissi ile saat anlaşmazsa, saate güven.
- #ai-tools
- #developer-productivity
- #metr
- #open-source
- #llms