· kaynak dev.to (home feed)
20 paralel yapay zekâ kodlama ajanı çalıştırmak, darboğazın model değil derleyici olduğunu gösterdi
Bir geliştirici tek bir bilgisayarda 20 yapay zekâ kodlama ajanını paralel çalıştırdı ve kısıtlamanın model kalitesi değil, derleme ve test kapasitesi olduğunu gördü. Content-hash önbellekleme ve harici değerlendirme ile 1.770 kontrolün 1.770'si yeşile döndü.

Kısıt model değil, derleyiciydi
Yapay zekâ kodlama ajanları hakkındaki tartışmaların çoğu, hangi modelin daha iyi kod yazdığı üzerine tartışmalardır. dev.to'da mattbusel kullanıcısının yayımladığı bir yazıya göre, tek bir PC üzerinde yirmi ajanı paralel çalışan bir deney, model kalitesinin hiçbir zaman verimi sınırlayan şey olmadığını ortaya koydu. Sınırlayan şey derleme ve test hattıydı.
Kurulum bunun nedenini açıklıyor. Paralel ajanlar genellikle git worktrees kullanarak depoun ayrı kopyalarında izole edilir ve her ajan her değişiklikten sonra kodu derlemek ve test paketini çalıştırmak ister. Dolayısıyla yirmi ajan, aynı anda makineye çarpan yirmi soğuk derlemeye kadar anlamına gelir. Normal bir masaüstü bilgisayarda önce RAM tükenir, sonra CPU, ve ajanlar modeli çalıştıran GPU boş beklerken cargo test'i beklemekten başka bir şey yapmaz — kıt kaynağın inference hesaplama gücü olduğu yönündeki olağan varsayımın tam tersi.
Sorunu çözen beş değişiklik
Yazı, çoğu göz alıcı olmayan altyapı çalışması olan (prompt mühendisliği değil) beş düzeltmeyi adım adım anlatıyor.
Doğrulamayı içerikle önbellekle
Bu paralel derlemelerin çoğu gereksizdir. Aynı görev üzerinde çalışan ajanlar sıklıkla birbirinin aynısı koda yakınsar ve herhangi bir değişiklik az sayıda dosyaya dokunur. Yazar, bir kontrolün girdilerini — kaynak ağacı, araç zincirini ve komutu — hash'leyip sonucu önbelleğe alıyor; böylece özdeş girdiler derlemeyi tamamen atlıyor. Anlatılan çalışmalarda kontrollerin yüzde 83 ile 85'i bu önbellekten yanıtlandı.
Değerlendirmeyi ajanın dışındaki bir şeye yaptır
Bu kurulumda bir ajanın işinin bittiğini beyan etmesinin hiçbir değeri yoktur. Bitti, ajanın kontrol etmediği bir araç tarafından gerçekleştirilen gerçek bir derleme ve gerçek bir test çalışması demektir.
Testleri ve değerlendiriciyi salt okunur yap
Ajanlar kaynak kodu yazabilir ama testleri veya değerlendirme mantığını yazamaz. Gerekçe şu: sıkışan bir ajan sonunda, kötü niyetle değil ama yeşil bir sonuca giden en kısa yol olduğu için, kodu değil başarısız testi "düzeltir".
Makineyi sınırla
Sürüsü ana makinesini çökerten bir sürü hiçbir şey teslim etmez ilkesiyle RAM, makinenin 32 GB'ının 21'iyle sınırlanıyor ve derleme işleri kısılanıyor.
Seri şekilde birleştir ve yeniden değerlendir
Ajanlar paralel keşfeder, ancak değişiklikler tek tek kabul edilir ve her birleştirme yeniden doğrulanır. Bir değişiklik yalnızca geçen test sayısı artıyorsa ve hiçbir test yeni başarısız olmuyorsa kabul edilir.
Bildirilen sonuç
Beş değişikliğin tamamı uygulandığında yazar, yirmi ajan, dört tur ve 1.770 kontrolün 1.770'inin geçtiğini bildiriyor. Yazı temelindeki projeyi veya görevi ayrıntılandırmıyor; bu nedenle sayılar tekrarlanabilir bir kıyas olarak değil, tek bir geliştiricinin anlatımı olarak okunmalı.
Neden önemli
Deneyin sonucu, ajan filolarını ölçekleyen herkes için faydalı bir bakış açısı değişikliği: ajan eklemek, yalnızca doğrulama hem ucuz hem de sahtelenemez olduğunda yardımcı olur. Derlemeler pahalıysa daha fazla ajan çoğunlukla boşa harcanan derlemeyi katlar. Ajanlar kendilerini sertifikalandırabiliyorsa veya kendilerini yargılayan testleri düzenleyebiliyorsa, daha fazla ajan sadece daha fazla inandırıcı görünen bozuk kodu, daha hızlı üretir. Burada işe yarayan düzeltmeler — content-addressed önbellekleme, harici değerlendirme, salt okunur testler, kaynak tavanları ve kapılı seri birleştirmeler — aslında CI sistemlerinin ve trunk-based development'ın insan ekiplere zaten dayattığı disiplinlerdir.
Uyarılar var. Bu tek bir makine, tek bir yazar ve Rust ağırlıklı bir iş akışı (beklemeler cargo test üzerindeydi); bu nedenle kesin sayılar her yığınla örtüşmez. Ancak yapısal nokta daha geniş kapsamlı: model kalitesi ilgiyi toplarken, kapıyı doğrulama kapasitesi açıp kapatıyor. Ajan sürüleri kuran ekipler için, marjinal yatırım, marjinal derecede daha iyi bir modelin peşinden koşmak yerine derleme önbelleğine ve birleştirme kapılarına yapmak daha iyi olabilir.
- #ai-agents
- #build-systems
- #testing
- #developer-tools
- #continuous-integration