deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

16.893 agent çalışmasını inceleyen araştırma: Claude, Codex ve Cursor araç seçimlerinde sık sık aynı fikirde değil

Armature, 16.893 kodlama-agenti oturumunu inceledi ve Claude Code, Codex ve Cursor'ın yalnızca yüzde 42 oranında aynı araçta uzlaştığını, her birinin farklı araştırma alışkanlıklarına güvendiğini tespit etti.

16.893 agent çalışmasını inceleyen araştırma: Claude, Codex ve Cursor araç seçimlerinde sık sık aynı fikirde değil

Araştırma neyi ölçtü

Büyüme pazarlaması firması Armature, kodlama ajanlarının üçüncü taraf araçları nasıl seçtiğine dair büyük bir deneyin sonuçlarını yayımladı. Ekip, Claude Code, Codex ve Cursor'ın yalnızca bir hizmet önermesi değil, bir kod tabanının içinde bir hizmeti bulmasını ve gerçekten uygulamasını istediği 16.893 oturum yürüttü. Oturumlar, 10 dilde yazılmış 75 sentetik depo, 1.163 prompt varyasyonu ve yalnızca belirtiler anlatan teknik olmayan "vibe coder"lardan uyumluluk ve tedarik kısıtlarını açıkça dile getiren kurumsal mühendislere kadar dört kullanıcı personasını kapsıyordu.

Armature ticari açısından açık sözlü: şirket, geliştirici-araç satıcılarına büyüme hizmetleri satıyor ve araştırma, ürünlerin ajanlar tarafından seçilmesini sağlamaya yönelik çalışmasını besliyor. Bununla birlikte, kullanıcı promptları, ajanların muhakemesi ve uyguladıkları kod değişiklikleri dahil olmak üzere temel izleri de yayımladı.

Armature'un çerçevelediği ölçü, Vercel'e atfettiği bir istatistikten geliyor: Nisan ayında dağıtımların yüzde 30'undan fazlası kodlama ajanları tarafından başlatıldı; Vercel, bu rakamın altı ayda yüzde 1000 büyüdüğünü söyledi.

Deney nasıl kuruldu

Gerçekçi test ortamları oluşturmak için Armature önce binlerce herkese açık GitHub deposunu dil, çerçeve, üçüncü taraf hizmetler ve ekip büyüklükleri açısından inceledi, ardından açık kaynak kodun girişimlere doğru eğilim göstermesi gerçeğini dengelemek için istatistikleri yeniden ağırlıkladı. Kodlama ajanları daha sonra o dağılıma uyan 75 depo üretti; bunlar uydurma şirket adları, elle yapılmış git geçmişleri ve npm gibi kayıt defterlerine karşı doğrulanmış gerçek kilit dosyalarıyla birlikteydi. Hiçbir sağlayıcının önceden seçilmemesi için her deponun, mevcut entegrasyonları çıkarılmış varyantları da oluşturuldu.

Her görev dört personadan biri tarafından sunuldu ve kabaca durumların yüzde 20-25'inde prompt, maliyet veya beklenen kullanım hacmi gibi açık kısıtlar içeriyordu. Her çalışma, geçici bir sandbox'ta gerçekleşti ve Armature, sandbox seçiminin sonuçları değiştirmediğini doğruladıktan sonra üç sağlayıcı — E2B, Blaxel ve Daytona — arasında döndürüldü.

Sonuçları şekillendiren iki ek otomasyon parçası daha vardı. Gemini 3.7 Flash'ın canlandırdığı bir "simüle insan" kullanıcının yerine geçti ve genellikle uygulamadan önce ajanın öne çıkan önerisini onayladı; Armature, izin isteme şansı olmadan hemen uygulaması söylenen ajanların her şeyi içeride kurmaya meyillendiğini buldu. İkinci bir Gemini 3.7 Flash örneği daha sonra her oturumu değerlendirdi; taraflı ya da sonuçlanmamış saydığı çalışmaları elerken, hem konuşmayı hem de uygulanan diff'leri kullanarak hangi satıcıların anıldığını ve hangisinin gerçekten kazandığını kaydetti.

16.893 çalışmanın 5.292'si, 51 kod tabanı ve 18 sektörden olanlar, yayımlanan ilk dalga sonuçlar için doğrulamadan geçti. Armature, kalan 10.000'den fazla oturumun ileri bir tarihte yayımlanabileceğini söylüyor.

Ajanlar anlaştıklarından çok daha fazla anlaşmazlık ediyor

Armature'a göre, üç ajanın tamamı, karşılaştırılabilir karar noktalarının yalnızca yüzde 42'sinde aynı araçta uzlaştı. Örneğin sesli-ajanlar kategorisinde Claude Code Twilio'yu seçerken Codex, OpenAI'nin Realtime API'sine yöneldi; yayımlanan alıntı, Cursor'ın seçimini belirtmeden kesiliyor.

Araştırma alışkanlıkları da keskin biçimde ayrışıyordu:

  • Cursor, kararlarını oturumlarının yaklaşık üçte ikisinde web aramalarına dayandırdı.
  • Codex, oturumların yüzde 94'ünde web'de arama yaptı ve kabaca on sorgudan dokuzunda sonuçları güvenilir alan adlarıyla ya da tek bir satıcının belgeleriyle sınırlamak için site: gibi operatörler uyguladı.
  • Claude Code çoğunlukla iç bilgisine güvendi ve oturumların yalnızca yaklaşık yüzde 30'unda web'de arama yaptı. Arama yaptığında ise Codex'ten kabaca üç kat fazla sayfa gezdi ve önceden edinilmiş bilgisinin daha zayıf olduğu sandboxing gibi yeni kategorilerde zamanın yaklaşık yüzde 80'inde arama yaptı.

Döngüdeki simüle insan da sonuçları değiştirdi: nesne depolama görevlerinde Cloudflare R2, daha önce Amazon S3'e giden oturumları kazanmaya başladı. Ayrıca deneyin daha önceki, gayri resmi sürümü — iki sandbox, farklı ajanlar, personalar ve kod tabanları — her iki seferde de aynı veritabanı önerisini, Neon'u üretti ve ölçeklendirilmiş çalışmayı da buna tetikledi.

Neden önemli

Ajanlar giderek daha fazla araç seçimi yapıyorsa, araştırma alışkanlıkları dağıtım hunisine dönüşüyor. Ajanı nadiren arama yapan bir geliştirici, fiilen o modelin eğitim verisini sorguluyor; ajanı agresif arama yapan ise sorgu kalıplarının yüzeye çıkardığı neyse onu alıyor. İkisi de nesnel bir karşılaştırmayla aynı şey değil ve yüzde 42'lik uzlaşma oranı, "en iyi" aracın çoğu zaman hangi ajanı kullanmaya denk geldiğinize bağlı olduğunu gösteriyor.

Geliştirici-araç satıcıları için sonuçları ticari: görünürlük artık makine okuyucular için, bir ajanın aramalarında ortaya çıkan ya da önceden edinilmiş bilgisinde yer eden belgeler, karşılaştırma sayfaları ve kayıt defteri üst verisi yoluyla mühendislik gerektiriyor. Armature'un kendi iş modeli bunu açık hale getiriyor ve çalışması, ajan kararlarını etkileme çevresinde kurulmakta olan yeni bir sektörün önizlemesi olarak da işlev görüyor.

Uyarılar ağır basmayı hak ediyor. Veriler, ajan seçimlerini şekillendirme konusunda açıkça beyan edilmiş bir çıkarı olan bir firmadan geliyor, çalışmanın yalnızca yaklaşık üçte biri değerlendiricinin doğrulamasından geçti ve kullanıcılar gerçek değil simüle edildi. Hafifletici etken ise Armature'ın izleri tamamen yayımlamış olması; böylece bağımsız analistler özetlere körü körüne inanmak yerine sıralamaları ve yöntembilimi yeniden inceleyebiliyor.

  • #coding-agents
  • #developer-tools
  • #ai-agents
  • #market-research

İlgili yazılar