deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Anthropic'ın yüzde 90'lık çoklu ajan araştırma başarısı 15 kat token faturası getiriyor

Anthropic'ın çoklu ajan araştırma sistemi tek bir ajana karşı yüzde 90,2 daha iyi sonuç aldı ama yaklaşık 15 kat daha fazla token kullandı; UC Berkeley araştırması ise çoklu ajan başarısızlıklarının çoğunun yetenekten değil yapıdan kaynaklandığını ortaya koyuyor.

Anthropic'ın yüzde 90'lık çoklu ajan araştırma başarısı 15 kat token faturası getiriyor

Anthropic neyi ölçtü

Anthropic, bir lider ajanın işi paralel çalışan alt ajanlara dağıttığı bir araştırma sistemi kurdu. Mark Fulton'ın dev.io'daki yazısında özetlenen rakamlara göre, bu kurulum şirketin dahili araştırma değerlendirmesinde tek ajanlı taban çizgisine göre yüzde 90,2 daha iyi sonuç aldı.

Aynı yazı bu başarının bir bedelini de ortaya koydu: çoklu ajan sistemi sıradan bir sohbetin yaklaşık on beş katı kadar token tüketti ve token kullanımı tek başına BrowseComp kıyaslamasındaki performans değişiminin yüzde 80'ini açıkladı.

Yan yana konduğunda bu iki sayı sonucun yorumunu değiştiriyor. Çoklu ajan sistemi, birden fazla model birlikte daha iyi akıl yürüttüğü için değil; büyük ölçüde görev, birbirine bağlı olmayan parçalara çok daha fazla hesaplama gücünün paralel olarak harcanmasına izin verdiği için kazandı. dev.to analizinin de çerçevelediği gibi, belirleyici soru şu: iş gerçekten bölünüyor mu?

Tasarım nerede uyar, nerede uymaz

Anthropic'ın yazısı uymayan alanları da sayıyor: her ajanın aynı bağlama ihtiyaç duyduğu alanlar ve ajanlar arası güçlü bağımlılıklar içeren görevler. Yazıya göre çoğu kodlama işi, araştırma işlerinden daha az gerçekten paralel parça içeriyor.

Araştırma ideal durum: on kaynak, hiç etkileşime girmeyen on ajan tarafından okunabilir. Bir modül yeniden düzenlemesi ise daha çok bir pipeline gibi davranır — alt görev B'ye başlamadan önce alt görev A'nın çıktısı gerekiyorsa, işi beş ajana yaymak çoğunlukla bağlamın kaybolabileceği geçiş noktaları ekler.

Bu sistemler nasıl başarısız olur

UC Berkeley'deki araştırmacılar ve iş birlikçilerinin 2025'te yayımlanan ayrı bir çalışması, "Why Do Multi-Agent LLM Systems Fail?", yedi popüler çoklu ajan çerçevesinden 1.600'den fazla açıklamalı iz topladı. Ekip, 0,88 kappa'lık bir açıklamacılar arası uzlaşmayla üç kategoride on dört başarısızlık modu belirledi:

  • Sistem tasarımı sorunları, yaklaşık on başarısızlıktan dördü: ajanların görev tanımını görmezden gelmesi, adımları tekrarlaması ve net bir durma koşulunun bulunmaması.
  • Ajanlar arası hizasızlık, yaklaşık üçte bir: en büyük tek mod, bir ajanın beyan ettiği akıl yürütme ile eylemleri arasındaki uyumsuzluk; onu açıklama isteme başarısızlıkları ve görevden sapmalar izliyor.
  • Görev doğrulama, yaklaşık dörtte bir: doğrulamanın olmaması, yanlış doğrulama ya da işin bitmeden bitmiş sayılması.

Göze çarpan eksiklik model yeteneği. Yazarlar, başarısızlığın yalnızca altta yatan modelin sınırlarının bir işlevi olmadığını açıkça belirtiyor; ters giden şeylerin çoğu yapısal — neyin kime ait olduğu, neyin tamamlanmış sayıldığı ve sonucu kimin kontrol ettiği.

Ne işe yarıyor, ne yaramıyor

Araştırmacılar düzeltmeleri bir çerçeve üzerinde test etti. Daha net rol tanımları başarı oranını yüzde 9,4, üst düzey bir doğrulama adımı eklemek ise yüzde 15,6 artırdı. Bunlar gerçek iyileşmeler; ama yazarlar yine de tek tek yamaların yeterli olmadığı ve güvenilirliğin daha derin bir yeniden tasarım gerektirdiği sonucuna vardı.

Her iki bulgu setinden yola çıkan dev.to yazarı, tek bir ajanı birkaçına bölmadan önce dört test öneriyor: işin gerçekten bölünüp bölünmediğini, yoksa bir pipeline oluşturup oluşturmadığını doğrulayın; işi on beş katlık token faturasına karşı fiyatlandırın; her ajan için girdisini, çıktı biçimini ve durma koşulunu kapsayan açık bir brief yazın; ve bir şey gönderilmeden önce çıktıyı tanıma göre doğrulayan bir denetleyici — insan ya da ajan — belirleyin.

Neden önemli

Anthropic'ın rakamları bu takası alışılmadık ölçüde somutlaştırıyor: yüzde 90,2'lik performans kazancı gerçek ama sıradan bir sohbetin yaklaşık on beş katı olan token faturası da öyle; ve ölçülen kazancın büyük kısmı mimari incelikten çok ham token harcamasını izliyor. Mühendislik ekipleri için bu, çoklu ajan sorusunu en az teknik olduğu kadar bir maliyet kararı haline getiriyor — dev.to yazarının da savunduğu gibi, günde yüz kez çalıştırılan rutin bir görev bu çarpanı nadiren hak eder.

Başarısızlık verileri de aynı yöne işaret ediyor. Başarısızlıkların çoğu yapısal olduğu için — belirsiz brief'ler, eksik sonlandırma koşulları, olmayan doğrulama — bir sonraki model yükseltmesini de atlatacaklar; çünkü tasarımda değil ağırlıklarda değil, tasarımda yaşıyorlar. Kıt beceri, model seçmekten roller, brief'ler ve denetimler tasarlamaya kayıyor: daha az prompt yazımı, daha fazla yönetim.

  • #multi-agent
  • #ai-agents
  • #anthropic
  • #llms
  • #benchmarks

İlgili yazılar