deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Stanford'un Paper2Agent'ı 100 araştırma makalesini çalıştırılabilir MCP agent'larına dönüştürüyor

Stanford araştırmacıları, 100 hesaplamalı biyoloji makalesinin 74'ünü doğrulanmış MCP agent'larına dönüştürdü; bu agent'lar Claude artı repo taban çizgisini geçti ve hiçbir tek makalenin içermediği bulgular ortaya çıkardı.

Stanford'un Paper2Agent'ı 100 araştırma makalesini çalıştırılabilir MCP agent'larına dönüştürüyor

Makalelerden agent'lara

Stanford'daki bir ekip, araştırma makalelerini araştırmacıların düz İngilizce ile sorgulayabileceği agent'lara dönüştüren otomatik bir pipeline yayımladı. dev.to'daki bir yazıya göre, Jiacheng Miao, Joe R. Davis, Yaohui Zhang, Jonathan K. Pritchard ve James Zou tarafından geliştirilen ve 16 Eylül 2026'da Nature'da yayımlanan Paper2Agent adlı sistem, 100 hesaplamalı biyoloji makalesi üzerinde çalıştırıldığında 74 çalışan agent üretti ve 593'ü otomatik doğrulamadan geçen 599 tool çıkardı.

Motivasyon net: bir makale bir yöntemi tarif eder ama onu çalıştırmaz. Yayımlanmış kodu kendi verilerine uygulamak isteyen herkes, depoyu bulmak, bağımlılık çakışmalarını çözmek, yöntemi hangi notebook'un uyguladığını tahmin etmek ve şekilleri elle sayılara geri eşlemek zorundadır.

Pipeline nasıl çalışıyor

Paper2Agent kurulumu uçtan uca altı aşamada hallediyor: makaleye bağlı depoyu, notebook'ları ve dokümantasyonu bulur; sabitlenmiş bağımlılıklarla izole bir ortam kurar; yöntemleri gösteren tutorial'ları toplar; bunları çalıştırır ve çıktıları ground truth olarak saklar; çalıştırılabilir bileşenleri JSON şemalı, parametrelendirilmiş tool'lar olarak sarar; ve her şeyi herhangi bir chat agent'ının çağırabileceği bir Model Context Protocol (MCP) sunucusu olarak paketler.

Tool çıkarımı ile montaj arasında bir doğrulama kapısı var. dev.to'nun aktardığına göre, sayısal çıktılar makalenin kendi sonuçlarıyla yüzde 3 içinde eşleşmek zorunda, üretilen şekiller algısal hashing ile karşılaştırılıyor ve tool'lar kilitleniyor, böylece çağıran model yeni davranışlar uyduramıyor. Adversarial testlerde kapsam dışı sorgularda yüzde 100 doğru reddetme oranı elde edildiği bildiriliyor; makalenin çıktılarını yeniden üretmeyen her tool ise atılıyor.

Kıyaslama rakamları

Tutorial'lardan türetilen ve 74 agent'a yayılan 300 kıyaslama sorusunda, agent'lar yüzde 91,2 (artı eksi 1,6) puan aldı; Claude'a aynı depoların ham dosyalar olarak verildiği taban çizgisi ise yüzde 82,7 (artı eksi 3,4) kaldı. Her iki kurulumda da aynı model ailesi kullanıldı; dev.to yazısı farkı paketlemeye bağlıyor ve çağrılabilir, doğrulanmış tool'ların doğrudan kod erişiminden daha iyi performans gösterdiğini savunuyor.

Maliyetler mütevazı. AlphaGenome agent'ı yaklaşık 45 dakikada ve yaklaşık 14 dolarlık işlem gücüyle, 22 tool vererek kuruldu; 15 tutorial sorgusunda yüzde 98,7 ve yazarların yazdığı 15 yeni soruda yüzde 100 puan aldı. Biyoloji dışında, diğer 10 hesaplamalı makaleden alınan 42 yürütme görevinde yüzde 98,1'e ulaşıldı; medyan çalışma süresi Claude artı repo kurulumundan 1,9 kat, Biomni'den 3,1 kat hızlıydı. Sorgu başına agent'lar 0,20 dolara ve 1,6 dakikaya karşılık taban çizgisi 0,38 dolar ve 4,3 dakika tuttu.

Bulguları birleştiren agent'lar

Pipeline, tek tek makalelerin yapamayacağı bir şeyi de mümkün kılıyor. Ekip, birbirinden bağımsız üç makaleden agent'lar üretti — bir AlphaGenome varyant etki tahmincisi, bir MPRA eşleşli scCRISPRi tarama agent'ı ve bir CD4+ T hücre Perturb-seq agent'ı — ve tahminlerini zincirleyerek GPR137'yi sedef ile ilişkili rs887314 lokusunda olası nedensel gen olarak önceliklendirdi. Ayrı bir Stanford Medicine gösterimi, bir mutasyon tahmin agent'ını bir ADHD genom genişli ilişki çalışmasıyla eşleştirerek artan ADHD riskiyle ilişkili, MPHOSPH9 yakınında daha önce raporlanmamış bir varyant ortaya çıkardı. James Zou'nun öngördüğü bildiriliyor: milyonlarca böyle agent ölçekli biçimde örtüşen işler bulacak, keşifler yine özgün makalelere ve insan yazarlarına atfedilecek.

Belirtilen sınırlamalar

Yirmi altı makale dönüştürülemedi; eksik kod, erişilemeyen veri veya kurulamayan ortamlar buna engel oldu; yazarların bu başarısızlık oranını bir kusur değil, tekrarlanabilirlik denetimi olarak gördüğü bildiriliyor. Açık uçlu hipotez seçimi ve kanıt değerlendirmesi insan görevleri olarak kalıyor. MCP sunucuları, yukarı akış bağımlılıkları kaydıkça sürekli bakım gerektiriyor; bu da her agent'ı arşive kaldırılmış bir PDF değil, yaşayan bir artifact yapıyor. Ve yeni sorgulardaki yüzde 100 sonucu, yazarların kendi yazdığı yalnızca 15 soruya dayanıyor; dolayısıyla gerçek sınav bağımsız kıyaslamalar olacak. Haberde sözü edilen Weill Cornell'den Olivier Elemento ve Maryland Üniversitesi'nden Dongping Chen gibi dış araştırmacılar olumlu ama bunu hakem değerlendirmesinin yerini alacak bir şey olarak görmüyorlar.

Neden önemli

Paper2Agent, araştırma makalesini statik bir belge değil, dağıtılabilir bir arayüz olarak yeniden çerçeveliyor. Doğrulanmış tool'lar ucuz üretilebilirse (bu çalışmada makale başına yaklaşık 14 dolar), yayımlanmış yöntemleri fiilen kullanmanın marjinal maliyeti çöküyor ve tekrarlanabilirlik ölçülebilir bir özellik haline geliyor: pipeline'dan sağlam çıkan makaleler ölçülebilir biçimde eksiksiz, geçemeyenler ise işaretleniyor. Çoklu agent sonuçları daha da ileriyi gösteriyor: makaleden türetilmiş agent ağları, özgün yazarlarının asla bağlamayacağı işleri çapraz referanslayacak. Açık soru dayanıklılık; topluluk bu artifact'ları sürdürecek mi, yoksa geldikleri bakımsız depolar gibi çürüyecekler mi.

  • #ai-agents
  • #mcp
  • #reproducibility
  • #research
  • #llm

İlgili yazılar