deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Procedural Graphs, LLM ajanlarına kendi kendini düzenleyen bir yürütme yapısı kazandırıyor

Yeni bir arXiv makalesinin dev.to özetine göre Procedural Graphs, ajanların kendi yürütme izlerinden rafine ettiği yönlü iş akışları; WebShop'ta bellek tabanlı ajanlara kıyasla %15-25 başarı artışı bildiriyor.

Procedural Graphs, LLM ajanlarına kendi kendini düzenleyen bir yürütme yapısı kazandırıyor

9 Eylül 2026'da Yuxing Lu, Yicheng Chen ve Shanchan Wu, arXiv'de (2609.08593), ajanların yürütme deneyimine dayanarak kendini yeniden yazan bir LLM ajanı yürütme yapısı olan Procedural Graphs öneren bir makale yayımladı. Makalenin dev.io'daki özetine göre fikir, nasıl yapılır bilgisini bilgi grafiklerinin olguları düzenlediği şekilde düzenlemek ve bu yaklaşımın standart benchmark'larda bellek güdümlü ajanlara kıyasla iki haneli kazançlar sağladığı bildiriliyor.

Yalnızca bellek kullanan ajanların sorunu

AutoGPT veya LangChain gibi framework'ler genellikle düşünceler, gözlemler ve eylemlerden oluşan sürekli bir kayıt tutar ve sonraki adımı bu bağlamdan seçer. Özet, bunun basit görevlerde işe yaradığını ancak karmaşıklık arttıkça bozulduğunu savunuyor: ajanlar uzun etkileşimlerde özgün hedeften uzaklaşıyor, araçları yanlış sırada çağırıyor, daha önce başarısız olmuş eylemleri tekrarlıyor ve genel bir plan olmadan adım adım ilerliyor.

Grafik nasıl görünüyor

Bir procedural graph üç parçadan oluşan yönlü bir grafiktir. Düğümler prosedürel adımları temsil eder; her biri bir açıklama, beklenen girdi ve çıktılar ile başarı ve başarısızlık koşulları taşır. Kenarlar adımlar arasındaki ilişkileri kodlar; bunlar sıralı, koşullu veya paralel olabilir. Düğümlere bağlı yürütme olasılığı, ortalama süre, başarı oranı ve tekrarlayan hata kalıpları gibi nitelikler, ajan çalışırken güncellenir.

Gönderi bunu bir uçuş rezervasyonu göreviyle örneklendiriyor: uçuşları araştır, ucuz seçenekleri filtrele, koltuk uygunluğunu kontrol et, yolcu bilgilerini doldur, ödeme yöntemi seç ve siparişi onayla; koltuk yoksa filtreleme adımına geri dönen döngüler ve hiçbir şey isteği karşılamıyorsa yakındaki havalimanlarına giden bir dal bulunur. Dallar, döngüler ve koşullu yapılar, aksi halde doğrusal bir bellek kaydı olacak şeyin yerini alır.

Yapı kendini nasıl düzenliyor

Kendi kendini geliştirme mekanizması döngüler halinde çalışır. Ajan tam yürütme yörüngelerini kaydeder, başarısız çalışmaları başarılı olanlarla karşılaştırır ve ayrıştıkları noktaları tespit eder. Makalenin Refiner adını verdiği bir LLM bileşeni düzenlemeler önerir; bunlar bir doğrulama setinde test edilir ve yalnızca yardımcı olurlarsa tutulur. Düzenlemeler üç aileye ayrılır: düğüm ve kenar ekleme ya da kaldırma gibi topoloji değişiklikleri; istatistikleri, eşikleri ve yürütme olasılıklarını güncelleme gibi nitelik değişiklikleri; ve adım açıklamaları ile yol gösterici dili yeniden yazan içerik değişiklikleri.

Araştırmacıların üç farklı başlangıç noktası test ettiği bildiriliyor. Boş bir grafik yavaş gelişti ama alternatiflere yakın bir performansa ulaştı. Minimal, elle çizilmiş bir iskelet en hızlı gelişti ve en güçlü sonuçla bitti. En dikkat çekici şekilde, hatalı, uzman tarafından tasarlanmış bir başlangıç grafiği aynı geliştirme döngüsüyle onarılabilmiş; bu da mekanizmanın kusursuz bir başlangıç tasarımına bağlı olmadığını gösteriyor.

Bildirilen sonuçlar

Ajanların doğal dille verilmiş talimatlarla e-ticaret sitelerinde ürün satın aldığı bir benchmark olan WebShop'ta, özet saf bellek tabanlı bir temele kıyasla %15-25 başarı oranı artışı bildiriyor; geliştirilmiş grafik kendi başlangıç sürümünü %10-20 geçiyor. Makalenin ayrıca simüle edilmiş bir evde ev görevleri için ALFWorld'u, çok adımlı soru yanıtlama için HotPotQA'yı ve çoklu API araç kullanımı görevlerini değerlendirdiği söyleniyor; grafik bu son görevde araç çağrı sırasını ve parametre ayarlarını doğru tutmakla anılıyor.

Uygulayıcılar için iki bulgu öne çıkıyor. Gönderinin örneğinde GPT-4 üzerinde geliştirilmiş grafiklerin Claude veya Llama gibi diğer modellere aktarıldığı bildiriliyor; bu, yapının göreve özgü bilgiler değil de görevin kendisini yakaladığına işaret ediyor. Yaklaşım ayrıca özete göre on örnekten az veriyle de etkili kalmış; buna karşılık bellek tabanlı temeller bu az verili rejimde keskin biçimde düşmüş.

Neden önemli

Ajan sistemleri geliştiren ekipler için bu çalışta, iki tatmin edici olmayan uç arasında bir orta yol gösteriyor: öngörülmeyen durumlarda bozulan katı iş akışlarını elle yazmak ya da bir ajanın çiğ bellekten doğaçlama yapmasına izin vermek. Bir insan tarafından tohumlanmış ve yürütme izleriyle rafine edilmiş kaba bir grafik; bir ajanın neden böyle davrandığını görmek için düğümleri ve kenarları okuyabileceğiniz için denetlenebilir, ayrıca model satıcıları arasında taşınabilir bir yapı sunuyor; bu da kilitlenme konusunda endişe edenler için önemli.

Özet bu araştırmayı nöro-sembolik olarak çerçeveliyor: LLM anlamsal anlayışı, grafik ise açık prosedürel kısıtlamaları sağlıyor; yazar bu kombinasyonu hızlı, sezgisel bir sistem ile yavaş, kural tabanlı bir denetleyiciyi eşleştirmeye benzetiyor. Bu çerçeveleme yorumlayıcıdır ve burada alıntılanan benchmark rakamları makalenin kendisinden değil ikincil bir özetten geldiği için, geliştiriciler mimarilerini buna göre yeniden yapılandırmadan önce doğrudan arXiv:2609.08593'e başvurmalı. Yine de yön net ve pratik: bir sonraki prompt ayarlamasını ya da model sürümünü beklemeden, kendi başarısızlık izlerinden gelişen ajan altyapısı.

  • #llm-agents
  • #ai-research
  • #neuro-symbolic
  • #agent-frameworks
  • #arxiv

İlgili yazılar