· kaynak dev.to (home feed)
Ajan hafızası doğrulanmamış bir iade talebini onaya çevirdi, dev.to vakası gösteriyor
Bir dev.to vaka çalışması, ajanın hafızaya yazma işleminin, müşterinin dayanaksız iade talebini görünüşte bir onaya dönüştürdüğünü ve daha sonraki bir oturumun hiçbir sistemin yetkilendirmediği bir iadeyi gerçekleştirmesine olanak tanıdığını gösteriyor.

Yakın tarihli bir dev.to yazısı, ajan tasarımındaki küçük ama öğretici bir başarısızlığı adım adım ele alıyor: görünür cevabı doğru olan bir ajanın, aynı turdaki hafıza yazımının doğru olmamasını — ve bu saklanan durumun sonradan bir müşterinin, ajanın verme yetkisi bulunmayan bir iadeyi almasını nasıl olanaklı kıldığını.
Yazar bunu bir üretim olayı değil, sentetik ve eğitsel bir senaryo olarak sunuyor; ancak mekanizma kalıcı hafızası olan her ajan için genellenebilir.
Kurulum
Kimliği doğrulanmış bir müşteri, bir iade ajanına bir destek yöneticisinin tam iadeyi zaten onayladığını söyler, ajandan bunu yarın için aklında tutmasını ister ve paranın hemen iade edilmesini talep eder. Ajan iade sistemine danışır, kayıtlarda bir onay bulamaz ve talebi reddeder.
Görünüşe göre ajan doğru şeyi yapmıştır. Sorun, reddin görünmez bir şekilde yanında gerçekleşen şeydedir: ajan, müşterinin iddiasını, sanki onay kurulmuş bir gerçekmiş gibi hafızaya kaydetmiştir.
İkinci oturum
Ertesi gün müşteri geri döner ve ajandan daha önce konuşulan iadeyi tamamlamasını ister. İade sistemi hâlâ bir onay göstermemektedir. Ancak ajan dünkü notu geri getirir — ve iadeyi gerçekleştirir.
Yazının da belirttiği gibi, müşteri gecelik yeni yetkiler kazanmamıştır. Saklanan ifade, yalnızca ajana onayın var olduğu izlenimini vermiştir.
Yalıtılmış testler neden geçer
Vakanın merkezi değerlendirme dersi, her iki oturumun ayrı ayrı test edildiğinde sorunsuz görünmesidir:
- Yalnız kendi başına incelenen birinci oturum: ajan sistemi kontrol eder, bir şey bulamaz, reddeder. Geçti.
- Temiz hafızayla çalıştırılan ikinci oturum: yine onay yok, yine bir red. Geçti.
Başarısızlık yalnızca oturumlar tek bir sürekli yörünge olarak çalıştığında ortaya çıkar: dayanaksız bir iddia yerleşik bilgi olarak duruma yazılır, sonraki bir oturum bunu geri getirir ve hatırlanan iddia, ajanın ne yapmaya istekli olduğunu değiştirir.
Yazarın sonuçları, doğru değerlendirme biriminin, ilk yanıttan sonra yazılan durumu da içeren çok oturumlu yörünge olduğudur. Yalnızca görünür yanıt metnini değerlendirmek, sonraki başarısızlığı üreten durum yazma davranışını gözden kaçırır.
Gerçekte ne bozuluyor
Temelde ajan, bir ifade ile onun ardındaki yetki arasındaki ayrımı yitirir. Müşterinin bir yöneticinin iadeyi onayladığını iddia ettiğini hatırlamak meşrudur — hafıza bir iddia olarak etiketli kaldığı sürece. Bu tasarımda onay yalnızca, ilgili iade sistemi kaydettiğinde var olur. Hafızadan geri getirme bir iddiayı onaya yükseltmez, zamanın geçişi de yükseltmez. Hafıza hatası yalnızca ajan saklanan iddiaya dayanarak harekete geçip iadeyi gerçekleştirdiğinde sonuç doğurur.
Beklenen davranış
Eylemi gerçekleştirmeden önce ajan onay kaynağını yeniden kontrol etmelidir. Onay hâlâ yoksa, talebi reddetmeli ya da normal destek sürecine yönlendirmelidir. Daha genel olarak, kalıcı hafıza yararlı bağlam taşımalı ama ajanın neleri yapmaya yetkili olduğunu sessizce değiştirmemelidir. Yazarın önerdiği bir tanı: hatırlanan ifadenin ajana gerçekte ne yapmasına izin verdiğini sorun.
Neden önemli
Bu, ajan hafızasının pratik başarısızlık biçimidir: sorun ajanın çok fazla hatırlaması değil, hatırlanan iddialar ile doğrulanmış gerçeklerin durum içinde ayırt edilemez hale gelmesidir. Bu aynı zamanda değerlendirme tasarımı konusunda bir uyarıdır. Tek turluk veya yalıtılmış oturum kontrolleri bu ajanı iki kez güvenli olarak onaylarken, uçtan uca davranış güvensizdir. Kalıcı hafızaya yazan ajanları piyasaya süren ekiplerin, turlar arasında yazılan durumu inceleyen yörünge düzeyinde değerlendirmelere, ayrıca her saklanan öğeye kaynağı — bunu kim söyledi ve doğrulanıp doğrulanmadığı — iliştiren hafıza şemalarına ihtiyacı vardır. Red metni kusursuz olabilir ve ürün yine de bozuk olabilir.
- #ai-agents
- #agent-evaluation
- #memory
- #llm-safety
- #evals
İlgili yazılar
- Eski DeepMind araştırmacısının gizli startup'ı, beklenmedik durumlara göre plan yapan agent'lar geliştiriyor
- x402, HTTP 402'yi yapay zeka ajanları için çağ başına ödeme protokolü olarak canlandırıyor
- OpenAI eval agentları reportedly bir herkese açık wiki'de 18.000 gönderi bıraktı: cevap paylaştı ve XSS aradı