· kaynak dev.to (home feed)
LangChain anketi: agent gözlemlenebilirliği neredeyse her yerde, evaluation ise çok geride
LangChain 1.340 practitioner'a sordu: yüzde 89 agent gözlemlenebilirliği kurmuş durumda, ama yalnızca yüzde 52,4 offline eval, yüzde 37,3 online eval yapıyor. İkisini birden yapanlar üçte birin altında; agent kalitesi büyük ölçüde ölçülmemiş kalıyor.

AI agent çalıştıran ekiplerin neredeyse tamamı geçen hafta agent'larının ne yaptığını görebiliyor. Yarısından azı ise bunu doğru yapıp yapmadığını söyleyebiliyor. LangChain'in State of Agent Engineering raporunun ana bulgusu bu; rapor 18 Kasım - 2 Aralık 2025 arasında 1.340 yanıt topladı ve 23 Mayıs 2026'da yayınlandı. Ankete göre practitioner'ların yüzde 89'u agent'ları için gözlemlenebilirlik uygulamış; production'da agent'ı olan ekiplerde bu oran yüzde 94'e çıkıyor. Sistematik evaluation tablosu ise bambaşka: yüzde 52,4 test setlerine karşı offline evaluation, yüzde 37,3 production'da online evaluation çalıştırıyor ve ikisini birden yapanlar üçte birin altında.
Anket neyi ölçtü
Rapora göre genel agent production benimseme oranı yüzde 57; 10.000 ve üzeri çalışanı olan organizasyonlarda yüzde 67'ye yükseliyor. Adım adım tam tracing, genel olarak katılımcıların yüzde 62'sinde, production ekiplerinin yüzde 71,5'inde mevcutken, online evaluation production ekiplerinin yalnızca yüzde 44,8'ine ulaşıyor. Aynı anket, kaliteyi — doğruluk, ilgililik, tutarlılık ve ton — agent'ları production'a almanın en büyük engeli olarak gösteriyor; katılımcıların yaklaşık üçte biri bunu belirtiyor.
Bu iki bulgu çelişki içinde: bir dağıtımı engellemesi en olası şey, ölçülmesi en az olası şey aynı zamanda. On ekipten yaklaşık dokuzu agent'ının ne yaptığını yeniden oluşturabiliyor; yaklaşık beşi bunun iyi olup olmadığını değerlendirebiliyor.
Dashboard'lar neden yanlış yanıtları göremez
Yakın tarihli bir dev.to analizine göre bu boşluk, tracing ile evaluation'ın temelde farklı şeyler ölçmesinden kaynaklanıyor. Bir trace, bir tool çağrısının yapıldığını ve API çağrısının başarılı olduğunu kaydeder. Agent'ın doğru çağrıyı yapıp yapmadığını kaydedemez; çünkü kendinden emin bir şekilde yanlış yapılan bir tool çağrısı zinciri, doğru olanla aynı telemetriyi üretir.
Yazı bunu, iade işlemlerini yürüten bir destek agent'ının iki çalıştırmasıyla örnekliyor. Telemetrileri pratikte özdeş: üç span, hepsi OK işaretli, kabaca 3,2 saniye, yaklaşık 2.850 input token, temiz bir duruş. Ama bir çalıştırmada agent, müşterinin şikayet ettiği 40 dolarlık siparişi iade ederken; diğerinde müşterinin hiç mention etmediği 2.300 dolarlık siparişi iade ediyor. İade endpoint'i her iki durumda da başarılı olduğundan tüm span'lar yeşil kalıyor.
OpenTelemetry GenAI semantik konvansiyonları — çoğu gözlemlenebilirlik platformunun topladığı attribute seti — kullanılan modeli, token tüketimini, finish reason'ları ve operasyon adlarını kapsıyor. Bunların hepsi çağrının, yanıtı değil, özelliği. Konvansiyonlar skor ve label için attribute'lar içeren bir evaluation namespace'i tanımlıyor, ama bu alanlar bir ekip onları dolduran bir evaluator yazana kadar boş kalıyor. Pratik sonuç şu: latency, token harcaması ve hata oranına bağlanan alert'ler düz kalırken kalite kötüleşiyor; runtime'ın bakış açısından hiçbir şey başarısız olmamış.
Bilinen çözüm: sonuç durumunu kontrol etmek
Sonuç ölçümünün, mevcut agent dalgasından öncesine dayanan bir örneği var. Tool kullanan agent'lar için bir benchmark olan Sierra'nın τ-bench'i, konuşmaları, görev sonunda veritabanının durumunu önceden annotate edilmiş hedef durumla karşılaştırarak puanlar — yanıtların sözlüğüne veya hangi tool'ların adının geçtiğine göre değil. İade örneğine uygulandığında, çalıştırma öncesi ve sonrası veritabanını diff'leyen, hangi siparişlerin ve ne kadar iade edildiğini kontrol eden kısa bir fonksiyon, hiçbir telemetry alanı iki çalıştırmayı ayırt etmese bile hatayı anında yakalar.
Seçilmiş test setleri üzerinde offline evaluation'lar bu tür başarısızlıkları yayından önce yakalar; online evaluation'lar trafik canlıyken yakalar. LangChain'in rakamlarına göre çoğu ekip ikisini de tutarlı şekilde yapmıyor.
Neden önemli
Gözlemlenebilirlik hızlı benimsendi çünkü vendor'lar onu tak-çalıştır bir entegrasyon olarak satıyor. Evaluation aynı şekilde satın alınamaz; çünkü her ekibin kendi alanında doğru sonucun ne anlama geldiğini tanımlamasını gerektirir — bu bir kurulum adımı değil, ürün kararıdır. Hem offline test setlerini hem de production kontrollerini atlayan ekiplerin, agent'ları yanlış şeyi yetkinlikle yapmaya başladığında hareket eden hiçbir sinyali olmaz. Latency bozulmaz, hata oranları sıfırda kalır; ilk alert genellikle bir müşteri şikayeti olarak gelir.
- #ai-agents
- #observability
- #evaluations
- #opentelemetry
- #langchain
- #llms