· kaynak dev.to (home feed)
İki hafta gerçek muhasebe: saha raporu, otonom bir yapay zeka ajanında 17 sessiz başarısızlığı kaydediyor
dev.to'daki bir saha raporu, küçük bir firmanın muhasebesini denetimsiz yürüten bir ajanın bozuk yüklemelerden on yedi kat hatalı ödeme toplamına kadar gerçek olmayan başarılar bildirdiği on yedi vakayı belgeliyor.

dev.to'daki bir saha raporu, gerçek dosyalara ve gerçek bir banka hesabına erişimi olan otonom bir yapay zeka ajanının küçük bir inşaat şirketinin muhasebesinde denetimsiz olarak iki hafta boyunca çalıştırılmasını ele alıyor. Yazara göre, yazıda kataloglanan on yedi başarısızlığın her biri aynı biçimi taşıyor: ajan başarı bildirdi ve başarı ortada yoktu. Bunların hiçbiri bir çökme değildi. Her başarısızlık, normal işlem olarak görünecek kadar sessizdi.
Hata vermeden bozulan dosyalar
İlk başarısızlık grubu, her kontrol yeşil kalırken hasarlı ulaşan verilerle ilgili. Modelin bir ikili dosyayı base64 dizgesi olarak yeniden üretmesi kabaca 6.000 karakterin altında güvenilir oldu; rapor, yaklaşık 11.564, 22.108 ve 37.000 karakterde bozuk çıktı kaydediyor. Bozuk bir base64 dizgesi yine de çözümlenir, yani sonuç içinde yanlış baytlar bulunan, geçerli görünümlü bir dosyadır — bir vakada açıldığında boş bir kılavuz gösteren bir elektronik tablo, bir diğerinde başlığın altındaki içeriği okunamayan bir fatura görseli. Yazarın kuralı net: modelin uzun base64 üretmesine hiç izin verme; çözümlemeyi kaydedilmiş bir dosyadan programatik olarak yap.
İkinci başarısızlık: ajanın "doğrulandı"sı yalnızca yükleme çağrısının başarılı olduğunu ve dosya boyutunun eşleştiğini anlamına geliyordu. Aynı boyut, yanlış içerik en yaygın bozulma biçimi olarak tanımlanıyor ve bu, dosya boyutunu bir sinyal olarak neredeyse işe yaramaz hale getiriyor. Düzeltme, doğrulamayı dosya türüne göre tanımlamaktı — metni kaynağıyla karşılaştır, elektronik tablo toplamlarını CSV'ye dışa aktararak karşılaştır, görselleri işle ve belirli alanların okunabilir olduğunu denetle — artı davranışı değiştiren bir talimat: neyin karşılaştırıldığını belirtmeden asla "doğrulandı" yazma.
Toplu üretim üçüncüyü ekledi: aynı şablondan üretilen ve art arda yüklenen iki ödeme makbuzu, görünüşe göre uzun bir özdeş bayt öneki paylaştıkları için üst üste üç kez içeriklerini takas etti. Benzer belgeleri erken aşamada farklılaştırmak, sonra her birini ona özgü bir dizgeyle doğrulamak sorunu çözdü. Düz metin bile muaftı — bir İbranice belge kaynağında olmayan bir kelime kazandı ve başka bir kelime İbranice ve Latin karakterlerin karışımıyla çıktı, ikisi de hiçbir hata olmadan. Önerilen savunma, yüklemeden sonra bayt bayt karşılaştırma veya bir özet (hash) yapmaktır.
Okunmamış veri üzerinde kendinden emin akıl yürütme
Rapor bunu listedeki en tehlikeli başarısızlık olarak adlandırıyor. Bir e-posta üç tutar listeliyordu: 216, 864 ve 2.610. Ajan bunları topladı, 3.690 beklenen borç bildirdi ve ödemeyi onaylamayı önerdi. Gerçek rakam 64.118,41 idi ve ajanın kendi günlüğünün bir satır önce okumadığını söylediği bir PDF ekinde duruyordu. Çıktı akıcı, kendinden emindi ve kabaca on yedi kat hatalıydı.
Önerilen sert kural: bir sayıyı asla ajanın okumadığı bir kaynaktan türetme. Bilginin bir kısmı okunmamış bir ekte bulunuyorsa, ajan bilineni, bilinmeyeni ve eksik kısmın neden okunamadığını raporlamalı — asla bir sayı vermemeli.
Birkaç ilgili tuzak ardından geliyor. Kullanılabilir Gmail araçları yalnızca ek üst verisini döndürüyor, bu yüzden durumun farkında olmayan bir ajan ekleri okumuş gibi e-postaları özetliyor; düzeltme sınırlamayı açıkça belirtmek ve kullanıcıdan dosyaları bulut depolamaya taşımasını istemek. Bir talebin altı gündür yanıtlanmadığı sonucu, gönderildikten yaklaşık bir saat sonra ayrı bir diyalogda QuickBooks bildirim adresinden gelen bir yanıtı gözden kaçırdı; düzeltme sessizlik ilan etmeden önce üç arama yapmak — şirket adı, anahtar kelime, tarih aralığı — ve aksi halde bunu "diyalogun kendisinde yanıt bulunamadı" diye ifade etmek. Gmail'i etiketin görünen adı yerine etiket kimliğiyle aramak her seferinde boş bir liste döndürüyor, böylece ajanın izleme mekanizması her çalıştırmada "yeni bir şey yok" bildirirken hiç işlemedi. Ve ajan "yarın" ifadesini bir gün sınırının ötesine taşıdı, doksan dakika uzaklıktaki bir toplantıyı yarın olarak tanımladı; düzeltme her yanıtın ve zamanlanmış çalıştırmanın başında gerçek bir saat denetimi ve zorunlu tek bir iş saat dilimidir.
Kendini bozan yapı
Son grup mimari. Ajanın talimatları yapılandırma dosyalarına kimlikle (ID) başvuruyordu, ancak bu yığında bir dosyayı güncellemek yeni bir kimlik üretiyor — dolayısıyla ajanın kendi dosya haritasını güncellemesini gerektiren bir kural, ona yapılan her işaretçinin kırılmasını garanti ediyordu ve üç zamanlanmış görev de saatler içinde başarısız oldu. Dosyalara kararlı adla başvurmak ve bir ad birden fazla dosyayla eşleştiğinde duraklatmak önerilen düzeltme. Ayrıca, ham bir CSV'yi Google Sheets arayüzünden açmak onu düzenlemez; aynı adla ve farklı içerikle ikinci bir dosyayı sessizce oluşturur.
Neden önemli
Ajan yazılarının çoğu temiz bir demodur. Bu, gerçek paranın bağlı olduğu bir dağıtımdan bir başarısızlık günlüğü ve değeri adlandırdığı örüntüde: ajanlar akıcı biçimde başarısız oluyor. Sessiz bozulma, okunmamış kaynaklardan makul sayılar, yanıt gibi okunan boş sonuçlar ve kendini bozan yapılandırma, adlandırıldıklarında güvence altına alınması kolaydır — dosya türüne göre açık doğrulama, toplu işlerde benzersiz içerik işaretleri, zorunlu saat denetimleri, ada dayalı başvurular ve okunmamış materyalden çıkarsamaya karşı sert kurallar. Bir ajanı dosyalara, e-postaya veya ödemelere yönelten herkes bunlardan birkaçına çarpacağını beklemeli.
- #ai-agents
- #automation
- #reliability
- #llm
- #verification
İlgili yazılar
- Eski LinkedIn SRE'si, yapay zekâ ile olay yönetiminin mühendislerin sistem bilgisünü aşındırdığı konusunda uyarıyor
- Runtime gateway'leri ve katmanlı savunmalar: ekipler yapay zeka agent'lerini üretimde nasıl yönetiyor
- Moadim: Yapay zeka ajanlarını bir zamanlamayla reponuzda çalıştıran açık kaynaklı bir döngü motoru