deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Jev destekli pipeline, LLM agent olmadan SREGym-Lite SRE teşhislerinin %76'sını geçti

Programatik bir toplayıcı Kubernetes durumunu kanıta dönüştürüyor ve Jev karar modeli kök nedenleri seçiyor; SREGym-Lite hata teşhislerinin %76,2'sini ortanca 14,6 saniyede geçiyor.

Jev destekli pipeline, LLM agent olmadan SREGym-Lite SRE teşhislerinin %76'sını geçti

Döngüde agent bulunmayan bir pipeline

SREGym ekibi, hiçbir LLM agent içermeyen otomatik bir olay teşhis pipeline'ından elde edilen sonuçları yayımladı. Bunun yerine, programatik bir toplayıcı Kubernetes kanıtlarını topluyor ve düzenliyor; sağlanan seçenekler arasından yanıt seçen bir model olan Jev ise kararları veriyor. Hacker News'in ana sayfasında öne çıkan sregym.com blog yazısına göre pipeline, 21 SREGym-Lite hatası boyunca 105 teşhisin 80'ini (%76,2) geçti ve ortanca teşhis süresi 14,6 saniye oldu.

Yazı, Jev'in bir LLM agent için karar destek aracı olarak acting yaptığı, agent'ın önerdiği testleri sıralamaya ve gönderimden önce kanıtları incelemeye yardımcı olduğu daha önceki bir deneyin devamı niteliğinde. Yeni çalışmada agent kaldırılıyor ve teşhis kararları tamamen Jev'e bırakılıyor.

Pipeline nasıl çalışıyor

Jev yalnızca sağlanan yanıtlar arasından seçim yapabildiği için pipeline'ın hem kanıtı hem de aday yanıtları sunması gerekiyor. Toplayıcı Kubernetes objelerini, event'leri, son pod loglarını ve kaynak kullanımını okur, ardından gözlemleri bileşene göre — örneğin bir Deployment'a — gruplandırır ve hata sinyallerini özetler. Jev bu özetleri inceleyip en çok incelenmeye değer bileşeni seçer.

Toplayıcı daha sonra o bileşene ilişkin daha ince ayrıntıları toplar ve numaralandırılmış kanıt öğeleri hazırlar. Jev, bileşenin hataya neden mi olduğunu, hatadan etkilendiğini mi yoksa ilgisiz mi olduğuna karar verir ve yanıtını en iyi destekleyen kanıtları seçer. Bu seçimlerden yola çıkan pipeline bir teşhis oluşturur ve gönderir. Kanıt hipotezi destekleyemiyorsa bir sonraki adaya geçilir.

Mevcut sürüm aynı anda yalnızca bir adayı inceliyor. Jev hiçbir zaman komut üretmez veya rapor metnini yazmaz; yazarlar uygulamayı GitHub'da yayımladı.

Webhook hatası, adım adım

Yazı, Social Network uygulamasının mutating_webhook_resource_limits hatasını adım adım ele alıyor. nginx-thrift için oluşturulan Pod'lar sürekli OOMKilled oluyordu: Deployment şablonu 256Mi bellek limiti belirtiyordu, ancak canlı Pod'lar 16Mi ile geliyordu. Bir mutating admission webhook, pod oluşturulurken limitleri yeniden yazıyor ve kümede başka dört webhook konfigürasyonu daha bulunduğu için yalnızca isme göre arama faili izole edemiyordu.

Toplayıcı, social-network namespace'indeki 27 Deployment'ı özetledi ve nginx-thrift için hem şablon ile pod arasındaki bellek uyuşmazlığını hem de eşleşen gatekeeper-mutating-webhook-configuration webhook'unu işaretledi. Jev, nginx-thrift'i olası kaynak ve admission_webhook'u hata taşıyan obje türü olarak belirledi. İkinci bir çağrıda kendisine sunulan 26 kanıt öğesiyle bileşeni kaynak olarak sınıflandırdı, nedeni bir admission veya namespace politika sorunu olarak kategorize etti ve 16Mi limitini eşleşen webhook ile birlikte gösteren kanıt öğesini öne çıkardı. Pipeline ardından gönderiminde mekanizmayı çıkararak adlandırdı. Bu hatadaki beş denemenin tümü değerlendirme ölçütlerini geçti — ancak yazarların da belirttiği gibi, toplayıcı burada ciddi bir iş yaptı: uyuşmazlığı fark edip Jev herhangi bir seçim yapmadan önce webhook adaylarını daralttı.

Sonuçlar ve tutarlılık

Değerlendirme, 4 Eylül SREGym-Lite kohortundaki 21 hata senaryosunu kapsadı; jev-1.13.0 ile beş kez çalıştırıldı ve her çalıştırma bir teşhis gönderdi. Puanlama, yüksek reasoning eforuyla gpt-6-astra kullanılarak SREGym'in dokuz soruluk değerlendirme ölçütü ve 0,70 geçiş eşiğiyle yapıldı; yazarlar bunun güncel leaderboard seti değil, geçmiş kohort olduğunu vurguluyor.

%76,2'lik geçiş oranının ötesinde: 21 hatanın 16'sı beş denemenin tamamını geçti, 5'i tamamında başarısız oldu; Jev toplamda 252 çağrı yaptı (deneme başına 2,4) ve deneme başına ortanca toplam API gecikmesi 0,53 saniyeydi; çalıştırmalar TypeSafe'ın yayımlanan fiyatlandırmasıyla tahmini 0,15 dolar maliyetle 3,48 milyon girdi tokenı tüketti. Sonuçlar tamamen kümelendi: her hata ya beş üstü beş ya da sıfır üstü beş oldu ve 21 hatanın 18'i her çalıştırmada aynı teşhis puanını aldı — ancak özdeş puanlar özdeş inceleme yollarını kanıtlamaz. Kurtarılamayan beş hata; edge istek filtresi CPU doygunluğu, bir Kafka poison pill'i, arama oranı yeniden deneme çöküşü, bir servis DNS çözümleme hatası ve Valkey kimlik doğrulama kesintisiyle ilgiliydi.

LLM agent'lara karşı maliyet

Jev'in %76,2'si, aynı hatalarda GPT-5.6 Sol (medium)'ın %77,8'inin hemen altında kalıyor; ancak teşhis başına yaklaşık 7 kat daha hızlı ve kabaca 200 kat daha ucuz çalışıyor. Yazı ayrıca sonuçları GPT-6 Astra, GPT-6.1 Sol, Claude Opus ve Sonnet varyantları, Codex ve Claude Code ile karşılaştıran grafikler içeriyor; bunların aynı 21 hata kimliği üzerinde ayrı deneyler olduğu belirtiliyor.

Yazarların merkezî açık sorunu ayrıntı düzeyi: kaba bir özet, bir hatayı açıklayan ayrıntıyı atlayabilir; her YAML satırını iletmek ise yararlı sinyali boğabilir. Jev'e ne gösterileceğinin seçiminin, modelin bunu değerlendirme yeteneği kadar önemli olabileceğini savunuyorlar.

Neden önemli

Sonuçlar, otomatik olay müdahalesi için makul bir iki katmanlı mimari çiziyor: hızlı, ucuz ve kısıtlı bir yargıç birinci basamak triyajı üstlenir ve yalnızca kendisine sunulan kanıt ve seçenekler tükendiğinde işi bir LLM agent'a devreder. Jev açıkça bir agent'tan daha az esnek — özgürce inceleme yapamaz ve beş sıfır-üstü-beş hatası tam olarak toplayıcının kanıtının yetersiz kaldığı yerleri işaret eder. Ancak çalıştırmalar arasındaki tutarlılık, 15 saniyenin altındaki ortanca süre ve çok küçük bir maliyetle agent'a yakın geçiş oranı, Kubernetes üzerinde otomatik SRE araçları inşa eden ekipler için somut bir veri noktası oluşturuyor.

  • #sre
  • #kubernetes
  • #ai-agents
  • #incident-response
  • #diagnostics

İlgili yazılar