deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

107 görevlik veri mühendisliği kıyaslaması LangGraph, CrewAI ve AutoGen'i ölçekle sınadı

dev.to üzerinde yayınlanan kod odaklı bir kıyaslama, LangGraph, CrewAI ve AutoGen'i 107 I/O yoğun veri mühendisliği görevinde çalıştırarak her framework'ün soyutlamalarının agent iş akışları ölçeklendikçe nerede zorlandığını ortaya koydu.

107 görevlik veri mühendisliği kıyaslaması LangGraph, CrewAI ve AutoGen'i ölçekle sınadı

Kurulum: Gerçek pipeline'ları zorlamak için tasarlanmış 107 görev

dev.to üzerinde priyeshdave6 kullanıcı adıyla yayımlanan, geliştirici tarafından yazılmış bir yazı, yaygın olarak kullanılan üç agent orkestrasyon framework'ünü — LangGraph, CrewAI ve AutoGen'i — üretim iş yüklerini temel alan 107 veri mühendisliği göreviyle sınıyor. Yazıya göre görev seti; API, PDF ve HTML'den veri çekme; şema normalizasyonu, tekrarları temizleme ve özellik üretimi gibi dönüşümler; Snowflake, S3 ve Postgres'e yükleme; null tespiti ve anomali işaretleme gibi QA kontrolleri; ve küçük yönlü asiklik grafları (DAG) kapsıyor.

Yazar her görev için katı kısıtlar belirliyor: en az bir API veya veritabanı çağrısı, medyan boyutu 100KB olan yarı yapılandırılmış veri yükleri, GPT-4-turbo veya Claude 3 Opus kullanan bir ila altı arası LLM çağrısı, 15 saniyenin altında medyan runtime olacak şekilde katı bir servis seviyesi ve görev başına bir sent hedef maliyeti. Görevlerin dörtte birinden fazlası agent zincirleme, hata kurtarma veya bulanık tekrar tespiti içeriyor — yazarın iddiasına göre tam da resmi framework dokümantasyonunun olduğundan fazla vaat edip eksik teslim ettiği alanlar; çünkü her şeyin yolunda gittiği demo'lar, çalışma ortasında kilitlenen akışlar ya da gecede fırlayan faturalar hakkında pek bir şey söylemiyor.

Tüm çalışmalarda raporlara göre hız limitlerinden kaçınmak için I/O'su kısıtlanmış aynı 8 çekirdekli ARM düğümü kullanılmış; LLM çağrıları için GPT-4-turbo, veri hedefi olarak Postgres tercih edilmiş.

LangGraph: Açık kontrol, artan boilerplate

LangChain üzerine kurulu LangGraph yalnızca Python'da çalışıyor, deterministik ve graf yapısını, adım kontrolünü ve state'i açık hale getiriyor. dev.to yazısına göre bu açıklığın bedeli kod hacminde ortaya çıkıyor: yaklaşık yirminci görevden itibaren her düğüm kendi try/catch işlemesini, retry ve çıktı doğrulamasını gerektiriyor. Düğüm kodu görev aileleri arasında tekrarlanıyor ve yukarı–aşağı akışlı DAG'leri koordine etmek çoğu zaman hantal global state'ler veya bant dışı callback'ler gerektiriyor.

Yazarın belirttiğine göre telafi edici fayda şeffaflık: state her zaman görünür durumda, dolayısıyla bir pipeline başarısız olduğunda nerede ve neden olduğunu tam olarak görebiliyorsunuz. Genel değerlendirme, karmaşıklık arttıkça boilerplate bedeli ödenen, öngörülebilir kontrol ve hız.

CrewAI: Belirli bir noktaya kadar ergonomik

CrewAI, orkestrasyon derdi olmadan modüler agent iş birliği vaat ediyor ve kıyaslama da bunu onaylıyor — kabaca ilk on agent veya görev için. Yazıya göre bunun ötesinde görev soyutlaması sızmaya başlıyor: değişken bağımlılıklarını eşlemek karışık hale geliyor, görevler arası çıktı zincirleme kırılganlaşıyor ve üç ya da daha fazla adımlı zincirler hata ayıklamayı yavaşlatan aralıklı "variable not found" hatalarını tetikliyor. Ölçek büyüdükçe yayılım da artıyor; modülerliğin yerini yüzlerce agent ve iş sınıfı alırken retry yönetimi opak kalıyor.

Yazar bunu bir birleştirilebilirlik uçuğu olarak tanımlıyor: LangGraph'tan daha az boilerplate, ama işler ters gittiğinde daha az kontrol ve netlik, ve ekiplerin akışları yeniden yazarak ya da soyutlamayı tamamen kırarak sonuçlandığı bir kırılma noktası.

AutoGen: En pürüzsüz başlangıç, en dik bedeller

AutoGen mesaj iletimini ve belleği kutudan çıktığı gibi otomatikleştiriyor; yazı onboarding deneyimini doğrusal veya gevşek bağlı akışlarda sınıfının en iyisi olarak nitelendiriyor. Bedel, iş akışı derinliği arttıkça görünüyor. Yazar, tembel mesaj budamanın prompt bağlamının şişmesine izin verdiğini, zincir uzunluğu arttıkça token maliyeti ve bellek kullanımının LangGraph ve CrewAI'ı yüzde 30 ila 90 aşığını iddia ediyor; agent ve mesaj grafı derinliği ise gecikmede kuadratik büyümeye yol açıyor.

Hata yönetimi üçlü arasında en zayıf durumda: raporlara göre agent zincirlerindeki arızalar genel istisnalar olarak yayılıyor ve bu da hata analizini gürültülü hale getiriyor. Yazının sonucu şu: AutoGen prototipler için etkileyici, ama gerçek iş akışı derinliği ve üretim bütçeleri devreye girdiğinde riskli.

Toplu sayılar

Yazı, tüm 107 görevi kapsayan ve medyan ile 99. yüzdelik dilimdeki runtime'ı, görev başına ortalama maliyeti ve toplam hata sayılarını içeren bir toplu karşılaştırmayla kapanıyor. Makalenin elimize ulaşan kopyası tablonun ortasında kesildiğinden burada somut rakamlar alıntılanamıyor. Ancak niteliksel çerçeve yazı boyunca tutarlı: ölçekte kontrol edilebilirlik ve maliyet öngörülebilirliği için LangGraph, küçük ve sığ ekipler için CrewAI ve AutoGen yalnızca yüzeydeki akışlar için.

Neden önemli

Agent framework seçimleri genellikle hızlı başlangıç demo'larının etkisiyle yapılıyor ve bu kıyaslama, gerçek dağıtımlarda asıl belirleyici olan şeyleri test ettiği için yararlı bir denge unsuru: hata kurtarma, zincirlenmiş agent'lar arası state aktarımı ve derinlikteki token maliyeti. Ekipler için pratik öneri şu: deterministik kontrol önemliyse boilerplate için bütçe ayırın, CrewAI dağıtımlarını zincirleme derinleşmeden önce sınırlayın ve AutoGen'in otomasyonunu doğrudan bir harcama ve gecikme dengesi olarak görün.

Uyarılar da gerçek. Bu, tek bir iş yükü sınıfının — GPT-4-turbo ile I/O yoğun veri mühendisliği — tek bir kişinin kendi yayınladığı kıyaslaması; diğer alanlar, modeller veya framework sürümleri farklı davranabilir. Yine de agent soyutlamalarının yüz görevi geçince nasıl durduğuna dair somut, kod odaklı bir veri noktası olarak, çoğu satıcı dokümantasyonundan daha eyleme dönük.

  • #llm-agents
  • #benchmarks
  • #langgraph
  • #crewai
  • #autogen

İlgili yazılar