deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Çinli LLM'lerin tool calling'i benchmark'larda GPT-5.5'i geride bıraktı ama geçiş bir config değişimi değil

DeepSeek, GLM, Qwen, Kimi ve MiniMax ailelerinden on modelin dev.to üzerindeki karşılaştırması, her yerde OpenAI uyumlu tool calling buluyor; ancak streaming, paralel çağrı ve hata yönetimi farkları model başına adapter'lar gerektiriyor.

Çinli LLM'lerin tool calling'i benchmark'larda GPT-5.5'i geride bıraktı ama geçiş bir config değişimi değil

Beş Çinli LLM ailesinden on üretim modelinin sistematik bir karşılaştırması, OpenAI tarzı tool calling'in Çinli sağlayıcılar arasında artık temel bir beklenti olduğunu — ve bu yüzey uyumluluğunun, üretim ajanlarını zorlayacak kadar sapma barındırdığını sonucuna varıyor.

dev.to'da yayınlanan karşılaştırmaya göre, test edilen her model — DeepSeek-V4-Pro; GLM-5.1 ve GLM-5.3; Qwen3.5, Qwen3.6-Plus ve Qwen3.7-Max; Kimi K2.5, K2.6 ve K3; ayrıca MiniMax M3 — GPT-5.5'in uyumluluk referansı alındığı testte tool_choice ve çok turlu tool-result mesajları dahil OpenAI formatındaki function ve tools şemalarını kabul ediyor. On modelin tamamı, aynı tool şemaları, prompt'lar ve mock下游 servisleriyle birleşik bir test düzeneğinden geçirildi ve altı boyutta puanlandı: protokol uyumluluğu, JSON payload şema doğruluğu, paralel tool-call desteği, streaming tool-call ayrıştırma, hata kurtarma ve genel entegrasyon emeği.

Üç dağıtım kademesi

Karşılaştırma alanı üç gruba ayırıyor. DeepSeek-V4-Pro, GLM-5.3 ve Qwen3.x ailesi standart function şemalarını doğrudan kabul eden hosted API'ler; GLM-5.3 ve DeepSeek-V4-Pro ayrıca ayarlanabilir reasoning effort ile bir milyon token'lık bağlam penceresi sunuyor. Kimi K2 ailesi açık ağırlıklı seçenek — 32 milyar aktif parametreli bir trilyon parametrelik mixture-of-experts model, vLLM, SGLang, KTransformers ve TensorRT-LLM için dağıtım yolları belgelenmiş durumda. Qwen3.7-Max kendi başına bir kategoride: kapalı ve yalnızca anakara Çin'deki Alibaba Cloud Model Studio üzerinden erişilebilir; yazar bunu AB ve ABD kuruluşları için veri ikamet sorunu olarak işaretliyor.

Uyumluluğun kırıldığı yerler

Sorun protokolün kabul edilmesi değil. Karşılaştırma gerçek sapmaların olduğu üç alanı belirliyor. Birincisi, paralel tool call'lar: bazı modeller asistan turu başına yalnızca bir çağrı üretiyor, bu da orkestrasyon varsayımlarını değiştiriyor. İkincisi, streaming delta'ları: sağlayıcılar tool call'ların artımlı token parçaları mı yoksa chunk başına bütün JSON nesneleri mi olarak geldiği konusunda farklılık gösteriyor; bu ayrım doğrudan parser tasarımını şekillendiriyor. Üçüncüsü, MCP adapter kalitesi sağlayıcılar arasında önemli ölçüde değişiyor; dolayısıyla tool katmanı olarak MCP kullanan ekipler her uygulamayı ayrı ayrı test etmeli.

Modele özgü tuhaflıklar da sürtünme ekliyor. MiniMax M3 temel OpenAI formatındaki çağrıları yönetiyor ama ek ayrıştırma gerektiren özel uzantı alanları ekliyor. Kimi K2.6 standart payload'ı kabul ediyor ancak bazı sürümlerinde geçmişte standart olmayan streaming tool-call delta'ları üretmiş durumda; bu da ekipleri sürüme özgü parser'lara itiyor.

Router katmanları bunu çözmez. Karşılaştırmada test edildiği üzere OpenRouter, Requesty ve Eden AI iletişim protokolünü düzeltiyor ama tool-call payload'larının anlamını değil — sizin için şema veya streaming uyumsuzluklarını onarmazlar.

Benchmark'lar ve uzun vadeli davranış

Karşılaştırmanın atıf yaptığı BenchLM tool-use paketinde (21 Ağustos 2026'da güncellendi) GLM-5.1 ve MiniMax M3 yaklaşık 70,1 ile lider durumda; GPT-5.5'in 67,8'inin önündeler, Qwen3.7-Max ise 68,8 ile hemen arkalarında. Kimi K2.6 60,5 puan alıyor ve eski GLM-5 58,3 ile geride kalıyor. Yazar ayrıca Qwen3.7-Max'in tek bir görevi 1.158 kümülatif tool call boyunca 35 saat gözetimsiz çalıştırdığı bir Alibaba gösterimine atıf yapıyor; bu, uzun ajan döngülerinde güçlü bağlam korumasına işaret ediyor — anakara Çin barındırma uyarısı burada da geçerli.

Pratik öneriler

Ajan yığınlarını taşıyan ekipler için karşılaştırma, üretimde base-URL değişikliği denemek yerine tool-call ayrıştırma için model başına bir adapter yazmayı öneriyor; benchmark doğruluğu öncelikse GLM-5.1 veya MiniMax M3 seçmeyi; kendi barındırma veya katı veri kontrolü için (sabitlenmiş, iyi bilinen bir sürümle) Kimi K2'yi tercih etmeyi; ve bozuk JSON, akış aşağı istisnaları ile boş sonuçları ele almak üzere şema doğrulama ile retry mantığını uygulama katmanına koymayı. Router'lar yalnızca endpoint yönlendirme ve failover için kullanılmalı. Sonda yer alan geçiş kontrol listesi tool şemalarını hedef modele göre doğrulamayı, paralel çağrı davranışını test etmeyi, sağlayıcı bazlı karşılaştırma için ham streaming chunk'larını kaydetmeyi ve MCP adapter'larını doğrulamayı kapsıyor.

Neden önemli

Makale, birçok ajan geliştiricisinin şu anda karşı karşıya olduğu bir kararı çerçeveliyor: Çinli modeller bildirildiğine göre çok daha düşük bir maliyetle GPT-5.5 seviyesinde tool-use doğruluğuna ulaşıyor veya onu aşıyor; ama bunu yalnızca uyumluluk için ciddi bir mühendilik emeği ayıran, konfigürasyon değişikliği varsaymayan ekipler için. Gizli maliyet API değil — her modelin çevresindeki parser kararlılığı, streaming yönetimi ve hata kurtarma; router'lar bu maliyeti sizin için karşılamaz. Bu bulgular tek bir karşılaştırmadan geldiği için benchmark rakamları en iyi şekilde bir başlangıç noktası olarak ele alınmalı; ekipler bir sağlayıcı değişikliğine karar vermeden önce kendi test düzeneklerini çalıştırmalı.

  • #llm
  • #tool-calling
  • #ai-agents
  • #openai-api
  • #qwen

İlgili yazılar