deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Eşdeğer CLI araçlarına kıyasla MCP tool şemaları 4-32 kat token maliyeti ölçüldü

50 MCP sunucusundaki 255 aracı kapsayan bir dev.to ölçümüne göre ham şema yükleme 71.929 token tutarken, yalnızca isim listesi 123 token; alıntılanan benchmark'lar CLI araçlarına karşı 4-32 kat ek yük bildiriyor.

Eşdeğer CLI araçlarına kıyasla MCP tool şemaları 4-32 kat token maliyeti ölçüldü

Ölçüm

Bir agent bir MCP sunucusuna bağlandığında, sunucu el sıkışmaya kendi yetenek kataloğuyla yanıt verir: araç isimleri, düz metin açıklamalar ve her parametresi türüyle ve kendi açıklamasıyla sıralanan JSON şemaları. mcptoon adlı bir CLI'nın geliştiricisi tarafından 26 Ağustos'ta yayınlanan bir dev.to yazısı, bunun ölçekte ne kadara mal olduğunu hesapladı. OpenAI'nin tokenizer'ı olan tiktoken ile sayıldığında, 50 MCP sunucusundan alınan 255 araç ham JSON şemaları olarak yüklendiğinde 71.929 token tuttu. Bir komut satırı arayüzünün yapacağı şekilde yalnızca araç isimlerini listelemek ise aynı küme için 123 token tuttu.

Yazarın argümanı, bu şemaların bir oturumda yalnızca iki kez gerçekten gerekli olduğudur: model bir araç seçtiğinde ve argümanları verdiğinde. Geri kalan zamanda tanımlar, aksi halde kullanıcının kodunun, konuşma geçmişinin ve modelin kendi akıl yürütmesinin ihtiyaç duyduğu context'i işgal eder.

En başta belirtilmesi gereken bir uyarı var: yazı yazarın kendi aracını tanıtıyor, dolayısıyla merkezindeki ölçüm kendi bildirimine dayanıyor. Ancak yazının ağırlığı, derlediği dış rakamlara dayanıyor.

Bağımsız rakamlar aynı yönü gösteriyor

Yazının Firecrawl'a atfettiği benchmark'lara göre, aynı görevleri düz bir CLI üzerinden çalıştırmak yaklaşık 200 token tutarken MCP üzerinden çalıştırmak yaklaşık 44.000 token tuttu; yazı bu farkı görevin şekline bağlı olarak 4 kat ile 32 kat arasında olarak nitelendiriyor. Scalekit'in ayrı analizinin, 32 kattaki en kötü durumu bağımsız olarak doğruladığı belirtiliyor.

Yazıda atıf yapılan Anthropic'in MCP ile kod yürütme üzerine mühendislik yazısı, talep üzerine araç yüklemeye geçişin context ek yükünü %98,7'ye varan oranda, yaklaşık 150.000 tokendan yaklaşık 2.000 tokena indirdiğini bildiriyor. Protokol tarafında, SEP-1576 önerisi şema fazlalığını azaltmayı ve daha akıllı araç seçimini hedefliyor; bu da spesifikasyonun kendi başına katalog formatının şişkin olduğunu kabul etmesi anlamına geliyor. Akademik çalışmalar da aynı sonuca varıyor: Xiamen Üniversitesi ve USTC'den MCP-Zero, araçları talep üzerine getirmenin araç sayısı arttıkça getirme maliyetini sabit tuttuğunu gösterirken, ACL ARR 2026'da görüneceği belirtilen ProMCP, bir MCP agent'ının token bütçesinin gerçekte nereye gittiğini profilliyor.

İstekli yüklemenin neden zararlı olduğu

Claude Sonnet veya GPT-4o sınıfı 128K context'li bir modelde, 71.929 tokenlık tanımlar, ilk kullanıcı mesajı işlenmeden pencerenin yaklaşık %56'sını tüketiyor. Daha ucuz ve daha hızlı modellerde tipik olan 64K pencerelerde katalog basitçe sığmıyor; operatörler ya zaman harcayarak yapılandırdıkları sunucuları bırakmak ya da temelde kalıp bilgi taşımak için daha büyük context'li bir model için ödeme yapmak zorunda. Ve şemalar her istekle birlikte geldiği için maliyet tur ve oturumlar boyunca tekrarlanıyor; yazının belirttiğine göre bu gider hiçbir yerde görünür bir kalem olarak ortaya çıkmıyor.

Önerilen çözüm: katalog yerine dizin

Yazarın geliştirdiği CLI olan mcptoon, agent ile MCP sunucuları arasında duruyor. Keşif işlemi şema dökümü yerine kademeli bir manifest üretiyor: 255 araçlı kurulum için yalnızca isimler 123 token, isimler artı parametre türleri ise 8.282 token, yani %88,5 azalma. Tam şemalar diskteki bir config dosyasında kalıyor ve asla context'e enjekte edilmiyor; model bir araçta karar kıldığında o aracın detaylarını talep edebiliyor. Yazar bunu, tüm yükü yine de pencereye teslim edecek olan sıkıştırmadan özenle ayırıyor. Burada şemalar ihtiyaç duyulana kadar hiç gönderilmiyor.

Yürütme de CLI üzerinden yönlendiriliyor: bir çağrı ilgili MCP sunucusunu başlatıyor, çağrıyı gerçekleştiriyor ve sunucuyu kapatıyor; soğuk başlangıç birkaç yüz milisaniye olarak raporlanıyor, ayrıca yoğun kullanılan yollar için kalıcı bağlantılara yönelik bir serve modu bulunuyor. Hatalar yapılandırılmış biçimde geri dönüyor; yanlış yazılmış sunucu isimleri için "bunu mu demek istediniz" önerileri sunuluyor, böylece bir agent kendini düzeltebiliyor. Varsayılan olarak kapalı, isteğe bağlı bir çıktı kodlaması olan TOON'un tipik araç yanıtlarından ek %34 kırpması sağladığı iddia ediliyor.

Neden önemli

Context pencereleri agent kalitesini sınırlayan asıl kısıt ve araç katalogları artık bir oturum başlamadan önce bir tanesinin çoğunu tüketebilecek kadar büyük. Yazıda öne çıkan şey yakınsama: bir spesifikasyon önerisi, MCP'yi yaratan şirket, iki uygulayıcı benchmark'ı ve iki akademik grup hepsi aynı teşhise ulaştı: istekli, tüm kataloğu kapsayan şema enjeksiyonu ölçeklenmiyor. Agent geliştiricileri için pratik reçete tembel keşif, isim öncelikli kademeli listeler ve belirli bir çağrı gerektirmedikçe şemaları diskte tutmak; kalıcı daha hafif bir pencere karşılığında ara sıra ek bir arama pahası kabul etmek. Açık soru benimsenme, çünkü bu tür desenlerin desteklenmesi yalnızca bir sarmalayıcı CLI'da değil, insanların zaten kullandığı istemci ve sunucularda gerekiyor.

  • #mcp
  • #llm-agents
  • #context-window
  • #token-efficiency
  • #developer-tools

İlgili yazılar