· kaynak dev.to (home feed)
MCP benchmark'ı: Popüler on server, ilk mesajınızdan önce 111K token ekliyor
dev.to'da yayınlanan bir benchmark, popüler on MCP server'ının başlangıçta yüklenen 111.713 tokenlık JSON schema'ları sayıyor; yalnızca Google Drive 47K iken, bir proxy araç ise bu yükü küçültmeyi amaçlıyor.

Neler ölçüldü
23 Ağustos 2026'da dev.to'da "mcptokensaver" adıyla yayın yapan bir geliştirici, popüler Model Context Protocol (MCP) server'larının kullanıcı tek bir soru sormadan önce bir agent'ın context penceresine kaç token ittiğini ölçen üç bölümlük bir benchmark yayınladı. Yöntem basitti: resmi registry'den en popüler on server'ı kurmak, stdio üzerinden bağlanmak, her birinde tools/list çağırmak ve sonuçları tiktoken'ın cl100k_base kodlamasıyla saymak. Tool-sonucu yükü ise her server için tools/call çağrısını yirmi kez yaparak ölçüldü.
Ana rakam, on server genelinde 111.713 tokenlık JSON schema'ları; Google Drive tek başına 31 aracı için 47.293 token oluşturuyor. Yazılardan biri, server durum mesajları, başlıklar ve hata schema'ları dahil edildiğinde toplamın 200.000 tokenı aştığını söylüyor.
| Server | Araçlar | Token |
|---|---|---|
| Google Drive | 31 | 47.293 |
| Slack | 22 | 14.672 |
| Notion | 24 | 13.780 |
| GitHub | 28 | 12.440 |
| Postgres | 19 | 8.231 |
| Puppeteer | 15 | 5.890 |
| Filesystem | 11 | 3.847 |
| Memory | 9 | 2.567 |
| Brave Search | 8 | 2.103 |
| Sequential Thinking | 3 | 890 |
Yazılar kendi içinde tamamen tutarlı değil: biri toplamda 847 araç iddia ediyor, ancak üç yazının server başına tabloları toplandığında 170 çıkıyor.
Tokenlar nereye gidiyor
Yazarın dökümüne göre schema maliyetinin yüzde 42'si inputSchema özelliklerinden, yüzde 35'i araç adları ve açıklamalarından, yüzde 15'i iç içe type tanımlarından, yüzde 3'ü zorunlu alan dizilerinden ve yüzde 5'i server metadata'sından geliyor. Başka bir deyişle en büyük maliyet açıklayıcı metin değil, parametre yapısı: her argümanın bir type'ı, bir açıklaması, bazen enum'ları ve iç içe objeleri olması gerekiyor.
İkinci verimsizlik ise sarmalamadır (wrapping). Her MCP araç sonucu bir content zarfının içinde gelir ve ölçülen bir örnekte payload 38 karakterken zarf 47 karakterdi. Yirmi çağrı boyunca yazar, sonuç token'ların kabaca üçte birinin saf zarf olduğunu tahmin ediyor.
Maliyeti ne
Claude 3.5 Sonnet fiyatlamasıyla (milyon giriş başına 3 dolar) on server'lı kurulum, yalnızca schema'lar için konuşma başına yaklaşık 0,34 dolar, yirmi araç çağrısı dahil edildiğinde yaklaşık 0,54 dolar tutuyor. Çalışma günü başına yirmi konuşmayla yıllığa vurulduğunda, yazılar farklı toplamlara ulaşıyor — birinde 2.376 dolar, diğerinde 2.592 dolar — yani yılda kabaca iki bin doların ortalarında.
Context iddiası daha çarpıcı. Kabaca 111K schema tokenı artı Claude Code'un kabaca 8K'lık sistem prompt'u, ilk kullanıcı mesajından önce 200K'lık pencerenin yaklaşık 81K'ını boş bırakıyor. Yazar, bu kurulumda konuşmaların 15. mesaj civarında bozulduğunu ve üç server'a indirildikten sonra kabaca 45 mesaja kadar dayandığını bildiriyor.
Daha geniş tartışma
Benchmark, yazarın atıfta bulunduğu ancak burada doğrulanamayan kamuya açık eleştirilere çerçevelenmiş: Y Combinator CEO'su Garry Tan'ın X'te "MCP honesty olarak kötü" ("MCP sucks honestly") yazması, Perplexity CTO'su Denis Yarats'ın şirketin MCP'yi içeride REST API'ler ve CLI'larla değiştirdiğini söylemesi ve bir Anthropic mühendislik yazısının karmaşık MCP akışlarının 150.000 tokenı tükettiğini, araç tanımlarını context'ten çıkarıp runtime koduna taşıyarak yüzde 98,7 azaltma sağlandığını gösterdiği iddiası. Cloudflare de anılıyor: sözde 1,17M token schema gerektiren 2.500 uç noktalı bir API'nin, yalnızca iki fonksiyon (search ve execute) açılarak yaklaşık 1K'ya sıkıştırıldığı belirtiliyor.
Sunulan çözüm ve uyarılar
Üç yazının tamamı yazarın kendi aracı olan mcptoon'ı tanıtıyor: Apache-2.0 lisanslı, konuşmalar arasında schema'ları önbelleğe alan, sonuç sarmalamasını soyan ve araç tanımlarını kompakt bir "TOON formatına" sıkıştıran bir CLI proxy — 111.713 tokenı 3.247'ye, konuşma başına maliyeti 0,54 dolardan 0,14 dolara indirdiğini iddia ediyor.
Aynı yazılardaki daha ucuz öğüt hiçbir araç gerektirmiyor: config'inizi denetleyin ve kullanmadıklarınızın bağlantısını kesin. Yazarın kendi denetimi, on server'dan üçünün haftada sıfır kez kullanıldığını, ayda kabaca bir kez kullanılan 47K tokenlık bir Google Drive server'ı dahil, ortaya çıkardı.
Uyarılar önemli. Bu, tek bir yazarın kendi ürününün tanıtımıyla birlikte yayınladığı kendi bildirdiği veri; üç yazı araç sayıları ve yıllık rakamlar konusunda birbiriyle çelişiyor ve tiktoken'ın cl100k_base'i Anthropic'in değil OpenAI'nin kodlaması, dolayısıyla Claude'daki kesin sayılar farklı olacak. Rakamlar, bağımsız olarak tekrarlanana kadar en iyi şekilde göstergesel olarak ele alınmalı.
Neden önemli
MCP, AI agent'ları için varsayılan altyapı haline geliyor ve benchmark'ın işaret ettiği yapısal sorun, kesin rakamlardan bağımsız olarak gerçek: bağlı her server'ın tam schema'sı başlangıçta context'e yükleniyor, dolayısıyla token maliyeti açığa çıkarılan araç sayısıyla ölçekleniyor; isterse hiç çağrılmasınlar. Bu, hem bütçeleri hem akıl yürütme kalitesini vergilendiriyor, çünkü schema'lar gerçek konuşmayla pencere alanı için yarışıyor. Server yazarları için pratik kılavuz, açıklamaları kısa tutmak, schema'ları düzleştirmek ve kullanılmayan araçları açığa çıkarmamaktır; kullanıcılar için ise daha az server bağlamak bedava ve anında. Anthropic ve Cloudflare'in sorunun etrafında zaten mimari çözümler geliştiriyor olması, baskının tek bir geliştiricinin faturasının çok ötesinde hissedildiğini gösteriyor.
- #mcp
- #ai-agents
- #context-window
- #llm
- #token-cost
İlgili yazılar
- Runtime gateway'leri ve katmanlı savunmalar: ekipler yapay zeka agent'lerini üretimde nasıl yönetiyor
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi