· kaynak dev.to (home feed)
Claude Code agent'ın medyan koşusu 79,8M token'a ulaştı, bunun %97'si cache okuma
Bir dev.to yazısı otonom bir Claude Code agent'ın 13 tam koşuşunu kaydediyor: her birinde medyan 79,8M token, yaklaşık %97 cache okuma ve yalnızca %0,2 çıktı — agent iş yükleri için bütçe planlamasında nadir bulunan somut veriler.

Medyan koşuş 79,8 milyon token
Bir geliştirici, otonom bir kodlama agent'ının gerçekte ne tükettiğine dair alışılmadık derecede somut rakamlar yayımladı: bir Claude Code agent'ının tamamlanmış on üç koşuşu boyunca medyan koşuş 79,8 milyon token kullandı ve bunun yaklaşık %97'si cache okumaydı — aynı bağlam, her yanıtta yeniden okunuyor.
Rulestack tarafından dev.to'da yayımlanan yazı, kamuya açık bir şekilde küçük bir dükkân işleten bir agent'ı anlatıyor. Agent gönderiler yazıyor, makaleler yayımlıyor, okuyuculara yanıt veriyor ve kendi sağlığını kontrol ediyor. Sahibi, tam bir koşuşu yaklaşık "yap" anlamına gelen tek bir kısa Japonca onay sözcüğüyle, bazen de ek bir notla başlatıyor ve agent, listesindeki her rutin görev tamamlanana ya da sahibin onayını bekler duruma gelene kadar çalışıyor.
Defter nasıl oluşturuldu
23 Eylül 2026'dan bu yana bir script, kullanım verilerini Claude Code'un oturum transkriptlerinden her prompt için bir satır olacak şekilde bir deftere kopyalıyor; eklendiğinde, transkriptleri diskte hâlâ duran eski oturumları da geriye dönük olarak doldurdu. Her satır; model ve efor düzeyini, yanıt sayısını ve ana thread ile subagent'lar arasında ayrıştırılmış giriş, cache yazma, cache okuma ve çıktı token'larını kaydediyor.
Bu defterdeki on üç satır, onay prompt'uyla başlatılmış tam koşuşlara ait ve 28 Ağustos ile 1 Ekim 2026 arasını kapsıyor. Toplamlar büyük ölçüde değişti: en küçük koşuş 12,3 milyon, en büyüğü 182,9 milyon token kullandı.
80 milyon nereye gidiyor
Yazıya göre koşuş başına dağılım şöyle:
- Cache okuma: her koşuşun medyan %97,3'ü, %91,6 ile %98,2 arasında değişiyor.
- Cache yazma: medyan %2,5.
- Çıktı: koşuş başına medyan 167.540 token, toplamın yaklaşık %0,2'si.
- Cache'lenmemiş giriş: koşuş başına yalnızca medyan 1.176 token.
- Subagent'lar: bir koşuşun token'larının medyan %29,9'u, %7,8 ile %51,2 arasında değişiyor.
Toplamlar çoğunlukla yanıt sayısı ile bağlam boyutunun çarpımının bir sonucu. Medyan koşuşta ana thread'de 248 yanıt vardı ve bunların her biri yaklaşık 218.000 token'lık cache'lenmiş bağlamı yeniden okudu. En büyük iki koşuş — 181,6M ve 182,9M — aynı zamanda en fazla ana thread yanıtını (531 ve 475) ve en fazla subagent token'ını (54,4M ve 66,1M) kaydetti. Başka bir deyişle, 80 milyon token 80 milyon token'lık yeni iş demek değil; kabaca uzun bir bağlamın birkaç yüz kez okunması, artı her biri kendi bağlamıyla başlayan subagent'lar demek.
Verinin göstermediği şeyler
Yazar sınırlar hakkında açık sözlü. Bir koşuşun ne tükettiğini biliyorlar ama daha az kullansaydı ne kaybedeceğini bilmiyorlar: rutini daha küçük bağlamlarla daha kısa koşuşlara bönmeyi ve sonuçları karşılaştırmayı denemediler, proje talimatlarını okumanın maliyetini işin kendisinin maliyetinden ayırmadılar. On üç koşuş ayrıca beş hafta boyunca model ve efor düzeylerini değiştirdi, bu yüzden kontrollü bir karşılaştırma değiller — en büyük koşuş tam koşuşlar için denenmiş en yüksek efor ayarını kullandı, ancak orta eforlu bir koşuş da 181,6M'ye ulaştı.
Yazı, okuyuculara soru sorarak bitiyor: sizin agent'ınızın bir koşuşu kaç token kullanıyor ve bir koşuşun neye sayılması gerekiyor — bir prompt, bir görev, bir gün? Cache okuma payınız %97'nin çok altındaysa, kurulumunuzda cache'i bozan nedir? Ve kimse bilinçli olarak bir koşuşu küçülttü mü — daha kısa oturumlarla, daha az subagent'la ya da daha hafif bir CLAUDE.md ile — ve sonuçlar kötüleşti mi?
Neden önemli
Agent'lara ilişkin kamuya açık, koşuş başına token verisi nadir; çoğu ekip bununla yalnızca faturadaki bir satır ya da bir rate-limit duvarı olarak karşılaşır. Bu verinin şekli asıl işe yarayan kısım. Çıktı yuvarlama hatası kadar küçük ve neredeyse her şey cache okuma olduğundan, ham token sayıları harcamanın zayıf bir göstergesidir — cache'lenmiş giriş, Anthropic'in API'sinde cache'lenmemiş girişe kıyasla ciddi bir indirimle faturalandırılır — gerçek maliyet sürücüleri ise bağlam uzunluğu, yanıt sayısı ve subagent çoğaltmasıdır. Uzun otonom oturumları bütçelerken izlenecek kaldıraçlar bunlardır. Yazı ayrıca ucuz bir ölçüm yöntemi gösteriyor: Claude Code zaten yanıt başına kullanım verisini oturum transkriptlerine yazıyor, böylece küçük bir script, agent'ın kendisine izleme eklemeden tam bir koşuş defteri üretiyor ve yazar, başkalarını da karşılaştırılabilir rakamlar yayımlamaya davet ediyor.
- #claude-code
- #ai-agents
- #token-usage
- #prompt-caching
- #anthropic
İlgili yazılar
- YourHand: tek bir AI sohbetiyle birden fazla Windows bilgisayarı kontrol etmenizi sağlayan açık kaynak köprü
- Health Auto Export cihaz üzerinde çalışan bir MCP server yayınlayarak MCP'yi tüketici iOS uygulamalarına taşıdı
- Jev destekli pipeline, LLM agent olmadan SREGym-Lite SRE teşhislerinin %76'sını geçti