· kaynak Hacker News – Front Page (native)
Bağımsız karşılaştırma testi, RTK'nın token tasarrufunun gerçek yapay zekâ kodlama faturalarını nadiren düşürdüğünü ortaya koydu
Quesma, RTK'yı Terminal-Bench 2.1 üzerinde test etmek için 1.500 dolardan fazla harcadı: bir modelde birkaç yüzdelik tasarruf görülürken, diğer modelde görev başına maliyet ortalama %17 arttı. RTK'nın kazanç metriği kaldırılan çıktıyı ölçüyor, faturalanan tokenları değil.

İddialar neler
RTK, Rust Token Killer'ın kısaltması olan bir araç, bir yapay zekâ kodlama agent'ı okumadan önce terminal çıktısını sıkıştırıyor ve GitHub'da 79.000'den fazla yıldız topladı. Popülerliği büyük ölçüde yaygın olarak paylaşılan rakamlara dayanıyor: RTK'nın Claude Code tokenlarını %60'a kadar düşürebildiğini iddia eden bir X gönderisi 313.000 görüntülenmeye ulaştı. Ancak iki bağımsız test — biri JetBrains'in SkillsBench seti üzerinde, diğeri haber Hacker News'in ana sayfasına düştükten sonra Quesma tarafından yayımlanan — bu tasarrufun gerçek faturalarda büyük ölçüde ortaya çıkmadığını gösterdi. RTK'nın kendi README'sinde bile, bash çıktısının %90'a kadarını kesmenin faturanızı %90 kesmekle aynı şey olmadığını belirten bir uyarı yer alıyor.
Quesma nasıl test etti
Quesma'ya göre RTK, ls, git ve find gibi shell komutlarını aynı çıktının daha kısa sürümlerine dönüştürüyor; dosya adlarını ve boyutlarını korurken sahiplik ve tarih bilgilerini atıyor. Ekip, daha yeni 3.0 ve 4.0 sürümleri yerine Terminal-Bench 2.1 üzerinde test etti; gerekçeleri, maliyetin yalnızca agent'ların tamamlayabildiği görevlerde önemli olduğu ve agent'ların 2.1 görevlerinin çoğunu geçtiğiydi.
Claude Code'u Fable 5.0 ile ve OpenCode'u DeepSeek V4 Pro 0813 ile OpenRouter üzerinden çalıştırdılar; görev başına aynı model rotaları ve zaman aşımlarıyla RTK'lı ve RTK'sız beşer deneme yaptılar. Reddedilen yanıt üreten dört Fable görevi çıkarıldıktan sonra karşılaştırma 85 Fable görevini ve 89 DeepSeek görevini kapsadı — 1.740 deneme, token maliyeti 1.500 dolardan fazla. Kullanılan sürümler RTK 0.45.0, Claude Code 2.1.220, OpenCode 1.18.25 ve Harbor 0.20 idi.
En iyi ihtimalle karışık sonuçlar
Toplam harcamada Fable maliyetleri RTK ile %5 düştü, DeepSeek maliyetleri %5 arttı. Geçiş oranları her iki durumda da biraz düştü: Fable'da %84'ten %83'e, DeepSeek'te %71'den %69'a. Başarılı geçiş başına maliyet olarak ölçüldüğünde Fable %3 daha ucuz, DeepSeek %7 daha pahalı çıktı.
Her görevi eşit ağırlıklandırınca — böylece tek bir pahalı görev ortalamayı domine edemiyor — Fable RTK ile %1 daha pahalıydı; Quesma bunu sıfırdan ayırt edilemez bir fark olarak nitelendiriyor. DeepSeek'in ortalama görev maliyeti ise %17 arttı. DeepSeek analizini on denemenin tamamının geçtiği 36 görevle sınırlamak bile %18'lik artış gösterdi.
Fable'ın tasarrufunun neredeyse tamamı, RTK'nın gereken tur sayısını kabaca yarıya indirdiği winning-avg-corewars adlı tek bir göreve dayanıyordu; kalan görevlerde tasarruf %1'in altındaydı. DeepSeek aynı görevde ters sonuç aldı: RTK etkinken daha fazla tur attı ve daha pahalıya mal oldu.
Tasarruf sayacı parayı ölçmüyor
Quesma'nın temel itirazı RTK'nın kendi raporlama metriği olan rtk gain'e: bu metrik, ham çıktı baytlarından filtrelenmiş çıktı baytlarının çıkarılıp dörde bölünmesini sayıyor — faturalanan tokenları değil. 445 DeepSeek denemesi boyunca RTK 349,2 milyon token tasarruf edildiğini, %89'luk bir azalma bildirdi; gerçek maliyetler ise arttı.
Yazıda somut bir başarısızlık durumu anlatılıyor: train-fasttext görevinde model head -1 train.txt komutunu iki kez istedi ve RTK, bu sınırlı okumaları dosyanın tamamıyla karşılaştırarak her seferinde yaklaşık 120,5 milyon token tasarruf kaydetti. Bu iki çağrı bildirilen tasarrufun %69'unu oluşturuyordu; oysa istenen komutlar dosyanın tamamını hiçbir zaman döndürmeyecekti. rtk gain'i tasarruf edilen para olarak görmek, denemenin geri kalanının değişmediğini varsayıyor; oysa sıkıştırma agent'ın sonraki turlardaki davranışını değiştirebiliyor.
Bu dinamik verinin her yerinde görülüyor. DeepSeek'in ortalama turu RTK ile %7 daha az girdi taşıyordu, ama denemeler toplamda %18 daha fazla tur attı ve daha fazla tur genellikle daha yüksek maliyet demekti. Quesma bunu bir başka "tokenflation" biçimi olarak çerçeveliyor ve JetBrains'in SkillsBench üzerinde aynı örüntüyü gördüğüne dikkat çekiyor: RTK düşük efor seviyesinde tur ekledi ve yüksek efor seviyesinde maliyeti düşürmedi.
Önbellekleme (caching) de faydayı daha da köreltiyor. Her turdan sonra bağlam önbelleğe alınıyor, dolayısıyla terminal çıktısının sonraki okumaları cache read olarak faturalanıyor — Fable için normal girdi fiyatının onda biri, DeepSeek için otuzda biri. DeepSeek çalıştırmalarında RTK terminal çıktısı karakterlerini %9 azaltırken prompt tokenları %9 arttı; model çıktısı her iki durumda da maliyetin %56–57'sini oluşturuyordu.
Kapsam da kısmi. RTK yalnızca shell komutlarını yakalıyor, bu yüzden Read, Grep ve Glob araç çağrıları tamamen onun dışında kalıyor. Claude Code'un terminal çağrılarının %31'ine ve OpenCode'unkilerin %51'ine uygulanabildi; Claude Code'un Bash çağrılarının yaklaşık yarısı da kendi çıktısını zaten head, tail veya wc ile sınırlıyordu.
Hatalar da can sıkabiliyor
Quesma ayrıca bir başarısızlık döngüsü belgeledi: bir DeepSeek git-multibranch denemesi, rtk find 0.45.0'nın desteklemediği bir flag geçti; plugin komutu rtk find olarak yeniden yazdı ve bu da "Use find directly" hatası verdi. Agent, zaman aşımına uğramadan önce yaklaşık 12 dakika boyunca üst üste 339 hata biriktirdi ve eşleşen referans denemenin yaklaşık dokuz katına mal oldu. RTK bu hatayı karşılaştırma testi çalıştırmalarından sonra 0.46.0'da düzeltti.
Neden önemli
RTK'nın itibarı, harcanan parayı değil kaldırılan çıktıyı ölçen rakamlara dayanıyor ve Quesma, onu genel bir maliyet tasarrufu aracı olarak önermeyi açıkça reddediyor. Transkriptler, son teknoloji modellerin terminali zaten verimli kullandığını gösteriyordu — Fable'ın bağlamının yalnızca yaklaşık %7'si terminal çıktısıydı — bu da RTK'nın güncel modellerden çok eski modellere yardım ettiğini düşündürüyor. Yapay zekâ kodlama maliyetlerini bütçeleleyen herkes için çıkarım şu: iddia edilen tasarrufları kendi faturalarınıza karşı doğrulayın ve bayt azaltma sayaçlarını muhasebe değil pazarlama olarak görün.
- #ai-coding
- #benchmarking
- #developer-tools
- #cost-optimization
- #llm-agents
İlgili yazılar
- Electron'dan Tauri'ye geçiş, macOS menü çubuğu uygulamasını 289 MB'tan 15 MB'a indiriyor
- Valkey 9.1 hash field TTL, kendi dokümantasyonundaki kullanıcı başına token deseninde bellek kullanımını üçe katlıyor
- Herdr Studio, Herdr agent terminallerini tarayıcı tabanlı görsel bir çalışma alanına dönüştürüyor