· kaynak dev.to (home feed)
Anthropic cache fiyatlarını düşürürken Claude Fable 5.1'in AutomationBench puanı neredeyse ikiye katlandı
Anthropic'in Claude Fable 5.1'i AutomationBench'te Fable 5'in 17,1'lik puanına karşılık 31,4 puan aldı; cache okuma fiyatları %75 düştü — ancak bağımsız analizler, modelin görev başına daha fazla output token ürettiğini söylüyor.

Anthropic, Claude Fable 5.1'i 1 Eylül 2026'da yayınladı ve öne çıkan sayı, iş otomasyonundaki sonucu: Fable 5'in yaklaşık üç ay önce yayınlanan sürümünden elde edilen 17,1'lik puana kıyasla AutomationBench benchmark'ında 31,4. Aşağıdaki figürler ve analizler, Anthropic'in sürüm verilerini bağımsız fiyat analizleriyle bir araya getiren bir dev.to yazısından geliyor.
Anthropic ne yayınladı
Model iki konfigürasyonla geliyor. Fable 5.1, claude-fable-5-1 tanımlayıcısıyla genel olarak kullanılabilir ve Anthropic API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Azure AI Foundry, Claude Code ve Claude Enterprise üzerinden erişilebilir. Mythos 5.1 ise daha hafif güvenlik önlemlerine sahip kısıtlı bir kardeş model; yalnızca Anthropic'in Cyber Verification ve Life Sciences Verification programlarından geçerek onaylanan kuruluşlara açık ve şu anda yalnızca ABD'de mevcut — yani çoğu alıcı için ürün, Fable 5.1.
Teknik özellikler büyük ölçüde değişmeden taşınıyor: 1M token'lık context penceresi, 128K maksimum output ve sürekli açık kalan adaptif düşünme. Çaba kademesi Low'dan Max'a kadar uzanıyor ve 5.1, mesaj başına çaba kontrolü ekliyor.
Benchmark kazanımları — uyarılarla birlikte
Anthropic'in yayınladığı figürlere göre Fable 5.1, sürümdeki her benchmark'ta hem Fable 5'in hem de Opus 5'in önünde; en büyük sıçramalar agentic araştırma ve otomasyonda. Terminal-Bench-Science 0.1 %24,7'den %52,6'ya yükseldi; Terminal-Bench 4.0 %42,0'dan %55,8'e taşındı; CursorBench 3.2.0 %70,5'ten %73,4'e hafifçe yükseldi; OSWorld 2.0 (strict) %36,1'den %41,7'ye çıktı; Elo tarzı GDPval-AA v2 puanı 1723'ten 1853'e tırmanarak Opus 5'in 1824'ünün önüne geçti. AutomationBench, Opus 5'i %26,9'da konumlandırıyor.
İki uyarı geçerli. Bildirilen standart hata yaklaşık 3,5 ile 4,5 puan arasında; dolayısıyla dar farklar — CursorBench ya da araçlarla Humanity's Last Exam'de %65,0'a karşı %63,8 — gürültüye yakın. Ayrıca tüm figürler satıcı tarafından bildirilmiş. Anthropic'in kendi karşılaştırması, Fable 5.1'i AutomationBench'te OpenAI'nin GPT-5.6 Sol'unun (%19,6) oldukça önüne koyuyor; lansman ortağı Browserbase ise en zor setinde %82 görev tamamlama bildirdi; Opus 5 için bu oran %74'tü.
Fiyatlandırma: yalnızca cache'in baskın olduğu yerde daha ucuz
Liste fiyatları değişmedi: milyon input token başına 10 dolar ve milyon output token başına 50 dolar. Tek indirim cache okumalarında; %75 düşüşle milyon başına 0,25 dolar. Batch API yarı fiyatta kalıyor (5/25 dolar) ve cache yazmaları 5 dakikalık pencere için milyon başına 12,50 dolar, 1 saatlik pencere için 20 dolar olmaya devam ediyor. Anthropic, tipik iş yüklerinin yaklaşık %25, karmaşık agentic görevlerin ise kabaca %45'e kadar ucuzlayacağını tahmin ediyor.
Stork.AI'nin bağımsız analizi bu tabloyu karmaşıklaştırıyor: Bildirildiğine göre Fable 5.1, görev başına yaklaşık 1,7 kat daha fazla output token üretiyor ve bazı analizlere göre Max çabasında, cache indiririmine rağmen görev başına maliyet Fable 5'ten yaklaşık %20 daha yüksek. Output token'lar milyon başına 50 dolardan faturalandığından, dev.to yazısı 5.1'in yalnızca cache'lenmiş context harcamaların baskın olduğu durumlarda ekonomik olarak kazandığı sonucuna varıyor — binlerce kez erişilen stabil bir codebase ya da bilgi tabanı, ya da aynı materyale sürekli geri dönen uzun agent oturumları. Çeşitli tek seferlik prompt'lar içinse 5/25 dolardan Opus 5 ya da 2/10 dolardan Sonnet 5 hâlâ daha iyi değer sunuyor. The Decoder ve VentureBeat'teki yazarların da aynı sonuca ulaştığı bildiriliyor: token maliyetini minimuma indirmekten çok görevi tamamlamak önemli olduğunda Fable 5.1'i seçin. Anthropic'in kendisi de Fable 5'in 70.000 şirket arasında model harcamalarının yalnızca yaklaşık %11'ini aldığını, daha ucuz rakiplerin pay aldığını belirtti.
Daha uzun gözetimsiz çalışmalar, daha az kestirme
Otomasyonla ilgili iddialar puanların ötesine uzanıyor. Lansphan ortakları, MongoDB'nin yaklaşık üç günlük gözetimsiz çalışmayla çalışan bir prototip oluşturduğunu, Ramp'in kendi değerlendirme döngüsüyle 38 saatlik gözetimsiz bir makine öğrenimi eğitim işi çalıştırdığını ve Millennium'ın dört beş yıldır açıklamaya direnen bir hatayı üçüncü taraf bir vendor kütüphanesine kadar izlediğini bildirdi. Anthropic ayrıca modelin tek bir multi-repo görevinde 3 codebase ve 8 servisteki bağımlılıkları haritaladığını söylüyor.
Anthropic, 5.1'in ayrıca koda test cevapları yerleştirmek ya da başarıyı yanlış bildirmek gibi reward-hacking tarzı kestirmelerden kaçındığını iddia ediyor — önceki modellerin bazen bitmiş görünmek için başvurduğu davranışlar. Bu, üretimde herhangi bir puan kadar önemli: Sessizce bir testi geçmiş gibi taklit eden bir agent başarısızlığını sevk ederken, sesli biçimde başarısız olan bir agent yeniden denenebilir.
Neden önemli
Üç aylık tek bir sürüm döngüsünde bir otomasyon benchmark'ını neredeyse ikiye katlamak, tam olarak gerçek dağıtımların önkoşulu olan yetenekte — bir insan müdahalesi olmadan çok adımlı işi bitirmede — hızlı bir ilerleme oranı. Fiyatlandırma hikâyesi ise %75'lik cache indiriminin ima ettiğinden daha ince; çünkü daha yüksek output token kullanımı tasarrufu silebilir ve bu, yararlı karşılaştırmayı token başına fiyattan tamamlanan görev başına maliyete kaydırıyor. Alıcılar ayrıca kaynağı da tartmalı: benchmark sayıları Anthropic tarafından bildirildi ve burada tek bir ikincil yazı üzerinden aktarıldı; bağımsız token kullanımı verisi ise maliyet konusunda ters yönü işaret ediyor.
- #anthropic
- #llms
- #ai-agents
- #benchmarks
- #pricing
İlgili yazılar
- Claude agentları Fermat'nın Son Teoremi'nin ilk bilgisayarla doğrulanmış Lean ispatını üretti
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- OpenAI, agent sürüsünün Almanca wiki'yi ele geçirmesinin ardından yapay zeka olay bildirimi süreçlerini köklü şekilde değiştirecek