· kaynak dev.to (home feed)
Anthropic, Claude Sonnet 5.5'i Terminal-Bench liderliğiyle ve milyon token başına 2 dolar fiyatla duyurdu
Anthropic, Claude Sonnet 5.5'i yayımladı; dev.to'daki bir habere göre bu orta segment model, Terminal-Bench 4.0'ta daha büyük rakiplerini geride bırakıyor ve milyon girdi token'ı başına 2 dolara mal oluyor.

Neler yayımlandı
11 Ekim'de dev.to'da yayımlanan bir yazıya göre Anthropic, güncel model ailesindeki orta segment model Claude Sonnet 5.5'i resmen yayımladı. Model, hafif Haiku 5.5 ile derin akıl yürüten Opus 5.5 arasında yer alıyor; ancak terminal tabanlı yazılım işlerinde bildirildiğine göre yalnızca daha büyük kardeşini değil, OpenAI'nin GPT-6 Astra ve Google DeepMind'ın Gemini 4 Argon gibi daha pahalı frontier rakiplerini de geride bıraktı.
Öne çıkan sonuç, Terminal-Bench 4.0'taki yüzde 70,6'lık çözüm oranı; bu benchmark, bir modelden gerçek bir depodaki hatayı teşhis etmesini, eksik bağımlılıkları kurmasını, testleri çalıştırmasını, stack trace'leri yorumlamasını, bir düzeltme uygulamasını ve insan yardımı olmadan derlemeyi doğrulamasını istiyor. dev.to yazısına göre bu sonuç, yüzde 66,4 ile Opus 5.5'in dört puan üzerinde ve yüzde 61,8 ile GPT-6 Astra'nın yaklaşık dokuz puan önünde; Gemini 4 Argon ve açık ağırlıklı DeepSeek 4.1 ise yüzde 57,4 ve yüzde 55,2 ile geride kaldı.
Komut satırının ötesindeki güç
Yazı ayrıca çok modlu ilerlemelere de dikkat çekiyor. Sonnet 5.5, harici OCR araçları veya yardımcı script'ler olmadan görsel akıl yürütme benchmark'ı Chartography'de yüzde 61,6 puan aldı; bildirildiğine kadar yoğun mimari diyagramları ve veri ağırlıklı vektör grafikleri ele alabiliyor. Masaüstü GUI otomasyonunu ölçen OSWorld 2.1'de model yüzde 80,1'e ulaştı; bu, yazıda işletim sistemi görev otomasyonu için mevcut en güçlü sonuçlar arasında olarak nitelendiriliyor. Sıralı görsel akıl yürütmenin bir gösterimi olarak modele, yalnızca ham ekran görüntülerini kullanarak Game Boy klasiği Pokémon Red'i oynama challenge'ı verildi; arayüzü okuyarak, savaş menülerinde gezinerek ve haritadaki rotaları tamamen gördüklerinden planlayarak ilerledi.
Opus'un hâlâ önde olduğu alanlar
Opus 5.5, derin sentez ve IDE ağırlıklı işlerde dar bir üstünlüğünü koruyor. Yazıdaki karşılaştırma tablosuna göre Opus; CursorBench 4.0'ta (Sonnet'in yüzde 55,5'ine karşı yüzde 57,8), Xhigh yapılandırmasındaki FrontierCode 1.1'de (yüzde 52,1'e karşı yüzde 54,3), GDPval-AA v2.1'de (1.844 puana karşı 1.846 puan) ve AA-Briefcase'te (1.811'e karşı 1.822) önde. Bilgi ağırlıklı benchmark'lardaki fark fiilen yuvarlama hatası düzeyinde; bu da orta segment modelin, girdi token'ı başına yarım maliyetle, analiz genişliğinde amiral gemisine şimdi çok yakın olduğunu gösteriyor.
Hız, context ve fiyat
Claude Code CLI, Cursor ve Windsurf gibi günlük geliştirici araçları için yazıya göre çıktı token'ları, önceki orta nesil modele kıyasla yüzde 30'dan fazla hızlı üretiliyor. Sürüm bu verimi 128.000 token'lık çıktı üst sınırı ve bir milyon token'lık context penceresiyle birleştiriyor. Geliştirilmiş Preserved Thinking mekanizması, önceki akıl yürütmeyi context belleğinde tutuyor ve ardışık araç çağrılarında etkin caching ile koruyor; böylece model, yürüttüğü her shell komutundan sonra varsayımlarını sıfırdan yeniden kurmak zorunda kalmıyor.
Fikir hikayenin merkezinde. Yazı, Sonnet 5.5'i milyon girdi token'ı başına 2,00 dolar olarak listeliyor; Opus 5.5 için 4,00 dolar, GPT-6 Astra için 12,00 dolar ve Gemini 4 Argon için 10,00 dolar söz konusu; yalnızca 0,55 dolarlık DeepSeek 4.1 daha ucuz. Model ayrıca Models.dev'de kataloglandı; yazıya göre gerçek zamanlı olarak takip ediliyor.
Neden önemli
Bildirilen rakamlar tutarsa, bu durum 2026'da frontier kavramının ne anlama geldiğinde bir değişimi işaret ediyor: belirleyici rekabet artık tek seferlik sorunlardaki zirve akıl yürütme değil, saatte yüzlerce iterasyon çalıştıran agent'ların maliyeti ve gecikmesi. Özerk terminal işlerinde amiral gemilerini, bazı rakiplerinin girdi fiyatının altıda birine yenen bir orta segment model, CI pipeline'larındaki ve üretim mühendisliği döngülerindeki sürekli arka plan agent'larının ekonomisini değiştiriyor. Ancak bir uyarı geçerli: bu hikayedeki her rakam dev.to'daki tek bir topluluk yazısından geliyor ve bunları doğrulayacak bağımsız bir benchmark çalışması ya da Anthropic duyuru belgesi kaynaklar arasında mevcut değil.
- #anthropic
- #claude
- #llm
- #benchmarks
- #ai-agents
İlgili yazılar
- Microsoft'un ThinkingBox'ı, yapay zeka agent'larının görevlerin yarısından azında 20 denemenin tümünü geçtiğini ortaya koydu
- Gemini 4 Argon rakip amiral gemilerinin beşte biri fiyatına iniyor, ama geliştiriciler henüz satın alamıyor
- Anthropic'ın yeni kullanım politikası, silah ve gözetim kurallarının yanı sıra Claude'a karşı sürekli zalimce davranışı yasaklıyor