· kaynak dev.to (home feed)
Anthropic, kodlama agent'ları için 200K context üzerinde extended thinking sunan Claude Sonnet 4.5'i yayınladı
Anthropic'un Claude Sonnet 4.5'i, 200K token'lık bir context penceresini, akıl yürütme ve araç kullanımını iç içe geçiren extended thinking özelliğiyle birleştiriyor ve SWE-bench Verified'da %77,2 puan aldığı bildiriliyor.

Anthropic ne yayınladı
Anthropic, doğrudan kodlama agent'ları geliştiren geliştiricilere yönelik bir güncelleme olan Claude Sonnet 4.5'i yayınladı. Lansmanla ilgili bir dev.to haberine göre öne çıkan özellik ham bir benchmark puanı değil, 200.000 token'lık bir context penceresinin agent iş akışları için tasarlanmış yeni bir "extended thinking" moduyla eşleştirilmesi.
200K penceresi yeni değil — dev.to yazısının belirttiği gibi önceki Sonnet modelleri bunu zaten sunuyordu. Değişen şey, modelin tüm bir kod tabanına yayılan çok adımlı görevler üzerinde çalışırken bu kapasiteyi ne kadar etkili kullanabildiği.
İç içe akıl yürütme, bütçeye göre ayarlanabilir
Extended thinking, Sonnet 4.5'in akıl yürütmeyi eylemle harmanlamasını sağlıyor. Model tek bir plan üretip onu körü körüne uygulamak yerine, görev ortasında duraklayabiliyor, ara sonuçları inceleyebiliyor ve devam etmeden önce yaklaşımını gözden geçirebiliyor.
Claude API'de bu, modelin istek başına ne kadar akıl yürütme yapacağını sınırlayan budget_tokens ayarına sahip bir thinking parametresi aracılığıyla sunuluyor. Bu, akıl yürütme derinliğini açık bir ayar dial'ına dönüştürüyor: yalnızca dosya okuyan hafif bir agent küçük bir bütçeyle çalışabilirken, karmaşık bir çoklu dosya refactor'una çok daha büyük bir bütçe verilebilir.
Anthropic'un teknik bir raporuna atıfta bulunan dev.to yazısı, iç içe geçmiş yaklaşımın çok adımlı agent benchmark'larındaki halüsinasyon oranlarını Sonnet 4'e kıyasla yaklaşık %30 azalttığını söylüyor. Pratikte model tüm bir repository'yi context'te tutabiliyor, onlarca dosyaya yayılan bir refactor planlayabiliyor ve makul görünen diff'ler uydurmak yerine kendi çıktısını orijinal kaynakla karşılaştırarak kontrol edebiliyor.
Benchmark'larda nerede konumlanıyor
Gerçek GitHub issue'larından derlenen bir benchmark olan SWE-bench Verified'da dev.to haberi, Sonnet 4.5'i yaklaşık %77,2'ye yerleştiriyor; Sonnet 4'te bu oran kabaca %68'di.
Aynı benchmark'ta GPT-4.1 ve Gemini 2.5 Pro ile karşılaştırıldığında, modelin çoklu dosya refactor görevlerinde önde geldiği, tek dosyalık hata düzeltmelerinde ise hafifçe geride kaldığı bildiriliyor — bu, otonom agent'lara giderek daha sık verilen iş türü olan tüm kod tabanına yayılan çalışmaya yarayan bir takas.
Agent geliştiricileri için sonuçları
LangGraph, CrewAI veya AutoGen gibi framework'lerle çalışan ekipler için pratik etki, daha fazla karmaşıklığın orkestre edilmiş alt görevlere bölünmek yerine tek bir agent döngüsü içinde kalabilmesi. dev.to yazısı, Anthropic'un Claude CookBooks repository'sine işaret ediyor; burada Sonnet 4.5'in tek bir konuşmada 50'den fazla tool çağrısı boyunca tutarlı bir planı koruduğu örneklerin halihazırda bulunduğu söyleniyor.
Maliyet modeli ise başlıca uyarı noktası. Akıl yürütme token'ları diğer çıktılar gibi faturalandırılıyor, dolayısıyla extended thinking bir isteğin fiyatını artırıyor. Rapor, bütçeyi iş yüküne göre ayarlamayı öneriyor: derin akıl yürütmeyi gerçekten planlama gerektiren görevler için ayırın ve basit fetch-and-respond döngüleri için atlayın.
Neden önemli
Otonom kodlama, büyük laboratuvarların şu anda en sert rekabet ettiği alan ve kodlama agent'larını bozan hata türleri iyi biliniyor: dosyalar arası bağımlılıkları takibi kaybetmek, doğru görünen değişiklikler halüsinasyonu ve önemsiz adımlar için akıl yürütmede aşırı harcama yapmak. Bildirilen rakamlar tutarsa, Sonnet 4.5 üçüne birden çözüm getiriyor — ilki için uzun context, ikincisi için görev ortası yansıma, üçüncüsü için açık bir akıl yürütme bütçesi.
Bu sürüm ayrıca akıl yürüten modellerin nasıl konumlandırıldığında bir değişimi işaret ediyor: düşüncenin derinliği, modelin sabit bir özelliği olmaktan çıkıp geliştiricinin görev başına ayarladığı ve buna göre ödediği bir şey haline geliyor. Halihazırda production'da agent çalıştıran ekipler, bu ayarın her iş yükü için nerede durması gerektiğine karar vermek zorunda kalacak; çünkü doğrulanmış bir çoklu dosya refactor'unu mümkün kılan aynı yetenek, rutin çağrılarda faturaları sessizce şişirebilir.
Bir uyarı: buradaki tüm rakamlar Anthropic'un kendi yayın materyalleri değil, dev.to'daki tek bir topluluk haberi üzerinden geliyor; dolayısıyla benchmark rakamları ve iddia edilen %30'luk halüsinasyon azalması, resmi onay gelene kadar bildirilen iddialar olarak okunmalı.
- #anthropic
- #claude
- #ai-agents
- #coding-agents
- #llm
İlgili yazılar
- Anthropic'in yeni Claude system prompt'u şarkı sözlerini ve telif hakkı korumalı karakterleri engelliyor
- SWE-Gate benchmark'ı, testleri geçen agent yamalarının %34'ünün kod inceleme kurallarına takıldığını ortaya koyuyor
- Runtime gateway'leri ve katmanlı savunmalar: ekipler yapay zeka agent'lerini üretimde nasıl yönetiyor