deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Anthropic'ın Claude Opus 5.5 prompt rehberi effort, thinking ve agent değişikliklerini haritalıyor

Anthropic'ın yeni prompt rehberi Claude Opus 5.5'in Opus 5'ten nasıl farklılaştığını — daha hızlı çıktı, her zaman açık thinking — ve effort, max_tokens ile agent harness'lerinin nasıl yeniden ayarlanacağını anlatıyor.

Anthropic'ın Claude Opus 5.5 prompt rehberi effort, thinking ve agent değişikliklerini haritalıyor

Anthropic, Claude Opus 5.5 için modelin Opus 5'ten nasıl farklı davrandığını ve geliştiricilerin promptlarında ve harness'lerinde bu nedenle neleri değiştirmeleri gerektiğini ortaya koyan bir prompt rehberi yayınladı. Anthropic'ın platform dokümantasyonunun bir parçası olan sayfa, Hacker News'in ana sayfasında dikkat çekti — bu da, Opus'u üretimde zaten çalıştıranlar için ne kadar migration işi kurtardığının bir göstergesi.

Opus 5'ten değişen ne

Rehbere göre Claude Opus 5.5, output token'larını Claude Opus 5'ten yüzde 30'dan daha hızlı üretiyor ve genellikle aynı görevi daha az token'la tamamlıyor. Opus 5 için yazılmış promptlar değiştirilmeden çalışmaya devam etmeli; Anthropic, eski modelin prompt kalıplarını hâlâ makul bir başlangıç noktası olarak konumlandırıyor.

Yetenek tarafında Anthropic'ın testleri, modelin gerçek bir repository'deki çok adımlı işlerde en güçlü olduğunu gösterdi — bir değişikliği, testleri geçene kadar büyük bir kod tabanında taşıma. Varsayılan medium effort ayarında, bu tür görevlerde yüksek effort'ta çalışan Opus 5'e denk geldi ya da onu geçti; daha az adımda ve daha az token'la. Ayrıca uzun otonom koşuları daha iyi sürdürüyor; paralel subagent'larla ve minimal gözetimle uçtan uca yürütülen saatlerce süren denetim ve migration'lar dahil. Erken test edenler daha keskin kod incelemesi bildirdi — daha fazla gerçek hatanın yakalandığını ve daha az yanlış alarm verildiğini.

Bilgi işlerinde Anthropic'a göre model, yanlış bir rakam verme ya da yanlış kaynağa atıfta bulunma olasılığı çok daha düşük ve büyük girdilerde gözden kaçması kolay ayrıntıları yakalıyor — uzun bir planlama zincirindeki bir tarihin yanlış güne düşmesi ya da bir sunumdaki grafiğin altındaki rakamlarla çelişmesi. Görsel işleme de gelişti: en düşük effort ayarında bile model, yoğun grafiklerdeki değerleri, Opus 5'in en yüksek ayarındakinden daha doğru okudu ve bunu çıktı token'larının çok küçük bir bölümünü kullanarak yaptı. Konuma bağımlı anlamı — bir okun hangi kutuları bağladığı ya da bir takım ekran görüntüsünde toplantının ne zaman başlayıp bittiği — daha güvenilir şekilde ele alıyor. Varsayılan effort'ta, Opus 5'in ancak çok daha yüksek bir ayarda ulaştığı computer-use başarı oranına denk geldi.

Effort ana ayar haline geliyor

Opus 5.5'te thinking her zaman açık; bu da zekâ ile gecikme ve maliyet arasındaki dengeyi kurmanın birincil aracı haline getiriyor. Varsayılan ayar, Opus 5'teki high seviyesinden 5.5'te medium seviyesine düşüyor ve Anthropic, effort isimlerinin modeller arasında karşılaştırılabilir olmadığını açıkça belirtiyor: 5.5'in medium ayarı, kodlama ve bilgi işi değerlendirmelerinde 5'in high ayarına denk geldi ya da onu geçti; low ise birkaç kodlama değerlendirmesinde çok daha düşük maliyetle yakın sonuçlar verdi. Tavsiye, eski değeri devralmak yerine effort'u açıkça ayarlamak ve kendi değerlendirmelerinizde birkaç seviyeyi test etmek.

Belirli bir seviyede yeni model tur başına daha fazla düşünüyor, özellikle xhigh ve max seviyelerinde; yani değişmemiş bir ayar daha uzun turlar ve daha fazla token demek. Bunun ardından üç ayar geliyor: max_tokens'ı yükseltin, çünkü thinking içeriği döndürülse de döndürülmese de sınıra sayılıyor (Anthropic, modelin maksimumu olan 128.000'in uzun agentic turlar için iyi çalıştığını bildiriyor); xhigh ve max'ı yalnızca kalite kazancını ölçtüğünüz işler için ayırın; ve thinking'i azaltmak için prompt talimatları eklemek yerine effort'u düşürün — Anthropic bunu daha az güvenilir olarak tanımlıyor. Operasyonel bir pürüz: istekler arasında üst düzey effort'u değiştirmek prompt cache'i geçersiz kılıyor; rehber bu nedenle tekil turlar için beta durumundaki mesaj başına effort değişikliğine işaret ediyor.

Thinking'i devre dışı bırakan entegrasyonların migrasyonu

Opus 5.5 artık thinking devre dışı bırakılmış şekilde kabul etmiyor. Opus 5'i bu şekilde çalıştıran entegrasyonlar için rehber şunları öngörüyor: low effort'tan başlayın ve kendi trafiğinizde gecikme ile kaliteyi ölçün; kalite düşerse yukarı çıkın. İlk token'a kadar geçen süre hâlâ önemliyse isteğe bağlı olarak "Cevap vermeden önce düşünmeden, doğrudan yanıtla." gibi bir system-prompt satırı ekleyin — daha az thinking kaliteyi düşürebileceğinden kaliteyi yeniden ölçün. Modelden akıl yürütmesini yanıtın içine yazmasını isteyen talimatları çıkarın — Anthropic böyle promptların reasoning_extracting reddi kategorisi altında reddedilebileceği konusunda uyarıyor — ve bunun yerine özetlenmiş thinking bloklarını okuyun. Thinking her zaman açıkken eski thinking-devre dışı hafifletmelerin hedeflediği artefaktlar ortaya çıkmayabileceğinden, bu hafifletmeleri yeniden test edin. Ve yanıtları, ilk bloğun metin olduğunu varsaymak yerine content block türüne göre ayrıştırın.

Haritanın geri kalanı

Rehber belirti-çözüm şeklinde düzenlenmiş. "refusal" durumdaki bir stop_reason, güvenlik reddiyle ilgili bir bölüme yönlendiriyor; sessiz uzun agentic turlar, kullanıcıya yönelik ilerleme güncellemelerine; bir görevin hiç işaret etmediği bilgiyi kaçıran agent'lar, çok uygulamalı iş akışlarında bağlam keşfine; uzun başlangıç thinking'i kaynaklı yavaş sohbet yanıtları, sohbet system prompt'larındaki thinking talimatlarına; kullanıcı tarafından yapıştırılan metindeki talimatlara itaat, yapıştırılan içeriği işaretlemeye; genel frontend çıktısı, tasarım varsayılanlarına; ve yoğun grafikler ile ekran görüntülerindeki kaçırıklar, karmaşık görsel girdiler için araçlara yönlendiriyor. Zaman sinyalleriyle ilgili bir bölüm ise daha erken bitmesi gereken multiagent harness'lerini hedefliyor.

Neden önemli

Migration başarısızlıkları genellikle modelde değil, harness'te yaşanır. Hangi eski varsayılanların kırıldığına, hangi daha ucuz ayarların artık yeterli olduğuna ve cache geçersiz kılma ile red işlemenin nerede sorun çıkardığına dair ölçümlü rehber yayınlayarak Anthropic, opak bir model değişimini bir kontrol listesine dönüştürüyor. Maliyete duyarlı dağıtımlar için, 5.5'in low effort'unun çok daha düşük maliyetle 5'in high effort'una yaklaşması iddiası, herhangi bir yetenek sıçramasından daha önemli olabilir.

  • #anthropic
  • #claude
  • #prompt-engineering
  • #llm
  • #ai-agents

İlgili yazılar