deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Claude Fable 5.1 yeni bir bilim benchmark'ında yüzde 52,6 iddiasında bulundu; pelikan testi 10 sentten 3,30 dolara kadar çıkıyor

Anthropic'in Claude Fable 5.1 modeli, günler önce duyurulan bir bilim benchmark'ında yüzde 52,6 skor iddiasında bulunuyor; Simon Willison'ın pelikan testiyse kalite ve maliyetin reasoning eforuyla birlikte keskin biçimde arttığını gösteriyor.

Claude Fable 5.1 yeni bir bilim benchmark'ında yüzde 52,6 iddiasında bulundu; pelikan testi 10 sentten 3,30 dolara kadar çıkıyor

Anthropic, Fable 5.1'i bilim benchmark'larıyla pazarlıyor

Anthropic, Claude Fable 5.1'i 1 Eylül 2026'da Mythos 5.1 ile birlikte yayınladı. Modeli çıkış gününde test eden Simon Willison'a göre Anthropic, modeli kodlama, bilgi işi ve uzun soluklu problem çözmede yeni bir çıta olarak sunuyor ve duyuru belirgin biçimde bilimsel araştırmaya yaslanıyor.

Öne çıkan sayı, 27 Ağustos'ta ilk kez duyurulan Terminal-Bench-Science 0.1'deki yüzde 52,6'lık sonuç. Willison'ın aktardığı karşılaştırmalara göre Fable 5 yüzde 24,7, Opus 5 yüzde 29,0 ve GPT-5.6 Sol yüzde 22,4 skor aldı. Duyurudaki diğer benchmark'larda yalnızca küçük iyileşmeler var; bu da bilim sonucunu daha da göze çarpar hale getiriyor.

Pelikan testi

Willison'ın üretici benchmark'larına karşı gayriresmi karşılığı, yıllardır çalıştırdığı bir prompt: modelden bisiklete binmiş bir pelikanın SVG'sini çizmesini istemek ve geri gelen sonuca bakmak. Temmuz ayında yazdığına göre bunun genel bir yetenek göstergesi olarak güvenilirliğini yitirmeye başlamış, çünkü 2025'ten bu yana diğer becerilerle korelasyonu zayıflamış — ama yine de aynı model ailesi içindeki modelleri ve özellikle aynı prompt'taki reasoning eforu seviyelerini karşılaştırmak için yararlı buluyor.

Bu, burada önemli; çünkü Fable 5.1 beş reasoning seviyesi sunuyor — low, medium, high, xhigh ve max — ve reasoning'i tamamen kapatmanın bir yolu yok. llm-anthropic eklentisindeki reasoning kayıtlarının düzgün tutulmasını engelleyen bir hatayı düzelttikten sonra Willison, pelikan prompt'unu her seviyede çalıştırdı.

Tek prompt'ta 10 sentten 3,30 dolara

Seviyeler arasındaki fark çarpıcı. Low eforunda model 23,8 saniyede 1.998 çıktı token'i üretti ve 10,017 sente mal oldu; görünürde hiç reasoning metni yoktu. Medium tuhaf biçimde benzerdi: 23 saniyede 1.977 token — low'dan 21 az — 9,912 sent, yine reasoning gösterilmeden; Willison'ın dikkat çektiği bir bilmece, çünkü Claude'ın çıktı token sayımlarına normalde reasoning token'ları da dahildir. High kısa bir planlama özeti ekledi: 2.612 token, 29,6 saniye ve 13,087 sent; çıktı, daha ucuz seviyelerden çok farklı değildi.

Asıl sıçrama xhigh'da geldi: 36.767 çıktı token'i, 7 dakika 51 saniye ve 1,83 dolar. Reasoning izinde gerçek bir tasarım düşünme süreci var; pelikanın bisikletin yanında komik etki için bilerek orantısız büyük tutulması kararı dahil. Max seviyesinde — 65.927 token, 13 dakika 54 saniye, 3,30 dolar — Willison sonucu bir Anthropic modelinden gördüğü en iyi pelikan olarak niteliyor: zarif bir arka plan, çerçevenin iki yanında bacaklar, pedalarda ayaklar, gidonda bir kanat, mavi bir şapka ve balık taşıyan bir sepet.

Max reasoning izi adeta bir tasarımcının notları gibi okunuyor. Model bir bisiklet kaskını pelikanın imza tepesiyle karşılaştırmış, kaskı gaga ile çakışmayacak şekilde küçültmüş, kask deliklerinin kaskın konturu içinde kaldığını kontrol etmiş, gereksiz bularak gidon zilinden vazgeçmiş ve ön çatalın doğru bir eğimle öne kavislenmesi için bir kontrol noktasını kaydırmış. Willison gösteriş açısından Gemini 3.7 Flash'ı hâlâ daha yüksek buluyor; yine de bir SVG istediğini ve tam olarak onu aldığını belirtiyor.

Sonra onu animasyonlu hale getirdi

Bir Hacker News yorumcusu animasyonlu bir sürüm isteyince Willison, max pelikanı varsayılan high eforundaki Fable 5.1'e animasyonlaştırması talimatıyla geri verdi. O çalıştırma 6.121 girdi ve 26.201 çıktı token'iyle 1,37 dolara mal oldu. Video olarak dışa aktarıldığında tekerlekler geriye doğru dönüyor gibi görünüyor; ama Willison bunun MP4 dönüşümünün bir yapay eseri olduğunu düşünüyor — özgün SVG'de doğru yönde dönüyorlar.

Neden önemli

İki şey öne çıkıyor. Birincisi, lansmanın en etkileyici rakamı, yayımlandığında beş günlük olan ve öncül modellere farkın alışılmadık derecede büyük olduğu bir benchmark'a dayanıyor. Kamuoyunda pek sicili olmayan taze benchmark'lar bir lansman anlatısına hâkim olabilir; Willison'ınki gibi bağımsız denetimlerin bu yüzden ağırlığı var.

İkincisi, pelikan çalıştırması, modern reasoning modellerindeki maliyet-kalite kadranının alışılmadık net bir resmi: aynı prompt low eforunda yaklaşık 10 sente, max seviyesinde 3,30 dolara mal oldu — kabaca otuz katlık bir fark — ve görünür kalite kazançları en üst iki seviyede yoğunlaştı. Reasoning seviyesi seçmek artık en az kalite kadar bir bütçe kararı; ve reasoning kapatılamadığı için tabanı API belirliyor, geliştirici değil.

  • #anthropic
  • #claude
  • #benchmarks
  • #reasoning
  • #llms

İlgili yazılar