deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Real-SWE benchmark'ında Fable 5.1 yüzde 38,8 ile lider, Gemini 3.8 Flash maliyette öne çıkıyor

Specific Labs'ın lisanslı kurumsal kod üzerindeki Real-SWE benchmark'ı, Claude Code içinde çalışan Fable 5.1'i yüzde 38,8 çözüm oranı ve rollout başına 6,96 dolarla ilk sıraya koyarken, Gemini 3.8 Flash 2,50 dolara yüzde 31,2'ye ulaşıyor.

Real-SWE benchmark'ında Fable 5.1 yüzde 38,8 ile lider, Gemini 3.8 Flash maliyette öne çıkıyor

Benchmark neyi ölçtü

Specific Labs, Eylül 2026'da Real-SWE'yi yayımladı; bu benchmark, uç seviye kodlama modellerini herkese açık depolar yerine özel üretim kod tabanlarında değerlendiriyor ve faturalandırma, vergi, müşteri migrasyonu ile altyapı işlerinde gerçek şirketlerden lisanslanan görevleri kullanıyor. Dev.to'daki bir yazının aktardığına göre koşu, sekiz model-harness kombinasyonu, on görev ve 640 rolloutu kapsıyordu; çözüm oranı, görev başına sekiz bağımsız koşuda ortalama alınan pass@1 olarak ve yüzde 95 güven aralıklarıyla puanlandı. Görevler Harbor formatında izole sandbox'larda çalıştırıldı; doğrulayıcılar değerlendirme anında enjekte edildi ve her kod tabanının mevcut test paketlerinden alındı ya da onlardan esinlenildi. Referans çözümler medyan 11 dosyayı düzenledi; bu sayı FrontierCode ve DeepSWE'de 6'ydı ve medyan talimat uzunluğu 1.742 karakterdi.

Liderlik tablosu

Claude Code içinde çalışan Fable 5.1, tahmini 6,96 dolar rollout maliyetiyle yüzde 38,8 çözüm oranıyla tablonun zirvesinde — ölçülen en pahalı kurulum. Codex CLI üzerinden GPT-6 Astra yüzde 33,8 ve 4,67 dolarla onu izliyor; Gemini CLI üzerinden Gemini 3.8 Flash ise 2,50 dolara yüzde 31,2 ile fiyat/performans seçimi. Alt sıralarda: Claude Code'da GLM 5.3 yüzde 28,8 (5,12 dolar), Grok Build'de Grok 4.6 ile Muse Code'da Muse Spark 1.3 eşit olarak yüzde 23,8 (sırasıyla 3,44 ve 2,74 dolar), Kimi Code'da Kimi K3 yüzde 18,8 (3,90 dolar) ve Codex CLI'da GPT-5.6 Sol yüzde 16,2 (2,65 dolar).

İki uyarı geçerli. Grok 4.6 ve Kimi K3 için kullanım verileri eksikti, dolayısıyla gerçek maliyetleri daha yüksek olabilir; yine de LavX News genel maliyet yayılımını bağımsız olarak doğruluyor. Ayrıca ilk üçün güven aralıkları örtüşüyor — kabaca Fable için yüzde 32–45, Astra için yüzde 27–40 ve Gemini için yüzde 25–38 — dolayısıyla birincilikle üçüncülük arasındaki fark, kesinleşmiş değil yönlü olarak tutarlı okunmalı.

Maliyet fiyat listelerini değil, sözü çok seviyeti izliyor

Specific Labs'a göre Fable 5.1'ın yüksek faturası daha dik liste fiyatlarından değil, çok daha fazla yazmasından geliyor. Vergi yetki alanı görevinde rollout başına ortalama 78.000 çıktı token'ı üretti; iki başka görevde ölçülen rakamlar 86.000 ve 88.000 idi; buna karşılık GPT-6 Astra 13.000 ile 32.000 token aralığında kaldı. Dev.to yazısı pratik sonucu çıkarıyor: prim, çok sayıda ekstra token karşılığında ilk denemede başarıda birkaç ekstra puan satın alıyor ve bir insan zaten her agent yamasını gözden geçiriyorsa, daha ucuz bir kurulum ikinci denemeyle aynı sonuca daha az paraya ulaşabilir.

Harness'ler puanın parçası

Real-SWE bir modeli yalın halde değil, harness'iyle birlikte puanlıyor. En net örnek tek bir CLI'nin içinde: Codex CLI, GPT-6 Astra ile yüzde 33,8'e ulaşırken GPT-5.6 Sol ile yalnızca yüzde 16,2'ye ulaşabildi; Claude Code ise Fable 5.1 ile yüzde 38,8'e karşılık GLM 5.3 ile yüzde 28,8 sundu. Dolayısıyla modeller yerine agent kabuklarını karşılaştıran ekipler, sandıklarından farklı bir değişkeni karşılaştırıyor.

Agent'lar nerede başarısız oluyor

Görevler zor ve ortalamalar hikâyenin büyük kısmını gizliyor. Winzheng'e göre on görevin altısı yüzde 15'in altında çözüm oranı aldı; çok bölgeli tarama görevi yüzde 67,2'ye ulaşırken vergi yetki alanı görevi yüzde 3,1'de kaldı ve analitik akış reducer'ı test edilen kombinasyonlar arasında hiç başarılı rollout üretmedi.

Başarısızlık taksonomisi ham zorluktan daha önemli. Kaçırılan gereksinimler tüm sahadaki en yaygın başarısızlık kategorisi: Grok 4.6'nın başarısız koşularının yüzde 67,2'si (61'den 41), Kimi K3'ün yüzde 53,8'i (65'ten 35), GLM 5.3 için yüzde 38,6 ve Fable 5.1 için yüzde 36,7. Bu agent'lar çoğunlukla derlemede başarısız olmuyor — ticket'ın istediği her şeyi yapmada başarısız oluyorlar. Onlara daha fazla zaman da çare değil: Superpower Daily, on dakikanın altındaki rollout'ların yüzde 71,4 oranında, on dakika ve üzeri koşuların ise yüzde 73,4 oranında başarısız olduğunu, yani neredeyse aynı oranı buldu.

Neden önemli

Araç seçimi açısından benchmark bir kısıt ödünleşimine indirgeniyor. Gözden geçirme zamanının darboğaz olduğu ve işin faturalandırma ya da migrasyona dokunduğu yerlerde, Claude Code içindeki Fable 5.1 en iyi ilk deneme başarı oranını ve en yüksek token faturasını sunuyor. Agent'ların geniş bir birikmiş iş listesinde yoğun çalıştığı yerlerde ise Gemini 3.8 Flash, yeteneğin büyük kısmını yaklaşık üçte bir harcamayla sağlıyor. Ancak en eyleme dönük bulgu model seçiminden bağımsız: başarısızlıklara kaçırılan gereksinimler hâkim olduğu için, açık ve madde madde listelenmiş kabul kriterleriyle ticket yazmak, baskın başarısızlık biçimine doğrudan saldırıyor — daha uzun çalışma süreleri ise kanıtlandığı üzere etki etmiyor.

  • #benchmarks
  • #llm
  • #coding-agents
  • #ai-tools
  • #enterprise

İlgili yazılar