deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Cognition, frontier kalitesine yakın bir coding modeli olan SWE-2'yi %64 daha düşük maliyetle piyasaya sürdü

Cognition'a göre SWE-2, FrontierCode 1.1 Main'de %50 puan alarak Fable 5.1'in bir puan gerisinde kaldı ama %64 daha ucuz; model Devin Desktop ve CLI'de şimdiden kullanılabilir.

Cognition, frontier kalitesine yakın bir coding modeli olan SWE-2'yi %64 daha düşük maliyetle piyasaya sürdü

Cognition, yazılım mühendisliği agent'leri için maliyet-performans frontier'ini ileri taşıdığını söylediği yeni bir coding modeli olan SWE-2'yi yayınladı. Cognition'ın duyurusuna göre SWE-2, FrontierCode 1.1 Main'de %50,0 puan alıyor — Fable 5.1'in bir puan gerisinde, ama %64 daha ucuza — ve GPT-6 Astra'nın kabaca dörtte biri kadar bir maliyetle o modelin birkaç puan gerisinde yer alıyor. Model şu andan itibaren Devin Desktop ve Devin CLI'de kullanılabiliyor; Devin Web ve Fusion'da ise kademeli olarak sunuluyor.

Benchmark konumu

Cognition'ın kendi açıkladığı rakamlar SWE-2'yi FrontierCode 1.1 Main'de %50,0'a yerleştiriyor; bu, Grok 4.6'nın (%48,0) ve GPT-5.6 Sol'un (%47,5) önünde, Fable 5.1'in (%50,9) hemen gerisinde ve GPT-6 Astra'nın (%53,3) birkaç puan gerisinde. DeepSWE 1.1'de %73,0 elde ediyor; bu, yalnızca GPT-6 Astra'nın %74,1'inin ardında ve GPT-5.6 Sol'un %72,7'sinin hemen üzerinde. Terminal-Bench 2.1'de %92,8 ile karşılaştırma grubunun lideri.

Tablo, daha zor bir suite olan Terminal-Bench 4'te daha az tek düze: Cognition'ın tablosuna göre SWE-2 burada %27,3 alırken Fable 5.1 %55,8 ve GPT-6 Astra %57,9 elde ediyor. Başka bir deyişle, maliyet avantajı her yerde denkliğe dönüşmüyor ve bu özel suite'teki fark geniş.

Eğitim yaklaşımı

SWE-2, Cognition'ın agentic coding için kapsamlı RL'den geçmiş olduğunu belirttiği 2,8 trilyon parametreli temel model Kimi K3'ten post-train edildi. Şirket, kendi RL koşusunun önemli bir iyileştirme alanı bulduğunu, birçok benchmark'ta beş altı puan eklediğini ve temel modelin tüm maliyet-performans frontier'ini kaydırdığını söylüyor. Cognition bunu, RL'yi trilyon parametre rejimine ölçeklendirdiği ilk kez olarak tanımlıyor ve SWE-1.7'den gelen eğitim altyapısı ile tarifi üzerine inşa ediyor.

Merkezi metodolojik iddia, tüm reasoning-effort seviyelerini tek bir RL koşusunda eğiten maliyet cezalı bir ödül. Ödül, başarı sinyalinden doğrusal bir maliyet cezasını çıkarıyor; ceza katsayısı, temel modelin Pareto frontier'inin yerel eğimine uyacak şekilde her effort seviyesi için ayrı ayarlanıyor. Cognition, doğrusal cezanın burada ilkesel doğru tercih olduğunu savunuyor; çünkü beklenen ödülü yalnızca ortalama maliyete ve çözüm oranına bağlı hale getiriyor. Yazı ayrıca eğitim kararlılığı için length-weighted reward baseline'larından, decoding throughput'unu artırmak ve bellek kullanımını azaltmak için online draft model ile NVFP4/FP8 kernel'lerinden ve quantization-aware training'den, RL ortamlarının sayısının üçe katlanmasından ve önceki SWE-2 checkpoint'lerinin verifier'ları iteratif olarak sağlamlaştırmak için kullanıldığı bir flywheel'den söz ediyor.

Verimlilik ve davranış

Kazanımların en somut olduğu alan verimlilik. Cognition'a göre SWE-2 medium, FrontierCode 1.1 Main'de SWE-1.7'den daha yüksek puan alırken %58 daha az turn kullanıyor ve ortalama %81 daha az maliyete mal oluyor. Ayrıca ilk gerçek düzenlemesini medyan 18 adımda yapıyor; SWE-1.7'de bu sayı 48'di — bu, SWE-1.7'nin kodu ellamadan önce basit görevlerde aşırı keşif yapma ve aşırı düşünme eğilimine dair kullanıcı geri bildirimlerine doğrudan bir yanıt.

Cognition, iç testlerde gözlemlenen birkaç davranışsal iyileştirme listeliyor: regresyonları ve uç durumları yakalayan daha iyi uçtan uca test kapsamı; kullanıcı tarafından belirlenen sınırlar içinde alternatif yollar bulma konusunda daha fazla isteklilik (bir örnekte, bir MCP entegrasyonu kullanılamadığında gerekli veriyi Slack kanal geçmişinden yeniden oluşturma); ve doğrulama disiplini, yani modelin zorlandığında sonuçları yeniden türetmesi ve yüzeysel iddiaları kabul etmek yerine kanıt toplamak için artifact'ları çalıştırması. Effort seviyelerinin farklı davrandığı bildiriliyor: medium, basit ve orta görevlerde hızla harekete geçerken, high ve max karmaşık işler için planlamaya, keşfe ve doğrulamaya daha fazla harcıyor.

Neden önemli

Coding agent'leri görev başına çok sayıda turn, dosya okuma ve test koşusu tükettiği için alışılmadık derecede maliyete duyarlıdır; bu yüzden yetenek frontier'ine yakın bir kesim fiyatının bir bölümüne sunan bir model, bunları ölçekte çalıştırmanın ekonomisini değiştirir. Cognition'ın rakamları bağımsız değerlendirme altında da tutarsa, SWE-2 bir uzlaşma değil, güvenilir bir bütçe seçeneği haline gelir. Her effort seviyesini tek bir RL koşusunda eğitme tekniği de çok katmanlı model geliştiren herkes için izlemeye değer. Aynı zamanda Terminal-Bench 4 sonuçları yararlı bir düzeltme: frontier'e yakın ortalamalar en zor suite'lerdeki geniş farkları gizleyebilir ve şimdiye dek yayımlanan her rakam satıcının kendi rakamı.

  • #ai
  • #coding-agents
  • #devin
  • #reinforcement-learning
  • #benchmarks

İlgili yazılar