· kaynak Hacker News – Front Page (native)
Cognition'ın SWE-2'si, 2,8 trilyon parametreli RL ile eğitilmiş modelle Terminal-Bench 2.1'de 92,8 puan aldı
Cognition'ın Kimi K3 tabanından post-training ile türetilen 2,8 trilyon parametreli MoE modeli SWE-2, Terminal-Bench 2.1'de 92,8 puan aldı ve FrontierCode'da frontier modellere yakın bir seviyeye ulaştı; ancak Terminal-Bench 4.0'da frontier modellerin gerisinde kaldı.

Cognition, şirket açıklamasına göre Terminal-Bench 2.1'de 92,8 puan alan SWE-2 adlı bir kodlama ajanı modelini yayınladı — bu, modelin yayımlanan benchmark tablosundaki en yüksek değer. Ayrıntılar, Hacker News ana sayfasına çıkan bir Tokenstead model sayfasından geliyor ve içindeki her rakam, bağımsız doğrulama beklenene kadar satıcı tarafından bildirilmiş olarak işaretlenmiş durumda.
Kimi K3 tabanı üzerinde 2,8 trilyon parametreli MoE
Tokenstead'a göre SWE-2, toplam 2,8 trilyon parametreli ve token başına 104 milyar aktif parametreye sahip bir mixture-of-experts modeli. Temeli Kimi K3 ve Cognition bunun üzerine post-training uygulamış. Tokenstead, taban modelin agentic kodlama için pekiştirmeli öğrenme (RL) ile zaten kapsamlı şekilde ayarlandığını, Cognition'ın eğitim turunun ise çoğu benchmarkta yaklaşık beş altı puan eklediğini belirtiyor. Bu ayrıca Cognition'ın RL eğitimini ilk kez trilyon parametrenin üzerindeki bir ölçeğe taşıması anlamına geliyor.
Kendi tarafından bildirilen benchmark sonuçları
Tokenstead'ın listelediği, tamamı Cognition'ın kendi model kartına atfedilen puanlar şöyle:
- FrontierCode 1.1 Main: 50,0
- DeepSWE 1.1: 73,0
- Terminal-Bench 2.1: 92,8
- Terminal-Bench 4.0: 27,3
FrontierCode sonucu, SWE-2'yi Claude Fable 5.1'in (50,9) bir puan gerisine ve GPT-6 Astra'nın (53,3) 3,3 puan gerisine koyuyor — buna karşılık Cognition, Fable 5.1'e kıyasla %64 daha düşük maliyet ve Astra'nın maliyetinin yaklaşık dörtte birini iddia ediyor. Belirgin zayıf nokta ise Terminal-Bench 4.0: SWE-2'nin 27,3 puanı, Fable 5.1'in (55,8) ve GPT-6 Astra'nın (57,9) çok altında kalıyor. Tokenstead'ın rakamlardaki okumasına göre, uzun ufuklu (long-horizon) agentic işler, frontier modellere olan açığın hâlâ sürdüğü yer.
Görev başına daha az adım, çalıştırma başına daha düşük maliyet
Tokenstead, görev başına ortalama adım sayısını orta eforda 53, yüksek eforda 80 ve maksimum eforda 98 olarak listeliyor; önceki SWE-1.7'de bu sayı 127'ydi. Orta eforda SWE-2'nin, %58 daha az tur ve %81 daha düşük ortalama maliyetle SWE-1.7'nin FrontierCode puanını geçtiği bildiriliyor. Ayrıca ilk anlamlı kod düzenlemesine adım 18'de (medyan) ulaşırken, SWE-1.7'nin bunun için adım 48'e kadar beklemesi gerekiyordu.
Servis yığını, nicemleme farkındalıklı eğitim (quantization-aware training) ile NVFP4 ve FP8 çekirdekleri üzerinde MoE çıkarımı olarak tanımlanıyor; MLA katmanlarındaki K, Q, V ve score hesaplarını FP8 üstleniyor. SpecForge ile yeniden eğitilmiş bir taslak modeli, spekülatif çözümleme (speculative decoding) için %15 daha uzun kabul uzunlukları sağlıyor ve bir prefill delayer, GPU başına iş hacmini ve istek başına saniyedeki token sayısını ilk tokena kadar geçen sürenin yavaşlaması pahasına %10–20 artırıyor.
Kapalı ağırlıklar, yalnızca Devin üzerinden erişilebilirlik
Cognition, SWE-2'nin ağırlıklarını yayınlamadı; yani indirilecek bir şey yok ve yerel kurulum yolu bulunmuyor. Token başına API fiyatlandırması da yok, bu yüzden maliyet karşılaştırmaları — örneğin FrontierCode eşitliğinde Fable 5.1'e karşı %64 tasarruf — birim fiyat listesi yerine görev başına çerçeveleniyor. Tokenstead'a göre model şu anda Devin Desktop ve Devin CLI'da kullanılabilir durumda; Devin Web ve Fusion üzerinde kademeli sunuluyor. Modelin tescilli olduğu, ABD'de geliştirildiği ve Eylül 2026'da yayımlandığı belirtiliyor.
Neden önemli
SWE-2, bir kodlama ajanı satıcısının tamamen başkasının frontier API'si üzerine inşa etmek yerine, kendi RL ile eğitilmiş modelini trilyon parametre ölçeğinde çıkarması — agentic kodlama ürünlerinin nasıl inşa edildiğinde anlamlı bir değişim. İddia edilen fiyat-performans, frontier modellerin maliyetinin çok küçük bir karşılığında FrontierCode eşitliğine yakın olmak, üçüncü taraf testlerden geçerse kategori genelinde fiyatlara baskı uygulayabilir. Benchmark ayrımı da aynı derecede anlamlı: Terminal-Bench 2.1'de 92,8'e karşı Terminal-Bench 4.0'da 27,3, kısa ufuklu terminal görevlerinin doygunluğa yaklaşırken uzun ufuklu agentic işlerin hâlâ gerçekten çözülmemiş olduğunu gösteriyor. Ve kapalı ağırlıklar, token başına API'nin olmaması ile yalnızca kendi tarafından bildirilen rakamlarla birlikte, bağımsız doğrulama şu anki en büyük eksik parça.
- #agentic-coding
- #benchmarks
- #cognition
- #devin
- #large-language-models