deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Multiverse Computing, yeni 438B akıl yürütme modeliyle Avrupa'nın en yüksek AI benchmark skorunu elde ettiğini iddia ediyor

Multiverse Computing'un ilk büyük modeli Quasar 438B, Artificial Analysis Intelligence Index'te 43 puan aldı — şirkete göre Avrupa'nın en yüksek sonucu — ve 15,3 saniyede yanıt veriyor.

Multiverse Computing, yeni 438B akıl yürütme modeliyle Avrupa'nın en yüksek AI benchmark skorunu elde ettiğini iddia ediyor

Multiverse Computing, kurumsal agentler ve kodlama için amiral gemisi teklifi olarak sunduğu Quasar 438B adlı akıl yürütme modelini yayınladı. Hacker News ana sayfasında öne çıkan şirket duyurusuna göre model, Artificial Analysis Intelligence Index'te 43 puan alıyor — şirket tarafından Avrupa modelleri arasında en yüksek sonuç.

Verimlilik odaklı bir laboratuvardan ilk büyük model

Quasar 438B, Multiverse Computing'un piyasaya sürdüğü ilk büyük model. İngilizce ve İspanyolca çalışıyor ve planlama, araç kullanımı, kod yürütme ve büyük bağlam pencereleri içen çok adımlı görevler için tasarlandı. Şirket, müşterilerden altyapı hazırlamasını istemek yerine modeli CompactifAI API'si üzerinden sunuyor; böylece ekipler kayıt olup istek göndererek testlere başlayabiliyor. Multiverse, konumunu AI'ı daha verimli ve dağıtılabilir hale getirerek oluşturdu ve Quasar bu yaklaşımı 400 milyar parametreyi aşan sınıfa taşırken yanıt sürelerini bu boyuttaki modeller için tipik olanın altında tutuyor.

Benchmark konumu

Artificial Analysis Intelligence Index v4.1.1, GPQA Diamond, Humanity's Last Exam, SciCode, Terminal-Bench v2.1 ve AA-LCR dahil dokuz değerlendirmeyi birleştiriyor. Quasar'ın 43'lük bileşik skoru, onu 30 puanlı Mistral Medium 3.5, 42 puanlı Inkling ve NVIDIA'nın Nemotron 3 Ultra'sının önüne koyuyor. Duyuru bu son karşılaştırmada tutarsız; Nemotron'u bir bölümde 38, başka bir bölümde 36 listeliyor, bu da farkı dört ile beş puan arası yapıyor. Alanın genelünde lider Claude Opus 5, 63 puanla zirvede; Quasar Avrupa sahasının tepesinde olsa da frontier grubunun net bir şekilde gerisinde.

Pratik farklılaştırıcı olarak hız

Quasar, akıl yürütme için harcadığı süre dahil 500 token'lık bir yanıtı 15,3 saniyede döndürüyor. Şirketin karşılaştırmasında yalnızca üç model daha hızlı — 9,4 saniyeyle Nemotron 3.5 Lightning, 10,8 saniyeyle Gemini 3.5 Flash-Lite ve 11,5 saniyeyle Gemini 3.7 Flash — ve yalnızca sonuncusu aynı zamanda daha yüksek puan alıyor, 56. Daha yakın rakiplere karşı fark daha geniş: endekste bir puan geride olan Inkling 48,3 saniyeye ihtiyaç duyuyor, Quasar'ın süresinin üç katından fazla; Mistral Medium 3.5 ise 30 puan için 18,8 saniye alıyor. Quasar'ı geçen modeller arasında yalnızca ikisi 25 saniyenin altında yanıt veriyor; geri kalanlar 38 ile 156 saniye arasında sürüyor.

Uzun bağlam ve terminal sonuçları

Bir modelin uzun belgeler boyunca dağılmış bilgileri toplayıp üzerinde akıl yürüme yeteneğini ölçen AA-LCR'de Quasar 75,0 puan alıyor — Grok 4.6 (high) ile aynı seviyede ve 75,7'lik Claude Opus 5 ile 75,3'lük Qwen3.8 2.4T A95B'in bir puan içinde. Canlı terminal ortamlarında çalışan agentleri değerlendiren Terminal-Bench v2.1'de ise 69,3 puan alıyor; Mistral Medium 3.5'i 18,7 puan, Nemotron 3 Ultra'yı 15,4 puan geride bırakırken 89,1'lik Claude Opus 5 liderliğindeki frontier grubunun arkasında yer alıyor. Şirket, terminal çalışmalarının en fazla gelişme alanının burada olduğunu kabul ediyor, bunu bir sonraki iyileştirme turunun odağı olarak nitelendiriyor ve daha fazla güncellemenin yolda olduğunu söylüyor.

Neden önemli

Avrupa laboratuvarları, ABD frontier sistemleriyle rekabet eden modeller ortaya koymakta zorlandı ve bir Avrupa modelinin üçüncü taraf bir bileşik endekste Mistral'ın güncel orta segment teklifini geçmesi, bölgenin ekosistemi için kayda değer bir veri noktası. Yetenek başına gecikme dengesi tartışmalı biçimde daha ilginç iddia: rakamlar bağımsız testler altında doğrulanırsa, 15 saniyede yanıt verirken 43 puan alan 438B parametreli bir model, toplu iş yükleri yerine doğal olarak etkileşimli agent ürünlerine uyacaktı. Ancak uyarılar gerçek. Buradaki her sayı, şirketin kendi duyurusundan ve seçtiği Artificial Analysis grafiklerinden geliyor; Claude Opus 5'e açık 20 puan; ve Quasar'ın en geride kaldığı agent benchmarkı, tam olarak kurumsal alıcıların önem verdiği alan. Bunu, dış doğrulama bekleyen güçlü bir satıcı iddiası olarak değerlendirin.

  • #llm
  • #benchmarks
  • #european-ai
  • #reasoning-models
  • #enterprise-ai

İlgili yazılar