· kaynak Hacker News – Front Page (native)
MiMo-v2.6-Pro, Artificial Analysis tarafından zekâ, hız ve fiyat açısından değerlendirildi
Artificial Analysis, MiMo-v2.6-Pro değerlendirmesini yayımladı; zekâ endeksi puanlarını throughput, gecikme süresi ve görev başına maliyet verileriyle birleştiren sonuç sayfası Hacker News'in ana sayfasına ulaştı.
Ne oldu
Yeni bir model olan MiMo-v2.6-Pro, Artificial Analysis'ın bağımsız kıyaslama sürecinden geçirildi ve zekâ, performans ve fiyatı kapsayan sonuç sayfası, 22 Eylül 2026'da Hacker News'in ana sayfasına çıkacak kadar ilgi gördü. Artificial Analysis, modelleri standartlaştırılmış bir değerlendirme setiyle ölçüyor ve puanları throughput, gecikme süresi ve fiyatlandırma verileriyle birlikte yayımlıyor; MiMo-v2.6-Pro sayfası da bu şablonu izliyor.
Zekâ puanı neyden oluşuyor
Öne çıkan rakam, şu anda v4.3.2 sürümünde olan Artificial Analysis Zekâ Endeksi. Bu endeks on değerlendirmeyi birleştiriyor: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ve AA-LCR v1.1.
Bunlardan ikisi, Artificial Analysis'ın kendi içinde geliştirdiği testler olduğu için açıklamaya değer. AA-Briefcase v1.1, ajanssal bilgi işini test ediyor ve rubrik geçme oranını analitik kalite ile sunum puanlarıyla harmanlayan birleşik bir Elo puanı raporluyor. AA-Omniscience ise bilgi güvenilirliğini ölçüyor: doğru cevaplar puan eklerken, halüsinasyonlu cevaplar puan düşürüyor ve cevap vermemek ise herhangi bir ceza getirmiyor. Bu ölçümdeki puanlar -100 ile 100 arasında değişiyor; sıfır, yanlış cevap sayısının doğru cevap sayısına eşit olması anlamına geliyor.
Geriye kalan değerlendirmeler ise ajanssal kodlama ve terminal kullanımı, bilimsel kod ve zorlu akıl yürütme gibi alanları kapsıyor. Tek bir endeksin ötesinde, sayfa ajanssal bilgi işi, gerçek dünyadaki ajanssal görevler, kodlama ve terminal kullanımı, profesyonel belge akıl yürütme ile tıbbi uzun bağlam akıl yürütmesi için yetenek endekslerini ayrı ayrı sunuyor. Artificial Analysis, zekânın kullanım alanları arasında genellikle aktarıldığını, ancak uygulamaya bağlı olarak tek tek değerlendirmelerin daha önemli olabileceği konusunda uyarıyor.
Sayfada ayrıca, bir modelin ne kadar açık olduğunu gösteren 0 ile 100 arasında normalize edilmiş bir Açıklık Endeksi yer alıyor ve bir modelin lisansı ağırlıklarının ticari kullanımını kısıtladığında veya yasakladığında bunu işaretliyor.
Performans ve maliyet metrikleri
Performans birkaç farklı açıdan raporlanıyor. Çıkış hızı, model üretim yaparken saniyedeki token sayısını ölçüyor; bu, modelin birinci taraf API'sine ya da birinci taraf API bulunmadığında sağlayıcılar arasındaki medyan değere dayanıyor. Gecikme süresi, ilk cevap token'ına kadar geçen süre olarak ölçülüyor; bu da akıl yürüten modeller için görünür cevabın başlamasından önceki düşünme aşamasını kapsıyor. Ayrıca 500 token'lık bir yanıt için uçtan uca bir süre ve Zekâ Endeksi görevi başına ağırlıklı ortalama çözme süresi de yer alıyor. Getirme destekli iş akışları için önemli olan bağlam penceresi boyutu da yanında listeleniyor.
Maliyet tarafında ise merkezi rakam, bir Zekâ Endeksi görevini çalıştırmanın ağırlıklı ortalama fiyatı. Bu fiyat; girdi, cache isabet, cache yazma, akıl yürütme ve cevap token fiyatlarından hesaplanıyor, görev sayısına bölünüyor ve her kıyaslamanın endeks içindeki payıyla ağırlıklandırılıyor. Analiz ayrıca endeksteki tüm değerlendirmeleri çalıştırmanın toplam maliyetini gösteriyor ve cache'lenmiş prompt'lar için indirimli oran dahil milyonlarca token başına fiyatlandırmayı sunuyor.
Neden önemli
Bir model seçmek genellikle farklı sağlayıcıların yetenek iddialarını, token cinsinden ölçülen faturalarla tartmak anlamına geliyor. Artificial Analysis'ın sağladığı şey ortak bir ölçü birimi: aynı görevler, aynı şekilde çalıştırılıyor, aynı şekilde fiyatlandırılıyor; böylece bir modelin zekâ puanı, tamamlanan görev başına maliyetiyle doğrudan karşılaştırılabiliyor. Birim yetenek başına fiyat bakışı, çoğu zaman ham kıyaslama başarılarından daha karar odaklıdır; çünkü biraz daha düşük puanlı ama daha ucuz bir model, dolar başına yine de daha fazla yetenek sunabilir.
Ajanssal uygulamalar geliştiren ekipler için performans kolonları, puanlar kadar önemli. İlk token'a kadar geçen süre ve çıkış hızı, bir modelin etkileşimli araçlarda nasıl hissettirdiğini belirlerken; bütçenin gerçekte ölçeklendiği şey token başına değil, tamamlanan görev başına maliyettir.
Her zamanki uyarılar geçerli: bir endeks, on değerlendirmenin ortalamasıdır ve genel olarak iyi puan alan bir model, belirli bir iş yükü için yine de yanlış tercih olabilir; bu yüzden karar vermeden önce yetenek bazlı kırılımlar incelenmeyi hak ediyor. MiMo-v2.6-Pro'nun puanları ve sağlayıcı fiyatlandırması dahil tam sonuçları Artificial Analysis model sayfasında yer alıyor.
- #llm-benchmarks
- #artificial-analysis
- #model-evaluation
- #mimo