deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Bağımsız kıyaslamalar Qwen3.8-Flash-Next'i zekâ, hız ve maliyet testlerinden geçirdi

Artificial Analysis, Qwen3.8-Flash-Next'e ilişkin zekâ, hız, gecikme süresi ve görev başına maliyeti kapsayan bağımsız bir değerlendirme yayımladı; analiz Hacker News'in ana sayfasına ulaştı.

Bağımsız kıyaslamalar Qwen3.8-Flash-Next'i zekâ, hız ve maliyet testlerinden geçirdi

Ne oldu

Yapay zekâ modellerini kendi kıyasma paketiyle ölçen bağımsız kuruluş Artificial Analysis, Qwen "Flash" ailesinin en yeni üyesi Qwen3.8-Flash-Next için ayrı bir değerlendirme sayfası yayımladı. Yazı, modelin kıyasma zekâsını, çıktı hızını, gecikme süresini, bağlam penceresini, token kullanımını ve fiyatlandırmasını yan yana sunuyor ve gönderinin üst verilerine göre 27 Ağustos 2026'da Hacker News'in ana sayfasına çıkacak kadar ilgi gördü.

Zamanlama asıl mesele: Flash sınıfı yeni sürümler genellikle üreticinin seçtiği kıyasmalar ve token başına öne çıkan fiyatlarla gelirken, geçiş yapıp yapmamaya karar verecek geliştiriciler asıl olarak modelin ne kadar hızlı yanıt verdiği ve tipik bir görevin gerçekte ne kadara mal olduğuyla ilgileniyor.

Dokuz bileşenli zekâ endeksi

Analizin merkezinde, şu anda 4.1.1 sürümünde olan Artificial Analysis Intelligence Index yer alıyor; bu endeks dokuz değerlendirmeyi birleştiriyor: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ve AA-LCR. Yayılım bilinçli olarak geniş tutulmuş: tablo ve belgeler üzerinde nicel çalışma, bankacılık temalı bir akıl yürütme görevi, bir terminal ortamında kodlama, bilimsel kod üretimi ve iki tanınmış zor bilgi testi. Yanıtlamadan önce akıl yürüten modeller ayrı bir işaretle gösteriliyor; böylece uzun düşünme zincirleriyle kazanılan bir puan, tek geçişte elde edilen bir puanla karıştırılmıyor.

Endeks grafikleri ayrıca açık ağırlıklı ve tescilli modelleri ayrı kulvarlara ayırıyor ve her model bir Openness Index puanı taşıyor: bu, sürümün ne kadar açık olduğunu gösteren 0 ile 100 arasında normalize edilmiş bir ölçüt; lisans ticari kullanımı kısıtladığında "Commercial Use Restricted" veya "Non-commercial" gibi etiketler uygulanıyor.

Halüsinasyon kendi puanını alıyor

Dokuz bileşenden biri olan AA-Omniscience, ham bilgi değil bilgi güvenilirliğini ölçüyor. Doğru yanıtları ödüllendiriyor, halüsinasyon olanları cezalandırıyor ve yanıtlamayı reddetmeye ceza uygulamıyor. Puanlar -100 ile 100 arasında değişiyor; sıfır, modelin en az doğru sayıda yanlış yanıt verdiği, negatif puan ise yanlışlarının doğrularından fazla olduğu anlamına geliyor.

Token başına değil, görev başına maliyet

Fiyatlandırma bölümü, bu tür bir analizde işin karşılığını veren yer. Milyon token başına liste fiyatlarında durmak yerine Artificial Analysis, tek bir Intelligence Index görevini tamamlamanın dolar cinsinden ağırlıklı ortalama maliyetini hesaplıyor. Bu rakam, girdi, cache isabet, cache yazma, akıl yürütme ve yanıt token fiyatlarını birleştiriyor, görev sayısına bölüyor ve her değerlendirmeyi endeksteki payıyla ağırlıklandırıyor. Sayfa ayrıca görev başına harcanan çıktı token sayısını ve tüm endeksi baştan sona çalıştırmanın toplam maliyetini de raporluyor.

Bu çerçeve önemli, çünkü akıl yürüten modeller herhangi bir yanıt üretmeden önce çok büyük bir "düşünme tokenı" bütçesi harcayabiliyor; dolayısıyla çıktı fiyatları aynı olan iki modelin gerçek bir işteki maliyeti büyük ölçüde farklı olabilir. Cache isabet fiyatlandırması standart girdi fiyatlandırmasından ayrı raporlanıyor; cache yazma ve depolamanın ayrı faturalandırıldığı ve sağlayıcıya göre değiştiği uyarısıyla birlikte.

Hız, gecikme süresi ve bağlam

Performans tarafında sayfa, saniye başına token cinsinden çıktı hızını izliyor; bu hız, varsa modelin kendi birinci taraf API'si üzerinde, yoksa sağlayıcılar arası medyan üzerinden ölçülüyor. Gecikme süresi ilk yanıt tokenına kadar geçen süre olarak ölçülüyor; bu da akıl yürüten modeller için herhangi bir yanıt metni görünmeden önceki "düşünme" aşamasını kapsıyor. Ayrı bir uçtan uca rakam, 500 tokenlık bir yanıt üretmek için gereken saniyeleri tahmin ediyor; ilk token gecikmesini, düşünme süresini ve üretim hızını birleştiriyor.

Ayrıca görev başına bir çözümleme süresi var: görev başına çıktı tokenları çıktı hızına bölünüp endeks boyunca ağırlıklandırılarak hesaplanıyor ve bu, ham verimliliği kullanıcı tarafından algılanan tepkiselliğe daha yakın bir şeye dönüştürüyor. Bağlam penceresi sınırı da listeleniyor; büyük belge kümelerini prompt içine dolduran erişim ağırlıklı iş akışları için önemli bir sayı bu.

Neden önemli

Flash sınıfı modeller üretim yapay zekâsının çalışma atlarıdır: yüksek çağrı hacmi, dar gecikme bütçeleri, ince kârlar. Bu sınıf modeller için belirleyici sorular nadiren hangisinin üreticinin favori kıyasmasında zirvede olduğu, daha çok hangisinin yeterince hızlı yanıt verdiği ve tamamlanan iş başına en az maliyetle çalıştığıdır. Fiyatlandırmayı görev başına dolara, verimliliği görev başına dakikaya dönüştürerek ve üretici rakamlarını kabul etmek yerine aynı değerlendirmeleri bağımsız biçimde yürüterek bu tarz analiz, geliştiricilerin adayları ölçülmüş davranışa göre sıralamasını sağlıyor. Hacker News ilgisi, tam da bu tür kanıtlara olan talebin yeni model sürümlerinin seliyle ayak uydurduğunu gösteriyor.

  • #llm-benchmarks
  • #qwen
  • #artificial-analysis
  • #pricing
  • #open-weights

İlgili yazılar