· kaynak Hacker News – Front Page (hnrss.org)
StepFun'ın Step 5 Preview'ı, Artificial Analysis benchmarklarında Pareto sınırına ulaştı
StepFun'ın Step 5 Preview modeli, Artificial Analysis'ın Pareto sınırında yer alıyor; bu, halihazırda izlenen hiçbir modelin ölçülen zeka ve görev başına maliyet açısından ikisini birden onu geçemediği anlamına geliyor.
Ne oldu
Bir Hacker News gönderisi, Şanghay merkezli yapay zeka laboratuvarı StepFun'ın büyük dil modeli Step 5 Preview'ın, sağlayıcılar arasında model kalitesini, hızını ve fiyatını karşılaştıran bağımsız benchmark hizmeti Artificial Analysis üzerinde Pareto sınırına ulaştığını işaret ediyor. Gönderi, Step 5 için Artificial Analysis'ın model sayfasına bağlantı veriyor; sayfada "On AA Pareto frontier" (AA Pareto sınırında) etiketi taşıyor.
Artificial Analysis'ın çerçevesinde bu etiket, şu anda izlediği başka hiçbir modelin hem daha yüksek bir Intelligence Index puanı hem de görev başına daha düşük maliyet sunmadığı anlamına geliyor. Daha fazla ölçülmüş yetenek isteyen biri, grafiğin başka bir yerinde bunun bedelini ödemek zorunda; daha ucuz bir görev isteyen ise daha düşük bir puanı kabullenmek durumunda.
Sıralama nasıl oluşturuluyor
Artificial Analysis, modelleri halihazırda 4.3 sürümünde olan Intelligence Index ile puanlıyor; bu indeks on değerlendirmeyi bir araya getiriyor: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ve AA-LCR v1.1.
Bu karışım bilinçli olarak geniş tutulmuş. Sayfadaki metodoloji metnine göre AA-Briefcase, Elo puanı analitik kaliteyi, sunum kalitesini ve rubrik geçme oranlarını birleştiren bir agentic bilgi-işi benchmarkı. Terminal-Bench 4.0 agentic kodlama ve komut satırı kullanımını sınarken, ayrı yetenek indeksleri profesyonel belge muhakemesi ve tıbbi uzun bağlam çalışmalarını kapsıyor. AA-Omniscience bilgi güvenilirliğini ölçüyor; doğru cevapları ödüllendirip halüsinasyonları -100 ile 100 arasındaki bir ölçekte cezalandırıyor; sıfır, doğru cevap sayısının yanlışlarla eşit olduğu anlamına geliyor.
Maliyet, Intelligence Index görevi başına, bir modelin girdi, cached-prompt, cache-write, reasoning ve çıktı token fiyatları kullanılarak, her değerlendirmenin indeksteki payıyla ağırlıklandırılarak hesaplanıyor. Hizmet ayrıca çıktı hızını, ilk tokena kadar geçen süreyi ve bağlam penceresini de izliyor; ancak sınır (frontier) etiketi kendi başına zeka-maliyet dengesiyle ilgili.
İddiayı dikkat çekici kılan bir detay var: Artificial Analysis açık ağırlıklı ve tescilli modelleri aynı grafikte gösteriyor, ağırlıkların erişilebilir olup olmadığını işaretliyor ve ticari kullanımı kısıtlayan lisansları belirtiyor. Bu nedenle açık ağırlıklı bir model için sınır konumu, yalnızca diğer açık sürümlere değil, kapalı sınır laboratuvarlarının amiral gemisi API'lerine kıyasla elde edilmiş bir karşılaştırmadır.
Belirsiz kalan noktalar
Mevcut kaynak materyali bir benchmark kaydı ve bir agregat başlığı; StepFun'dan yapılan bir duyuru değil. Bu yüzden çeşitli pratik sorular açık kalıyor:
- Model bir preview (önizleme) olarak etiketlendi ve üçüncü taraf benchmarklardaki önizleme puanları, modeller güncellendikçe veya değerlendirme çalışmaları tekrarlandıkça rutin olarak değişebiliyor.
- Kaydedilen sayfa metni Step 5'in lisans koşullarını, parametre sayısını, bağlam penceresini veya barındırma seçeneklerini belirtmiyor; bu yüzden ağırlıkların erişilebilir olmasının pratik sonuçları, burada bulunmayan ayrıntılara bağlı.
- Sınır, mevcut alana göre tanımlanıyor. Rakiplerin fiyat değişiklikleri veya herhangi bir laboratuvardan gelecek yeni bir sürüm, modelin kendisi değişmeden onu bu sınırdan düşürebilir.
- Intelligence Index v4.3 de Artificial Analysis'ın metodolojisinin yakın tarihli bir revizyonu ve hizmet, değerlendirme setini güncellediğinde puanları periyodik olarak yeniden hesaplıyor.
Neden önemli
Fiyat-performans sınırında rekabetçi bir açık ağırlıklı model, iki nedenden dolayı önemli. Birincisi, tescilli API sağlayıcıları üzerinde fiyat baskısı yaratıyor: indirilebilir ya da ucuz barındırılabilen bir model, dolar başına amiral gemisi kalitesini yakalıyorsa premium fiyatlandırmanın alanı daralıyor. İkincisi, geliştiricilere güvenilir bir kendi sunucunda barındırma veya çok sağlayıcılı seçenek sunuyor; bu da maliyet kontrolü, verinin bulunduğu ülke ve tedarikçiye bağımlılıktan kaçınma açısından önem taşıyor.
Bu durum aynı zamanda Çinli yapay zeka laboratuvarlarının, bağımsız yetenek-başına-dolar sıralamalarının tepesine yakın kümelenen açık ağırlıklı modelleri defalarca piyasaya sürdüğü daha geniş bir örüntünün devamı. Tek bir benchmark kaydı kanıt değildir ve bir preview üründür de değil. Ancak Step 5 Preview'ın konumu bağımsız inceleme altında da korunursa, bu StepFun'ı açık ağırlıkların en büyük kapalı modellerle doğrudan rekabet ettiği segmentte ciddi bir yarışmacı olarak işaret eder.
- #llm
- #open-weights
- #benchmarks
- #artificial-analysis
- #stepfun
İlgili yazılar
- GPT-6 Astra, bir asırdır çözülemeden duran Birinci Dünya Savaşı dönemine ait bir Alman ADFGVX şifresini çözdü
- LLM'ler 45 denemenin tamamında zaten optimal kodu yeniden yazdı; tek bir prompt satırı hatayı yarıya indirdi
- ABD, yapay zekâ sohbet botunun Çinli gemi istihbaratını uydurmasının ardından silahlı operasyonu iptal etti