· kaynak Hacker News – Front Page (hnrss.org)
Mercury 2.5, bağımsız Artificial Analysis testlerinde saniyede 770 token seviyesine ulaştı
Artificial Analysis, Mercury 2.5'in saniyede yaklaşık 770 çıktı token ürettiğini ölçtü; bu, tipik barındırılan LLM decode hızlarının çok ötesinde bir değer ve çıkarım hızının rekabetçi bir eksen haline geldiğinin bir işareti.
Mercury 2.5 bağımsız testlerde saniyede 770 token üretti
Inception Labs'ın Mercury ailesinin en yeni üyesi Mercury 2.5, bağımsız kıyaslama hizmeti Artificial Analysis tarafından saniyede yaklaşık 770 token hızında çıktı üretirken ölçüldü. Bu rakam, Hacker News ana sayfasına ulaştıktan sonra geniş ilgi gören Mercury 2.5'in Artificial Analysis model sayfasından geliyor. Artificial Analysis'a göre sayı, modelin kendi API'sinin performansını — ya da birinci taraf API bulunmayan durumlarda sağlayıcılar arasındaki medyanı — model aktif olarak üretim yaparken teslim edilen saniye başına token olarak yansıtıyor.
Kıyaslama nasıl çalışıyor
Artificial Analysis çıktı hızını, üretim başladıktan sonra, akış halindeki yanıtın ilk parçasından sonra token'ların gelme hızı olarak tanımlıyor. Hizmet bunu aynı sayfada birkaç ilgili ölçümle birlikte sunuyor: gizli düşünme süresi de dahil, ilk yanıt token'ına kadar geçen saniye cinsinden gecikme süresi; 500 token'lık bir yanıt için hesaplanan uçtan uca yanıt süresi; ve Artificial Analysis Intelligence Index üzerindeki görev başına decode süresi. Halen 4.3.2 sürümünde olan bu indeks, Terminal-Bench 4.0, SciCode ve Humanity's Last Exam'ın yanı sıra hizmetin kendi yürüttüğü ajanik bilgi-işi ve kodlama paketleri de dahil on değerlendirmeyi birleştiriyor. Sayfa ayrıca Intelligence Index görevi başına ağırlıklı maliyeti, token kullanımını ve bağlam penceresini de takip ediyor; böylece öne çıkan hız rakamı, tek başına durmak yerine yetenek, fiyat ve gecikme süresinden oluşan daha geniş bir resmin içinde yer alıyor.
Hız nereden geliyor
Mercury bir diffusion mimarisi üzerine inşa edildi. Geleneksel otoregresif transformer'lar gibi metni katı bir şekilde aynı anda yalnızca bir token üretmek yerine, diffusion dil modelleri bir yanıtın bütün bölümlerini sabit sayıda paralel adım boyunca rafine ediyor. Bu tasarım, saniyede yüzlerce token seviyesindeki decode hızlarını teknik olarak mümkün kılan şey: çıktının büyük kısmı sıralı değil eşzamanlı olarak üretiliyor. Barındırılan frontier modeller genellikle Mercury 2.5'in ölçülen hızının çok küçük bir kesri kadar çıktı üretiyor, bu da sonucu üretim API'leri için normal aralığın epey dışına koyuyor. Bu hızla metin, bir insanın okuyabileceğinden çok daha hızlı geliyor ve bu, etkileşimli uygulamaların hissini değiştiriyor.
Hızlı decode neyi değiştiriyor
Sonuçlar iki gruba ayrılıyor: ekonomi ve gecikme süresi. Ekonomi tarafında üretim süresi GPU işgal süresi demek. Bir yanıtı birkaç kat daha hızlı tamamlayan model, serving kapasitesini daha çabuk serbest bırakıyor; bu da belirli bir dağıtımın karşılayabileceği istek sayısını artırıyor ve istek başına maliyeti aşağı çekiyor. Artificial Analysis bunu açıkça görev başına maliyet metriği üzerinden çerçeveliyor; bu metrik girdi, önbelleğe alınmış, akıl yürütme ve çıktı token fiyatlarını tamamlanan işe göre ağırlıklandırıyor.
Gecikme tarafında ise çıktı hızı, yanıtların uzun olduğu veya çağrıların zincirlendiği yerlerde en çok önem taşıyor: doğal sıra alma gerektiren sesli ajanlar, öneri akıştan sunan kodlama asistanları ve her adımın bekleme süresinin biriktiği ajanik boru hatları. Reasoning modelleri özel bir durum, çünkü yanıtlamadan önce içsel düşünme için çok sayıda token harcıyorlar — daha hızlı decode, düşünmenin yol açtığı gerçek zaman cezasını doğrudan küçültüyor.
Şüpheler de var. İlk token'a kadar geçen süre çıktı hızıyla aynı şey değil ve reasoning modellerinde kullanıcının fiilen algıladığı bekleme süresine hâkim olabilir. Tek akış ölçümleri yoğun eşzamanlı yük altındaki throughput'tan sapabilir ve hız, yalnızca üretilen şeyin kalitesiyle orantılı olarak faydalıdır — Artificial Analysis'in hızı yalıtılmış bir rakam olarak değil de zekâ ve maliyet endekslerinin yanında yayımlamasının nedeni de bu.
Neden önemli
Çıkarım hızı, model kalitesi ve fiyatın yanı sıra başlı başına rekabetçi bir eksen haline geliyor. Artificial Analysis'in Mercury 2.5 için ölçtüğü gibi, saniyede yaklaşık 770 çıktı token üretebilen bir üretim modeli, diffusion tabanlı serving'in araştırma demolarından ticari olarak önemli bir alana geçebileceğini gösteriyor. Bu hızlar ölçekte ve makul bir maliyetle korunursa, gerçek zamanlı ses arayüzleri, canlı kodlama araçları ve uzun çok adımlı ajan çalışmaları daha ucuz ve daha duyarlı hale gelir — ve hâlâ aynı anda tek token decode eden rakipler, sadece liderlik tablosunda değil, kronometrede de ölçülebilir bir dezavantajla karşı karşıya kalır.
- #llm
- #inference-speed
- #benchmarks
- #diffusion-models
- #apis