· kaynak Hacker News – Front Page (hnrss.org)
Inception Labs, saniyede 1.107 token sunan diffusion LLM Mercury 2.5'i yayınladı
Inception Labs, Mercury 2.5'in şimdiye kadar eğitilmiş en büyük diffusion dil modeli olduğunu belirtiyor; model, frontier seviyesine yakın kaliteyi saniyede 1.107 token hızı ve milyon girdi tokenı başına 0,20 dolar fiyatla birleştiriyor.

Inception Labs, diffusion tabanlı büyük dil modelinin en yeni sürümü olan Mercury 2.5'i yayınladı; şirket, modeli bugüne kadarki en yetenekli üretim modeli olarak tanımlıyor. Hacker News ana sayfasında da yer bulan duyuru, önceki Mercury 2 modelinin binlerce geliştirici tarafından benimsendiği ve düzinelerce kurumsal müşteri tarafından üretime alındığı, şirkete göre kullanımın on katından fazla büyüdüğü bir dönemin ardından geldi.
Öne çıkan rakamlar
Inception Labs, Mercury 2.5'in şimdiye kadar eğitilmiş en büyük diffusion dil modeli olduğunu ve Mercury 2'ye kıyasla yüzde 40 daha yüksek zekâ seviyesine sahip olduğunu iddia ediyor. Şirket, modelin kalitesini GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite ve Claude Haiku 4.5 gibi maliyet-optimize edilmiş frontier modellerle aynı lige koyuyor — ancak bu, bağımsız bir benchmark değil, satıcının kendi yaptığı bir karşılaştırma.
Öne çıkan diğer teknik özellikler arasında, yaygın olarak bulunan NVIDIA GPU'larında saniyede 1.107 token işleme hızı, 260K tokenlık bağlam penceresi ve milyon girdi tokenı başına 0,20 dolar, milyon çıktı tokenı başına 0,75 dolarlık fiyatlandırma yer alıyor. Lansmanda modele yüzde 80 indirim uygulanıyor ve fiyatlar sırasıyla 0,04 ve 0,15 dolara düşüyor. Özellik desteği arasında ayarlanabilir reasoning, paralel tool çağrıları ve şemaya uygun JSON çıktısı bulunuyor.
NVIDIA'nın Accelerated Computing Group grubunda kıdemli ürün yöneticisi olan Shruti Koparkar, sürümün yeni mimarilerin NVIDIA platformunda ne kadar hızlı üretime hazır sistemlere dönüşebildiğini gösterdiğini söyledi.
Üretim hatalarıyla şekillenen model
Inception Labs, arama, ses ve kodlama alanlarındaki gerçek dünya iş yüklerinin yalnızca benchmark'lardan daha güçlü bir sinyal sunduğunu, müşteri geri bildirimleri ve üretimdeki hata vakalarının Mercury 2.5'in eval'lerini keskinleştirmek ve eğitimi odaklandırmak için kullanıldığını belirtiyor.
Duyuru, isim verilen müşterilerden gelen sonuçları da içeriyor. AI telefon ajanları geliştiren OpenCall, kendi üretim iş yükünde medyan model yanıt gecikmesinin yaklaşık 170 milisaniye olduğunu bildiriyor. Kurucu ortak ve CEO Oliver Silverstein, P99 yanıt sürelerinin birkaç dakikadan yaklaşık bir saniyeye düştüğünü, P50'nin ise reasoning dahil 0,4 saniyeden 0,2 saniyenin altına indiğini söyledi.
Augment Code, Mercury'yi bağlam sıkıştırma (context compaction), model yönlendirme (model routing) ve MCP tool araması için kullanıyor. Inception Labs'a göre sıkıştırmanın Mercury'ye taşınması gecikmeyi yüzde 82 azalttı — yaklaşık 150 saniyeden 27 saniyeye indi — ve maliyeti, kaliteyi korurken yüzde 90 düşürdü; tool araması özetleri ise bir saniyenin altında dönmeye başladı.
Arama tarafında şirket, bir ajan veya RAG pipeline'ındaki tek bir isteğin sorgu planlama ve yeniden yazmadan yeniden sıralama ve özetlemeye kadar düzinelerce model çağrısını tetikleyebildiğini, ve önde gelen several arama altyapısı şirketinin Mercury'yi şu anda üretimde çalıştırdığını, ancak bu şirketlerin adını vermediğini belirtiyor.
Önizlemeler: Mercury Voice ve Mercury Router
Sürümün yanı sıra Inception Labs, iki yan ürünün önizlemesini de duyurdu. Mercury Voice, en sıkı gecikme bütçelerine sahip sesli ajanlar için optimize edilmiş, ilk tokena ulaşma süresini 170 milisaniyenin altını hedefleyen bir diffusion LLM. Mercury Router ise gelen prompt'ları bir diffusion modelle analiz ederek, kalite, hız ve maliyetin en iyi karışımını sunan açık veya kapalı modellere yönlendiriyor.
Erişilebilirlik
Mercury modelleri Inception API, Baseten ve OpenRouter üzerinden erişilebilir. Kurumsal dağıtımlar ayrıca özel kapasite, otomatik ölçeklendirme, uyumluluk kontrolleri ve yapılandırılabilir veri saklama sunuyor. Yeni API kullanıcıları modeli denemek için 100 milyon ücretsiz token alıyor ve Y Combinator şirketleri 500.000 dolarlık dağıtım avantajı talep edebiliyor. Inception Labs ayrıca, bugüne kadarki en büyük modeli olan daha büyük bir halefin eğitiminin çoktan başladığını ve önümüzdeki aylarda yayınlanmayı hedeflediğini söylüyor.
Neden önemli
Diffusion dil modelleri, metni kesinlikle soldan sağa token üretimiyle değil, yinelemeli rafine etme yoluyla üretir; saniyede 1.107 token gibi işleme hızlarını mümkün kılan da budur. Yukarıdaki tüm kalite ve performans rakamları satıcı ve müşterilerinden geldiği için bağımsız doğrulama bekliyor. Yine de Mercury 2.5, diffusion yaklaşımının araştırma demolarını aşarak gecikme ve maliyete duyarlı üretim iş yüklerine — ajan orkestrasyonu, sesli arayüzler, RAG pipeline'ları — geçtiğinin kanıtı; bu iş yüklerinde çağrı başına gecikme ve maliyet, kullanıcı etkileşimi başına düzinelerce model çağrısında birikerek büyüyor. Fiyatlandırması ayrıca benzer hızlı servis modellerinin çoğundan daha uygun, giderek kalabalıklaşan bu pazar segmentinde baskıyı artırıyor.
- #diffusion-models
- #llm
- #inference
- #low-latency
- #inception-labs