· kaynak dev.to (home feed)
Inception Labs' Mercury 2.5, milyon başına 0,75 dolarlık çıktı token fiyatıyla 1.107 tok/s difüzyon LLM hızı iddia ediyor
dev.to'da yayımlanan bir karşılaştırma, Inception Labs' Mercury 2.5'ı API üzerinden erişilebilen en hızlı LLM olarak gösteriyor: OpenRouter'da gözlemlenen 440 tok/s, satıcı tarafından bildirilen 1.107 tok/s ve karşılaştırılan modeller arasında en düşük çıktı fiyatı.

dev.to'da yayımlanan bir hız karşılaştırması, Inception Labs' Mercury 2.5'ı Eylül 2026 itibarıyla bir API üzerinden erişilebilen en hızlı LLM ilan ediyor. Difüzyon tabanlı model, yaygın bulunan NVIDIA GPU'larda satıcı tarafından bildirilen 1.107 token/saniye hızına ulaşırken, OpenRouter'ın canlı telemetrisi medyan olarak 440 tok/s ve yaklaşık 1,17 saniyelik gecikme kaydediyor — her iki metrikte de karşılaştırmadaki tüm rakiplerinin önünde. Milyon başına 0,20 dolarlık girdi token ve 0,75 dolarlık çıktı token fiyatıyla, gruptaki en ucuz çıktı fiyatını da sunuyor.
Dört model nasıl kıyaslanıyor
dev.to yazısı Mercury 2.5'ı Gemini 3.5 Flash-Lite, GPT-5.6 Luna ve Claude Haiku 4.5 ile karşılaştırıyor. Orada alıntılanan Artificial Analysis verilerine göre Flash-Lite 382 tok/s hızla çalışıyor ve milyon başına 0,30/2,50 dolar tutuyor; Luna dördü arasında en büyük context penceresiyle milyon başına 0,20/1,20 dolar fiyatla 129 tok/s'e kadar ulaşıyor; Haiku 4.5 akıl yürütme dışı modda kabaca 82 tok/s hızla 1,00/5,00 dolara sunuluyor. Çıktı fiyatında Haiku, Mercury'den yaklaşık 6,7 kat; Flash-Lite yaklaşık 3,3 kat pahalı.
Karar iş yüküne göre değişiyor. Gecikmeye duyarlı üretim trafiği Mercury'yi; ucuz, uzun context'li genel sohbet Luna'yı; Google yerel yığınları Flash-Lite'ı işaret ediyor; Haiku 4.5 ise yerini verimden çok Anthropic'in talimat takibi becerisiyle kazanıyor.
Difüzyon bu hıza nasıl ulaşıyor
Luna ve Haiku gibi geleneksel otoregresif modeller token'ları tek tek üretir, bu yüzden toplam yanıt süresi çıktı uzunluğuyla birlikte büyür. Mercury bir difüzyon dil modeli: token bloklarını gürültü giderme adımları boyunca paralel olarak rafine eder ve hızı dizi uzunluğundan ayırır — Inception'ın 1.107 tok/s iddiasının kaynağı budur.
Inception, ilk ticari difüzyon LLM'i Şubat 2025'te piyasaya sürdü ve Şubat 2026'da Mercury 2 ile devam etti. 2024'te Stanford'dan Stefano Ermon, UCLA'dan Aditya Grover ve Cornell'den Volodymyr Kuleshov tarafından kurulan şirket, Menlo Ventures öncülüğünde, Microsoft'un M12'si ve NVIDIA'nın NVentures'ının katılımıyla 50 milyon dolarlık tohum yatırımı aldı; ayrıca Andrew Ng ve Andrej Karpathy'den melek yatırım desteği aldı. Inception ayrıca Mercury 2'ye kıyasla yüzde 40 zekâ artışı iddia ediyor ve daha büyük bir modelin halihazırda eğitimde olduğunu belirtiyor.
Dağıtımlar ne gösteriyor
Satıcı tarafından yayımlanan iki müşteri verisi öne çıkıyor. Augment Code, sıkıştırma gecikmesinin 150 saniyeden 27 saniyeye düştüğünü — yüzde 82'lik bir azalma — ve maliyetin yüzde 90 düştüğünü bildiriyor. Sesli ajan firması OpenCall, medyan yanıt gecikmesinin 170 ms'ye yakın olduğunu ve P99'un dakikalardan yaklaşık bir saniyeye indiğini bildiriyor. dev.to yazarı her ikisinin de bağımsız kıyaslamalar değil, satıcı verileri olduğuna dikkat çekiyor; bu yüzden yönlendirici olarak değerlendirmek gerekir.
OpenRouter'ın trafik deseni de bu hikâyeyle uyumlu: uç noktanın en büyük tüketicileri ajan istemcileri — 3,86 milyar token'la Hermes Agent ve 2,3 milyar token'la Claude Code — yani bir aracın çok sayıda kısa iç çağrı yaptığı ve kullanıcının beklediği sürenin hepsinin toplamı olduğu iş yükü biçimleri.
Bütçeye katılması gereken uyarılar
Birincisi, manşetteki hız Inception'ın kendi donanım ölçümü; OpenRouter'da gözlemlenen 440 tok/s medyanı çoğu çağırıcının göreceğine daha yakın, bu yüzden kendi prompt'larınızla ölçüm yapın. İkincisi, Mercury'yi 0,04/0,15 dolara fiyatlayan yüzde 80'lik lansman indirimi 8 Eylül 2026'da sona erdi — planları liste fiyatlarına göre yapın. Üçüncüsü, ucuz katmanla kalite denkliği iddiası Inception'ın kendi değerlendirme paketine dayanıyor ve uygulayıcılar hız karşılaştırmalarının rakiplerin eski sürümlerine atıfta bulunduğunu belirtiyor. Dördüncüsü, ajan döngüleri için fazlasıyla yeterli olsa da 260K'lık context penceresi buradaki en küçüğü ve tüm depoyu kapsayan geçişlerde önemli.
Entegrasyon tarafında API OpenAI uyumlu ve tool calling, paralel tool çağrıları, yapılandırılmış çıktılar ve ayarlanabilir akıl yürütme destekliyor. Ayrıca Baseten ve OpenRouter üzerinden sunuluyor; OpenRouter maksimum çıktıyı 65.536 token olarak listeliyor ve Inception başlangıç için 100 milyon ücretsiz API token sunuyor.
Neden önemli
Gecikmeye duyarlı uygulamalar — sesli ajanlar, arama hatları, kodlama alt ajanları — için bir ürünün kullanılabilir hissettirip hissettirmesine en yüksek zekâ değil, verim ve kuyruk gecikmesi karar veriyor ve Mercury 2.5 şu anda ölçülen hızda liderliği elinde tutarken karşılaştırılan modeller arasında en düşük çıktı fiyatını alıyor. Difüzyonun paralel kod çözümü, çağrı başına gecikmenin çok sayıda kısa istekte biriktiği ajan döngülerinin ekonomisini de değiştiriyor. Dürüst okuma manşetten daha dar: gözlemlenen verim satıcı rakamının oldukça altında, yetenek iddiaları fiilen öz değerlendirmeye dayalı ve context sınırlı. dev.to yazısının önerdiği yaklaşım — birkaç yüz gerçek üretim prompt'unu dört modelde de yeniden oynatmak ve ortalama yerine P50 ve P99'da toplamak — hız avantajının gerçek iş yükleriyle temas edince ayakta kalıp kalmadığını test etmenin en akılcı yolu.
- #llm
- #diffusion-models
- #api
- #latency
- #inception-labs