deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

OpenRouter analizi: Aynı model sağlayıcılar arasında 14 kata kadar farklı fiyata satılıyor

OpenRouter'ın sağlayıcı bazlı fiyatlandırmasına yönelik bir analiz, aynı modelin bir endpoint'ten diğerine 14,47 kata kadar pahalıya mal olabildiğini ortaya koydu; farkın arkasındaki etkenler hassasiyet, çalışma süresi ve verinin konumu.

OpenRouter analizi: Aynı model sağlayıcılar arasında 14 kata kadar farklı fiyata satılıyor

Fark ne kadar büyük

dev.to'da yayımlanan bir fiyatlandırma analizi, bir API endpoint'inin arkasındaki sağlayıcının ne kadar önemli olduğunu sayısallaştırdı: Tek bir model adının birçok sağlayıcıya eşlendiği yönlendirme platformu OpenRouter'da, aynı model çağrıyı hangi endpoint'in hizmet verdiğine bağlı olarak 14,47 kata kadar pahalıya mal olabiliyor.

Farkın boyutu

Yazarlar OpenRouter'daki ücretli her model için sağlayıcı bazlı fiyatlandırmayı çekti. Listelenen 405 ücretli modelden 182'si iki veya daha fazla ücretli sağlayıcı tarafından sunuluyor. Bu grupta en ucuz ile en pahalı endpoint arasındaki medyan fark 1,87x, en geniş fark 14,47x ve modellerin %46'sı en az 2x farkla değişiyor. Ağırlıklar, model kartı ve API çağrısı aynı; yalnızca fatura değişiyor.

Bir modelin neden çok fazla fiyatı var

Analize göre, tek bir model tanımlayıcısı altında üç değişken birbirinden bağımsız hareket ediyor:

  • Hassasiyet. fp4 quantization sunan bir sağlayıcı, bf16 çalıştıran bir sağlayıcıyla aynı yapıtı teslim etmiyor; model kimliği eşleşse bile. Düşük hassasiyet sağlayıcı için daha ucuz ve çağırıcıya aslında ulaşan şeyi değiştiriyor.
  • Çalışma süresi. %89,3 erişilebilirliğe sahip bir endpoint ile %99,9'a sahip biri, bir durum sayfasında ikisi de çalışıyor olarak görünebilir; ancak pratikte ciddi biçimde farklı güvenilirliği temsil ederler.
  • Veri konumu. 182 çok sağlayıcılı modelin 71'i, yani %39'u, birden fazla ülkede kurulu sağlayıcılar tarafından sunuluyor. Veri yerleşikliği yükümlülükleri olanlar için model tanımlayıcısı verinin nereye gittiği konusunda hiçbir şey söylemiyor; sağlayıcı listesi söylüyor.

Yazının savunulan görüşü, bunlardan hiçbirinin gizlenmemiş olduğu. Bilgiler, kimsenin bir modeli seçmeden önce tipik olarak bir araya getirmediği ayrı sayfalara dağılmış durumda.

Gecikme ölçülmeli, miras alınmamalı

OpenRouter'ın herkese açık model verisi gecikme alanını null bırakıyor; yazarlar bunu, cevabın sağlayıcıya, bölgeye ve ana bağlı dürüst bir itiraf olarak okuyor. Bu yüzden 329 modeli ücretli bir API üzerinden tek bir sabit prompt ile çağırdılar ve ilk token'a kadar geçen süre ile saniyedeki token sayısını kaydettiler.

Bu sırada iki uygulama tuzağına dikkat çekiliyor. Reasoning etkinleştirildiğinde bir model tüm token bütçesini düşünmeye harcayabilir ve boş içerik döndürebilir; böylece benchmark hiçbir şey üretmezken çağrı hâlâ para kazandırır. Ve açıklanmayan fiyatlar -1 olarak gelir; değer toplama öncesinde sıfıra sabitlenmezse bu, projeksiyon maliyet toplamını sessizce söndürür. Ekip tek çağrılık ölçümlerini OpenRouter'ın kendi p50'den p99'a yüzdelikleriyle birlikte yayımlıyor; ancak iki veri kümesi ayrı tutuluyor çünkü farklı sorulara cevap veriyorlar: kararlı trafik ile kontrollü tek istek.

Akıcı ama yanlış çıktı

Aynı proje 330 modeli Korece kalitesinin yedi ekseninde notladı; bunlara hitap dili, onur ekleri, terminoloji ve Kore kurumları bilgisi dahil. İki eksen neredeyse her yerde başarısız: modellerin yalnızca %8,5'i onur eklerini doğru kullanıyor ve %9,4'ü Kore kurumları hakkında yeterli bilgi gösteriyor. Terminoloji %31,2, biçim uyumu %47,6 ve hitap dizi %53,3 geçiyor.

Yazarlar bu başarısızlık biçimini sessizce başarısız olan bir bug'a benzetiyor: Çıktı, onur ekini yanlış kullanırken akıcı, doğal Korece gibi okunabiliyor ve iyi okunan ama yanlış metin, görünür biçimde bozuk çıktının geçemeyeceği incelemelerden kolayca geçiyor. Alışılmış göstergeler de sonucu öngörmüyor. Notlandırmaya göre 2023 çıkışlı gpt-3.5-turbo-16k, tam bir 3,00 alarak 2026'nın çoğu amiral gemisi modelinin üstünde.

Veri açık

Her şey, API anahtarı olmadan projenin Hugging Face Space'i olan ginigen-ai/open-router-leaderboard üzerinden erişilebilir; toplam 425 modeli kapsıyor: endpoint başına fiyat, hassasiyet, çalışma süresi ve sağlayıcı merkezi; gecikme ve iş hacmi yüzdelikleri; ayrıca ekibin kendi ölçümleri ve eksen bazlı notlar. Veri kümesi günlük olarak yenileniyor, üç dil ve üç para birimini kapsıyor ve tam bir metodoloji yazısı Hugging Face blog'unda yayımlandı.

Neden önemli

Bir model seçmek ile bir endpoint seçmek iki ayrı karardır ve ikincisi, aynı ağırlıklarla faturayı neredeyse bir büyüklük mertebesi kadar oynatabilir, güvenilirliği birkaç çalışma süresi puanı kadar kaydırabilir ve uyumluluk durumunu bir ulusal sınırın ötesinde değiştirebilir. Yönlendirme platformları üzerine inşa eden ekipler için quantization, "aynı model"in hiç de aynı yapıt olmayabileceği anlamına geliyor; bu yüzden maliyet karşılaştırmaları model düzeyinde değil, endpoint düzeyinde yapılmalı. Korece sonuçları, LLM özellikleri yayımlayan herkes için daha geniş bir ders taşıyor: yalnızca bir modelin yanıt verip vermediğini değil, doğru yanıt verip vermediğini kontrol etmeyen değerlendirme paketleri, sessizce başarısız olan sistemleri geçmeye devam edecek.

  • #openrouter
  • #llm-pricing
  • #ai-inference
  • #api
  • #model-evaluation