deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Açık ağırlıklı çıkarım, eski NVIDIA GPU'ları yıllarca daha uzun kazandırıyor, Ornn Data analizi bunu savunuyor

Ornn Data'nın GPU kiralama pazarına dair analizi, açık ağırlıklı model çıkarımı talebinin eski NVIDIA donanımını ekonomik olarak verimli tuttuğunu, seyrek iş yüklerinde A100'ün H100'ü geride bıraktığını savunuyor.

Açık ağırlıklı çıkarım, eski NVIDIA GPU'ları yıllarca daha uzun kazandırıyor, Ornn Data analizi bunu savunuyor

Ornn Data'dan, "The Economics of Open-Weight Inference" başlıklı ve 7 Eylül 2026'da yayımlanan kiralama pazarı çalışması, Hacker News'in ana sayfasında öne çıktı. Çalışmanın merkezindeki iddia, standart veri merkezi muhasebesinin tersine: açık ağırlıklı model çıkarımına yönelik talep, eski NVIDIA GPU'larının ekonomik ömrünü uzatıyor; yeni bir mimari çıktığında bu kartları atıl duruma düşürmüyor.

Temel argüman

GPU'lar genellikle her yeni NVIDIA neslinin öncekini kullanılmaz hale getirdiği varsayımıyla amortismanlane yazılır. Ornn Data bu teze karşı çıkıyor. Kapalı modellere yalnızca sağlayıcı kontrollü uç noktalar ve abonelik kotaları üzerinden erişilebilir; dolayısıyla açıklanan token başına fiyat listesi, ek kullanımın marjinal fiyatını fiilen belirliyor. Buna karşılık açık ağırlıklı modeller uyumlu donanımda herkes tarafından çalıştırılabilir; bu da fiyat duyarlı müşterilerin işi, verilen bir modeli en ucuza sunan GPU'ya yönlendirmesine olanak tanıyor.

Artificial Analysis Intelligence Index üzerindeki on bir açık ağırlıklı ve sekiz kapalı modelde yapılan incelemede, makale, zekâ puanına göre maliyet düzeltmesi yapıldığında en ucuz uygun açık ağırlıklı modelin bir görevi, karşılaştırılabilir kapalı bir modelin yaklaşık beşte biri fiyatına tamamladığını buluyor. Bu avantaj evrensel değil: bazı puan eşiklerinde kapalı modeller daha ucuz kalıyor ve aralığın en üstünde kapalı sınır hâlâ açık örneklemi aşıyor.

Maliyet rakamları

Makaleye göre, kiralık donanımda kendi kendine barındırma, tam kullanımda yalnızca işlem maliyetlerini milyon çıktı token başına 0,12 ile 0,35 dolara indiriyor; bu, yayımlanan verim (throughput) rakamlarına ve Ornn'nin 1 Eylül 2026 spot kira fiyatlarına dayanıyor.

Hangi GPU'nun kazandığı büyük ölçüde iş yüküne bağlı. Yoğun (dense) Llama-2-70B sunumunda yeni silikon en ucuz: temel senaryoda B200 milyon çıktı token başına 0,39 dolara denk gelirken, H100 için bu 0,68 ve A100 için tahmini 0,75 dolar. 5,1 milyar aktif parametreli, MXFP4 uzman ağırlıklarına sahip ve tek bir 80 GB A100 üzerinde sunulabilecek kadar küçük olan seyrek gpt-oss-120b'de ise sıralama tersine döner. A100'ün temel senaryo maliyeti milyon çıktı token başına 0,29 dolar olup H100'ün 0,64 dolarının yarısından azdır ve A100, spot ile üç ve beş yıllık vade fiyatlarında da daha ucuz kalır. Ornn, A100 ve H100 seyrek rakamlarının farklı üçüncü taraf sunum kurulumlarından geldiğini ve yoğun A100 satırının tahmini olduğunu belirtiyor.

Kiralama pazarı sinyalleri

Ornn kendi kiralama verilerini pazar kanıtı olarak sunuyor. A100'ün beş yıllık vade fiyatı, bir aylık işaretinin yüzde 80,2'sini koruyor — bu, Ampere ailesi on bir yaşından büyük olana dek sürecek bir sözleşme için — buna karşılık Hopper parçaları yüzde 43,7 ila 59,8, Blackwell parçaları yüzde 53,8 koruyor. Ayrıca A100 doluluk oranı, listelenen kiralama kapasitesi yüzde 13 ve spot endeksi yüzde 20 artmasına rağmen Mart'tan Eylül 2026'ya 74'ten 90'a yükseldi; yani ailenin gücü yalnızca daralan kiralama arzıyla açıklanamaz.

Uyarılar

Makale sınırları konusunda açık sözlü. Açık ağırlık talebinin A100'ün doluluk ve fiyat davranışına neden olduğunu kanıtlamıyor; ileri vadeli fiyat işaretleri, çalıştırılabilir teklifler değil analist üretimi göstergelerdir ve taşınabilirlik kusursuz değildir. Eylül 2026 OpenRouter anlık görüntüleri, yaygın sunulan açık modeller için on sekiz ile yirmi iki sağlayıcı listeliyordu; en yüksek ile en düşük arasında çıktı fiyatı oranı 5,6'ya kadar çıkıyordu, ancak quantization, kapasite, güvenilirlik ve göç maliyetleri ikameyi kısıtlıyor. Eski donanıma en uygun iş yükleri — uzun soluklu agent'lar, toplu (batch) değerlendirme ve pekiştirmeli öğrenmenin bazı bölümleri — gecikmeye tahammüllüdür ve etkileşimli sohbetin aksine donanımdan bağımsızdır. Makaleye göre etiket gücünde elektrik, spot kiranın yüzde birkaçı kadar ve sıralamaları değiştirmiyor. Metin ayrıca talep yönlendirmesine ilişkin argümanıyla bağlantılı olarak 3 Eylül 2026 tarihli NVIDIA'nın Hugging Face'i satın almasına atıfta bulunuyor.

Neden önemli

Tez doğruysa sonuçlar hem bilançolara hem de tedarik planlarına ulaşıyor. Ampere dönemi filolarını agresif biçimde amortismanlayan işletmeciler ve kiraya verenler, gecikmeye tahammüllü çıkarımla yıllarca kazanç sağlayabilecek donanımı hurdaya çıkarıyor olabilir; açık ağırlık sunumu için alışveriş yapan alıcılar ise eski GPU'ları kurtarılmış parça değil, gerçekten rekabetçi bir kademe olarak görebilir. Analiz ayrıca kullanılabilir yapay zekânın maliyet tabanının sürekli düştüğünü ima ediyor: kabaca beş yaşındaki bir hızlandırıcı, yetenekli bir seyrek modelde güncel nesil bir amiraliyi geçtiğinde, zekânın marjinal fiyatı donanım yaşı değil, iş yükü uyumu meselesi haline geliyor. Bu baskı doğrudan kapalı model fiyat listelerine — ve yeni silikonun eskisini emekliye ayırdığını varsayan her tahmine biniyor.

  • #nvidia
  • #gpu-cloud
  • #inference
  • #open-weight-models
  • #cloud-economics

İlgili yazılar