deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

NVIDIA H200 vs AMD MI325X: Büyük model çıkarımında (inference) belirleyici olan FLOPS değil, bellek

dev.to'da yayınlanan bir GPUYard karşılaştırması, H200 ve MI325X'in 400 milyar parametreli modelleri ne kadar iyi servis ettiğini tepe hesaplama gücünün değil, bellek kapasitesi ve bant genişliğinin belirlediğini savunuyor; VRAM'de AMD, yazılımda NVIDIA önde.

NVIDIA H200 vs AMD MI325X: Büyük model çıkarımında (inference) belirleyici olan FLOPS değil, bellek

GPUYard tarafından dev.to'da yayınlanan bir donanım karşılaştırması, çok büyük açık ağırlıklı modellerin — yazıda 400 milyar parametreli Llama sınıfı modeller ve DeepSeek gibi 671 milyar parametreli bir Mixture-of-Experts mimarisi örnek veriliyor — günümüzün amiral gemisi çıkarım (inference) GPU'larında servis edildiğinde ne olduğuna bakıyor. Merkezî argüman şu: bu ölçekte, bir rafın verimli çalışıp çalışmayacağını ya da darboğaza dönüşüp dönüşmeyeceğini ham hesaplama gücü değil, bellek kapasitesi ve bellek bant genişliği belirliyor.

Öne çıkan teknik özellikler

Yazıya göre iki hızlandırıcı şöyle sıralanıyor: NVIDIA H200, 141 GB HBM3e, 4,8 TB/s bellek bant genişliği, 1.979 TFLOPS FP8 hesaplama gücü ve 700W TDP sunuyor. AMD Instinct MI325X ise 256 GB HBM3e, 6,0 TB/s bant genişliği, 2.615 TFLOPS FP8 hesaplama gücü ve 1000W TDP ile karşılık veriyor. AMD, yaklaşık yüzde 43 daha yüksek güç tüketimi bedeliyle tüm ham değer sütunlarında önde.

Kapasite küme tasarımını neden yeniden şekillendiriyor

Yazı temel sorunu bir VRAM duvarı olarak çerçeveliyor: 400 milyar parametreli bir model, prompt işlemenin gerektirdiği KV cache için alan ayrılmadan önce bile ağırlıklarını tutmak için yüzlerce gigabayta ihtiyaç duyuyor. Bu çerçeve MI325X'in lehine. GPU başına daha büyük bellek, daha büyük model parçalarının (shard) tek bir çipte sığması anlamına geliyor; bu da gereken tensor parallelism derecesini ve onunla birlikte parçalamanın yarattığı GPU'lar arası trafiği — ve gecikmeyi — azaltıyor. H200'ün 141 GB tavanı aynı iş yükünü ters yöne itiyor: eşdeğer bir DeepSeek dağıtımını barındırmak için daha fazla fiziksel GPU'nun birbirine bağlanması gerekiyor, çok düğümlü topolojiler daha erken devreye giriyor ve ağ karmaşıklığı artıyor.

Decode aşaması bellek sınırlı

Yazının açıkladığına göre çıkarımın decode aşamasında token üretimi, çekirdeklerin kendisinden çok verinin hesaplama çekirdeklerine ne kadar hızlı ulaştığıyla kısıtlanıyor — takılan bir veri çekimi her şeyi durduruyor. Bu, MI325X'in 6,0 TB/s'lik değeri ile H200'ün 4,8 TB/s'lik değerini saniye başına token sayısı açısından doğrudan ilgili kılıyor. Yazarın değerlendirmesine göre AMD'nin daha yüksek FP8 hesaplama rakamının önemi daha az, çünkü bu ölçekteki iş yükü matematikten çok bellekle kısıtlı.

Yazılım hâlâ NVIDIA'nın hendeği

Geliştirici deneyimi konusunda karşılaştırma net şekilde NVIDIA'nın yanında yer alıyor. CUDA ve TensorRT-LLM ile yeni Llama sürümlerinin ilk günden çalıştığı, özel kernel gerektirmediği ve topluluk yamaları beklenmediği belirtiliyor. AMD'nin ROCm'u, özellikle vLLM ve SGLang gibi açık kaynak çıkarım motorlarıyla eşleştiğinde açığı büyük ölçüde kapattı; ancak yepyeni modelleri dağıtan ekipler yine de ara sıra yaşanacak derleme hataları ve geçici çözümlerle dolu bir hata ayıklama dönemi için bütçe ayırmalı.

Öneriler

GPUYard, en büyük modelleri — Llama 400B+ veya DeepSeek 671B — servis eden ve VRAM yoğunluğuna öncelik veren, ROCm sorun çözümünü kaldırabilecek mühendislere sahip ekipleri MI325X'e yönlendiriyor; saf donanım ekonomisinde AMD'nin kazandığını savunuyor. H200 ise karma eğitim-çıkarım iş yükleri ve yeni bir model yayınlandığı anda kararlılık isteyen ekipler için öneriliyor. Belirtmeye değer bir uyarı: dev.to yazısı, okuyucuları GPUYard'ın kendi sitesindeki toplam sahip olma maliyeti hesaplamalarını içeren daha uzun bir derinlemesine incelemeye yönlendirerek bitiyor; yani aynı zamanda o kapsamlı analiz için bir tanıtım işlevi de görüyor.

Neden önemli

Açık ağırlıklı modeller tek bir hızlandırıcının bellek bütçesini aşmaya devam ediyor. Bir modelin yalnızca ağırlıkları tek bir GPU'nun tutabileceği büyüklüğe yaklaştığında, GPU başına kapasite bir spec-sheet detayı olmaktan çıkıp küme topolojisini diktate etmeye başlıyor: kaç çip alacağınız, bunların nasıl birbirine bağlanacağı, ne kadar ağ sağlayacağınız ve mühendislik zamanının ne kadarının üründen çok serving stack'e gideceği gibi. Bu karşılaştırma, çıkarım altyapısı planlayan herkes için pratik ödünleşimi ortaya koyuyor: AMD'nin daha büyük ve hızlı belleğine karşı NVIDIA'nın olgun yazılımı, her iki tarafa bağlı 1000W'a karşı 700W'luk elektrik faturasıyla birlikte. Spec-sheet aritmetiği tek başına bunu çözemez — toplam sahip olma maliyeti, ağ harcaması ve hata ayıklama süresi karara dahil edilmeli; daha uzun analiz de tam olarak bunları ele almayı vaat ediyor.

  • #nvidia
  • #amd
  • #gpu-hardware
  • #llm-inference
  • #hbm-memory