deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Yeniden üretilebilir kıyaslamalar, workstation Blackwell üzerinde Qwen3-8B için vLLM'i SGLang ve llama.cpp'in önüne geçiriyor

RTX PRO 6000 Blackwell üzerinde yapılan yeniden üretilebilir kıyaslamalar, vLLM'in eşzamanlılık 32'de Qwen3-8B'yi llama.cpp'e kıyasla yaklaşık 4 kat daha hızlı servis ettiğini, FP8 ağırlıkların ise ek olarak 1,5 kat verim artışı sağladığını gösteriyor.

Yeniden üretilebilir kıyaslamalar, workstation Blackwell üzerinde Qwen3-8B için vLLM'i SGLang ve llama.cpp'in önüne geçiriyor

Kıyaslamalar neyi kapsıyordu

Conatus AI tarafından dev.to'da yayınlanan bir kıyaslama yazısı, aynı modeli aynı GPU üzerinde servis eden üç inference yığınını karşılaştırdı: vLLM 0.27.1, SGLang 0.5.9 ve llama.cpp'in CUDA derlemesi; hepsi 96 GB belleğe sahip bir RTX PRO 6000 Blackwell üzerinde Qwen3-8B'yi çalıştırıyordu. Manşet sonuç şu: tek kullanıcı için motor seçiminin neredeyse hiç önemi yok, ancak eşzamanlı yük altında bu seçim yaklaşık 4 katlık bir verim kararı haline geliyor ve bu alanda vLLM açık ara öndeydi. Yazar, kazanan yığında bir FP8 turu daha çalıştı ve ek yüzde 1,5 kat verim artışı elde etti.

Gönderiye göre her rakam ham CSV dosyaları, bir ortam manifestosu ve tek komutluk bir yeniden üretim scripti ile geliyor; script, rapor yazıldıktan sonra baştan sona tekrar çalıştırıldı ve tüm rakamlar yüzde 6 sapma içinde yeniden üretildi.

Metodoloji

Test, tüm üç motorda aynı prompt setini ve örnekleme ayarlarını kullandı; deterministik olması için greedy decoding tercih edildi. Toplu rakamlar ısınma sonrasında eşzamanlılık 32'de ölçüldü ve tepe değerler yerine tüm prompt seti üzerinden kararlı durum rakamları olarak raporlandı. İlgili ayarın bulunduğu her motora aynı maksimum batch ve bağlam ayarları verildi.

Metodolojik olarak öne çıkan bir ayrıntı var: herhangi bir zamanlama karşılaştırılmadan önce çıktı token sayıları motorlar arasında eşitlendi. Yazar, motorların durdurma koşulları ve detokenization konusunda anlaşmazlık gösterdiğini, bu yüzden üretilen tokenlardaki yüzde 10'luk bir farkın sessizce yüzde 10'luk bir verim bozulmasına dönüşebildiğini belirtiyor.

BF16 sonuçları: yük altında geniş bir yayılım

BF16 ve eşzamanlılık 32'de yığınlar arasındaki yayılım büyüktü:

  • vLLM 0.27.1: toplam 1.725 token/s, medyan ilk token süresi 39 ms, uçtan uca p99 3,4 s.
  • SGLang 0.5.9: 1.327 token/s, medyan TTFT 42 ms, uçtan uca p99 5,0 s.
  • llama.cpp (CUDA): 428 token/s, medyan TTFT 316 ms, uçtan uca p99 16,3 s.

Tek kullanıcılı senaryolarda tablo düzleşiyor. Yazar, her yığında tek akışlı decode hızını 83 ile 96 token/s bandında ölçtü ve tek eşzamanlı kullanıcısı olan bir servisin basitçe en kolay işletilen motoru seçmesi gerektiği sonucuna vardı. Ancak yük altında 4 katlık verim açığı ve ilk token süresindeki 4 katlık yayılım (medyan 39 ms'ye karşı 316 ms) belirleyici oluyor; özellikle TTFT, bir chat iş yükünün ne kadar hızlı hissettirdiğini belirliyor.

FP8 turu

vLLM'i aynı ayarlarla resmi FP8 checkpoint ile çalıştırmak, tek akış verimini 86'dan 130 token/s'ye, toplu batch verimini 1.725'ten 2.597 token/s'ye, medyan gecikmeyi ise 0,74 s'den 0,49 s'ye düşürdü. Geçiş öncesi ve sonrası yapılan sabit 20 promptluk gerçeklik kontrolü hiçbir regresyon göstermedi. Yazar, 96 GB'lık bir kartta VRM tasarrufunun 8B bir model için anlamsız olduğunu; asıl kazancın verim olduğunu vurguluyor.

sm_120 sürprizi

Rapor ayrıca bir donanım sınıfı tuzağını belgeliyor. Workstation Blackwell (compute capability sm_120), datacenter Blackwell değildir ve datacenter parçaları için ayarlanmış varsayılan kod yolları workstation çipinde tamamen başarısız olabilir. FP8'i çalıştırmak, varsayılan FP8 yolundaki bir kernel assertion'ını dolanmayı gerektirdi: DeepGEMM sm_120 üzerinde assert ediyor ve çözüm CUTLASS yoluna geri düşmekti.

Yazar, aynı uçurumun ilgili bir örneği olarak vLLM issue 53748'i gösteriyor; burada Triton MLA decode kernel'i, GB10 ve workstation Blackwell'in paylaştığı ama datacenter parçalarının paylaşmadığı blok başına 101.376 baytlık shared-memory sınırını aşıyor. RTX PRO 6000, GB10 veya tüketici sınıfı Blackwell üzerinde servis yapan herkes için pratik tavsiye şu: bu sınıf sorunlar için zaman ayırın, çünkü performans orada ama varsayılan konfigürasyonlar çoğu zaman değil.

Neden önemli

Yayınlanan LLM servis kıyaslamalarının çoğu datacenter GPU'larını hedefliyor ve workstation kartlarıyla dağıtım yapan ekiplere zayıf rehberlik bırakıyor. Bu kıyaslama tam olarak workstation Blackwell üzerinde çalıştığı, eşleştirilmiş ayarlarla üç ana akım yığını kapsadığı ve uçtan uca yeniden üretilebilir olduğu için değerli. İki pratik çıkarımı şunlar: motor seçimi tek kullanıcı ölçeğinde büyük ölçüde önemsizken eşzamanlılık altında 4 katlık bir karar; FP8 ise, datacenter donanımını varsayayan kernel yollarının etrafından gelebilirseniz nispeten ucuz bir 1,5 katlık verim kazancı.

Her zamanki uyarılar geçerli: bu, tek bir GPU üzerinde tek bir modeli kapsayan, kendi kendine yayınlanmış tek bir kaynak; ayrıca hem vLLM hem SGLang hızla geliştiği için belirli rakamlar kesin değil, yol gösterici olarak okunmalı.

  • #vllm
  • #llm-inference
  • #benchmarks
  • #blackwell
  • #qwen3

İlgili yazılar