deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

vLLM, AMD Instinct GPU'larda beş speculative decoding yöntemini kıyasladı

vLLM ekibi, ROCm altında AMD Instinct MI300X ve MI355X üzerinde beş speculative decoding yöntemini ölçtü ve verimlilik etkilerinin drafting yöntemine, öneri uzunluğuna, iş yüküne ve kabul davranışına göre değiştiğini gördü.

vLLM, AMD Instinct GPU'larda beş speculative decoding yöntemini kıyasladı

Modeli değiştirmeden daha hızlı bir decode döngüsü

Çoğu LLM servis sistemi hâlâ standart otoregresif decoding ile çalışıyor: model bir token üretiyor, onu bağlama ekliyor ve tekrarlıyor. Yazısı Hacker News'in ana sayfasına çıkan vLLM ekibi, bu döngüyü güvenilir ama doğası gereği seri olarak tanımlıyor — her çıktı tokeni modelin içinden bir geçişe mal oluyor ve bu durum gecikmeye baskın olabiliyor, uzun üretimlerde verimliliği sınırlayabiliyor.

Speculative decoding, bu seri darboğaza modeli değiştirmeden saldırıyor. Küçük bir draft bileşeni, mevcut konumun ilerisinde birkaç aday token öneriyor ve hedef model tüm öneriyi tek bir doğrulama geçişinde kontrol ediyor. Kontrol soldan sağa ilerliyor: kabul edilen adaylar işleniyor, ancak ilk reddedilen token çalışmayı durduruyor — hedef model o konumdaki düzeltilmiş tokeni sağlıyor ve ondan sonra üretilen her şey çöpe atılıyor. Adayların çoğu hayatta kalırsa, hedef modelin tek bir geçişi birkaç çıktı tokeni işliyor ve yazı, hedef modelin çıktı davranışının baştan sona korunduğunun altını çiziyor.\n Yazıdan somut bir örnek: "Bugün hava" promptu verilip taslakçı "güneşli ve ılık dışarıda" önerdiğinde, ilk iki token kabul edilebilir, "ılık" hedef modelin seçtiği "açık" ile değiştirilebilir ve "dışarıda" da reddedilmeyi izlediği için atılabilir.

Beş taslakçı, üç mimari kamp

Yazı beş drafting yaklaşımını değerlendiriyor — native MTP, Gemma 4 MTP, EAGLE-3, DFlash ve DSpark — ve bunları, taslakçının hedef modelden bilgiyi nasıl aldığına ve adayların sıralı mı paralel mi üretildiğine göre üç gruba ayırıyor.

Native MTP modülleri hedef modelin kendi mimarisinin içinde yaşar ve adayları yardımcı bir tahmin yolu üzerinden sırayla üretir. Gemma 4 MTP'nin düştüğü kamp olan ayrı MTP taslakçıları, belirli bir hedef modelle eşleşen ayrı bir checkpoint kullanır; hedef model aktivasyonlarından ve paylaşılan KV-cache bilgisinden yararlanır ama yine de tek seferde bir token taslaklar. Üçüncü kamp, hedef modele koşullu adanmış taslak ağlarını kapsıyor: EAGLE-3 hedef modelin gizli durumlarından otoregresif olarak taslak çıkarır, DFlash bu gizli durumdan token bloklarını paralel olarak taslaklar, DSpark ise hafif nedensel düzeltme ve güvene dayalı önek seçimi ekler.

Bu kategoriler yalnızca drafting tarafını tanımlar, hedef model ailesini değil. vLLM ekibinin belirttiği gibi, tek bir hedef model native MTP'yi desteklerken yanında ayrıca eğitilmiş EAGLE-3, DFlash veya DSpark taslak modelleri de bulunabilir.

MI300X ve MI355X üzerindeki sonuçlar

Ölçümler, ROCm açık yazılım platformu kullanılarak AMD Instinct MI300X ve MI355X GPU'larda koşuldu. Manşet bulgu bilinçli olarak gösterişsiz: çıktı tokeni verimliliğindeki etki, drafting yöntemlerine ve öneri uzunluklarına göre değişti; ayrıca model ailesine, draft checkpoint'ine, iş yüküne ve hedef modelin taslakları ne sıklıkla kabul ettiğine de bağlıydı. Hiçbir yapılandırma her yerde kazanmadı.

Bu değişkenlik doğrulama kuralından mekanik olarak kaynaklanıyor. Bir öneri ilk reddedişinde öldüğü için, daha uzun öneriler yalnızca taslakçı o iş yükünde yeterince isabetliyse karşılığını veriyor — yazı da bu yüzden ölçümlerinin yanına her yöntemi etkinleştirme talimatlarını ve ayarlama ile gözlemlenebilirlik değerlendirmelerine dair bir tartışmayı ekliyor.

Neden önemli

Decoding verimliliği doğrudan servis maliyetine dönüşüyor: hedef modelin kabul ettiği her taslak tokeni, fazladan bir tam model geçişi olmadan üretilmiş bir çıktı tokenidir ve tekniğin temel iddiası, bu hızlanmanın modelin gerçekte ne söylediğini değiştirmeden geldiğidir. Benchmark'ın pratik dersi şu: speculative decoding aç-kapat bir anahtar değil, iş yüküne özel bir ayarlama problemi; dolayısıyla Instinct donanımındaki işletmeciler bir yapılandırmaya bağlanmadan önce kendi model, taslakçı ve öneri uzunluğu kombinasyonlarını ölçmeli. AMD açısından ise vLLM'in ROCm altında MI300X ve MI355X için somut ayarlama verileri yayımlaması, yayımlanmış optimizasyon rehberlerinin çoğunun NVIDIA donanımı çevresinde biriktiği LLM servis alanında bir niyet sinyali.

  • #vllm
  • #amd
  • #speculative-decoding
  • #llm-inference
  • #rocm