· kaynak Hacker News – Front Page (hnrss.org)
vLLM 0.28.0, Kimi-K3 ve DeepSeek V4 performans çalışmalarıyla birlikte 584 commit ile geliyor
vLLM 0.28.0, 270 katkıda bulunandan gelen 584 commit ile yayınlandı; Kimi-K3 için modele özel performans iyileştirmeleri, DeepSeek V4 için uçtan uca seyrek MLA, kademeli KV cache boşaltma ve yeni varsayılanlar içeriyor.
vLLM 0.28.0, 584 commit ile geliyor
vLLM projesi, 270 katkıda bulunandan (bunların 76'sı projeye yeni katılan isimler) gelen 584 commit'i bir araya getiren büyük bir güncelleme olan 0.28.0 sürümünü yayınladı. GitHub'da yayınlanan sürüm notlarına göre çalışmaların büyük bölümü çıkarım (inference) throughput'u ve bellek verimliliğine odaklanıyor; yeni paralellik teknikleri, fused kernel'lar, speculative decoding iyileştirmeleri ve en büyük açık ağırlıklı modellere yönelik mimari değişiklikler kapsıyor.
Kimi-K3 için tam yığın optimizasyon çalışması
Öne çıkan emek, Kimi-K3 için koordineli bir performans hamlesi. Sürüm, Decode Context Parallel (DCP) desteği, decode ve prefill için fused FlashKDA kernel'ları, MegaMoE için SiTU aktivasyon desteği ve sequence paralelliği için GEMM-RS ekliyor. All-gather işlemlerinin birleştirilmesi bildirildiğine göre kernel düzeyinde 1.5x ila 3x hızlanma sağlarken, uyarlanabilir speculative token bütçesi DSpark'ın time-to-first-token süresini yaklaşık %60 iyileştiriyor. İsteğe bağlı shared-expert sharding modu GPU başına yaklaşık 17 GiB bellek tasarrufu sağlıyor. Kimi-K3 artık V2 model runner üzerinden AMD ROCm'da da çalışıyor.
DeepSeek V4 ve speculative decoding
DeepSeek V4 desteği de ilerliyor. Sparse MLA artık düz decode, MTP ve DSpark speculative decoding için uçtan uca çalışıyor; buna AMD Quark NVFP4 desteği, reasoning-effort prompt'ları ve eşlemeleri, optimize edilmiş seyrek top-k metadata kernel'ları, daraltılmış eager CUDA graph bölgeleri ve gfx11 ile gfx950 donanımında ROCm desteği eşlik ediyor.
Speculative decoding, lokal convolution ve candidate selector ile birlikte DFlash2, ayrıca DSpark için confidence-scheduled doğrulama kazanıyor. Asenkron zamanlama artık draft modeller için otomatik olarak etkinleştiriliyor.
Model Runner V2 ve kademeli KV cache
Motorun daha yeni yürütme yolu olan Model Runner V2 olgunlaşmaya devam ediyor. Sürüm; E/P/D disaggregation, ağırlık (weight) boşaltma, çok katmanlı MTP KV cache desteği, encoder CUDA graph'ları, token bazlı decoder pooling, Transformers pooling modelleri, attention-free model desteği ve thinking_token_budget parametresi ekliyor.
Kademeli KV cache boşaltma da genişliyor: disk boşaltma, module_path seçeneğiyle yüklenen ağaç dışı (out-of-tree) ikinci kademe yöneticileri, kısmi ikinci kademe yükleme sonuçları, kademe metrikleri ve kullanılan paralellik stratejisinden bağımsız olacak şekilde tasarlanmış standart bir CPU düzeni.
Rust frontend, gRPC ve yeni varsayılanlar
Rust frontend ve gRPC API; bağımsız bir renderer, gRPC üzerinden multimodal görüntü çıkarımı, açık veri-paralel rank yönlendirmesi ve pekiştirmeli öğrenme (RL) yaşam döngüsü kontrolü kazanıyor. Projenin protobuf şemaları artık Buf'a yayınlanıyor.
Bu sürümle birlikte birkaç varsayılan değişiyor. max_num_batched_tokens üst sınırı 8192'den 16384'e iki katına çıkıyor, Mamba modelleri için prefix caching varsayılan olarak etkinleştiriliyor ve Blackwell CUDA graph yakalama varsayılanı 1024'e yükseliyor.
Yıkıcı değişiklikler ve daha geniş model desteği
Yükseltme yapanların yıkıcı değişikliklere dikkat etmesi gerekiyor: bitsandbytes desteği ağaç dışı bir plugin'e taşındı, Transformers 5.15.0'a yükseltildi ve kullanımdan kaldırılmış olan calculate_kv_scales runtime KV ölçek hesaplaması ile override_attention_dtype kaldırıldı.
Model kapsamı genişliyor; Muse Glimmer, Ling 3.0 Flash (FP8 varyantı ve hibrit MXFP4 routed expert'lerle), doğal multimodal destekli Dots3 NOTE ve Interns2mobius gibi yeni gelenler bulunuyor. Qwen modelleri, Qwen3.8 için ROCm desteği, Qwen3.5 GDN için fused CUDA MTP decode kernel'ı ve yalnızca metin içeren checkpoint'ler için düzeltmeler kazanıyor. Donanım tarafında NVIDIA, SM12x parçalarında FlashInfer XQA decode, SM100 üzerinde CuTeDSL fused query kernel'ı ve GB10 FP8 ayar yapılandırmaları kazanırken; AMD, torch 2.12 / Triton 3.7 yığını yükseltmesinin yanı sıra GFX120x üzerinde AITER ve FP8 çıkarım elde ediyor.
Sürüm yapıları arasında CUDA 13.0 için PyPI wheel'leri, projenin kendi indeksinden ROCm wheel'leri ile CUDA 12.9 ve 13.0, Ubuntu 24.04 varyantları, ROCm, CPU ve XPU'yu kapsayan Docker imajları yer alıyor.
Neden önemli
vLLM, açık ağırlıklı modelleri üretimde çalıştıran ekipler için varsayılan bir serving katmanı haline geldi; dolayısıyla sürüm temposu, çıkarım mühendisliğinin nereye gittiğine dair yararlı bir sinyal. Burada iki eğilim öne çıkıyor. Birincisi, optimizasyon çalışmaları giderek modele özgü hale geliyor: kernel'lar, paralellik şemaları ve bellek düzenleri, genel transformer serving yerine Kimi-K3 ve DeepSeek V4 gibi tek tek mimariler etrafında yazılıyor. İkincisi, yığın tek düğümlü GPU serving'inin ötesine uzanmaya devam ediyor; disaggregated prefill ve decode, disk dahil kademeli bellek ve RL iş akışları için gRPC tabanlı kontrol düzlemlerine doğru. Değişen varsayılanlar da operasyonel açıdan önemli: iki katına çıkan batched token limitleri ve değişen caching davranışı gecikme ve bellek profillerini etkileyebilir, bu yüzden yükseltme yapan ekipler performansın değişmediğini varsaymak yerine benchmark yapmalı.
- #vllm
- #inference
- #llm
- #open-source
- #gpu
İlgili yazılar
- FineTune Studio, Qwen3-1.7B'yı yaklaşık 3,2 GB VRAM ile QLoRA üzerinden fine-tune ediyor
- Gemini 3.8 Flash değişmeyen fiyatlarla, 2027'de iki katına çıkacak tarifelerle ve erişim kısıtlı bir Cyber modeliyle geldi
- BrowserSkill, yapay zeka ajanlarınıza zaten oturum açtığınız tarayıcıyı kullanma imkanı veriyor