vLLM v0.28.0リリース!新機能と性能向上が実現

要約

vLLMの最新バージョンv0.28.0がリリースされ、584のコミットが270人の貢献者から行われました。このリリースでは、Kimi-K3の性能向上が主な焦点となっており、DCPサポートやメモリ効率の向上が図られています。また、DeepSeek V4の導入により、スパースMLAがエンドツーエンドで機能するようになり、AMD Quark NVFP4のサポートも追加されました。

この新バージョンは、さまざまな最適化が施されており、特にKimi-K3では、GPUごとに約17GiBのメモリを節約できるオプションの共有エキスパートシャーディングなどが導入されています。さらに、Speculative Decodingの進展により、ローカル畳み込みや候補選択機能が追加され、モデルランナーの成熟度も向上しています。

vLLMは、リリースによってパフォーマンス向上が期待されるだけでなく、ユーザーにとって使いやすくなる新しいデフォルト設定も導入されました。このように、v0.28.0は機能性と効率性が両立した重要なアップデートと言えるでしょう。


元記事: https://github.com/vllm-project/vllm/releases/tag/v0.28.0

公開日: Sat, 29 Aug 2026 18:22:00 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする