跳到正文
vLLM 官方博客· Inferact and the vLLM Team·· 21 小时前精选AI 评分65

vLLM 支持 DeepSeek-V4.1-Flash:通过系统与内核优化实现 5.3× 通量提升

DeepSeek-V4.1-Flash on vLLM: 5x Agentic Throughput Since Day 0

AI 导读

vLLM 团队在 DeepSeek-V4.1-Flash 发布三周内,通过 SWA bounded replay、CUDA graphs 和新内核集成(如 MegaAttention、Mega-mHC、Mega-Gate)等优化,在 SemiAnalysis AgentX 基准上实现 5.3× 通量提升。

推荐理由

vLLM 团队结合 DeepSeek 新内核与系统优化,在 AgentX 基准上实现 5.3× 通量提升,读者可参考其 SWA 重放与 CUDA graphs 等方法优化自身推理部署。

来源:vLLM 官方博客 · vllm.ai