vLLM 官方博客· Inferact and the vLLM Team·· 21 小时前精选AI 评分65
vLLM 支持 DeepSeek-V4.1-Flash:通过系统与内核优化实现 5.3× 通量提升
DeepSeek-V4.1-Flash on vLLM: 5x Agentic Throughput Since Day 0
AI 导读
vLLM 团队在 DeepSeek-V4.1-Flash 发布三周内,通过 SWA bounded replay、CUDA graphs 和新内核集成(如 MegaAttention、Mega-mHC、Mega-Gate)等优化,在 SemiAnalysis AgentX 基准上实现 5.3× 通量提升。
推荐理由
vLLM 团队结合 DeepSeek 新内核与系统优化,在 AgentX 基准上实现 5.3× 通量提升,读者可参考其 SWA 重放与 CUDA graphs 等方法优化自身推理部署。
来源:vLLM 官方博客 · vllm.ai