跳到正文
vLLM 官方博客· vLLM Team·· 14 天前AI 评分51

vLLM 发布 Qwen3.8-2.4T 的 PD 服务性能结果

PD Serving of Qwen3.8-2.4T

AI 导读

vLLM 团队在 GB300 NVL72 集群上完成了 Qwen3.8-2.4T 模型的 PD 服务性能测试,实现了每 GPU 5000 总 token 吞吐量和每用户 180 生成 token/秒的低延迟表现,并公开了可复现的 srt-slurm 配置与调优流程。

来源:vLLM 官方博客 · vllm.ai