跳到正文
NVIDIA · 开发者博客· Tanya Lenz·· 25 天前AI 评分24

NVIDIA Dynamo 何时使用 Encode-Prefill-Decode 解耦以加速多模态模型推理

When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving

AI 导读

NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。

来源:NVIDIA · 开发者博客 · developer.nvidia.com