NVIDIA · 开发者博客· Tanya Lenz·· 25 天前AI 评分24
NVIDIA Dynamo 何时使用 Encode-Prefill-Decode 解耦以加速多模态模型推理
When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
AI 导读
NVIDIA 介绍了使用 Encode-Prefill-Decode (EPD) 解耦技术来优化多模态模型推理。该技术将视觉编码器阶段与预填充和解码阶段分离,尤其适用于图像密集型提示词、中短输出及量化 MoE 模型。结合 NVIDIA Dynamo 使用,可实现高达 5 倍的推理加速。
来源:NVIDIA · 开发者博客 · developer.nvidia.com