跳到正文
原文
NVIDIA Developer Blog· Tanya Lenz·· 24 天前AI 评分41

何时使用 EPD 分离加速多模态模型服务

When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving

AI 导读

Encode-Prefill-Decode(EPD)分离通过拆分视觉编码器阶段与 prefill、decode 阶段,加速多模态模型推理。该技术最适合图像较多的提示、短至中等长度输出,以及量化 MoE 模型。NVIDIA Dynamo 实践指南进一步说明了 EPD 分离的使用时机与方法。

来源:NVIDIA Developer Blog · developer.nvidia.com