NVIDIA Developer Blog· Tanya Lenz·· 24 天前AI 评分41
何时使用 EPD 分离加速多模态模型服务
When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
AI 导读
Encode-Prefill-Decode(EPD)分离通过拆分视觉编码器阶段与 prefill、decode 阶段,加速多模态模型推理。该技术最适合图像较多的提示、短至中等长度输出,以及量化 MoE 模型。NVIDIA Dynamo 实践指南进一步说明了 EPD 分离的使用时机与方法。
来源:NVIDIA Developer Blog · developer.nvidia.com