跳到正文
原文
NVIDIA Developer Blog· Tanya Lenz·· 19 天前AI 评分24

使用 NVIDIA Transformer Engine 在 JAX 中加速无 Dropout 的 MoE 训练

Accelerating Dropless MoE Training in JAX with NVIDIA Transformer Engine

AI 导读

内容聚焦使用 NVIDIA Transformer Engine 在 JAX 中加速无 Dropout 的 Mixture of experts(MoE)训练。MoE 通过条件计算实现高效训练,文中提及 DeepSeek、Qwen 和 Mixtral 等模型,并指出其训练计算需求可降至稠密模型对应水平的一定比例。

来源:NVIDIA Developer Blog · developer.nvidia.com