跳到正文
原文
NVIDIA Developer Blog· Elizabeth Goodman·· 18 天前AI 评分23

Dense 模型与 MoE 模型:活跃参数、吞吐量及选择依据

Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each

AI 导读

Nemotron 3.5 Lightning 采用 Mixture-of-Experts(MoE)架构,每个 token 仅激活总参数量 30B 中的 3B,同时利用更大模型的容量。Dense 模型与 MoE 模型的主要差异在于参数组织方式,模型如何组织参数会显著影响其计算方式与吞吐量,选择时应结合具体需求评估。

来源:NVIDIA Developer Blog · developer.nvidia.com