NVIDIA Developer Blog· Elizabeth Goodman·· 18 天前AI 评分23
Dense 模型与 MoE 模型:活跃参数、吞吐量及选择依据
Dense vs. MoE Models: Active Parameters, Throughput, and When to Choose Each
AI 导读
Nemotron 3.5 Lightning 采用 Mixture-of-Experts(MoE)架构,每个 token 仅激活总参数量 30B 中的 3B,同时利用更大模型的容量。Dense 模型与 MoE 模型的主要差异在于参数组织方式,模型如何组织参数会显著影响其计算方式与吞吐量,选择时应结合具体需求评估。
来源:NVIDIA Developer Blog · developer.nvidia.com