NVIDIA 发布融合内核提升 MoE 训练吞吐量,加速大模型规模化
NVIDIA 推出高级融合内核,显著提升混合专家(MoE)模型训练吞吐量。本文详解技术原理、性能提升数据,并分析对国内大模型训练与国产 GPU 生态的启示。
一句话看懂
NVIDIA 发布融合内核优化 MoE 训练,吞吐量提升 2-3 倍,降低通信开销,加速大模型规模化。
详细发生了什么
混合专家(MoE)模型已成为现代大规模 AI 系统的核心组件,通过为每个 token 仅激活部分参数,在有限算力下实现更大模型容量。但 MoE 训练面临严重的通信瓶颈:专家并行(expert parallelism)中,token 需要在不同 GPU 间动态路由,导致大量 all-to-all 通信,降低 GPU 利用率。
NVIDIA 研究团队开发了一套高级融合内核(advanced fusion kernels),将多个计算与通信操作融合为单一内核,减少内核启动开销和全局内存访问。具体技术包括:
- 融合门控与路由:将门控网络(gating network)和 token 路由逻辑合并,减少中间数据写回。
- 融合专家计算:将同一专家内的多个操作(如线性层、激活函数)融合,提升计算密度。
- 优化 all-to-all 通信:利用 NVLink 和 NCCL 的异步特性,将通信与计算重叠。
在 8 节点 DGX H100(64 块 H100 GPU)上,使用 32 专家、Top-2 路由的 MoE 模型测试,训练吞吐量相比基线提升 2.1 倍(FP16)和 3.0 倍(FP8)。显存占用降低约 15%,通信时间占比从 40% 降至 15%。
中文圈视角
这项技术对国内大模型训练有直接参考价值。当前国内主流 MoE 模型(如 DeepSeek-V2、Qwen2-MoE)同样面临通信瓶颈,尤其在国产 GPU(如华为昇腾、寒武纪)集群上,由于互联带宽(HCCS 等)弱于 NVLink,通信开销更为突出。
关键启示:
- 融合内核思路可迁移:NVIDIA 的融合策略不依赖特定硬件特性,国产 GPU 可通过类似优化提升训练效率。
- FP8 训练加速更显著:国内 FP8 支持正在普及(如昇腾 910B),结合融合内核可进一步降低训练成本。
- 平替路径:对于无法使用 H100 的团队,可参考此方法在 A100 或国产 GPU 上实现部分优化,预计吞吐量提升 1.5-2 倍。
注意:NVIDIA 的优化依赖 CUDA 和 NCCL,国产 GPU 需适配对应通信库(如 HCCL)。目前 ModelScope 等社区已有类似探索,但尚未公开成熟方案。
几条值得记住的细节
- 测试环境:8 节点 DGX H100,64 块 H100 GPU,模型为 32 专家、Top-2 路由的 MoE。
- 吞吐量提升:FP16 训练提升 2.1 倍,FP8 训练提升 3.0 倍。
- 通信时间占比从 40% 降至 15%,显存占用降低约 15%。
- 融合内核已集成至 NVIDIA 的 Megatron-LM 框架,开源可用。
- 该优化对专家数量敏感,专家越多(如 64 专家),提升越明显。
一句话总结
NVIDIA 的融合内核让 MoE 训练更快更省显存,国内团队可借鉴思路优化国产 GPU 集群。