NVIDIA GB300 NVL72 创下 MoE 预训练世界纪录:DeepSeek-V3 671B 性能达 1,648 TFLOPs/GPU
NVIDIA GB300 NVL72 在混合专家模型预训练中创下世界纪录,训练 DeepSeek-V3 671B 模型时每 GPU 性能达 1,648 TFLOPs。本文解读该架构如何突破通信瓶颈,以及对中国 AI 训练生态和国产硬件的启示。
一句话看懂
NVIDIA GB300 NVL72 在训练 DeepSeek-V3 671B 模型时实现每 GPU 1,648 TFLOPs,创下 MoE 预训练世界纪录,核心突破在于优化了跨 GPU 通信效率。
详细发生了什么
NVIDIA 宣布其 GB300 NVL72 系统在混合专家(MoE)模型预训练中创下世界纪录。该系统由 72 块 Blackwell GPU 组成,通过 NVLink 和 NVSwitch 实现高速互联。在训练 DeepSeek-V3 671B 模型时,每 GPU 达到 1,648 TFLOPs 的算力利用率。
MoE 架构通过稀疏激活降低每 token 计算量,但增加了通信开销——专家分布在不同的 GPU 上,需要频繁的 all-to-all 通信。GB300 NVL72 的 NVLink 带宽高达 1.8 TB/s,加上优化的通信调度,将通信瓶颈降低了 40% 以上。
测试中,系统在 1,024 块 GPU 集群上实现了接近线性的扩展效率,训练吞吐量相比上一代 H100 提升了 2.5 倍。NVIDIA 表示,这一成绩得益于硬件(更快的互联)和软件(NVIDIA NeMo 框架的通信优化)的协同改进。
中文圈视角
对国内 AI 训练意味着什么? 首先,DeepSeek-V3 是国产模型,NVIDIA 用其作为基准测试,说明该模型在国际上受到认可。但 GB300 NVL72 目前受出口管制,国内无法直接采购。
国产替代方案在哪里? 华为昇腾 910B 在 MoE 训练中面临类似的通信瓶颈,其 HCCS 互联带宽约为 400 GB/s,远低于 NVLink 的 1.8 TB/s。不过,国内厂商如壁仞、燧原也在开发高带宽互联方案,但尚未达到同等规模。
对中文用户的实际影响:短期内,国内大模型厂商(如智谱、百川)训练 MoE 模型时,可能需要通过更激进的模型并行策略或通信压缩算法来弥补硬件差距。长期看,这一纪录会刺激国产 AI 芯片加速互联技术升级。
一个盲点:很多人只关注算力,但 MoE 时代通信才是瓶颈。国内在通信库(如 NCCL 替代品)和调度算法上的投入相对不足,这可能成为未来追赶的关键。
几条值得记住的细节
- 每 GPU 性能达 1,648 TFLOPs,是 H100 的 2.5 倍
- 系统由 72 块 Blackwell GPU 组成,通过 NVLink 互联,带宽 1.8 TB/s
- 通信开销降低 40% 以上,主要得益于硬件和 NeMo 框架优化
- DeepSeek-V3 671B 是 MoE 模型,参数量 671B,激活参数约 37B
- 测试在 1,024 块 GPU 集群上进行,扩展效率接近线性
一句话总结
MoE 模型训练的未来在于通信效率,NVIDIA 用 GB300 NVL72 指明了方向,国产硬件需要加速追赶这一关键指标。