NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,吞吐量提升 2 倍
NVIDIA 推出 Nemotron-Labs-3-Puzzle-75B-A9B,一种压缩版混合 MoE 模型。通过迭代式结构压缩与知识蒸馏,总参数量从 120.7B 降至 75.3B,在 8×B200 节点上实现 2.03 倍服务器吞吐量,单 H100 可并发处理 8 个 1M token 请求。了解其技术细节、性能表现及对中文用户的潜在影响。
一句话看懂
NVIDIA 发布压缩版混合 MoE 模型 Puzzle-75B-A9B,参数量减少 38%,在保持用户吞吐量的前提下,服务器吞吐量提升 2 倍,单 H100 的 1M token 并发从 1 提升至 8。
详细发生了什么
NVIDIA AI 团队发布了 Nemotron-Labs-3-Puzzle-75B-A9B,这是 Nemotron-3-Super 的压缩变体。原始模型总参数量 120.7B,激活参数 12.8B;压缩后总参数 75.3B,激活参数 9.3B。模型保留了 88 个块的混合布局(40 Mamba、40 MoE、8 Attention),但内部容量被剪枝:Mamba SSM 状态大小从 128 降至 96,MoE 路由专家中间尺寸从 2688 降至 1280-2688,激活专家数从 22 降至 4-18。
性能方面,在单 8×B200 节点上,8K/64K 输入输出场景下,用户吞吐量 ≥100 tok/s 时,总吞吐量从 20,939 tok/s 提升至 42,601 tok/s,提升 2.03 倍。在单 H100 上,1M 上下文时,NVFP4 权重从 70GB 降至 44.5GB,并发请求数从 1 增至 8。
压缩方法名为 Iterative Puzzle,是一种迭代式神经架构搜索。它交替进行硬件感知的结构压缩和短知识蒸馏恢复,分三个阶段逐步压缩,最终在 10 个基准测试上平均得分 69.05,优于单步压缩的 68.48。恢复阶段使用 30% 预训练数据和 70% SFT 数据,训练了最多 100B token,并进行了 RL 后训练。
中文圈视角
这个模型对中文用户意味着什么?首先,模型已开源在 Hugging Face,提供 BF16、FP8 和 NVFP4 三个 checkpoint,但需要 NVIDIA 高端硬件(B200 或 H100)才能发挥优势,国内用户获取这些硬件可能受限。国产替代方面,DeepSeek 的 MoE 模型(如 DeepSeek-V2)在参数量和效率上也有竞争力,但 Puzzle 的压缩方法值得借鉴。
具体到中文场景:模型在 SWE-Bench 上仅下降 2.6 分,说明编程能力保持较好,对中文开发者可能有用。但 Arena-Hard-V2 下降 4.2 分,可能影响中文对话质量。此外,模型支持 1M token 上下文,对长文档处理(如中文法律合同、学术论文)有潜力,但需要关注数据安全和合规问题——模型权重需从 Hugging Face 下载,可能涉及数据出境。
一个中文圈尚未讨论的盲点:Iterative Puzzle 方法中的知识蒸馏使用了 Nemotron-3-Nano 的 SFT 数据,但中文数据占比未知。如果中文用户想微调该模型,可能需要补充中文指令数据。
几条值得记住的细节
- 总参数从 120.7B 降至 75.3B,激活参数从 12.8B 降至 9.3B,压缩比分别为 62.4% 和 73.1%。
- 在 8×B200 节点上,8K/64K 场景下吞吐量提升 2.03 倍(≥100 tok/s)至 2.14 倍(≥125 tok/s)。
- 单 H100 上,1M token 并发从 1 增至 8,聚合解码吞吐量约为原始模型的 4 倍。
- 迭代式压缩分三步:MoE 权重降至 75%→60%,激活专家预算降至 50%,每步后分别用 24B、43.2B、52.8B token 恢复。
- 模型提供 FP8 W8A8(Hopper)和 NVFP4 W4A4(Blackwell)两种量化版本,NVFP4 在 H100 上因内存限制仍被使用。
一句话总结
NVIDIA 的 Puzzle 压缩技术让大模型更省资源,如果你有高端 NVIDIA 显卡,这个开源模型值得一试。