NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,吞吐量提升 2 倍
NVIDIA 推出 Nemotron-3-Super 的压缩版 Puzzle-75B-A9B,总参数量从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B。在单节点 8x B200 上吞吐量提升 2.03 倍,单卡 H100 上 1M token 并发从 1 请求增至 8 请求。本文详解压缩技术、性能数据和部署要点。
一句话看懂
NVIDIA 发布 Nemotron-3-Super 的压缩版 Puzzle-75B-A9B,总参数减少 37%,活跃参数减少 27%,在 8x B200 节点上吞吐量提升 2.03 倍,单 H100 上 1M token 并发从 1 增至 8。
详细发生了什么
NVIDIA AI 团队发布了 Nemotron-Labs-3-Puzzle-75B-A9B,这是 Nemotron-3-Super 的压缩变体。原始模型总参数 120.7B,活跃参数 12.8B;压缩后总参数 75.3B,活跃参数 9.3B。模型保留了 88 层的混合架构(40 Mamba + 40 MoE + 8 Attention)。
压缩目标有两个:在 100 tok/s 每用户下实现 2 倍服务器吞吐量,以及在单张 H100 上支持 8 个并发 1M token 请求。实际测试中,在 8x B200 节点上,8K/64K 场景下吞吐量达到 2.03 倍(UT>=100),最高 2.14 倍;在单 H100 上,1M token 并发从 1 提升到 8,聚合解码吞吐量约为原始模型的 4 倍。
压缩方法采用 Iterative Puzzle 框架,交替进行硬件感知的结构压缩和短知识蒸馏恢复。分三个阶段:MoE 权重压缩至 75%、Mamba SSM 状态压缩至 75%,然后 MoE 权重至 60%,最后激活路由专家预算降至 50% 并异构分配。每个阶段后使用 24-52.8B token 进行知识蒸馏恢复。
基准测试显示,在 10 个基准上 Iterative Puzzle 平均得分 69.05,优于单步 Puzzle 的 68.48。主要损失在 Arena-Hard-V2(-4.2)和 SWE-Bench(-2.6),而 RULER 和 AA-LCR 几乎不变。
部署方面,提供了 FP8(W8A8)和 NVFP4(W4A4)两种量化方案。NVFP4 权重从 70 GB 降至 44.5 GB,使得单 H100 上 1M token 并发成为可能。
中文圈视角
对国内用户来说,这个模型的意义在于低成本部署高性能 MoE 模型。Nemotron-3-Super 原本需要多卡 B200 才能流畅运行,现在 Puzzle-75B-A9B 在单 H100 上就能处理 8 个 1M token 长上下文请求,大幅降低了硬件门槛。
国内类似工作可以参考 DeepSeek-V2 的 MoE 压缩或 Qwen 的量化版本,但 Puzzle 的 Iterative 压缩+蒸馏方法更系统化。对于有 H100 或 B200 资源的团队(如阿里云、字节跳动),可以直接在 Hugging Face 下载 BF16/FP8/NVFP4 三个 checkpoint 进行部署。
需要注意:模型基于 Nemotron-3-Super,其训练数据包含大量英文,中文能力可能不如国内模型。但长上下文(1M token)和高吞吐特性对文档分析、代码库理解等场景非常有用。合规方面,模型权重可本地部署,不涉及数据出境问题。
一个中文圈尚未讨论的盲点:Puzzle 方法对 Mamba 层的 SSM 状态压缩(128→96)在解码时带来 1.2-1.3 倍加速,这对混合架构的推理优化有参考价值,国内 Mamba 类模型(如 RWKV)可借鉴。
几条值得记住的细节
- 参数压缩:总参数从 120.7B 降至 75.3B(62.4%),活跃参数从 12.8B 降至 9.3B(73.1%)。
- 吞吐提升:8x B200 上 8K/64K 场景吞吐量 2.03 倍(UT>=100),最高 2.14 倍。
- 单 H100 并发:1M token 并发从 1 请求增至 8 请求,NVFP4 权重仅 44.5 GB。
- Iterative Puzzle:三阶段压缩+蒸馏,比单步 Puzzle 平均高 0.57 分。
- 量化方案:提供 FP8(W8A8)和 NVFP4(W4A4)两种,NVFP4 用于 H100 长上下文场景。
一句话总结
Puzzle-75B-A9B 让原本昂贵的 Nemotron-3-Super 在单卡 H100 上也能高效运行,长上下文和高吞吐特性对文档处理场景极具吸引力。