NVIDIA 发布 Molt:PyTorch 原生 Agentic RL 框架,代码量仅 8.6K 行
NVIDIA NeMo 团队推出 Molt,一个 PyTorch 原生的 agentic 强化学习框架,代码量仅 8.6K 行,相比 verl 缩小约 7 倍。Molt 组合 Ray、vLLM 和 AutoModel,支持 token 级精确轨迹,吞吐量与 Megatron 相当。本文解析其设计亮点、对中文圈研究者的意义及部署门槛。
一句话看懂
NVIDIA 发布 Molt,一个 PyTorch 原生的 agentic 强化学习框架,代码仅 8.6K 行,比 verl 小约 7 倍,旨在降低算法迭代成本。
详细发生了什么
Agentic RL 研究需要频繁修改算法,但在主流框架中,每次改动都要穿透 trainer、分布式后端和 rollout 胶水层,成本高昂。NVIDIA NeMo 团队推出的 Molt 直接针对这一痛点,设计目标是将代码库压缩到研究者能完全掌握、AI 编程助手能整体阅读的程度。
Molt 的 RL 代码量约 8.6K 行(通过从各框架 RL 入口追踪 import 图测得),相比之下 verl 约 62K 行、slime 约 25K 行、OpenRLHF 约 7.2K 行。它组合了 Ray(用于调度和异步队列)、vLLM(用于 rollout)和 NVIDIA AutoModel(配合 FSDP2 训练),三者均未 fork,上游更新只需更新容器版本。
运行时采用 agent 池、vLLM 引擎组和单一可训练策略 actor。部分 rollout 会暂停引擎,通过 NCCL 广播 actor 分片,并恢复保留的请求而非丢弃。Agent 是普通 Python 模块,支持 Env 和 ChatAgent 两种形式,后者可通过标准 OpenAI 或 Anthropic SDK 训练,通过 loopback 服务器实现 token 级精确累积。
Molt 强调三个正确性不变量:token 身份(轨迹由采样 token id 定义)、策略版本语义(可训练 token 保持行为策略 log-probabilities)、前向一致性(rollout 和 actor 模型语义一致)。对于 MoE 策略,Molt 采用 rollout routing replay,让 vLLM 返回每个 token 的 expert id,训练前向重放,避免路由不一致。
吞吐量与基于 Megatron 的堆栈统计相当,但披露了 MoE 不匹配的注意事项。规模可通过 flag 调整,同一循环支持从 4B 稠密模型到 700B MoE(—fsdp.ep_size 256)。Molt 以 Apache 2.0 协议发布,附带 launch codes、Slurm 脚本和预构建容器,但定位为研究基础设施,硬件门槛较高,默认配置需要 2 节点 8 张 H100 GPU。
中文圈视角
Molt 的发布对国内 AI 研究者和开发者有几点启示。首先,代码量小意味着更容易被理解和二次开发,对于想深入 agentic RL 底层的中文开发者,Molt 是一个比 verl 更友好的学习范本,无需梯子即可从 GitHub 获取源码。
其次,国内已有类似工作,如 OpenRLHF(代码量 7.2K 行)在中文社区有较高知名度,Molt 与其定位相似,但组合了 NVIDIA 生态(AutoModel、FSDP2),对使用 NVIDIA GPU 的国内实验室更友好。不过,Molt 的硬件门槛(2 节点 8×H100)对大多数国内学术实验室偏高,可能限制其普及。
对中文用户的具体场景,Molt 支持多轮 tool-use agent、代码执行 agent 和视觉-语言环境(如 geo3k),这些在中文的 agent 应用中同样关键。但需注意,Molt 的文档和示例目前以英文为主,中文社区可能需要额外的翻译和适配工作。此外,国内使用 vLLM 和 Ray 已很普遍,Molt 的组合方式对中文开发者并不陌生,但 AutoModel 的依赖可能让部分用户转向纯开源替代。
几条值得记住的细节
- Molt 的 RL 代码量约 8.6K 行,比 verl(62K)小约 7 倍,比 OpenRLHF(7.2K)略大。
- 组合 Ray、vLLM、AutoModel,均未 fork,上游更新通过容器 pin 实现。
- 支持 Env 和 ChatAgent 两种 agent 形式,ChatAgent 可使用标准 OpenAI/Anthropic SDK。
- 默认配置需要 2 节点 8×H100 GPU,训练和 rollout 各占 8 张。
- 通过 rollout routing replay 解决 MoE 策略的路由不一致问题。
一句话总结
Molt 让 agentic RL 研究更轻量,但硬件门槛高,适合有 H100 资源的实验室和团队。