Prime Intellect 发布 prime-rl 0.6.0:开源框架支持万亿参数 MoE 模型强化学习训练
Prime Intellect 推出 prime-rl 0.6.0,一个用于万亿参数 MoE 模型异步强化学习的开源框架。该框架在 28 个 H200 节点上训练 GLM-5 模型,支持 131k 序列长度,步骤时间低于 5 分钟。本文详解其 FP8 推理、专家并行、预填充/解码分离等优化技术,并探讨对中文圈用户的实际意义。
一句话看懂
Prime Intellect 发布 prime-rl 0.6.0,一个开源异步强化学习框架,可在 28 个 H200 节点上训练万亿参数 MoE 模型,步骤时间低于 5 分钟。
详细发生了什么
Prime Intellect 发布了 prime-rl 0.6.0,这是一个用于异步强化学习的开源框架,专门针对万亿参数级 Mixture-of-Experts(MoE)模型设计。该框架聚焦于长周期智能体任务,例如软件工程任务。研究团队使用该框架在 SWE 任务上训练了 GLM-5 模型,序列长度达到 131k,步骤时间低于 5 分钟,批次大小为 256 个 rollout,仅使用 28 个 H200 节点。
prime-rl 0.6.0 的核心优化包括:推理端采用 FP8 精度、Wide Expert Parallelism(专家并行)、预填充/解码分离、KV 缓存卸载和路由器重放;训练端采用 3-D 并行(FSDP、EP、CP)和块缩放 FP8。这些优化使得在有限硬件上训练超大规模模型成为可能。
中文圈视角
对于中文圈用户,prime-rl 0.6.0 的开源特性意味着可以基于它训练或微调国产 MoE 模型,例如 GLM-5、Kimi-K2.7-Code 等。目前国内类似框架较少,且多依赖闭源方案。该框架的异步 RL 设计特别适合长序列、多轮交互的智能体任务,如代码生成、自动化测试等。
然而,直接使用需要 Slurm 集群和 H200 等高端 GPU,国内用户可能面临硬件获取和成本问题。此外,框架依赖的 DeepEP、DeepGEMM 等库对 CUDA 版本有要求,部署门槛较高。但长远看,该框架为国内大模型厂商提供了一条低成本训练万亿参数模型的路径,尤其适合需要强化学习后训练的场景。
几条值得记住的细节
- 框架支持异步 RL,训练器和推理系统解耦,可独立扩展,避免 GPU 空闲。
- 推理优化包括 FP8 精度、Wide Expert Parallelism(专家分布在 ≥32 个 GPU 上)、预填充/解码分离。
- 训练使用 3-D 并行:FSDP 分摊参数和梯度,EP 分摊专家,CP 分摊序列维度。
- 路由器重放(R3)技术将推理路由决策回放给训练器,将 KL 散度降低约一个数量级。
- 完整 GLM-5.1 训练只需一条命令,但需要 Slurm 集群环境。
一句话总结
prime-rl 0.6.0 让万亿参数 MoE 模型的强化学习训练变得可行且高效,尤其适合长序列智能体任务,但国内用户需注意硬件和部署门槛。