Skyfall AI 发布 MORPHEUS:持续强化学习企业仿真基准,应对非平稳环境
Skyfall AI 推出 MORPHEUS,一个持续强化学习(CRL)企业仿真平台,模拟永不重置的运营环境。它通过故障注入和配置偏移制造非平稳性,并用六维评估协议测试 PPO、HER、EWC、LCM 等算法。本文解析其架构、评估方法及对中文圈 AI 应用与研究的启示。
一句话看懂
Skyfall AI 发布 MORPHEUS,一个永不重置的企业仿真基准,让持续强化学习在结构化非平稳环境中成为必需。
详细发生了什么
大多数强化学习基准在每轮结束后重置环境,但真实企业运营从不重置。Skyfall AI 的 MORPHEUS 填补了这一空白。它是一个持续强化学习(CRL)仿真平台,基于 Big World Hypothesis(Javed & Sutton, 2024)。该假设认为,世界复杂度超过任何智能体的表征能力,因此即使动态固定,环境也呈现非平稳性。
MORPHEUS 要求三个核心属性:持久性(过去决策影响未来)、非平稳性(任何固定策略最终都会变次优)、操作复杂性(不存在固定最优策略)。每个环境是一个自包含的 TypeScript 世界插件,通过能力 API 与智能体交互。非平稳性来自两个引擎:故障注入引擎(11 种故障类型,4 种预设速率)和异步配置偏移控制器(独立于训练循环改变故障预设和需求)。奖励由三个原生操作验证器计算:故障事件信号、财务账本状态、资源吞吐量,默认权重 w_f=0.5, w_l=w_p=0.25。
由于动作空间大,纯 RL 从零开始不现实。MORPHEUS 采用两阶段流程:先由前沿模型(Gemini 3.1 pro)用 ReAct 框架收集轨迹,再通过 SFT 微调 Qwen3-14B,所有 RL 运行从此共享检查点开始。评估协议包含六个指标:每配置奖励、适应速度、遗忘、恢复时间、稳定性、性能差距。基线测试了 PPO、HER、EWC、LCM 四种算法,在两项任务上均远低于理论上界(0.50),且没有单一算法全面胜出。
中文圈视角
MORPHEUS 对中文圈 AI 研究者和工程师有直接参考价值。首先,持续强化学习在国内工业场景中需求迫切,例如电商推荐系统、物流调度、金融风控等环境动态变化频繁,传统 episodic RL 难以适应。MORPHEUS 的持久性仿真和故障注入机制,为测试国产模型(如 Qwen、DeepSeek)在类似场景下的持续学习能力提供了标准化工具。
其次,其两阶段训练流程(前沿模型收集轨迹 + 小模型微调)与国内流行的“教师-学生”蒸馏范式类似,但 MORPHEUS 强调后续在线持续学习,这对国内模型部署后的自适应能力评估有启发。目前国内类似基准(如 ModelScope 上的 RL 环境)多侧重单任务或静态场景,MORPHEUS 的非平稳性设计填补了空白。
不过,MORPHEUS 的故障类型和偏移控制器设计基于西方企业 IT 环境(如 rate_limit、dependency_failure),中文用户需评估其在国内云服务(阿里云、腾讯云)和业务逻辑下的适配性。此外,其奖励权重为研究变量,未验证行业目标,国内企业直接套用可能需调整。
几条值得记住的细节
- MORPHEUS 包含 5 个环境,但当前仅评估了 2 个(process-outbound 和 process-inbound)。
- 故障注入有 4 种速率:light (5%)、realistic (8%)、moderate (15%)、aggressive (30%)。
- 理论上界假设零故障、最小成本、满吞吐量,得分为 0.50,所有基线远低于此。
- 适应速度是 headline 指标,定义为运行平均奖励达到上界一半所需的步数。
- 代码已开源:Skyfall-Research/morpheus-evals。
一句话总结
MORPHEUS 为持续强化学习提供了更真实的企业级测试场,但当前算法离理论极限仍有巨大差距。