AI 快讯 编译自 aws_ml_blog #模型训练#强化学习#AWS

部署 Amazon Nova 多轮强化学习基础设施:AWS SageMaker HyperPod 实战指南

本文介绍如何在 AWS SageMaker HyperPod 上部署多轮强化学习(Multi-Turn RL)基础设施,使用 Amazon Nova Forge 训练智能体。通过事件驱动管道,上传数据即可自动训练。适合需要自定义训练环境的企业用户,提供完整架构、部署步骤和成本分析。

编译发布 2026/07/06 原文发布 2026/07/06

一句话看懂

AWS 发布基于 SageMaker HyperPod 的多轮 RL 基础设施,用 Amazon Nova Forge 训练能执行多步任务的智能体,上传数据即可自动训练。

详细发生了什么

企业级智能体需要执行多步工作流:查询数据库、调用 API、交叉验证结果、从失败中恢复。传统 RLHF 只优化单次响应,无法处理这类序列决策问题。多轮强化学习(Multi-Turn RL)通过优化整个交互序列来弥补这一缺口,让智能体学会工具编排、错误恢复和多步推理。

AWS 在 SageMaker AI 中已提供全托管的多轮 RL 能力,但本文面向需要完全控制训练栈的用户——自定义 agent 环境、自定义编排、特定实例配置。解决方案是两阶段基础设施:

  • Phase 1(一次性部署):通过 AWS CDK 创建 VPC、EKS/HyperPod 集群、ECS on Fargate、S3 存储桶、IAM 角色、Step Functions 管道和 EventBridge 规则。
  • Phase 2(每次训练):上传数据到 S3 触发事件,自动拉起临时计算资源,训练完成后释放。

训练流程涉及三个计算层:

  1. SageMaker HyperPod (EKS):P5 实例运行 vLLM 生成和 GRPO 权重更新。
  2. ECS on Fargate:运行奖励环境(如 Wordle 或自定义 BYOO 环境),通过 SQS 接收模型响应并返回奖励信号。
  3. Amazon Nova Forge SDK:代理层在模型和奖励环境之间路由消息,跟踪对话状态。

示例训练任务让模型学会玩 Wordle,作为自定义 RL 任务的占位符。

中文圈视角

这套方案对国内用户有参考价值,但直接使用门槛较高:

  • 可用性:Amazon Nova 系列模型目前未在中国区开放,需要海外 AWS 账号和 Nova Forge 订阅。国内用户可关注阿里云 PAI 或百度千帆的类似能力,但暂无直接对标产品。
  • 成本:每小时 $786-$1180(约 5600-8400 元人民币),10 台 ml.p5.48xlarge 实例,对个人开发者不友好,适合预算充足的企业。
  • 平替思路:国内团队可参考其架构设计,用国产 GPU(如昇腾 910B)和 ModelScope 社区工具搭建类似管道。但多轮 RL 框架(如 GRPO)和事件驱动编排的成熟度仍有差距。
  • 场景价值:中文场景中,多轮 RL 可用于客服智能体、金融风控多步验证、医疗问诊等需要序列决策的任务,但数据隐私和合规要求可能限制直接使用 AWS 方案。

一个未被广泛讨论的盲点:多轮 RL 的训练效率高度依赖奖励函数设计,而中文环境下的奖励模型(如基于中文语义的评分器)尚不成熟,这可能是国产替代的突破口。

几条值得记住的细节

  1. 基础设施成本:运行时每小时 $786-$1180(10-12 台 ml.p5.48xlarge),不训练时务必销毁堆栈。
  2. 部署时间:Phase 1 约 30-40 分钟,其中 EKS 集群创建约 15 分钟,HyperPod 集群配置约 15-25 分钟。
  3. 实例要求:至少 10 台 ml.p5.48xlarge,生产环境建议 12-14 台;也支持 ml.p5en.48xlarge。
  4. 训练参数:支持 RFT_MULTITURN_FULL 和 RFT_MULTITURN_LORA 两种方法,默认 max_steps=10,global_batch_size=64。
  5. 自定义环境:通过 BYOO(Bring Your Own Orchestrator)支持自定义奖励环境,需放在 custom-environments/ 目录下。

一句话总结

多轮 RL 基础设施让企业能训练真正的多步智能体,但成本高昂,国内用户更适合参考架构而非直接部署。