AI 快讯 编译自 aws_ml_blog #机器人训练#强化学习#AWS SageMaker

NVIDIA Isaac Lab 结合 Amazon SageMaker AI 规模化训练机器人强化学习:Unitree H1 人形机器人案例

本文介绍如何利用 NVIDIA Isaac Lab 在 Amazon SageMaker AI 上训练 Unitree H1 人形机器人策略,涵盖 SageMaker HyperPod 和 Training Jobs 两种计算选项。了解物理 AI 从研究到生产的规模化路径,以及中文用户如何借鉴此方案进行机器人强化学习训练。

编译发布 2026/06/09 原文发布 2026/06/09

一句话看懂

NVIDIA Isaac Lab 与 Amazon SageMaker AI 结合,为 Unitree H1 人形机器人提供从迭代实验到生产级训练的强化学习方案,大幅降低基础设施管理负担。

详细发生了什么

物理 AI 正从研究走向生产。机器人在高保真仿真中训练后部署到工厂、仓库和物流中心,因为真实世界训练慢、贵且不安全,而 GPU 加速仿真可将数月学习压缩至数小时。这使计算成为关键挑战。

Amazon SageMaker AI 提供两种计算选项:

  • SageMaker HyperPod:专为分布式训练设计的托管基础设施,具备节点健康监控、自动故障恢复和自动恢复功能,适合长时间生产级训练。
  • SageMaker Training Jobs:完全托管的按需训练作业,每次运行自动分配 GPU 实例,结束后释放资源,适合快速迭代和超参数调优。

NVIDIA Isaac Lab 是一个开源机器人学习框架,基于 Isaac Sim,可在单个或多个 GPU 上同时运行数千个机器人实例。示例任务为 Isaac-Velocity-Rough-H1-v0,让 Unitree H1 人形机器人在粗糙地形上学习跟踪速度指令,使用 PPO 算法通过 skrl 训练。

解决方案包含一个 Docker 镜像和生成脚本,可在 HyperPod 或 Training Jobs 上运行。训练指标可流式传输到 SageMaker 托管的 MLflow 进行实验跟踪。

中文圈视角

对国内机器人团队来说,这套方案有几点值得关注:

  1. 平替与门槛:AWS 服务在国内需合规使用,但方案本身是开源的(GitHub 仓库),可移植到其他 Kubernetes 环境或国产云平台(如阿里云 ACK、华为云 CCE)。核心是 NVIDIA Isaac Lab,它本身支持多 GPU 仿真,国内团队可直接使用。

  2. 国产机器人适配:Unitree H1 是宇树科技的人形机器人,国内用户对此更熟悉。方案中的训练任务可直接用于宇树机器人,或修改后适配其他国产机器人(如小米 CyberOne、傅利叶 GR-1)。

  3. 基础设施对比:国内云厂商(阿里云、腾讯云)也提供类似 SageMaker 的托管训练服务,但 HyperPod 的自动故障恢复和自动恢复功能是差异化优势。对于长周期 RL 训练,节点故障恢复能力至关重要。

  4. 中文社区盲点:目前中文资料多聚焦于单机仿真训练,分布式 RL 训练的最佳实践较少。此方案提供了完整的分布式训练代码和配置,值得国内机器人团队参考。

几条值得记住的细节

  • 训练镜像基于 nvcr.io/nvidia/isaac-sim:5.1.0,并安装 Isaac Lab v2.3.2。
  • HyperPod 使用 Kubeflow Training Operator 注入 MASTER_ADDR、MASTER_PORT、RANK、WORLD_SIZE 等环境变量。
  • Training Jobs 通过 resource config 解析分布式拓扑,两者最终调用相同的 torchrun 命令。
  • 实验跟踪可选 SageMaker 托管的 MLflow,也可禁用。
  • 完整代码在 GitHub 仓库中,包含 Dockerfile、配置文件和生成脚本。

一句话总结

如果你在训练人形机器人或复杂 RL 策略,这套方案提供了从快速实验到生产部署的完整基础设施,且代码开源可移植。