AI 快讯 编译自 marktechpost #机器人#框架发布#NVIDIA

NVIDIA 发布 ASPIRE 机器人框架:零样本长任务成功率 31%,代码自修复加技能库复用

NVIDIA 联合多所高校推出 ASPIRE 框架,让机器人通过编写、调试程序并提炼可复用技能库,在 LIBERO-Pro 长任务上零样本达 31%,较此前方法提升近 8 倍。本文解析其工作原理、关键结果及对中文圈机器人开发者的启示。

编译发布 2026/07/04 原文发布 2026/07/04

一句话看懂

NVIDIA 联合多所高校推出 ASPIRE 框架,让机器人通过编写、调试程序并提炼可复用技能库,在 LIBERO-Pro 长任务上零样本达 31%,较此前方法提升近 8 倍。

详细发生了什么

传统机器人编程难以规模化,需要手动协调多模态感知、接触动力学、多样化配置和执行失败。Code-as-policy 系统让语言模型将这些组合成可执行程序,使行为可检查、可编辑、可调试。但现有机器人编码代理运行在简单执行环境中,只接收粗粒度的任务级反馈——一次失败只告诉任务失败,不告诉原因。根因可能是感知、运动规划、抓取、接触动力学或长时协调。此外,这些系统在任务结束后丢弃修复,因此代理解决第 100 个任务时并不比第一个更有经验。

来自 NVIDIA、密歇根大学、UIUC、UC Berkeley 和 CMU 的研究团队提出 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),这是一个持续学习系统,能编写和优化机器人控制程序,并将验证过的修复提炼为可复用、可迁移的技能库。ASPIRE 运行一个开放式的学习循环,包含三个组件:协调器-执行器架构、闭环机器人执行引擎、技能库和进化搜索。在仿真中,编码代理使用 Claude Code 搭配 Claude Opus 4.6 和 1M token context window,程序基于 CaP-X 框架(开源 code-as-policy 框架,构建于 MuJoCo Playground 之上)。代理不能读取仿真器 ground truth,也不能读取物理引擎状态或 .bddl、.xml、.urdf 等资产文件——规则是:真实机器人用摄像头能做的事才允许。

基准测试结果:在 LIBERO-Pro 上,ASPIRE 在 Object 套件上比最强基线提升高达 77 个百分点,在 Goal 上提升 41.5 点,Spatial 上提升 42.5 点。在 Robosuite 上,双手交接任务从 20% 升至 92%。在 BEHAVIOR-1K 上,收音机拾取任务从 56% 升至 88%。零样本结果尤为突出:复用 LIBERO-90 积累的技能,ASPIRE 在未见过的 LIBERO-Pro Long 任务上达到约 31%,而此前方法饱和在约 4%。

真实机器人技能迁移测试中,三个仿真发现的技能被迁移到真实双臂 YAM 工作站(使用 OpenAI Codex GPT-5.5 作为编码代理)。技能迁移后,易拉罐提升从 13/20 改善到 19/20,同时 token 消耗减少约 10 倍;抽屉打开从 0/20 提升到 11/20(基线从未成功)。

中文圈视角

ASPIRE 对中文圈机器人开发者意味着什么?首先,框架本身基于开源组件(CaP-X、MuJoCo Playground),理论上可复现。但核心编码代理依赖 Claude Code 和 Claude Opus 4.6,国内用户需通过 API 访问,存在网络和合规门槛。国产替代方面,可考虑使用 DeepSeek-Coder 或 Qwen2.5-Coder 作为编码代理,但需验证其在复杂机器人调试场景下的效果。

其次,ASPIRE 的技能库设计(存储局部修复而非完整任务程序)对国内机器人公司有直接参考价值。例如,在仓储物流、家庭服务机器人场景中,常见故障模式(如抓取失败、导航碰撞)可积累为可复用技能,减少重复调试成本。国内类似工作如清华的 RoboAgent 或华为的机器人平台,可借鉴其“进化搜索”机制来避免陷入局部修复循环。

最后,零样本迁移能力对中文用户的实际意义在于:若能在仿真中积累足够多样的技能库,部署到真实机器人时可大幅减少现场调试时间。但需注意,ASPIRE 的零样本结果(31%)仍远低于有监督水平,且依赖大规模仿真环境(LIBERO-90 含 90 个任务)。国内团队若缺乏类似规模的仿真数据集,直接复现效果可能打折扣。

几条值得记住的细节

  • 核心创新:ASPIRE 用 per-primitive multimodal traces 替代粗粒度反馈,让代理定位失败根因,而非猜测。
  • 技能库存储:每个技能包含失败特征、触发条件、修复策略和代码草图,而非完整任务程序。
  • 进化搜索:每轮生成 K 个候选程序,基于最优程序及其剩余失败轨迹,避免陷入局部修复。
  • 零样本结果:在 LIBERO-Pro Long 上达 31%,此前方法仅约 4%,提升近 8 倍。
  • 真实迁移:仿真技能迁移到不同实体和 API 的真实机器人,token 消耗减少约 10 倍。

一句话总结

ASPIRE 让机器人像程序员一样调试代码并积累经验,零样本长任务能力大幅提升,但中文用户需关注 API 依赖和仿真数据门槛。