AI 快讯 编译自 the_decoder #模型发布#机器人#世界模型

北京智源发布Orca世界模型:无动作标签训练,机器人任务性能媲美专用系统

北京智源人工智能研究院推出Orca世界模型,仅用12.5万小时视频训练,无需任何动作标签,即可在五项机器人任务上达到专用模型π0.5的水平。本文解读Orca的技术突破、对中文圈机器人研发的意义及数据短缺问题的潜在解决方案。

编译发布 2026/07/11 原文发布 2026/07/11

一句话看懂

北京智源发布Orca世界模型,仅靠视频学习预测世界状态,无需动作标签,在机器人任务上媲美专用系统。

详细发生了什么

北京智源人工智能研究院(BAAI)发布了名为Orca的世界模型。与传统模型预测token或像素不同,Orca直接预测抽象的“世界状态”——即场景中物体的位置、关系等高层语义信息。

Orca的训练数据来自12.5万小时的机器人操作视频,但没有使用任何动作标签(如“抓取”“移动”)。这意味着模型仅通过观察视频中的状态变化,自主学习理解物理世界的动态规律。

在五项机器人任务(如桌面整理、物体堆叠等)的测试中,Orca的表现与专门训练的π0.5模型持平。π0.5是一个针对具体任务精心调优的模型,而Orca是通用世界模型,无需针对每个任务单独训练。

这一成果有望缓解机器人领域长期面临的数据短缺问题——标注动作标签成本极高,而Orca证明了无监督学习在机器人理解世界方面的巨大潜力。

中文圈视角

Orca的发布对中文圈机器人研发有直接意义:

  1. 降低数据门槛:国内机器人公司常因缺乏高质量标注数据而进展缓慢。Orca的无标签训练方法意味着可以利用海量现成的视频数据(如工厂操作录像、家庭演示视频)来训练模型,大幅降低数据成本。

  2. 国产替代与对标:目前国内机器人世界模型领域,智谱、深蓝等公司也有布局,但Orca是首个公开宣称无需动作标签即可达到专用模型性能的成果。这为中文圈提供了一条不同于Google RT-2、OpenAI VLA等路线的技术路径。

  3. 应用场景:对于中文用户,Orca可应用于智能家居(如自动洗碗、整理)、工业自动化(如分拣、装配)以及教育机器人(通过观察学习新技能)。不过,目前模型尚未开源,实际部署需关注后续开放计划。

  4. 合规盲点:训练视频可能涉及隐私或商业敏感内容,国内企业在使用类似方法时需注意数据合规,避免采集未经授权的视频。

几条值得记住的细节

  • Orca训练数据量:125,000小时视频,无任何动作标签。
  • 测试任务:五项机器人操作任务,与专用模型π0.5性能持平。
  • 核心创新:预测抽象世界状态(物体位置、关系),而非像素或token。
  • 潜在影响:缓解机器人领域的数据短缺,降低研发成本。
  • 发布方:北京智源人工智能研究院(BAAI),国内AI研究重要机构。

一句话总结

Orca让机器人通过“看视频”学会理解世界,中文圈机器人公司可借此降低数据成本,加速落地。