Dyna Robotics发布Dyna-2:用100万小时人类视频预训练的世界动作模型
Dyna Robotics推出Dyna-2世界动作模型,基于100万小时人类视频预训练,实现跨实体泛化。本文解析其技术突破、部署方式及对中文圈机器人开发者的启示,探讨数据规模与模型性能的关系。
一句话看懂
Dyna Robotics发布Dyna-2,一个基于100万小时人类视频预训练的世界动作模型,显著提升机器人操作能力,但仅通过其商业系统部署,不开放权重。
详细发生了什么
Dyna Robotics推出了Dyna-2,这是一个用于机器人操作的世界动作模型(WAM)。预训练数据超过100万小时的以自我为中心的人类视频,相当于约170年的连续清醒经验。研究团队构建了从1000到100万小时的数据阶梯,验证了三个关键结果:人类数据上的缩放定律、该定律向未见机器人数据的首次迁移,以及视频预测驱动跨实体泛化的证据。
架构上,Dyna-2采用混合Transformer。视频和动作分别token化,使用不同的DiT层堆栈相互关注。训练采用flow matching,视频损失和动作损失共享主干。推理时,策略保持反应式,不生成或关注预测的未来视频。
在机器人测试中,每个阶梯在14个任务上微调,每个任务最多10小时机器人数据,跨三种实体。平均归一化得分从20%提升至53%,在100万小时时在9/14任务上最佳。与Dyna-1相比,早期Dyna-2在7个任务上成功率提高1.55倍,等级提高1.12倍。蒸馏流程将视频采样时间从10,203毫秒降至110毫秒(单张H100)。
中文圈视角
对于中文圈的机器人研究者和开发者,Dyna-2的发布传递了几个重要信号。首先,它验证了人类视频数据在机器人学习中的巨大潜力,这为国内类似工作(如智元机器人、宇树科技等)提供了方向参考。其次,Dyna-2不开放权重,仅通过商业系统部署,这意味着国内团队无法直接复现或微调,可能需要依赖自研或寻找替代方案。
从应用场景看,Dyna-2聚焦于酒店、餐饮、洗衣房等重复性操作任务,这些场景在国内同样存在大量需求,但国内机器人公司更倾向于端到端部署,且数据隐私和合规要求可能限制使用外部预训练模型。此外,Dyna-2的缩放定律表明,数据规模是关键,这提示国内团队应重视数据积累,尤其是人类操作视频的采集。
几条值得记住的细节
- 预训练数据:超过100万小时人类视频,约170年连续经验。
- 缩放定律:人类数据上MSE=0.0691·D^-0.0184(R²=0.919),机器人数据上MSE=0.306·D^-0.0713(R²=0.884)。
- 关键转折:在10k到100k小时之间出现性能拐点。
- 部署方式:仅通过Dyna机器人单元提供,无公开checkpoint、API或许可证。
- 性能提升:与Dyna-1相比,成功率1.55倍,等级1.12倍;蒸馏后视频采样时间从10,203ms降至110ms。
一句话总结
Dyna-2证明了人类视频数据可规模化驱动机器人学习,但封闭部署提醒中文圈需自建数据与模型。