AI 快讯 编译自 nvidia_developer #模型发布#行业分析#机器人

世界-动作模型(WAM)崛起:从预训练想象到微调执行,机器人AI新范式

NVIDIA 提出世界-动作模型(WAM)概念,将预训练的世界模型或视频生成模型微调为机器人策略,相比传统VLA方法更高效、更泛化。本文解读WAM原理、优势及对中文圈机器人开发者的意义。

编译发布 2026/06/15 原文发布 2026/06/15

一句话看懂

NVIDIA 提出世界-动作模型(WAM),将预训练的世界模型或视频生成模型微调为机器人策略,实现更高效、更泛化的机器人控制。

详细发生了什么

NVIDIA 博客文章《Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models》介绍了机器人策略领域的新范式——世界-动作模型(World-Action Model, WAM)。传统方法是从预训练的视觉语言模型(VLM)微调为视觉-语言-动作模型(VLA),例如 Pi-0 和 GR00T N1。而 WAM 则从预训练的世界模型或视频生成模型出发,通过微调使其能够根据视觉观察和语言指令直接生成动作。

WAM 的核心优势在于:世界模型本身已经学会了物理世界的动态规律(如物体运动、碰撞、重力等),因此微调后的策略能更好地泛化到未见过的场景,且数据效率更高。NVIDIA 展示了 WAM 在模拟和真实机器人上的实验结果,证明其在复杂任务(如抓取、堆叠、操作)中的表现优于同等规模的 VLA 模型。

中文圈视角

对中文圈机器人开发者而言,WAM 的提出意味着一个更高效的模型训练路径。目前国内机器人领域多采用 VLA 路线(如基于 Qwen-VL 或 InternVL 微调),但 VLA 模型需要大量动作标注数据,且泛化性受限于 VLM 的视觉理解能力。WAM 利用视频生成模型(如 Sora 类模型)的物理先验,可能大幅降低对真实机器人数据的依赖。

不过,国内目前缺乏高质量的开源世界模型(如 NVIDIA 的 Cosmos 平台),且视频生成模型的训练成本极高。短期内,开发者可尝试使用现有视频生成模型(如 Open-Sora、CogVideo)作为起点,但需注意其物理一致性可能不足。此外,WAM 的推理延迟和实时性要求对边缘部署构成挑战,国内厂商(如地平线、华为)的机器人芯片需针对性优化。

几条值得记住的细节

  • WAM 从预训练的世界模型或视频生成模型开始,而非 VLM。
  • 微调时仅需少量动作数据(相比 VLA 减少 50% 以上)。
  • 在 NVIDIA 的模拟环境 Isaac Sim 中,WAM 在 10 个未见任务上的成功率比 VLA 高 15%。
  • 真实机器人实验中,WAM 对光照变化和物体位置偏移的鲁棒性更强。
  • 目前 WAM 的训练代码和预训练权重尚未开源,仅提供技术报告。

一句话总结

WAM 让机器人学会“先想象世界如何运转,再决定如何行动”,是迈向通用机器人智能的关键一步。