世界-动作模型(WAM)崛起:从预训练想象到微调执行,机器人AI新范式
NVIDIA 提出世界-动作模型(WAM)概念,将预训练的世界模型或视频生成模型微调为机器人策略,相比传统VLA方法更高效、更泛化。本文解读WAM原理、优势及对中文圈机器人开发者的意义。
一句话看懂
NVIDIA 提出世界-动作模型(WAM),将预训练的世界模型或视频生成模型微调为机器人策略,实现更高效、更泛化的机器人控制。
详细发生了什么
NVIDIA 博客文章《Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models》介绍了机器人策略领域的新范式——世界-动作模型(World-Action Model, WAM)。传统方法是从预训练的视觉语言模型(VLM)微调为视觉-语言-动作模型(VLA),例如 Pi-0 和 GR00T N1。而 WAM 则从预训练的世界模型或视频生成模型出发,通过微调使其能够根据视觉观察和语言指令直接生成动作。
WAM 的核心优势在于:世界模型本身已经学会了物理世界的动态规律(如物体运动、碰撞、重力等),因此微调后的策略能更好地泛化到未见过的场景,且数据效率更高。NVIDIA 展示了 WAM 在模拟和真实机器人上的实验结果,证明其在复杂任务(如抓取、堆叠、操作)中的表现优于同等规模的 VLA 模型。
中文圈视角
对中文圈机器人开发者而言,WAM 的提出意味着一个更高效的模型训练路径。目前国内机器人领域多采用 VLA 路线(如基于 Qwen-VL 或 InternVL 微调),但 VLA 模型需要大量动作标注数据,且泛化性受限于 VLM 的视觉理解能力。WAM 利用视频生成模型(如 Sora 类模型)的物理先验,可能大幅降低对真实机器人数据的依赖。
不过,国内目前缺乏高质量的开源世界模型(如 NVIDIA 的 Cosmos 平台),且视频生成模型的训练成本极高。短期内,开发者可尝试使用现有视频生成模型(如 Open-Sora、CogVideo)作为起点,但需注意其物理一致性可能不足。此外,WAM 的推理延迟和实时性要求对边缘部署构成挑战,国内厂商(如地平线、华为)的机器人芯片需针对性优化。
几条值得记住的细节
- WAM 从预训练的世界模型或视频生成模型开始,而非 VLM。
- 微调时仅需少量动作数据(相比 VLA 减少 50% 以上)。
- 在 NVIDIA 的模拟环境 Isaac Sim 中,WAM 在 10 个未见任务上的成功率比 VLA 高 15%。
- 真实机器人实验中,WAM 对光照变化和物体位置偏移的鲁棒性更强。
- 目前 WAM 的训练代码和预训练权重尚未开源,仅提供技术报告。
一句话总结
WAM 让机器人学会“先想象世界如何运转,再决定如何行动”,是迈向通用机器人智能的关键一步。