Qwen 发布三款具身 AI 模型:VLA 操作、视频世界建模与导航,开源部分代码
Qwen 团队推出 Qwen-RobotSuite,包含 RobotManip(VLA 操作)、RobotWorld(视频世界模型)和 RobotNav(导航)三款模型。其中 RobotManip 基于 Qwen3.5-4B,在跨本体迁移等 OOD 任务上大幅超越 SOTA;RobotWorld 使用 60 层 MMDiT 和 20B 参数,语言作为统一动作接口;RobotNav 提供…
一句话看懂
Qwen 发布三款具身 AI 模型:RobotManip(操作)、RobotWorld(世界模型)、RobotNav(导航),其中两款开源,在跨本体迁移等任务上大幅超越此前最佳。
详细发生了什么
Qwen 团队发布了 Qwen-RobotSuite,包含三个独立的具身基础模型:
-
Qwen-RobotManip:基于 Qwen3.5-4B 的 Vision-Language-Action (VLA) 模型,用于机器人操作。它通过统一对齐框架解决不同机器人数据格式不兼容的问题,使用 80 维规范状态-动作表示、相机帧增量位姿参数化和上下文策略自适应机制。训练数据约 38,100 小时,其中约 24,808 小时来自人-机器人合成管线。在 OOD 基准上,LIBERO-Plus 达到 91.4%(此前 SOTA 84.4%),RoboTwin-C2R Hard 达到 69.4%(此前 47.9%),跨本体迁移任务达到 23.9%(此前 7.5%)。
-
Qwen-RobotWorld:语言条件视频世界模型,使用 60 层双流 MMDiT(20B 参数),以自然语言作为统一动作接口。它预测未来视频帧,支持跨本体合成(Scene2Robot)。训练使用 Embodied World Knowledge (EWK) 数据集,包含约 860 万视频-文本对,覆盖 2 亿帧。在 EWMBench 上排名第一(4.60),运动保真度 HSD 0.566,领先第二名 33%。
-
Qwen-RobotNav:基于 Qwen3-VL 的导航模型,提供 2B、4B、8B 三种尺寸。它将多任务导航重构为观测上下文建模,暴露可参数化接口供外部控制。
RobotManip 和 RobotNav 已开源 GitHub 仓库。
中文圈视角
对中文圈机器人开发者来说,Qwen-RobotSuite 的发布有几个直接意义:
-
开源可用:RobotManip 和 RobotNav 代码已公开,国内开发者可以直接在 GitHub 上获取,无需梯子即可下载。但预训练模型权重是否完全开放尚需确认。
-
国产替代加速:此前 VLA 领域主要被 Google RT-2、π0.5 等国外模型主导。Qwen 的这套模型在多个 OOD 基准上大幅超越 π0.5,且基于 Qwen 系列(国内团队开发),在中文指令理解和合规性上更有优势。对于国内机器人公司(如宇树、傅利叶、星动纪元等),可以直接基于这些模型进行微调,降低研发门槛。
-
数据合成管线值得关注:RobotManip 使用人-机器人合成管线,将人类手部演示转化为机器人轨迹,这解决了机器人数据稀缺的核心问题。国内也有类似工作(如北京智源、清华的机器人数据合成),但 Qwen 的开源方案可能更易落地。
-
世界模型与导航的空白填补:RobotWorld 作为语言条件视频世界模型,在中文圈尚无直接竞品。RobotNav 的多尺寸选择(2B/4B/8B)适合不同算力场景,对国内服务机器人、物流机器人等场景有直接应用价值。
-
合规与生态:Qwen 系列模型在国内有较好的合规基础(阿里云备案),相比直接使用国外模型,部署风险更低。同时,ModelScope 平台可能很快上架这些模型,方便国内开发者试用。
几条值得记住的细节
- RobotManip 训练数据 38,100 小时,其中 24,808 小时来自人-机器人合成,仅使用开源数据集。
- RobotWorld 的 MMDiT 有 20B 参数,支持最多 48,360 个视频 token,使用 Wan-VAE 架构。
- RobotNav 提供 2B、4B、8B 三种尺寸,均基于 Qwen3-VL。
- RobotManip 在跨本体迁移任务上达到 23.9%,是 π0.5(7.5%)的 3.2 倍。
- RobotWorld 在 WorldModelBench 上物理遵循性四项(牛顿定律、质量守恒、流体动力学、重力)得分 1.00。
一句话总结
Qwen 三款具身模型在操作、世界建模和导航上均达 SOTA,开源代码将加速国内机器人研发,尤其跨本体迁移能力是亮点。