蚂蚁集团 Robbyant 开源 LingBot-VLA 2.0:6B 参数跨形态机器人操控模型,统一 55 维动作空间
蚂蚁集团旗下 Robbyant 发布 LingBot-VLA 2.0,一个 Apache-2.0 开源的视觉-语言-动作(VLA)基础模型。该模型基于 6 万小时数据训练,支持 20 种机器人形态,在 GM-100 基准上超越 π0.5 和上一代。本文详解其技术亮点、中文圈可用性及对国内机器人开发者意味着什么。
一句话看懂
蚂蚁集团 Robbyant 开源了 LingBot-VLA 2.0,一个 6B 参数的视觉-语言-动作模型,能跨 20 种机器人形态操控,在 GM-100 基准上超越 π0.5。
详细发生了什么
7 月 9 日,蚂蚁集团旗下 Robbyant 团队发布了 LingBot-VLA 2.0。这是一个 Apache-2.0 开源的 Vision-Language-Action (VLA) 基础模型,包含技术报告、代码库和 6B 参数权重。该模型旨在解决 VLA 模型在实验室表现良好但部署时易失败的问题,沿三个方向改进:泛化能力、扩展动作空间和预测动力学建模。
LingBot-VLA 2.0 基于 Qwen3-VL-4B-Instruct 作为视觉语言骨干,通过两个教师模型(LingBot-Depth 和 DINO-Video)进行蒸馏训练。推理时在 NVIDIA RTX 4090D 上仅需约 130ms(10 步去噪)。数据方面,团队筛选了约 6 万小时高质量数据,包括 5 万小时机器人轨迹(覆盖 20 种机器人配置)和 1 万小时第一人称人类视频。
核心创新之一是统一的 55 维规范动作空间,将不同机器人的关节映射到固定向量,涵盖手臂、末端执行器、夹爪、灵巧手、腰部、头部和移动底座。动作专家采用 token 级无辅助损失的 MoE 设计,灵感来自 DeepSeek-V3,在相同活跃参数下训练损失更低。双查询蒸馏机制通过当前和未来两个可学习查询,结合深度和时序监督,实现前瞻性控制。
在 GM-100 通用基准上,LingBot-VLA 2.0 在 AgileX Cobot Magic 上达到 66.2/34.4(进度/成功率),在 Galaxea R1Pro 上达到 34.6/15.6,均优于 π0.5 和上一代。在长时移动操作任务中,无论是域内还是域外设置,都领先于 π0.5。
中文圈视角
国内用户用得上吗? 模型权重和代码已在 Hugging Face 和 GitHub 开源,但国内访问 Hugging Face 可能需要代理。不过,团队提供了完整的安装和部署脚本,支持 LeRobot 数据集格式,国内开发者可以将其下载到本地或阿里云等国内镜像。模型基于 Qwen3-VL,对中文指令的理解天然友好,但训练数据以英文为主,中文场景可能需要微调。
国产平替与对比:目前国内机器人 VLA 模型较少,LingBot-VLA 2.0 填补了空白。相比 π0.5(Physical Intelligence 的闭源模型),它完全开源且性能更强。与国内类似工作(如清华的 UniPi、星动纪元的模型)相比,LingBot-VLA 2.0 在跨形态统一动作空间和 MoE 设计上更具创新性。对于国内机器人公司(如宇树、傅利叶、智元),该模型可直接用于灵巧手和双足机器人控制,降低研发门槛。
监管与合规:模型使用 Apache-2.0 许可,商业友好。但需注意,训练数据包含人类视频,若用于国内场景需确保数据合规。模型本身不涉及敏感内容,但作为机器人控制模型,部署时需符合《新一代人工智能伦理规范》。
中文圈盲点:多数讨论聚焦于模型性能,但忽略了其“无辅助损失 MoE”设计对边缘部署的意义——在算力受限的机器人本体上,该设计能保持低延迟。此外,双查询蒸馏中的 DINO-Video 模型(基于 DINOv3 和因果时序注意力)本身也是一个值得关注的研究方向。
几条值得记住的细节
- 数据规模:预训练数据约 6 万小时,其中机器人数据 5 万小时(20 种配置),人类视频 1 万小时。
- 统一动作空间:55 维规范向量,覆盖手臂(14 维)、末端执行器(14 维)、夹爪(2 维)、灵巧手(12 维)、腰部(4 维)、头部(2 维)、移动底座(3 维)等。
- 推理速度:在 RTX 4090D 上约 130ms/步(10 步去噪),适合实时控制。
- 基准成绩:在 GM-100 上,AgileX Cobot Magic 平台成功率 34.4%,Galaxea R1Pro 成功率 15.6%,均领先 π0.5。
- 开源许可:Apache-2.0,代码和权重均可商用,支持 LeRobot 数据集微调。
一句话总结
LingBot-VLA 2.0 让国内机器人团队有了一个开源、高性能的跨形态操控基础模型,尤其适合灵巧手和移动操作场景。