蚂蚁集团 Robbyant 发布 LingBot-VA 2.0:专为物理世界打造的因果视频动作基础模型
蚂蚁集团旗下 Robbyant 发布 LingBot-VA 2.0 技术报告,这是一个从零训练的物理 AI 视频动作基础模型,具备预见推理、225Hz 异步控制等能力。本文解读其因果 DiT、稀疏 MoE、语义分词器等技术细节,并分析对国内具身智能开发者及中文用户的意义。
一句话看懂
蚂蚁集团旗下 Robbyant 发布 LingBot-VA 2.0,一个从零训练的因果视频动作基础模型,专为物理世界机器人操控设计,支持 225Hz 异步控制与预见推理。
详细发生了什么
Robbyant(蚂蚁集团具身智能部门)发布了 LingBot-VA 2.0 技术报告。与大多数视频动作模型不同,它并非从视频生成器微调而来,而是从头预训练了一个因果 DiT(Causal Diffusion Transformer)作为骨干网络。
模型包含两大核心组件:
- 语义视觉-动作分词器:取代传统重建型 VAE,通过语义对齐和潜在动作目标,将世界状态与动作映射到同一潜在空间,使未标注网络视频也能提供动作相关监督。
- 因果 DiT + 稀疏 MoE 视频流:视频专家使用 128 个路由专家(top-8 激活)的稀疏 MoE 层,动作专家保持密集 FFN。总参数量约 15.3B,推理时约 2.5B 激活。
训练采用多块预测(MCP)加速 2.3 倍,并联合训练 T2I、T2V、TI2VA、ICL 和人类-机器人共训五个目标。推理时通过预见推理(Foresight Reasoning)实现异步控制:视频专家预测未来状态,动作专家据此解码,实际观测返回后覆盖预测,避免漂移。
在 RoboTwin 2.0 基准上,LingBot-VA 2.0 平均成功率 93.6%,超过 π0.5(79.8%)和 Motus(87.9%)。通过蒸馏、FP8 TensorRT 引擎、分页 KV 缓存等优化,推理延迟从 927ms 降至 142ms,实现 225Hz 异步控制。
中文圈视角
对国内具身智能开发者意味着什么?
- 开源与可复现性:论文和代码已公开(GitHub),国内团队可直接基于其因果 DiT 架构和训练策略进行二次开发,无需依赖闭源模型。
- 与国产平替对比:相比 Google 的 RT-2、OpenAI 的 Figure 等,LingBot-VA 2.0 更强调因果性和异步控制,且训练数据包含中文场景(如“把葫芦放进绿盘子”)。国内类似工作如清华的 UniPi、智元的 EnerVerse 等,LingBot-VA 2.0 在稀疏 MoE 和预见推理上有独特设计。
- 中文场景适配:VLM 规划器支持中文指令,few-shot 仅需 10-15 条演示,适合国内工厂、物流等快速部署场景。但需注意,模型训练依赖大规模算力,中小企业可能需借助蚂蚁的云计算服务。
- 监管与合规:作为蚂蚁集团产品,数据安全与合规性有保障,但物理 AI 涉及工业控制,需关注相关行业标准。
中文圈尚未讨论的盲点:LingBot-VA 2.0 的语义分词器使未标注视频也能提供动作监督,这对国内海量监控、工业视频数据是巨大红利,可能催生低成本数据生成方案。
几条值得记住的细节
- 模型规模:总参数量约 15.3B,推理时约 2.5B 激活,视频专家含 128 个路由专家。
- 性能:RoboTwin 2.0 平均成功率 93.6%,比 π0.5 高 13.8 个百分点。
- 推理速度:优化后 142ms/chunk,对应 225Hz 异步控制(32 步/chunk)。
- few-shot 能力:10-15 条演示即可适配新任务,20 条演示用于真实评估。
- 训练加速:多块预测(MCP)使训练速度提升 2.3 倍。
一句话总结
LingBot-VA 2.0 为国内具身智能提供了从零训练的因果视频动作模型新范式,开源架构和中文场景适配使其值得开发者关注。