AI 快讯 编译自 marktechpost #模型发布#世界模型#视频生成#Agent框架#开源

蚂蚁集团发布LingBot-World-Infinity:14B因果世界模型,支持无限交互与Agent框架

蚂蚁集团具身智能团队Robbyant开源LingBot-World-Infinity,一个14B参数的因果视频生成模型,可作为交互式世界模拟器。核心创新MoBA注意力机制结合分布匹配蒸馏,解决长程漂移问题。附Director-Pilot Agent框架,支持20+场景连续1小时交互。但开源仅含一个checkpoint,无部署代码和量化基准。

编译发布 2026/07/10 原文发布 2026/07/10

一句话看懂

蚂蚁集团旗下Robbyant发布LingBot-World-Infinity,一个14B因果视频生成世界模型,通过MoBA注意力机制和Agent框架实现无限时长、低漂移的交互式模拟。

详细发生了什么

7月9日,蚂蚁集团具身智能团队Robbyant正式开源LingBot-World-Infinity(即LingBot-World 2.0)。这是一个14B参数的因果视频生成模型,核心定位是可交互的世界模拟器——用户通过连续动作(相机姿态加文本提示)驱动视频帧生成,每帧只依赖过去帧和当前输入。

团队提出混合双向自回归注意力掩码(MoBA),在标准教师强制掩码后附加双向全注意力块,作为正则化器防止模型过度依赖上下文导致漂移。训练分两阶段:预训练采用条件流匹配目标,后训练通过一致性蒸馏和分布匹配蒸馏(DMD)压缩多步教师模型为少步学生模型。DMD在长自展开轨迹上应用,直接优化学生模型自身预测的状态分布,从根本上抑制纹理模糊和几何扭曲。

更值得关注的是Director-Pilot协同仿真框架:VLM作为Director负责宏观语义和因果推理,Diffusion Transformer视频生成器作为Pilot模拟底层物理。用户可通过WASD移动、IJKL视角、空格跳跃等游戏化操作,或直接文本干预(改变天气、生成生物)。论文展示单次60分钟不间断会话覆盖20个场景。

但开源力度有限:目前只提供14B因果fast checkpoint(480P参考脚本),14B双向版和两个1.3B轻量版标注为TODO。没有部署代码,没有量化基准,采用非商业CC BY-NC-SA 4.0协议。

中文圈视角

对中文开发者来说,LingBot-World-Infinity的开源价值需要理性看待。

可用性门槛较高:参考脚本需要8卡GPU运行480P,60fps实时版本依赖TensorRT编译和时空精炼器,没有直接开源。国内用户想复现,得自己搭建多卡环境,而且模型权重托管在Hugging Face,下载可能受网络限制。

国产平替对比:相比智谱CogVideo、阿里I2VGen-XL等视频生成模型,LingBot-World-Infinity的核心差异在于因果交互——它不是一次性生成视频,而是逐帧响应动作。国内类似方向有上海AI Lab的OpenWorld模型,但尚未开源。对于游戏原型设计、具身仿真等场景,该模型填补了空白,但离产品级应用还有距离。

合规与场景:CC BY-NC-SA协议禁止商业用途,国内企业需要注意。个人开发者可用于研究:比如用其生成合成数据训练策略模型,或作为Agent评估环境。但要注意数据出境问题——模型运行需要下载权重,涉及跨境传输。

中文社区盲点:多数讨论聚焦视频生成质量,但MoBA注意力机制对长视频生成的改进思路值得关注——国内视频大模型(如快手可灵、字节即创)在长视频一致性上仍有瓶颈,LingBot的蒸馏策略或可借鉴。

几条值得记住的细节

  • 模型参数量14B,另有1.3B轻量版(未开源)宣称可单卡部署。
  • 参考脚本输出480×832分辨率,需要8张GPU;60fps 720p版本依赖TensorRT编译,没有直接提供。
  • 交互支持20多种动作类型:攻击、射箭、施法、射击等,通过文本或按键触发。
  • 开源协议为CC BY-NC-SA 4.0,禁止商业使用。
  • Diffusers checkpoint已上传,可通过pipe()一行调用生成视频。

一句话总结

LingBot-World-Infinity展示了因果世界模型的技术方向,但开源程度有限,适合有算力的研究者尝鲜,离普通用户可用还有距离。