AI 快讯 编译自 the_decoder #视频生成#世界模型#微软

微软研究院Mirage:用潜空间记忆实现长镜头视频生成空间一致性

微软研究院联合多所大学推出Mirage视频世界模型,通过将场景信息存储在潜空间而非像素点云,大幅降低计算开销并保持长镜头空间一致性。本文解读其技术原理、当前局限,并分析对中文视频生成赛道的影响。

编译发布 2026/06/14 原文发布 2026/06/14

一句话看懂

微软研究院联合多所高校推出Mirage视频世界模型,用潜空间记忆替代像素点云,让长镜头视频生成不再丢失场景空间一致性。

详细发生了什么

视频生成模型一直面临一个难题:当镜头长时间移动或旋转时,模型容易“忘记”场景中之前出现过的物体和布局,导致画面出现闪烁、变形或物体凭空消失。微软研究院与多所大学合作提出的Mirage,试图从记忆机制上解决这个问题。

Mirage的核心创新在于,它不再像传统方法那样用像素级的点云来存储场景几何信息,而是直接在潜空间中维护一个紧凑的场景记忆。这个潜空间记忆可以随着镜头移动动态更新,从而在长达数十秒的连续镜头中保持场景的时空一致性。

相比基于点云的方法,Mirage大幅降低了计算时间和显存占用——因为潜空间表示比像素级点云要稀疏得多。初步实验显示,在相同分辨率下,Mirage的显存消耗仅为点云方法的1/5左右,生成速度提升3-4倍。

不过,Mirage目前仍有明显局限:它无法可靠地跟踪跨片段的移动物体。当场景中有行人、车辆等动态目标时,模型在镜头切换或长时间移动后可能丢失这些物体的位置和外观。

中文圈视角

Mirage对中文视频生成赛道有直接参考价值。目前国内主流视频生成模型(如字节跳动的Boximator、腾讯的VideoCrafter、以及快手的可灵)在处理长镜头时普遍存在空间不一致问题——镜头转一圈回来,房间里的椅子可能变了位置或颜色。Mirage的潜空间记忆方案为这个问题提供了一条低成本路径。

对中文用户而言,Mirage目前还只是研究论文,没有开放API或demo。但考虑到微软亚洲研究院的参与,国内团队很可能已经在跟进类似思路。值得注意的是,Mirage的潜空间记忆与国内一些团队在NeRF上的工作有共通之处,但更轻量、更适合视频生成场景。

从应用场景看,Mirage对电影级长镜头生成、虚拟摄影、游戏过场动画等有重要意义。中文创作者如果未来能用到类似技术,将能更高效地制作连贯的叙事视频,而不必依赖繁琐的后期修复。

几条值得记住的细节

  • Mirage将场景信息存储在潜空间而非像素点云,显存消耗降低约80%
  • 生成速度相比点云方法提升3-4倍,但具体帧率未公开
  • 目前无法可靠跟踪跨片段的移动物体,动态场景仍是短板
  • 该研究由微软研究院与多所大学联合完成,尚未发布代码或demo
  • 潜空间记忆可随镜头移动动态更新,支持数十秒连续镜头

一句话总结

Mirage为视频生成的长镜头空间一致性提供了高效新思路,但距离实用化还需解决动态物体跟踪问题。