AI 快讯 编译自 marktechpost #模型发布#视频生成#开源权重

LTX-2.5发布:NVIDIA加速的开源权重世界模型,本地生成10秒视频仅需6.8秒

LTX-2.5开源世界模型发布,专为NVIDIA RTX GPU优化,本地生成10秒视频仅需6.8秒,支持原生多镜头一致性。本文解析其技术亮点、对创作者的意义,并探讨中文用户如何利用该模型及国产替代方案。

编译发布 2026/08/11 原文发布 2026/08/11

一句话看懂

LTX-2.5 开源世界模型发布,专为 NVIDIA RTX GPU 优化,本地生成 10 秒视频仅需 6.8 秒,支持原生多镜头一致性,让视频制作全流程在一台桌面电脑上完成。

详细发生了什么

LTX 公司正式发布 LTX-2.5,这是一个开源的 world model(世界模型),用于视频生成、实时应用和物理 AI。该模型针对 NVIDIA RTX GPU 和 DGX Spark 做了深度优化,大幅降低了 VRAM 需求,让前沿世界模型能在创作者已有的消费级硬件上跑起来。

核心亮点包括:原生多镜头生成(native multishot),能把整个序列渲染成一个连贯的整体,保持角色外观在不同镜头间一致,解决了早期开源模型在广告级应用中的闪烁问题。另外,LTX-2.5 用了更强大的 Gemma 4 语言骨干和新的解码器,减少了高动态场景里的视觉伪影。

性能方面,LTX 公布的图像到视频基准测试显示,在 2x NVIDIA GB200 上生成 10 秒视频只要 6.8 秒,而通过 LTX API 需要 23.7 秒。相比之下,最快的闭源替代品(Omni Flash、Grok 1.5、Veo 3.1)要 52 到 70 秒,Seedance 2.0 要 196 秒,Kling 3.0 Pro 要 398 秒。本地生成速度比最快的闭源模型快 7.6 倍,比最慢的快约 58 倍。

LTX-2.5 以开放权重形式在 Hugging Face 上发布,原生支持 ComfyUI,并提供 LTX API 用于托管生成。年经常性收入低于 1000 万美元的组织可免费使用。代码已在 GitHub 上开源。

中文圈视角

LTX-2.5 的发布对中文视频创作者和 AI 开发者意义重大。首先,本地生成意味着数据不出机器,对于有 IP 保护需求的中文团队(如广告公司、影视工作室)来说,避免了将素材上传到云端的数据出境风险,符合国内对数据安全的合规要求。

其次,国内用户可以直接在 Hugging Face 下载权重,但需要注意网络访问问题。不过,国内已有类似的开源视频生成模型,如快手的可灵(Kling)和智谱的 CogVideoX,但它们在本地部署的硬件要求和生成速度上可能与 LTX-2.5 存在差距。LTX-2.5 的 NVIDIA 优化特性对国内大量使用 RTX 显卡的用户非常友好,可以充分利用现有硬件。

对于中文短剧、广告和社交媒体内容创作者,LTX-2.5 的多镜头一致性和快速生成能力,可以大幅降低内容生产的成本和时间,实现“一夜生成一周内容”的工作流。不过,中文提示词的支持情况尚待测试,可能需要借助 Gemma 4 的多语言能力或额外翻译。

几条值得记住的细节

  • 性能:10 秒视频本地生成仅需 6.8 秒(2x GB200),比最快的闭源模型快 7.6 倍。
  • 多镜头一致性:原生 multishot 生成,保持角色和场景跨镜头一致,适合广告和影视预演。
  • 硬件要求:针对 NVIDIA RTX GPU 和 DGX Spark 优化,降低 VRAM 需求,消费级显卡可运行。
  • 开源与免费:权重在 Hugging Face 开放,年收入低于 1000 万美元的组织免费使用,ComfyUI 首日支持。
  • 物理 AI 检查点:提供针对机器人学的预训练检查点,便于在非影视数据上微调。

一句话总结

LTX-2.5 让视频生成进入“桌面时代”,中文创作者可低成本、高效率地制作高质量视频,但需注意网络访问和中文适配。