AI 快讯 编译自 the_decoder #模型发布#视频生成#多模态

Flux 3 发布:原生音频视频生成最长 20 秒,Black Forest Labs 首次实现多模态

Black Forest Labs 推出 Flux 3 多模态基础模型,首次实现视频原生音频生成,最长 20 秒。BFL 自测领先 Seedance 2.0,并已在机器人任务中测试。本文解析技术亮点、中文用户可用性及国产平替对比。

编译发布 2026/07/23 原文发布 2026/07/23

一句话看懂

Black Forest Labs 发布 Flux 3,首次在视频生成中集成原生音频,最长 20 秒,自测性能领先市场,并已用于机器人任务。

详细发生了什么

Black Forest Labs 于 2026 年 7 月 23 日发布 Flux 3。这是一个多模态基础模型,能从图像、视频和音频中学习,并首次支持生成带原生声音的视频,最长 20 秒。此前,Flux 系列只支持图像和视频生成,音频需要后期合成。

BFL 的内部测试显示,Flux 3 在视频生成质量上略领先于当前市场领导者 Seedance 2.0,但独立第三方评测尚未公布。公司表示,最终目标是构建一个世界模型,目前已在机器人任务中测试 Flux 3,探索其在物理世界理解中的应用。

Flux 3 的发布标志着 BFL 从纯视觉生成向多模态融合迈出关键一步。原生音频的加入让视频内容更真实,减少了后期制作成本。

中文圈视角

对于中文用户,Flux 3 目前需要通过官方 API 或 Hugging Face 访问,可能需要梯子。国内类似产品包括智谱的 CogVideoX 和字节跳动的 Seedance(中文名暂无),但 Seedance 2.0 目前不支持原生音频。国产视频生成模型如 Vidu、可灵等也主要聚焦视觉,音频需额外生成。

Flux 3 的原生音频功能对短视频创作者、游戏开发者、影视后期等场景有直接价值——例如生成带有环境音效的 AI 视频,减少手动配音工作。但中文语音和场景的适配度未知,BFL 的训练数据可能以英文为主,中文口型同步和语音自然度可能不如英文。

监管方面,视频生成内容需符合国内内容安全法规,Flux 3 的开放使用可能面临合规风险,建议开发者关注数据出境和内容审核要求。

几条值得记住的细节

  • Flux 3 支持生成最长 20 秒的带原生音频视频,这是 BFL 首次实现视频+音频联合生成。
  • BFL 自测性能领先 Seedance 2.0,但独立评测尚未发布,需谨慎看待。
  • 模型已在机器人任务中测试,暗示 BFL 向世界模型方向推进。
  • 目前通过官方 API 和 Hugging Face 提供,定价尚未公布。
  • Flux 3 是多模态基础模型,同时学习图像、视频和音频三种模态。

一句话总结

Flux 3 让视频生成自带声音,中文用户可关注,但需注意访问限制和国产平替的差距。