Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态流模型
Black Forest Labs 推出 FLUX 3,首个同时处理图像、视频、音频和动作预测的多模态基础模型。基于 Self-Flow 架构,视频生成长达 20 秒并自带音频,在人类偏好测试中大幅领先 Luma Ray 3.2 和 Runway Gen-4.5。本文详解技术原理、性能数据及对中文用户的实际意义。
一句话看懂
Black Forest Labs 发布 FLUX 3,一个能同时生成图像、视频、音频并预测机器人动作的多模态模型,视频最长 20 秒且自带音效,在多项对比中胜出。
详细发生了什么
Black Forest Labs(BFL)于 2026 年 7 月 26 日发布 FLUX 3,这是其首个多模态基础模型,在单一架构内同时学习图像、视频和音频。FLUX 3 也是首个从同一套权重输出视频、音频和动作预测的 FLUX 模型。BFL 团队认为,单一模态无法完整描述世界:图像捕捉瞬间空间结构,视频恢复时间与物理动态,音频揭示机械事件与声音的因果关系。每种模态都是对同一底层现实的有损投影,同时训练它们可以相互约束——声音必须匹配撞击,运动必须遵循质量。
FLUX 3 基于 BFL 此前提出的 Self-Flow 方法,该方法将 flow matching 目标与自监督特征重建目标结合,实现多模态生成与理解的对齐。参考实现(Apache-2.0)使用 SiT-XL/2 架构,每 token 时间步条件,25% 掩码率,从 EMA 教师(第 20 层)自蒸馏到学生(第 8 层)。BFL 表示,FLUX 3 在相同方法上大幅扩展了计算和数据资源,同时训练视频、图像和音频。
FLUX 3 Video 支持文本到视频、图像到视频、参考片段到视频、关键帧到视频以及生成式视频音频延续。单次生成最长 20 秒,自带原生音频。BFL 还提到多语言对话、片段智能链式拼接、强排版生成和动画设计。团队特别指出在人类面部表情和物理事件声音关联方面的优势。
在 10 秒 720p 文本到视频(含音频)的人类偏好测试中,FLUX 3 以 93% 胜率击败 Luma Ray 3.2,77% 击败 Runway Gen-4.5,69% 击败 Grok Imagine Video,60% 击败 Kling v3 Pro,59% 击败 Happy Horse v1,57% 击败 Happy Horse 1.1,与 Seedance 2.0 和 Gemini Omni Flash 持平(52%)。
中文圈视角
FLUX 3 对中文用户意味着几个关键点:
-
视频生成能力大幅领先国内竞品:对比数据中,Kling v3 Pro(可灵)仅获 60% 偏好率,而 FLUX 3 达到 93% 对 Luma。国内视频生成模型(如可灵、Vidu、PixVerse)在时长、音频同步和物理合理性上仍有差距。FLUX 3 的 20 秒单次生成+原生音频是当前国产模型难以企及的。
-
平替与使用门槛:FLUX 3 目前通过 BFL 官网(bfl.ai)提供早期访问,国内用户可能需要网络工具。但 BFL 一贯开源部分模型(如 FLUX.1),未来可能开放权重或 API。中文社区可关注 Hugging Face 和 ModelScope 上的社区复现。
-
机器人动作预测的潜在影响:FLUX 3 首次将动作预测纳入多模态框架,这对国内具身智能(如宇树、星动纪元)是重要信号。统一视觉-语言-动作模型可能降低机器人训练成本,但国内企业多走专用路线,通用模型适配需时间。
-
中文生成质量待验证:BFL 提到多语言对话和排版生成,但中文文本生成效果未知。此前 FLUX 模型在中文场景表现一般,FLUX 3 是否改进需实测。
几条值得记住的细节
- FLUX 3 视频单次生成最长 20 秒,支持原生音频同步,无需后期配音。
- 人类偏好测试中,FLUX 3 以 93% 胜率击败 Luma Ray 3.2,77% 击败 Runway Gen-4.5。
- 模型基于 Self-Flow 架构,结合 flow matching 与自监督特征重建,参考实现已开源(Apache-2.0)。
- 支持文本到视频、图像到视频、关键帧到视频、视频到视频及生成式视频音频延续。
- BFL 强调在人类面部表情和物理事件声音关联方面表现突出。
一句话总结
FLUX 3 将视频生成质量拉到新高度,中文用户可关注其开源进展,但当前需网络工具访问。