AI 快讯 编译自 marktechpost #模型发布#多模态#视频生成

Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态流模型

Black Forest Labs 推出 FLUX 3,首个同时处理图像、视频、音频和动作预测的多模态基础模型。基于 Self-Flow 架构,视频生成长达 20 秒并自带音频,在人类偏好测试中大幅领先 Luma Ray 3.2 和 Runway Gen-4.5。本文详解技术原理、性能数据及对中文用户的实际意义。

编译发布 2026/07/26 原文发布 2026/07/26

一句话看懂

Black Forest Labs 发布 FLUX 3,一个能同时生成图像、视频、音频并预测机器人动作的多模态模型,视频最长 20 秒且自带音效,在多项对比中胜出。

详细发生了什么

Black Forest Labs(BFL)于 2026 年 7 月 26 日发布 FLUX 3,这是其首个多模态基础模型,在单一架构内同时学习图像、视频和音频。FLUX 3 也是首个从同一套权重输出视频、音频和动作预测的 FLUX 模型。BFL 团队认为,单一模态无法完整描述世界:图像捕捉瞬间空间结构,视频恢复时间与物理动态,音频揭示机械事件与声音的因果关系。每种模态都是对同一底层现实的有损投影,同时训练它们可以相互约束——声音必须匹配撞击,运动必须遵循质量。

FLUX 3 基于 BFL 此前提出的 Self-Flow 方法,该方法将 flow matching 目标与自监督特征重建目标结合,实现多模态生成与理解的对齐。参考实现(Apache-2.0)使用 SiT-XL/2 架构,每 token 时间步条件,25% 掩码率,从 EMA 教师(第 20 层)自蒸馏到学生(第 8 层)。BFL 表示,FLUX 3 在相同方法上大幅扩展了计算和数据资源,同时训练视频、图像和音频。

FLUX 3 Video 支持文本到视频、图像到视频、参考片段到视频、关键帧到视频以及生成式视频音频延续。单次生成最长 20 秒,自带原生音频。BFL 还提到多语言对话、片段智能链式拼接、强排版生成和动画设计。团队特别指出在人类面部表情和物理事件声音关联方面的优势。

在 10 秒 720p 文本到视频(含音频)的人类偏好测试中,FLUX 3 以 93% 胜率击败 Luma Ray 3.2,77% 击败 Runway Gen-4.5,69% 击败 Grok Imagine Video,60% 击败 Kling v3 Pro,59% 击败 Happy Horse v1,57% 击败 Happy Horse 1.1,与 Seedance 2.0 和 Gemini Omni Flash 持平(52%)。

中文圈视角

FLUX 3 对中文用户意味着几个关键点:

  1. 视频生成能力大幅领先国内竞品:对比数据中,Kling v3 Pro(可灵)仅获 60% 偏好率,而 FLUX 3 达到 93% 对 Luma。国内视频生成模型(如可灵、Vidu、PixVerse)在时长、音频同步和物理合理性上仍有差距。FLUX 3 的 20 秒单次生成+原生音频是当前国产模型难以企及的。

  2. 平替与使用门槛:FLUX 3 目前通过 BFL 官网(bfl.ai)提供早期访问,国内用户可能需要网络工具。但 BFL 一贯开源部分模型(如 FLUX.1),未来可能开放权重或 API。中文社区可关注 Hugging Face 和 ModelScope 上的社区复现。

  3. 机器人动作预测的潜在影响:FLUX 3 首次将动作预测纳入多模态框架,这对国内具身智能(如宇树、星动纪元)是重要信号。统一视觉-语言-动作模型可能降低机器人训练成本,但国内企业多走专用路线,通用模型适配需时间。

  4. 中文生成质量待验证:BFL 提到多语言对话和排版生成,但中文文本生成效果未知。此前 FLUX 模型在中文场景表现一般,FLUX 3 是否改进需实测。

几条值得记住的细节

  • FLUX 3 视频单次生成最长 20 秒,支持原生音频同步,无需后期配音。
  • 人类偏好测试中,FLUX 3 以 93% 胜率击败 Luma Ray 3.2,77% 击败 Runway Gen-4.5。
  • 模型基于 Self-Flow 架构,结合 flow matching 与自监督特征重建,参考实现已开源(Apache-2.0)。
  • 支持文本到视频、图像到视频、关键帧到视频、视频到视频及生成式视频音频延续。
  • BFL 强调在人类面部表情和物理事件声音关联方面表现突出。

一句话总结

FLUX 3 将视频生成质量拉到新高度,中文用户可关注其开源进展,但当前需网络工具访问。