Flux 3
摘要
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 07:59
# FLUX 3 - 真实世界模型:迈向多模态流模型,成为视觉智能的基石。
来源:https://bfl.ai/blog/flux-3
*FLUX 3 现已提供早期访问。*
FLUX 3 是我们最新的多模态基础模型。它在一个统一的架构中共同学习图像、视频和音频,因为模型需要学习的不是这些元素中的任何一个孤立部分。相反,模型必须学习一个世界的表征:物体如何保持结构,事物如何运动,以及事件听起来如何。
没有任何单一模态能提供完整的描述。每一种都是对同一底层现实的投影,由不同的传感器捕获,每个传感器在此过程中都会丢失一些信息。图像捕捉特定时间点的空间结构和关系。视频恢复了时间的维度,揭示了时间动态和物理定律。音频揭示了视觉无法单独检测到的机械现象与声学之间的因果关系。语言将这些感知与目标、抽象概念和指令联系起来。
只从一种模态学习,你只能得到那个投影的良好模型。如果同时从所有模态学习,它们的相互约束会告诉你更多:声音必须与撞击匹配,运动必须服从质量,未来必须遵循过去。模态不再是独立的,而是成为关于一个底层现实的证据。
FLUX 3 是我们第一个完全基于这一原则构建的模型,也是我们开发真实世界视觉智能使命中的一个里程碑:能够感知、预测并在物理和数字环境中行动的模型。在内容创作和物理 AI 方面的早期结果表明,这是一条正确的道路。
## **FLUX 3:一个模型,多种能力。**
FLUX 3 基于 Self-Flow (https://bfl.ai/research/self-flow) 构建,这是我们用于在同一底层架构中高效对齐多模态生成和理解的方法。基于这一方法,我们大幅扩展了计算和数据资源,以同时训练 FLUX 3 在视频、图像和音频上的能力。
***Self-Flow 与 Flow Matching (FM) 对比。左图:每种模态的生成误差(Fréchet 距离),均归一化到 FM = 100(越低越好)。右图:通过微调在四组任务上的操作任务成功率(越高越好)。***
## **能力与早期评估**
因此,FLUX 3 能够混合模态,并联合生成图像和视频+音频;无论是仅凭文本提示,还是在提供输入参考(如图像和视频)时。下面我们重点介绍该模型的一些关键能力。
### **视频**
FLUX 3 可以一次生成长达 20 秒、带有音频的高度多样化视频。
其核心能力包括以下内容(所有输出均自带原生音频生成):
- 文本到视频生成。
- 图像到视频生成,可以从起始帧继续("动画")或使用图像作为视觉参考。
- 从参考片段进行视频到视频生成,将源视频的核心元素(例如相同角色)带入新的场景或情境。
- 从输入视频和音频进行生成式视频-音频延续。
- 关键帧到视频生成,用于在定义的时刻之间进行受控过渡。
- 多语言对话。
- 广泛的视觉风格和宽高比,远远超出传统的 cinematic 输出。
- 将单个片段代理式链接成更长的、多镜头序列。
- 高风格多样性——FLUX 3 Video 轻松处理从自然手持摄像机镜头到动画和电影的各种风格。
- 强大的字体生成和动画设计。
对于以下初步分析,我们生成了 720p 的 10 秒文本到视频片段并带有音频。
***评估尚处于早期,我们预计会有进一步改进***
由于模型及其工具仍在开发中,这些结果是初步的,我们预计在早期访问阶段会有进一步改进。在早期评估中,FLUX 3 在高达 69% 的比较中优于 Grok Imagine Video,在 60% 的比较中优于 Kling v3 Pro,在 59% 的比较中优于 Happy Horse v1,在 57% 的比较中优于 Happy Horse 1.1,在 52% 的比较中优于 Seedance 2.0 和 Gemini Omni Flash。FLUX 3 在 77% 的比较中优于 Runway Gen-4.5,在 93% 的比较中优于 Luma Ray 3.2。
虽然仍在开发中,FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已经特别出色。此外,这些能力可以组合起来创建长达几分钟的序列,其中视觉参考有助于确保角色在所有场景中保持一致。
FLUX 3 Video 现已在此提供早期访问 (https://bfl.ai/models/flux-3)
### **图像**
FLUX 3 可以以多种风格、宽高比和分辨率合成和编辑图像。在训练中期进行的初步评估中,FLUX 3 已经显示出比早期版本 FLUX 的显著改进:其处理复杂提示和文本生成的能力已显著提高。该模型产生广泛的输出风格(参见以下示例),并且能够以多种语言渲染高精度的文本。
与视频评估一样,这些是初步结果,我们预计在发布前会有进一步改进。我们将在未来几周内为 FLUX 3 Image 开启早期访问阶段。
### **行动**
FLUX 3 对世界的理解扩展到动作预测。我们采取了两种途径:将原生动作预测直接集成到 FLUX 3 中,扩展我们在 Self-Flow 中的初步工作;以及使用预训练的视频骨干作为动力学感知的基础,专门的行动模型可以基于有限的任务特定数据从中进行微调。
对于第二种途径,mimic robotics 是首批获得 FLUX 3 早期访问的合作伙伴之一。我们共同开发了 FLUX-mimic,一个结合了 FLUX 3 骨干与 mimic 在机器人学习(用于灵巧操作和生产部署)方面专业知识的视频-行动模型。阅读我们的论文,了解为什么物理 AI 和内容创作基于相同的基础,以及它如何在大众汽车 (Audi) 的真实生产任务中进行测试 (https://bfl.ai/blog/flux-3-mimic)。
### **发布计划**
在接下来的几周和几个月内,我们将提供以下能力,每种能力在早期访问阶段之后推出,以确保顺利部署、收集反馈和进行严格的安全测试。所有能力都基于相同的底层多模态流匹配模型构建。这些能力和模型包括:
- 通过 API 和私有权重访问进行视频和音频生成与编辑。("FLUX 3 Video")
- 通过选定的研究和商业合作伙伴进行动作预测,从 mimic robotics 开始("FLUX-mimic 和 FLUX 3 Action")
- 通过 API 和私有权重访问进行图像合成与编辑。("FLUX 3 Image")
- 开放权重访问多模态骨干,用于内容创作(视频、音频和图像)和动作预测。("FLUX 3 Dev")
我们还将发布更多关于底层方法的技术细节。
**在此申请早期访问** (https://tally.so/r/44d9NX)
## **下一步是什么?**
我们才刚刚开始探索多功能、强大、统一的多模态模型及其所能实现的可能性。从交互式图像和视频编辑、模拟到计算机使用和物理 AI,前沿领域十分广阔。在我们逐步推出这些新能力的同时,我们已经在研究下一代模型。我们的目标是统一感知、行动和语言预测到同一个统一模型中。
如果您有兴趣探索和使用 FLUX 3 进行构建,请在此联系我们。如果您有兴趣为我们的使命做出贡献,请加入我们!我们正在德国和美国招聘 (https://bfl.ai/careers)。
相似文章
BFL 推出 FLUX 3 - 支持图像、视频和音频的多模态模型
BFL 推出了 FLUX 3,这是一个能够生成图像、视频和音频的多模态 AI 模型。
Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测
Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。
Flux 3 X Mimic:新一代视频-动作模型
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
FLUX 3 - 现实世界模型:迈向多模态流模型作为视觉智能的骨干
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
FLUX.2 [pro]
Black Forest Labs 发布了 Flux 2 Pro,一款全新的图像生成与编辑模型,在文本渲染、逼真度和角色一致性方面均有提升。该模型已通过 Replicate 的 API 提供。