Flux 3

Hacker News Top 模型

摘要

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/24 07:59

# FLUX 3 - 真实世界模型:迈向多模态流模型,成为视觉智能的基石。 来源:https://bfl.ai/blog/flux-3 *FLUX 3 现已提供早期访问。* FLUX 3 是我们最新的多模态基础模型。它在一个统一的架构中共同学习图像、视频和音频,因为模型需要学习的不是这些元素中的任何一个孤立部分。相反,模型必须学习一个世界的表征:物体如何保持结构,事物如何运动,以及事件听起来如何。 没有任何单一模态能提供完整的描述。每一种都是对同一底层现实的投影,由不同的传感器捕获,每个传感器在此过程中都会丢失一些信息。图像捕捉特定时间点的空间结构和关系。视频恢复了时间的维度,揭示了时间动态和物理定律。音频揭示了视觉无法单独检测到的机械现象与声学之间的因果关系。语言将这些感知与目标、抽象概念和指令联系起来。 只从一种模态学习,你只能得到那个投影的良好模型。如果同时从所有模态学习,它们的相互约束会告诉你更多:声音必须与撞击匹配,运动必须服从质量,未来必须遵循过去。模态不再是独立的,而是成为关于一个底层现实的证据。 FLUX 3 是我们第一个完全基于这一原则构建的模型,也是我们开发真实世界视觉智能使命中的一个里程碑:能够感知、预测并在物理和数字环境中行动的模型。在内容创作和物理 AI 方面的早期结果表明,这是一条正确的道路。 ## **FLUX 3:一个模型,多种能力。** FLUX 3 基于 Self-Flow (https://bfl.ai/research/self-flow) 构建,这是我们用于在同一底层架构中高效对齐多模态生成和理解的方法。基于这一方法,我们大幅扩展了计算和数据资源,以同时训练 FLUX 3 在视频、图像和音频上的能力。 ***Self-Flow 与 Flow Matching (FM) 对比。左图:每种模态的生成误差(Fréchet 距离),均归一化到 FM = 100(越低越好)。右图:通过微调在四组任务上的操作任务成功率(越高越好)。*** ## **能力与早期评估** 因此,FLUX 3 能够混合模态,并联合生成图像和视频+音频;无论是仅凭文本提示,还是在提供输入参考(如图像和视频)时。下面我们重点介绍该模型的一些关键能力。 ### **视频** FLUX 3 可以一次生成长达 20 秒、带有音频的高度多样化视频。 其核心能力包括以下内容(所有输出均自带原生音频生成): - 文本到视频生成。 - 图像到视频生成,可以从起始帧继续("动画")或使用图像作为视觉参考。 - 从参考片段进行视频到视频生成,将源视频的核心元素(例如相同角色)带入新的场景或情境。 - 从输入视频和音频进行生成式视频-音频延续。 - 关键帧到视频生成,用于在定义的时刻之间进行受控过渡。 - 多语言对话。 - 广泛的视觉风格和宽高比,远远超出传统的 cinematic 输出。 - 将单个片段代理式链接成更长的、多镜头序列。 - 高风格多样性——FLUX 3 Video 轻松处理从自然手持摄像机镜头到动画和电影的各种风格。 - 强大的字体生成和动画设计。 对于以下初步分析,我们生成了 720p 的 10 秒文本到视频片段并带有音频。 ***评估尚处于早期,我们预计会有进一步改进*** 由于模型及其工具仍在开发中,这些结果是初步的,我们预计在早期访问阶段会有进一步改进。在早期评估中,FLUX 3 在高达 69% 的比较中优于 Grok Imagine Video,在 60% 的比较中优于 Kling v3 Pro,在 59% 的比较中优于 Happy Horse v1,在 57% 的比较中优于 Happy Horse 1.1,在 52% 的比较中优于 Seedance 2.0 和 Gemini Omni Flash。FLUX 3 在 77% 的比较中优于 Runway Gen-4.5,在 93% 的比较中优于 Luma Ray 3.2。 虽然仍在开发中,FLUX 3 Video 在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面已经特别出色。此外,这些能力可以组合起来创建长达几分钟的序列,其中视觉参考有助于确保角色在所有场景中保持一致。 FLUX 3 Video 现已在此提供早期访问 (https://bfl.ai/models/flux-3) ### **图像** FLUX 3 可以以多种风格、宽高比和分辨率合成和编辑图像。在训练中期进行的初步评估中,FLUX 3 已经显示出比早期版本 FLUX 的显著改进:其处理复杂提示和文本生成的能力已显著提高。该模型产生广泛的输出风格(参见以下示例),并且能够以多种语言渲染高精度的文本。 与视频评估一样,这些是初步结果,我们预计在发布前会有进一步改进。我们将在未来几周内为 FLUX 3 Image 开启早期访问阶段。 ### **行动** FLUX 3 对世界的理解扩展到动作预测。我们采取了两种途径:将原生动作预测直接集成到 FLUX 3 中,扩展我们在 Self-Flow 中的初步工作;以及使用预训练的视频骨干作为动力学感知的基础,专门的行动模型可以基于有限的任务特定数据从中进行微调。 对于第二种途径,mimic robotics 是首批获得 FLUX 3 早期访问的合作伙伴之一。我们共同开发了 FLUX-mimic,一个结合了 FLUX 3 骨干与 mimic 在机器人学习(用于灵巧操作和生产部署)方面专业知识的视频-行动模型。阅读我们的论文,了解为什么物理 AI 和内容创作基于相同的基础,以及它如何在大众汽车 (Audi) 的真实生产任务中进行测试 (https://bfl.ai/blog/flux-3-mimic)。 ### **发布计划** 在接下来的几周和几个月内,我们将提供以下能力,每种能力在早期访问阶段之后推出,以确保顺利部署、收集反馈和进行严格的安全测试。所有能力都基于相同的底层多模态流匹配模型构建。这些能力和模型包括: - 通过 API 和私有权重访问进行视频和音频生成与编辑。("FLUX 3 Video") - 通过选定的研究和商业合作伙伴进行动作预测,从 mimic robotics 开始("FLUX-mimic 和 FLUX 3 Action") - 通过 API 和私有权重访问进行图像合成与编辑。("FLUX 3 Image") - 开放权重访问多模态骨干,用于内容创作(视频、音频和图像)和动作预测。("FLUX 3 Dev") 我们还将发布更多关于底层方法的技术细节。 **在此申请早期访问** (https://tally.so/r/44d9NX) ## **下一步是什么?** 我们才刚刚开始探索多功能、强大、统一的多模态模型及其所能实现的可能性。从交互式图像和视频编辑、模拟到计算机使用和物理 AI,前沿领域十分广阔。在我们逐步推出这些新能力的同时,我们已经在研究下一代模型。我们的目标是统一感知、行动和语言预测到同一个统一模型中。 如果您有兴趣探索和使用 FLUX 3 进行构建,请在此联系我们。如果您有兴趣为我们的使命做出贡献,请加入我们!我们正在德国和美国招聘 (https://bfl.ai/careers)。

相似文章

Flux 3 X Mimic:新一代视频-动作模型

Hacker News Top

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。

FLUX.2 [pro]

Replicate Explore

Black Forest Labs 发布了 Flux 2 Pro,一款全新的图像生成与编辑模型,在文本渲染、逼真度和角色一致性方面均有提升。该模型已通过 Replicate 的 API 提供。