Flux 3 X Mimic:新一代视频-动作模型
摘要
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 11:00
# FLUX 3 × mimic:下一代视频-动作模型
来源:https://bfl.ai/blog/flux-3-mimic
FLUX 3(我们新的多模态基础模型)的早期版本已部署到机器人上。我们为mimic robotics提供了FLUX 3的早期访问权限。mimic在机器人学习和部署方面的优势,结合模型的世界知识与BFL的基础模型专长,共同打造了FLUX-mimic:下一代视频-动作模型。
### **FLUX**
FLUX 1和FLUX 2生成图像。FLUX 3将能力扩展至多模态,联合生成音视频内容——同时,它也为FLUX-mimic提供了基础:一种与mimic合作开发的视频-动作模型,驱动着已在奥迪测试和部署的机器人。
乍看之下,生成令人信服的视觉内容和控制机器人似乎没有太多共同点。一个需要生成像素,另一个需要理解当你触摸和操纵物理世界时它如何做出反应。如果一个模型能同时做到这两点,那么它从一开始就不仅仅是一个内容创作模型。它是一个关于世界如何运转的模型,而内容创作只是其应用之一。
这就是FLUX 3的本质。
### **视频是难点**
FLUX 3是一个从开始就联合训练图像、视频和音频的单一模型。训练中最具挑战性的部分——占总计算成本的95%以上——是视频预测。为了生成逼真的视频,模型必须学习接触、运动、重量、因果关系;其中任何一项出错,结果都会看起来不自然。准确地渲染世界意味着学习世界如何运转。
相对而言,音频是简单的模态。维度低且远不如视频详细,在720p带音频视频中,音频仅占不到0.5%的token。一旦模型完成了学习视频理解这项艰巨任务,它就能学习视频与音频之间的因果关系,从而预测与唇部运动同步的语音,以及与引发它们的物理事件同步的音频效果。
动作遵循同样的形式:一种低维度的机器人状态表示,与视觉观察紧密耦合。动作、音频和视频帧都是同一个底层物理现实的部分表征。在模型学习了视频和音频背后的物理过程之后,动作预测并非新的开始——而是它已经建模的现实又一视角。
### **单一主干网络**
如果这个框架是正确的,那么教FLUX 3预测动作应该不会产生持续的成本:我们预期会出现短暂的扰动阶段,因为模型需要学习动作空间的结构并将其内部世界表征与之对齐,然后恢复到完整性能。这正是我们观察到的。
在一次大规模训练中,我们将动作预测加入训练课程,并观察其对视频生成质量的影响。在文本到视频和图像到视频任务上,人工评分最初下降了高达10%,因为模型开始整合新的动作模态。经过3500步训练后,模型在视频生成任务上恢复了之前的全部质量,同时还能预测动作。
***每个系列都相对于添加动作预测前的自身质量进行了归一化。越高越好。***
模型必须将动作整合到其输入和输出中——但这并未永久占用其能力。它只是需要学习这种新模态如何与其现有的世界模型相关联。一旦弄清楚了这一点,对现有能力的性能损失就消失了。视频生成和动作预测不需要独立的基础。同一个主干网络承载着两者。
这使得物理AI成为Black Forest Labs路线图的自然延伸,而非方向的改变。内容创作是我们的多模态FLUX 3主干网络对图像、视频和音频所做的操作。物理AI则是它对动作所做的操作。一个以视觉智能为核心的基础模型,支撑着两个应用家族。我们没有构建一个独立的基础模型,而是专注于困难的事情:构建一个理解世界的模型。在这个世界中行动正是这种理解所带来的可能。
### **从实验室到现实:FLUX-mimic**
当我们将FLUX 3主干网络指向真实生产线上的实际自动化任务时,会发生什么?
这就是mimic和BFL创建FLUX-mimic要回答的问题。mimic建造自己的机器人,并在机器人学习、灵巧操作和生产部署方面拥有专长;BFL构建视觉基础模型,并在多模态训练和建模方面拥有专长。我们共同构建了下一代通用操作模型——针对行业需求进行了适配,并集成到mimic的全栈部署系统中。FLUX-mimic是一个基于FLUX 3主干网络的视频-动作模型。
### **解码学到的世界模型**
我们的论点是,FLUX 3必须学习一个世界的内部表征才能生成视频。FLUX-mimic贯彻了这一论点,并从FLUX主干网络已学到的世界表征中解码出动作。这种在mimic-video中首创的方法,在从FLUX视频预测路径提取的中间特征之上,训练了一个轻量级动作解码器。
***FLUX-mimic如何构建在FLUX 3之上的架构总览 ***
这种方法成功与否取决于两个相关但不同的方面:FLUX学到的世界模型的质量,以及这个世界模型的特征表征的质量。世界模型的质量与生成质量直接相关:如果模型不理解世界如何运转,它就无法模拟。然而,即使是最好的世界模型,如果其表征不可访问,也无助于动作解码器:如果特征空间以非线性方式纠缠了各模态之间的因果关系,那么从特征表征中理解这些关系仍与从原始输入中理解它们一样困难——表征质量至关重要。
生成质量和表征质量长期以来一直被孤立地研究和处理。生成方法产生高质量的世界模型,能够进行模拟,并展现出在计算投资上可预测回报的缩放定律。然而,与更专门化的表征学习方法相比,它们产生的表征解缠程度较低,这限制了它们在世界理解任务上的实用性。
由于生成模型本身依赖于自身的特征,它们在表征质量上的这种差异似乎违反直觉。生成模型中改进的表征应能提高其世界模型的质量,并使其更适用于下游任务。在我们的工作中,Self-Flow展示了如何在一个统一的框架中整合生成和表征学习,并观察到了这种互惠改进:世界模型得到提升(通过视频、图像和音频的生成质量衡量),其表征质量也得到提升(通过模拟中机器人控制任务的成功率衡量)。
***Self-Flow与流匹配对比。左图:每个模态的生成误差,均归一化为FM=100。右图:通过微调在四组操作任务上的平均成功率。***
### **扩展世界模型**
缩放定律在Self-Flow中依然成立,而FLUX 3正是其应用:Self-Flow的规模化版本。它使用数千万小时的一般视频内容进行训练,从一开始就尽可能广泛地学习世界动态;并使用数十万小时专注于人类和机器人操作任务的视频内容进行训练,为作为视觉智能的主干网络做好准备。这种规模化将Self-Flow的成功从实验室带到了现实世界。mimic已将FLUX-mimic部署到真实的工厂用例中,涵盖了生产和物流工作的日常现实:将零件组装到结构化托盘、将电子控制单元插入紧密配合的夹具、组装组件,以及处理密封件和线缆等传统自动化从未能触碰的柔软柔性材料。
基准测试表明,即使FLUX主干网络完全冻结——在这种情况下之前的视觉-语言-动作模型无法成功——动作解码器的表现也优于之前的视觉-语言-动作模型。这突显了规模化如何赋予我们的主干网络强大的世界知识以及在其中行动的知识,以及Self-Flow如何使这些知识易于从主干网络的特征表征中解码出来。在将主干网络与动作解码器一起微调时,FLUX-mimic达到了最先进的成功率。
***虚线标记每个模型在20次自主试验中的中位成功率。越高越好。***
### **从世界知识到可工作的任务**
一个将世界知识暴露在可解码表征中的主干网络,改变了教会机器人新任务所需的条件。如果物理规律已经存在于表征中且易于获取,那么适应一个任务就不再是教模型世界如何运作——它只需学习这个特定任务如何映射到它已知的事物上。昂贵的工作在机器人移动之前就已经完成了。
这直接体现在新任务所需演示数据的数量上。在我们的Self-Flow实验中,动作预测达到给定成功率所需的训练步骤比没有Self-Flow的视频模型少一半——更好的表征使得世界知识更容易提取,因此达到相同能力所需的数据更少。mimic-video论文报告称,视频-动作模型相对于视觉-语言-动作模型的样本效率提高了高达10倍;FLUX-mimic结合了这两者的效果。
同样的好处也体现在行为上。FLUX-mimic能够自然地从失败中恢复:一个抓取失败的机器人会自我纠正,再次抓取,并完成任务。没有哪套演示集能覆盖任务可能出错的所有方式。未被演示过的恢复能力必须来自其他地方——来自一个已经了解世界如何运作的模型。
***主干网络预测的未来,以及机器人从解码出的动作中产出的实际执行结果。***
### **快到足以行动**
现实世界的部署设定了一个硬性约束:模型必须与世界运行的速度一样快。FLUX-mimic的主要计算成本在于主干网络。它是模型中最大的组件,并且在mimic优化过的部署栈中,其延迟实际上为整个系统设定了上限。
这正是我们的方法论第二次产生回报的地方。更好的表征意味着每个参数具有更高的能力:一个学习了结构良好世界模型的模型,达到给定性能水平所需的容量,比一个没有这样学习的模型要少。对于部署而言,这直接意味着能够运行更小的主干网络——而更小的主干网络就是更快的模型。
***1.0M训练步数时的CLIP分数;越高越好。主干网络深度是部署延迟的主要驱动因素,因此更少的层意味着更快的模型。***
结果是,FLUX-mimic的主干网络可以优化到在单块NVIDIA RTX 5090 GPU上,从输入到世界表征的运行时间少于80毫秒——这与人类视觉反应时间处于同一数量级。
现实世界的部署需要对整个部署栈进行额外优化,以避免增加任何额外延迟:mimic的优化范围从动作解码器,到削减传感器、模型和执行器之间的进程间延迟,再到实时分块,使得预测和执行能够重叠进行,从而保持机器人平稳运行,无抖动。最终成果是一个反应时间为101毫秒的自包含机器人系统。
### **在工厂车间**
所有这一切都回到了自动化最重要的地方:工厂。奥迪运行着汽车行业最自动化的生产网络之一——这使其能够精确看到传统自动化仍然止步的地方。尽管进行了数十年的机器人投资,但涉及柔性零件和精细操作的任务仍然由人工完成,这主要是出于经济原因:优质生产的变体多样性使得传统编程的机器人单元针对每种情况进行重新改造的成本过高。基于学习的系统改变了这一计算方式。
"与mimic合作,奥迪一直在测试和部署FLUX-mimic。我们目睹了这些机器人解决了那些使用传统机器人根本不可能完成的复杂软体操作工作。这对于协助我们的员工、提高效率以及在生产与物流运营中扩展柔性自动化具有重大影响。对我们而言,与mimic和Black Forest Labs这样的先锋公司合作,对于推动物理AI的前沿并在真实生产环境中验证这些创新至关重要。" — Christoph Schneider,奥迪生产实验室
### **结语**
FLUX-mimic是一个为机器人量身定制的模型——也是未来发展方向的一个证明。它的样本效率和鲁棒性来自FLUX 3主干网络及其暴露的表征质量,而非特定于任务的工程设计。这使得该方法能够跨任务、跨行业、跨硬件进行迁移。通过mimic了解更多。
一个以视觉智能为核心的模型,生成图像、视频和音频——同时驱动生产线上的机器人。内容创作和物理AI是同一个基础的两个应用。
相似文章
Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测
Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。
Flux 3
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,能够共同从图像、视频和音频中学习,实现跨模态的统一生成和理解,现已开放早期访问。
BFL 推出 FLUX 3 - 支持图像、视频和音频的多模态模型
BFL 推出了 FLUX 3,这是一个能够生成图像、视频和音频的多模态 AI 模型。
FLUX 3 - 现实世界模型:迈向多模态流模型作为视觉智能的骨干
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
FLUX.2 [pro]
Black Forest Labs 发布了 Flux 2 Pro,一款全新的图像生成与编辑模型,在文本渲染、逼真度和角色一致性方面均有提升。该模型已通过 Replicate 的 API 提供。