@charles_irl: about to present this work (and a new surprise ) at @aiDotEngineer Paris! catch it on the livestream starting at 14:30 …
摘要
Jakob Porchman from Black Forest Labs presented at AI Engineer Paris on customizing the Flux video generation model for robot control and gaming, highlighting methods like prompt upsampling and content moderation.
查看缓存全文
缓存时间: 2026/09/25 04:39
about to present this work (and a new surprise ) at @aiDotEngineer Paris! catch it on the livestream starting at 14:30 CEST, about 5h16m in https://youtube.com/live/g0vqT_wZtXA?is=AQwvQyh3aVnUOQTs…
TL;DR: Black Forest Labs的Jakob Porchman在AI Engineer Paris上展示了如何将他们的视频生成模型Flux应用于控制机器人和玩电子游戏,并详细介绍了推理流程中的关键定制方法,包括提示上采样和内容审核。
Black Forest Labs与Flux模型介绍
Jakob Porchman领导Black Forest Labs的AI解决方案团队,这是一个四人的部署工程和解决方案工程团队。Black Forest Labs是一家基于德国的研究实验室,构建用于图像生成的基础图像和视频模型。
演讲开始时,Jakob通过一个问题与观众互动:有多少人以前使用AI生成过图像或视频?他指出,由于Black Forest Labs的Flux模型在图像和视频生成领域非常普遍,大多数人都可能接触过。他展示了使用最新模型Flux 3生成的图像和视频样本。
Jakob提出了一个看似修辞性的问题:如果他告诉观众,同样的视频模型可以用来控制机器人和玩电子游戏,有多少人会相信?这引出了他演讲的核心主题:如何定制Flux模型,使其不仅能生成媒体,还能控制电子游戏和机器人。
他展示了两个样本:左边是Flux在玩电子游戏,这不仅仅是生成的视频,而是Flux实际控制并生成正在发生的帧;右边是一个机器人(Lero)使用Flux 3作为智能骨干完成拾取和放置任务。从视频生成到机器人控制之间的桥梁,正是模型的定制。
推理流程的六个步骤
Jakob概述了推理流程的六个步骤,这为理解他们如何定制Flux提供了框架:
- 用户输入:通常是文本提示、图像提示或视频提示,相对直接。
- 提示上采样:在用户提示和Flux模型之间放置一个LLM或VLM,旨在理解用户意图并改进提示,使生成内容更接近用户实际想法。
- 审核:这是一个关键的产品界面,决定了用户能看到什么或看不到什么。它通常不是模型的一部分,但属于用户体验,可以被定制和嵌入模型权重。
- 模型权重:可以进行微调,使用LoRA,为风格、角色、产品或行为进行定制,甚至添加全新的模态(如在Flux 3 Action中所做的)。
- 后处理:包括上采样、恢复、进一步审核等,提供众多的定制机会。
- 模型服务:涉及如何部署、优化、蒸馏模型等。
Jakob表示,他将深入部署工程师的工具箱,探讨日常如何定制Flux,并重点讨论前几个定制向量。
提示上采样的定制
提示上采样是第一个主要的定制向量。它意味着在用户和模型之间有一个VLM或LLM。Jakob用一个例子说明:用户提示“森林中的小木屋”。如果直接发送给Flux模型,会生成一个普通的森林小木屋图像。但通过默认上采样器优化用户偏好,提示被扩展为“超现实、直角、石质壁炉、柔和的金色光线”等,生成了一个更符合潜在偏好的图像。提示上采样步骤可以引导用户意图和生成方向到任何可能的方向。
Jakob分享了一个真实的客户案例。客户希望用Flux图像来图解用户在应用程序中进行的某些对话,这些话题是机器生成的、随机的,例如“家庭友好的旅行目的地”或“为我的洗碗机排水”。任务是生成插图,同时满足设计要求:主题在右边、图像干净、左边留有大量空间用于文本叠加,并且不涉及人物或地标等。
图像模型本身可以生成各种内容,但设计要求成为了瓶颈。提示上采样的作用是将用户提示与设计要求匹配,并将这些要求与Flux的训练分布匹配,找到最佳点。
对于“家庭友好的旅行目的地”这个话题:
- 如果没有上采样,直接发送给Flux,会产生无意义的垃圾图像(如明信片风格),且变化很大。
- 使用默认上采样器(仅优化一般偏好),会生成接近插图但不符合设计要求的图像。
- 通过定制上采样步骤,直接将设计要求嵌入提示上采样中,会生成主题在右边、图像干净光滑、左边留有空间的图像,完全符合设计要求。
第二个例子“洗碗机排水”也展示了类似的结果:没有上采样时生成随机图像;使用默认上采样器时生成教学视频风格但不完全符合要求;定制上采样器后生成干净漂亮的图像,符合所有设计规则。
定制提示上采样的优势在于它迭代得非常快,只需要迭代系统提示,无需训练,并且具有最大的用例灵活性。这对于企业客户非常有用,因为用户往往不了解训练分布或如何完美提示模型,定制上采样可以精确匹配用户意图、设计要求和训练分布。
审核与安全的定制
Jakob强调,审核实际上是最重要的产品界面之一,尤其是在通过API提供模型时。它决定了用户看到什么和不看到什么,允许哪些提示,不允许哪些。他提到,当用户尝试使用一些前沿视频模型时,可能会遇到错误信息,例如“视频可能包含与真实人物相似的面孔”,这并非模型限制,而是审核服务的结果。
当与希望做非常具体事情的大型客户交谈时,这成为一个巨大问题,需要定制和解决。Jakob讨论了审核的两种方式。
首先是配置方式。他们有一个模块化的设置来定制配置,包括一个安全参数,可以通过API设置。对于特定客户定制审核时,有一个非常细粒度的配置设置,可以设置安全容忍度,并允许或阻止特定类别,如暴力、性暗示、自残、知识产权和肖像权。这还可以与阻止列表和允许列表结合,为每个客户专门设置。
Jakob举了三个例子:
- 儿童平台:需要严格得多,阻止暴力、性暗示、自残、知识产权、肖像权,甚至有特定的阻止列表。
- 时尚零售商:可能稍微开放,允许更多性暗示的提示,但特别阻止竞争对手品牌,只允许自己的产品组合。
- 媒体或电影制片厂:更加灵活,允许一些暴力,特别是想允许某些有许可的角色(即使受知识产权保护),并阻止没有许可的所有其他角色。
这种方式相当直接,只需设置配置,非常模块化。
然而,当模型直接部署在客户基础设施上时,他们不会发送整个审核栈,因此需要找到一种方法将审核和安全嵌入模型中……(视频片段到此结束)
Source: https://www.youtube.com/live/g0vqT_wZtXA
Charles 🎉 Frye (@charles_irl): After this, people kept asking us how @modal is able to serve agent inference so well.
So we wrote it all down.
New blog: “How to serve trillions of tokens for trillion-parameter coding agents”.
相似文章
推理基础设施 ... 在法国,我将在 @aiDotEngineer Paris 上分享我们在 @modal 开发的低延迟推理服务方案。
作者将在 AI Engineer Paris 大会上发言,介绍 Modal 用于低延迟推理服务的方案。
@stephenbtl: My talk at @aiDotEngineer is now online. I talked about our research and where @bfl_ml is heading. Thanks @swyx for the…
Black Forest Labs 在 AI Engineer 大会上分享了 Flux 系列模型的演进历程,并发布了 SelfFlow 研究论文,提出了一种无需外部编码器的自监督多模态训练方法。
Flux 3 X Mimic:新一代视频-动作模型
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
@aiDotEngineer:规模化构建生成式图像与视频模型 https://youtube.com/watch?v=xOP1PM8fwnk… 图像生成最近热度很高!
@sedielem 在 YouTube 上的演讲,精炼地回顾了生成式图像与视频模型在规模化时的最新进展,涵盖建模、架构、蒸馏与控制。
@Modular:AI工程师世界博览会第二天@aiDotEngineer!在U-G28展位与团队会面,讨论Mojo、MAX和Modu……
Modular正在AI工程师世界博览会上演示Mojo、MAX和Modular Cloud,使用FLUX.2在DGX Spark上进行快速图像生成,以及实时视频生成。