@mattpocockuk: 这是我在 AI Engineer Paris 上的演讲:我宣布了 /retro 和 /pr,并讨论了如何更快地通过你的组织获得更多 PR……
摘要
在 AI Engineer Paris 上,Black Forest Labs 展示了如何为机器人和视频游戏定制他们的 Flux 模型,详细介绍了专注于提示工程、安全性和微调的六步流程。
查看缓存全文
缓存时间: 2026/09/27 15:25
以下是在AI Engineer Paris的演讲内容:
我宣布了 /retro 和 /pr 功能,并讨论了如何通过以下方式在组织内更快获得更多PR(拉取请求):
- 避免生成低质量内容
- 使用 /pr 让PR更易于审查
https://t.co/LphXCNDZCF
摘要: Black Forest Labs展示了其视频生成模型Flux 3如何通过一个聚焦于提示工程、安全配置和模型微调的六步流程,不仅用于媒体创作,还能控制机器人和玩电子游戏。
引言:从图像/视频生成到机器人技术
在AI Engineer Paris 2024大会上,Black Forest Labs的代表展示了其基础模型Flux的多功能性。该模型虽以生成高质量图像和视频闻名,但团队正在将其核心技术应用于控制机器人和玩电子游戏。
演讲重点指出,媒体生成与现实世界控制之间的关联在于Flux模型的定制化。该预训练模型经过设计,能深度理解视觉世界及其中物体的行为。Black Forest Labs的AI解决方案团队专门针对特定新型用例,对这一强大基础模型进行微调。
Flux定制化流程:六个关键步骤
为实现针对性效果,Black Forest Labs采用了一个结构化的六步推理流程。该框架概述了与企业客户合作时进行定制化的主要途径:
- 用户输入: 用户的初始输入,可以是文本、图像或视频提示词。
- 提示词上采样: 在用户与Flux模型之间加入一个大型语言模型(LLM)或视觉语言模型(VLM)。其作用是解读用户的真实意图,并重新组织或扩展提示词,使其更好地匹配模型的训练分布,从而达到预期输出效果。
- 审核与安全: 一个关键的产品层,决定哪些内容可见或被允许。这主要独立于模型权重之外,但对用户体验至关重要,且可以进行定制。
- 模型本身: 核心Flux模型权重。此处的定制化包括使用LoRAs针对特定风格、角色或行为进行微调,也支持添加全新的模态,如用于机器人的动作控制。
- 后处理: 初始生成后可选的步骤,如超分辨率放大、修复或进一步的内容审核。
- 部署与优化: 关注模型如何被服务、优化,并可能针对特定硬件或延迟要求进行蒸馏。
定制化途径一:提示词上采样
提示词上采样利用中间层的LLM/VLM,在用户的原始请求与模型的最佳生成点之间架起桥梁。
- 基础示例: 像“森林中的小屋”这样简单的用户提示词可能会生成一张通用图像。上采样器可以将其扩展为“超写实、右视角、石制烟囱、柔和的金色光晕”,引导模型根据学习到的用户偏好,走向更具体的美学方向。
- 企业案例研究: 一位客户需要为其应用内随机生成的机器对话主题(如“家庭友好型旅行目的地”或“清空洗碗机”)生成插图。关键挑战在于遵守严格的设计要求:主体必须在右侧,图像必须干净,左侧需要留出充足空间用于添加文字。
- 未使用上采样: 输出内容混乱且差异巨大。
- 使用通用上采样器: 输出倾向于插图风格,但不符合设计规则。
- 使用定制配置的上采样器: 通过工程化设计系统提示词,使其既能理解用户意图,又能掌握严格的设计规则,从而始终生成主体位置正确、构图干净整洁的图像。
这种方法强大之处在于其高度可迭代性(仅需提示词工程,无需重新训练),并提供了最大的灵活性。它通过将模糊的请求转化为精确的模型指令,直接解决了用户需求模糊的问题。
定制化途径二:审核与安全配置
审核是定义用户体验的基础产品层,通过允许或屏蔽特定内容来实现。Black Forest Labs提供两种主要的定制方法:
- 基于配置(API设置): 一个模块化系统允许通过参数进行精细控制:
- 安全容忍度: 控制内容严格程度的通用设置。
- 类别控制: 允许或屏蔽特定类别,如暴力、性内容、自残、知识产权(IP)及真人肖像。
- 屏蔽/允许列表: 针对特定用例的自定义列表(例如,儿童平台屏蔽所有敏感类别;媒体工作室可能允许特定授权角色,同时屏蔽所有其他角色)。
- 嵌入模型权重中: 对于部署在客户基础设施上、未提供完整审核体系的场景,安全和审核规则直接嵌入到模型的权重本身。
这种定制化对多样化的客户至关重要。例如,时尚零售商可能允许更多暗示性内容,但会屏蔽竞争对手品牌;而电影工作室可能需要对授权的暴力内容保持灵活性,但对未授权角色则严格执行IP保护。
来源:https://www.youtube.com/watch?v=g0vqT_wZtXA
相似文章
@charles_irl: about to present this work (and a new surprise ) at @aiDotEngineer Paris! catch it on the livestream starting at 14:30 …
Jakob Porchman from Black Forest Labs presented at AI Engineer Paris on customizing the Flux video generation model for robot control and gaming, highlighting methods like prompt upsampling and content moderation.
@mattpocockuk: 向@aiDotEngineer Paris提交了一个演讲 "Fixing The PR Bottleneck" - 关于如何应用软件基础来...
一条推文宣布,一个题为'Fixing The PR Bottleneck'的演讲已提交给AI Engineer Paris活动,重点是如何应用软件基础和自动化审查来加速拉取请求,该演讲将被录制并在YouTube上分享。
@mattpocockuk: 下周四在@aiDotEngineer Paris演讲中的一张实际幻灯片。人们有种疯狂的想法,认为他们的执行代理应该……
Matt Pocock分享他在AI Engineer Paris即将到来的演讲中的一张幻灯片,讨论了从执行代理隐藏编码标准以便在代码审查中修复它们的观点。
@stephenbtl: My talk at @aiDotEngineer is now online. I talked about our research and where @bfl_ml is heading. Thanks @swyx for the…
Black Forest Labs 在 AI Engineer 大会上分享了 Flux 系列模型的演进历程,并发布了 SelfFlow 研究论文,提出了一种无需外部编码器的自监督多模态训练方法。
@mattpocockuk:我最近做了一个爆火的演讲,@swyx 让我写点东西解释一下我是怎么做到的——以帮助未来的 AIE 演讲者……
Matt Pocock 分享关于如何做好 AI 会议演讲的建议,他结合自己作为语音教练的背景,讨论了如何管理紧张感、呼吸、观众互动以及幻灯片设计。