@mattpocockuk: 这是我在 AI Engineer Paris 上的演讲:我宣布了 /retro 和 /pr,并讨论了如何更快地通过你的组织获得更多 PR……

X AI KOLs Timeline 新闻

摘要

在 AI Engineer Paris 上,Black Forest Labs 展示了如何为机器人和视频游戏定制他们的 Flux 模型,详细介绍了专注于提示工程、安全性和微调的六步流程。

这是我在 AI Engineer Paris 上的演讲: 我宣布了 /retro 和 /pr,并讨论了如何更快地通过你的组织获得更多 PR,通过: - 避免粗制滥造 - 使 PR 更易于审查(使用 /pr) https://t.co/LphXCNDZCF
查看原文
查看缓存全文

缓存时间: 2026/09/27 15:25

以下是在AI Engineer Paris的演讲内容:

我宣布了 /retro 和 /pr 功能,并讨论了如何通过以下方式在组织内更快获得更多PR(拉取请求):

  • 避免生成低质量内容
  • 使用 /pr 让PR更易于审查

https://t.co/LphXCNDZCF


摘要: Black Forest Labs展示了其视频生成模型Flux 3如何通过一个聚焦于提示工程、安全配置和模型微调的六步流程,不仅用于媒体创作,还能控制机器人和玩电子游戏。

引言:从图像/视频生成到机器人技术

在AI Engineer Paris 2024大会上,Black Forest Labs的代表展示了其基础模型Flux的多功能性。该模型虽以生成高质量图像和视频闻名,但团队正在将其核心技术应用于控制机器人和玩电子游戏。

演讲重点指出,媒体生成与现实世界控制之间的关联在于Flux模型的定制化。该预训练模型经过设计,能深度理解视觉世界及其中物体的行为。Black Forest Labs的AI解决方案团队专门针对特定新型用例,对这一强大基础模型进行微调。

Flux定制化流程:六个关键步骤

为实现针对性效果,Black Forest Labs采用了一个结构化的六步推理流程。该框架概述了与企业客户合作时进行定制化的主要途径:

  1. 用户输入: 用户的初始输入,可以是文本、图像或视频提示词。
  2. 提示词上采样: 在用户与Flux模型之间加入一个大型语言模型(LLM)或视觉语言模型(VLM)。其作用是解读用户的真实意图,并重新组织或扩展提示词,使其更好地匹配模型的训练分布,从而达到预期输出效果。
  3. 审核与安全: 一个关键的产品层,决定哪些内容可见或被允许。这主要独立于模型权重之外,但对用户体验至关重要,且可以进行定制。
  4. 模型本身: 核心Flux模型权重。此处的定制化包括使用LoRAs针对特定风格、角色或行为进行微调,也支持添加全新的模态,如用于机器人的动作控制。
  5. 后处理: 初始生成后可选的步骤,如超分辨率放大、修复或进一步的内容审核。
  6. 部署与优化: 关注模型如何被服务、优化,并可能针对特定硬件或延迟要求进行蒸馏。

定制化途径一:提示词上采样

提示词上采样利用中间层的LLM/VLM,在用户的原始请求与模型的最佳生成点之间架起桥梁。

  • 基础示例: 像“森林中的小屋”这样简单的用户提示词可能会生成一张通用图像。上采样器可以将其扩展为“超写实、右视角、石制烟囱、柔和的金色光晕”,引导模型根据学习到的用户偏好,走向更具体的美学方向。
  • 企业案例研究: 一位客户需要为其应用内随机生成的机器对话主题(如“家庭友好型旅行目的地”或“清空洗碗机”)生成插图。关键挑战在于遵守严格的设计要求:主体必须在右侧,图像必须干净,左侧需要留出充足空间用于添加文字。
    • 未使用上采样: 输出内容混乱且差异巨大。
    • 使用通用上采样器: 输出倾向于插图风格,但不符合设计规则。
    • 使用定制配置的上采样器: 通过工程化设计系统提示词,使其既能理解用户意图,又能掌握严格的设计规则,从而始终生成主体位置正确、构图干净整洁的图像。

这种方法强大之处在于其高度可迭代性(仅需提示词工程,无需重新训练),并提供了最大的灵活性。它通过将模糊的请求转化为精确的模型指令,直接解决了用户需求模糊的问题。

定制化途径二:审核与安全配置

审核是定义用户体验的基础产品层,通过允许或屏蔽特定内容来实现。Black Forest Labs提供两种主要的定制方法:

  1. 基于配置(API设置): 一个模块化系统允许通过参数进行精细控制:
    • 安全容忍度: 控制内容严格程度的通用设置。
    • 类别控制: 允许或屏蔽特定类别,如暴力、性内容、自残、知识产权(IP)及真人肖像。
    • 屏蔽/允许列表: 针对特定用例的自定义列表(例如,儿童平台屏蔽所有敏感类别;媒体工作室可能允许特定授权角色,同时屏蔽所有其他角色)。
  2. 嵌入模型权重中: 对于部署在客户基础设施上、未提供完整审核体系的场景,安全和审核规则直接嵌入到模型的权重本身。

这种定制化对多样化的客户至关重要。例如,时尚零售商可能允许更多暗示性内容,但会屏蔽竞争对手品牌;而电影工作室可能需要对授权的暴力内容保持灵活性,但对未授权角色则严格执行IP保护。

来源:https://www.youtube.com/watch?v=g0vqT_wZtXA

相似文章