Flow-Direct: 通过非参数引导场实现高效反馈与可复用的流模型引导
摘要
Flow-Direct 提出了一种用于基于流的生成模型的非参数引导场,该引导场持续累积奖励反馈,提高了反馈效率,并使得收集的样本可重复用于引导多目标生成,无需额外的奖励评估。
arXiv:2605.16348v1 公告类型: 新
摘要: 无训练引导使得预训练的扩散模型和流模型能够利用外部黑盒奖励函数的反馈来优化特定应用的目标。然而,现有方法存在反馈效率低下的问题,因为奖励反馈仅被短暂用于告知局部的梯度近似或离散搜索决策,随后便被丢弃。为解决这一局限,我们提出 Flow-Direct,一种通过持久引导场来引导生成过程的框架。理论上,该引导场由基础分布与奖励加权目标分布之间的对数密度比解析推导得出;它将预训练分布迁移到目标分布。在实践中,该引导场实现为一个非参数估计器,由所有累积的经过奖励评估的样本构建而成。随着优化过程中收集更多样本,这一经验引导场的精度逐渐提高。这种持久化形式带来了两大优势。首先,Flow-Direct 具有极高的反馈效率:因为每个评估过的样本都用于改进全局引导场,没有任何奖励信息被浪费。其次,该框架天然具有可复用性:一旦优化完成,所收集的数据集便定义了一个可复用的引导场,用于生成新的目标样本而无需额外的奖励评估,并且不同的引导场可以组合起来生成同时满足多个目标的样本。
查看缓存全文
缓存时间: 2026/05/19 06:41
# Flow-Direct: 通过非参数引导场实现流动模型的反馈高效可复用引导
来源:https://arxiv.org/html/2605.16348
Kim Yong Tan¹ 吕岳明²,³ Ivor Tsang¹,²,³ 王友顺¹,²,³
¹ 南洋理工大学计算机与数据科学学院,新加坡
² 新加坡科技研究局前沿人工智能研究中心
³ 新加坡科技研究局高性能计算研究所
{KIMYONG001,ASYSOng}@ntu.edu.sg {Lyu_Yueming,Ivor_Tsang}@cfar.a-star.edu.sg
###### 摘要
免训练引导方法使预训练的扩散模型和流动模型能够利用外部黑盒奖励函数的反馈来优化特定应用的目标。然而,现有方法存在反馈效率低下的问题,因为奖励反馈仅在局部梯度近似或离散搜索决策时被短暂使用,随后便被丢弃。为解决此局限性,我们提出 Flow-Direct,一种通过持久引导场来指导生成过程的框架。理论上,该引导场由基础分布与奖励加权目标分布之间的对数密度比解析推导得出;它能够将预训练分布输送到目标分布。实践中,该场通过一个由所有累积的奖励评估样本构建的非参数估计器来实现。随着优化过程中收集到更多样本,这一经验引导场的精度会不断提升。这种持久化公式带来了两个主要优势。首先,Flow-Direct 高度**反馈高效**:由于每个被评估的样本都用于优化全局引导场,没有任何奖励信息被浪费。其次,该框架自然**可复用**:一旦优化完成,所收集的数据集便定义了一个可复用的引导场,无需额外的奖励评估即可生成新的目标样本;不同引导场还可以组合,以生成同时满足多个目标的样本。
## 1 引言
基于扩散和流动的生成模型已成为高维生成的主导范式。它们在图像合成 [17, 3],视频生成 [15, 13] 和音频合成 [9] 方面表现出色,并越来越多地被应用于分子生成 [6, 4]、蛋白质设计 [22] 和材料发现 [25] 等科学领域。这一成功源于它们能够建模复杂的多模态数据分布,并通过学习到的生成轨迹将简单噪声转化为逼真样本。然而,许多应用不仅需要从预训练期间学到的广泛分布中采样,更需要从由特定应用目标定义的特定目标分布中采样。例如,蛋白质设计可能寻求具有高结合亲和力或稳定性的结构,而空气动力学设计可能寻求具有低阻力、高效率或其他物理特性的形状。在此类设置中,目标分布通常仅通过一个外部奖励函数隐式指定,该函数评估生成样本的性能。这一奖励评估过程可能是实验室实验、计算模拟或学习到的偏好模型。由于这些评估过程通常昂贵、不可微且无法在模型训练时获得,因此必须在有限的 black-box 反馈条件下实现目标生成。
解决此问题的一种突出方法是**免训练引导**,它在推理时利用外部奖励函数的反馈来引导预训练生成模型。由于这些方法不更新模型参数,因此避免了微调或强化学习的成本和稳定性问题,并且可以应用于奖励函数是黑盒或不可微的情况。为了实现这一点,近期方法通常依赖于梯度近似、序列蒙特卡洛 (SMC) 或树搜索。具体而言,在每个中间去噪步骤中,Evolvable [23] 通过零阶梯度估计指导生成轨迹,FK-Steering [20] 执行粒子重采样 (SMC) 以引导至目标分布。另一方面,TreeG [5] 将序列生成过程形式化为搜索树问题,而 DSearch [10] 则采用动态树扩展以实现高效遍历。尽管它们具有灵活性,但反馈效率仍然低下,需要大量奖励评估才能实现准确的梯度近似、稳健的粒子重采样或全面的搜索。我们将在附录 D 中提供更详细的回顾。
我们认为,这种低效的根本原因在于现有的推理时引导方法仅短暂地使用反馈。在每个生成步骤中,样本被评估以估计局部梯度、选择搜索分支或近似后验分布。一旦做出中间决策,这些评估过的样本就被丢弃。结果,来自昂贵奖励评估的宝贵信息未能保留,导致反馈效率低下。
为解决此局限性,我们提出 Flow-Direct,一个通过持久**引导场**来引导流动模型的框架。理论上,引导场由基础分布与奖励加权目标分布之间的对数密度比解析推导得出;它将预训练分布输送到目标分布。实践中,引导场通过一个由奖励评估样本构建的非参数估计器来实现。Flow-Direct 高度**反馈高效**,因为非参数实现使我们能够持久地聚合评估过的样本,确保没有奖励信息损失,而非短暂地利用奖励反馈。在优化过程中,所有经奖励评估的样本都被添加到一个不断增长的经验数据集中。随着数据集扩大,非参数估计器对精确引导场的近似越来越准确,从而有效地将流动模型引导向目标分布。此外,该框架自然**可复用**。一旦针对特定目标目标收集了带标签数据集,其对应的经验引导场就可以被复用以生成新的目标样本,而无需进一步的奖励评估。此外,从不同目标学到的非参数估计器可以线性组合,以生成同时满足多个目标的样本。
我们的贡献总结如下:
* • 我们提出 Flow-Direct,一个免训练框架,通过**非参数引导场**引导预训练流动模型。该场由基础分布与奖励加权目标分布之间的对数密度比解析推导得出,并作为非参数估计器实现。
* • 此外,Flow-Direct 高度**反馈高效**。因为非参数实现利用累积的奖励评估样本而非短暂使用反馈,所以没有任何奖励信息被丢弃。奖励反馈被持久地保留在引导场中,该场在优化过程中变得越来越准确。
* • 此外,构建的引导场在优化后自然**可复用**。一旦收集了带标签数据集,它就可以引导流动模型生成新的目标样本,而无需进一步的奖励评估。此外,多个经验场可以线性组合,以生成同时满足多个目标的样本。
* • 最后,我们在图像和 3D 生成任务上进行了全面的实验,表明 Flow-Direct 相比现有方法在多个领域具有优越的有效性、可扩展性和稳健性能。
## 2 预备知识
**流动模型。** 流动匹配框架 [11] 通过线性插值 \(x_t = (1-t)x_0 + t x_1\) 其中 \(t \in [0,1]\),构建了一个从噪声分布 \(p_0(x_0) = \mathcal{N}(0, I)\) 到数据分布 \(p_1(x_1)\) 的连续时间输运。在给定数据点 \(x_1\) 的条件下,中间状态服从高斯分布:
\[
p_t(x_t | x_1) = \mathcal{N}(x_t | t x_1, (1-t)^2 I). \qquad (1)
\]
\(x_t\) 的轨迹由 ODE \(\frac{dx_t}{dt} = v_t(x_t)\) 支配,其中时变向量场为:
\[
v_t(x_t) = \frac{x_t}{t} + \frac{1-t}{t} \nabla \log p_t(x_t), \qquad (2)
\]
推导过程见附录 A。在实践中,神经网络 \(v_\theta(x_t)\) 被训练来近似真实速度场,即 \(v_\theta(x_t) \approx v_t(x_t)\)。在推理过程中,通过采样 \(x_0 \sim \mathcal{N}(0, I)\) 并对 ODE 进行积分来生成新样本。求解 ODE 的一个标准且简单的选择是一阶欧拉离散化:
\[
x_{t+\Delta t} = \underbrace{x_t + \Delta t \, v_t}_{\text{step}(x_t, v_t)}, \qquad (3)
\]
其中 \(v_t \coloneqq v_\theta(x_t)\)。从 \(t=0\) 迭代更新到 \(t=1\) 产生来自学习数据分布 \(p_1^\theta(x_1)\) 的最终样本 \(x_1\)。在本文中,我们将数值更新算子 `step` 视为黑盒采样器,它可以通过更高级的 ODE 或 SDE 求解器实例化,我们仅关注修改向量场 \(v_t\)。
## 3 方法
在本节中,我们介绍 Flow-Direct,一个通过**非参数引导场**引导预训练流动模型的免训练框架。我们首先在 3.1 节阐述该引导场的公式,展示当目标数据直接可用时如何构建它。由于现实场景中此类目标数据通常不可用,3.2 节提出了一种优化算法,利用外部黑盒奖励来估计引导场。这一优化过程自然产生了一个带标签的目标数据集。在 3.3 节中,我们展示了如何将累积的数据集复用以生成新的目标样本,而无需额外的奖励评估。最后,3.4 节强调了我们框架的理论特性和实际优势。
### 3.1 从目标数据构建引导场
**问题设定。** 给定一个预训练流动模型,我们考虑仅使用两个小数据集(无需重新训练)将其生成分布引导至期望目标分布的问题。形式上,我们假设可以访问一个**基础数据集**(采样自近似预训练分布的分布)和一个**目标数据集**(采样自期望分布)。我们的目标是构建一个完全由这两个数据集计算得出的引导公式,从而将预训练分布从基础分布引导至目标分布。
[图片]
*图 1: 通过目标数据引导流动模型。每一行显示来自相同提示的生成结果:第一列是无引导基线,其余列应用方程 8 并使用不同的目标数据集。**“素描 + 卡通”** 列由两个偏移项相加产生。**顶部:** 引导将“小狗”生成导向每个目标分布,组合后的偏移有意义地混合了两种风格。**底部:** 即使提示(猫)与引导数据集(小狗)不匹配,目标属性仍然被迁移。这表明我们的公式超越了匹配分布设定,具有良好的泛化能力。*
**引导得分。** 令 \(v_\theta\) 表示预训练生成流动模型,\(p_t^\theta\) 表示该模型在时间 \(t\) 生成的边际分布。假设流动模型训练良好,能够近似真实向量场,即方程 2 中 \(v_\theta(x_t) \approx v_t(x_t)\),则有:
\[
v_\theta(x_t) \approx \frac{x_t}{t} + \frac{1-t}{t} \nabla \log p_t^\theta(x_t). \qquad (4)
\]
这一恒等式表明,学习到的流动隐式编码了 \(p_t^\theta\) 的得分,这使得我们能够在得分空间中进行引导。令 \(p_1^{\text{base}}\) 和 \(p_1^{\text{target}}\) 分别表示基础数据分布和目标数据分布。对于每个分布,我们使用方程 1 构建相应的概率路径 \(p_t^{\text{base}}\) 和 \(p_t^{\text{target}}\),其中 \(t \in [0,1]\),这是通过应用流动匹配插值(在噪声和各自端点分布之间)实现的。我们通过添加基础分布与目标分布之间的对数密度比来在得分空间中引导流动模型:
\[
v_\theta^{\text{guided}}(x_t) \coloneqq \frac{x_t}{t} + \frac{1-t}{t} \left( \nabla \log p_t^\theta(x_t) + \nabla_{x_t} \log \frac{p_t^{\text{target}}(x_t)}{p_t^{\text{base}}(x_t)} \right) \qquad (5)
\]
\[
= v_\theta(x_t) + \underbrace{\frac{1}{1-t} \left( \mathbb{E}_{p_1^{\text{target}}}[x_1 | x_t] - \mathbb{E}_{p_1^{\text{base}}}[x_1 | x_t] \right)}_{\text{引导场 } \Delta(x_t)}, \qquad (6)
\]
并且我们证明此引导等价于一个由基础分布与目标分布的后验期望之差构建的引导场 \(\Delta(x_t)\),推导过程见附录 A。在方程 5 中,基础分布起到参考分布的作用,假设 \(p_t^{\text{base}}(x_t) = p_t^\theta(x_t)\),则它们相互抵消,引导后的流动模型将精确生成目标分布。在方程 6 中,后验期望 \(\mathbb{E}[x_1 | x_t]\) 表示给定当前状态 \(x_t\) 在时间 \(t\) 时对干净数据 \(x_1\) 的理想估计。几何上,它是一个从基础数据指向目标数据的向量。在实践中,我们通过使用非参数估计器来近似后验期望,从而实现引导场。相似文章
面向组合奖励的流模型冲突感知加性引导
本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。
FlowBender: 自校正条件流的反馈感知训练
FlowBender 是一个闭环框架,通过训练网络利用推理时反馈来纠正对齐误差,从而提升扩散模型和流模型中的约束满足能力,优于传统的监督方法和基于引导的方法。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
遵循均值:参考引导的流匹配
本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。
Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习
提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。