D2PO:通过动态偏好优化扩散采样器

arXiv cs.LG 论文

摘要

D2PO提出了一种动态偏好优化框架,利用直接偏好优化使扩散采样策略与感知质量对齐,在低NFE约束下优于基于回归的方法。

arXiv:2607.06609v1 公告类型:新 摘要:我们提出了D2PO(动态直接偏好优化),这是一个关于时间步调度和无分类器引导(CFG)权重来优化扩散采样策略的原则性框架。我们的工作源于现有学生-教师回归框架的一个基本局限性:低NFE学生采样器被训练来模仿高NFE教师,往往在保留粗粒度全局结构的同时牺牲高频纹理保真度,从而导致采样器与感知质量不对齐。D2PO通过将采样器优化重新表述为基于偏好的对齐问题,利用直接偏好优化(DPO)框架来应对这一挑战。为了使DPO适用于扩散采样器,我们将采样策略建模为基于能量的模型(EBM),将偏好比较转化为易于处理的能量差异。我们进一步引入了一种直接源自预训练分数网络的新型能量公式,使得在扰动空间中进行偏好评估成为可能,该空间同时捕捉结构一致性和细粒度细节。此外,我们引入了动态偏好,即用于对齐的偏好样本随着采样策略的学习而逐步改进。这种自我改进机制以迭代的、偏好引导的精炼过程取代了僵化的静态教师监督,提供了逐步增强的对齐信号。大量实验表明,D2PO更忠实地将扩散采样器与感知质量对齐,释放了高质量教师的全部潜力,并在低NFE约束下持续优于传统的基于回归的调度器。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:41

# D2PO: 通过动态偏好优化扩散采样器
来源:https://arxiv.org/html/2607.06609
11机构:1电气与计算机工程系 & 2人工智能研究所,首尔国立大学,韩国
3人工智能研究生院,蔚山科学技术院,韩国###### 摘要

我们提出D2PO(动态直接偏好优化),一个用于优化扩散采样策略(针对时间步调度和无分类器引导权重)的理论框架。我们的工作源于现有师生回归框架的一个基本局限性:低NFE的学生采样器被训练来模仿高NFE的教师,通常牺牲高频纹理保真度而保留粗略的全局结构,从而使采样器与感知质量不一致。D2PO通过将采样器优化重新表述为基于偏好的对齐问题来应对这一挑战,利用了直接偏好优化框架。为了使DPO适用于扩散采样器,我们将采样策略建模为基于能量的模型,将偏好比较转化为可处理的能量差异。我们进一步引入了一种直接从预训练分数网络导出的新型能量公式,能够在联合捕捉结构一致性和细粒度细节的扰动空间中进行偏好评估。此外,我们引入了动态偏好,用于对齐的偏好样本随着采样策略的学习而逐步改进。这种自我改进机制用迭代的、偏好引导的细化过程取代了固定的静态教师监督,提供了逐步更强的对齐信号。大量实验表明,D2PO更忠实地将扩散采样器与感知质量对齐,充分释放了高质量教师的潜力,并在低NFE约束下持续优于传统的基于回归的调度器。

## 1. 引言

扩散概率模型在高质量图像合成、文本到图像生成和视频生成中取得了前所未有的保真度。然而,这种性能是以巨大的计算成本为代价的。扩散模型本质上是迭代的,在采样过程中需要多次函数评估,这使得高质量生成代价高昂并限制了实际部署。

为了缓解这一瓶颈,人们探索了广泛的方法,包括加速数值求解器、少步知识蒸馏、架构修改和训练时改进。最近,直接优化采样策略参数——例如时间步调度、无分类器引导权重和高阶求解器系数——已成为加速的一个关键方向。

“两只鸟坐在沼泽地里。”

转至标题说明

Δ=1

转至标题说明

Δ=2

转至标题说明

Δ=3

转至标题说明

Δ=4

“有一辆小巴士,旁边站着几个人。”

转至标题说明

Δ=1

转至标题说明

Δ=2

转至标题说明

Δ=3

转至标题说明

Δ=4

图1:LD3性能瓶颈的定性证据。所有图像均由同一模型生成,NFE=4。列显示了教师(T)和学生(S)之间NFE差距(Δ=T-S)增加的影响。虽然小差距(Δ=1)产生高质量输出,但更大的差距(高达Δ=4)会导致严重伪影,表明LD3无法利用高保真教师。在优化这些采样器参数时,先前的工作通常采用分布或实例视角。具体来说,一类工作优化分布级指标,如在大样本集上的FID或KID,但这类总体目标为低维采样器参数产生弱、高方差的梯度。或者,实例级蒸馏方法通过l2或LPIPS损失将低NFE学生采样器回归到固定高NFE教师的轨迹或输出上。虽然当师生差距适中时有效,但在需要激进加速时,这种回归范式表现出结构性局限。

当学生和教师之间的NFE差距变得显著时——这是追求最大加速时的常见场景——这种基于回归的目标迫使学生采样器在其有限容量内逼近高保真轨迹,从而损害生成质量。这种结构性约束通常抑制高频纹理和细粒度细节,阻止学生充分受益于更强的教师。我们在图1中凭经验验证了这一现象;当教师NFE增加而学生NFE保持不变时,感知质量下降,即使对于最先进的调度器也是如此。这种退化直接反映了固定教师回归的结构刚性,即学生被迫优先考虑低级对齐而非感知质量,未能发现更有效的采样路径。

为了解决这一局限性,我们将采样器优化重新解释为基于偏好的对齐问题,而不是回归到教师的任务。我们引入了D2PO(动态直接偏好优化),一个受DPO启发但适用于扩散采样策略的框架。将DPO应用于扩散采样器并非易事,因为边际对数概率是难以处理的。为了获得可处理的替代,我们将策略诱导的分布建模为基于能量的模型。我们使用一种新颖的基于分数的距离来定义能量,该距离利用预训练扩散分数模型测量样本之间的差异。通过比较多个噪声水平下的分数预测,该指标捕捉了传统感知指标无法反映的结构性和高频差异。

D2PO用与学生策略共同演化的动态参考机制取代了静态教师框架。具体来说,在每个训练步骤,偏好对是通过在当前策略下的两个不同计算预算下执行来构建的:失败样本使用快速、稀疏的时间步调度生成,而获胜样本则通过同一策略的更密集、更精细的调度获得。学生不是模仿一个外部、不可变的目标,而是被鼓励与其自身高质量、密集调度的近似对齐。这种动态偏好循环消除了静态蒸馏中固有的固定误差下限,并隐含地驱动采样器最小化离散化误差,从而促进高度准确和自我改进的采样轨迹。

我们的贡献总结如下:

- ∙ 我们提出了D2PO,一个基于偏好的扩散采样器优化框架,通过将确定性策略建模为基于能量的替代,建立了一个可处理的对齐目标。
- ∙ 我们制定了一种新颖的基于分数的能量度量,源自预训练分数网络,提供了捕捉细粒度纹理和结构细节的多尺度学习信号,超越了传统的感知损失。
- ∙ 我们引入了一种动态偏好机制,用基于细化的目标取代静态教师监督,使得能够持续自我改进,而不受固定残差误差的约束。
- ∙ 我们全面验证了D2PO学习到更优的采样策略,在各种实验设置下优于最先进的基于蒸馏的基线。

## 2. 相关工作

### 2.1 优化扩散采样参数

由于时间步轨迹在固定计算预算下深刻影响生成质量,大量研究集中在寻找最优采样调度上。早期的启发式方法,如EDM,采用多项式间隔在干净数据流形附近密集步骤,而Watson等人引入动态规划框架来搜索最大化对数似然的最优离散调度。Analytic-DPM通过直接从预训练分数网络推导出无训练、最优的反向方差解析形式来提高效率,同时通过动态规划获得相应的最优轨迹。为了自动化和泛化调度优化,AutoDiffusion采用以最小化FID为目标的进化搜索,而DDSS通过直接样本质量反馈(如KID)优化采样器参数。

另一类工作推导解析误差界或ODE/SDE轨迹的几何性质以优化时间离散化。诸如Chen等人、AYS和Xue等人等方法根据轨迹曲率或求解器误差的上界动态调整步长。最近,LD3采用松弛匹配目标通过师生回归学习离散轨迹。

除了时间步优化,最近的文献探索调整其他采样参数以进一步加速推理。例如,Galashov等人通过自一致性目标学习时间依赖的CFG权重。类似地,S4S使用师生匹配优化每一步的求解器系数。沿着这一方向,ConsistencySolver采用可学习的高阶求解器动态预测最优积分系数。

### 2.2 将预训练模型与偏好对齐

受预定义训练目标局限性的驱动,直接将生成模型与成对的人类或AI偏好对齐已成为主导范式。这一方法源于大型语言模型中的基于人类反馈的强化学习,它使用单独的奖励模型优化策略。为了简化这一多阶段流程,直接偏好优化将奖励隐式整合到分类损失中,实现了稳定和直接的策略更新。随后的自对弈框架如SPIN进一步消除了偏好标注的需要,从模型自身生成负例并与SFT响应进行对比。

最近,这种偏好对齐范式已被积极应用于文本到图像扩散和流匹配模型,以增强视觉质量和美学吸引力。标准的后训练方法,包括DPO风格的公式和在线强化学习变体,主要集中在微调去噪器或速度网络的基础权重上。虽然有效,但优化高维模型参数计算成本高,且存在降低输出质量的风险。相比之下,D2PO保持生成骨干网络不变,专门优化低维采样策略,提供了一种极其轻量级、正交且与现有权重调整方法互补的解决方案。

## 3. 预备知识

本节简要回顾基于分数的扩散模型和直接偏好优化,它们为我们的动态采样器优化框架提供了理论基础。

### 3.1 扩散概率模型

我们考虑基于分数的扩散模型,它通过逐渐加噪过程将数据分布转换为可处理的先验。具体来说,我们采用方差保持随机微分方程,由下式给出

dxt = -1/2 β(t) xt dt + √β(t) dwt, (1)

其中wt是标准维纳过程,t ∈ [0,T]。这个前向过程具有闭式边际分布:

pt(xt|x0) = N(xt; αt x0, σt² I), (2)

其中

αt = exp(-1/2 ∫₀ᵗ β(s) ds) 且 σt² = 1 - αt². (3)

为了构建反向过程,训练神经网络sθ(xt,t)来近似边际分布的分数函数,即 s(xt,t) = ∇ₓₜ log pt(xt)。这是通过去噪分数匹配实现的,最小化

LDSM = ∫₀ᵀ λ(t) E_{x0∼p_real, xt∼pₜ(·|x0)} [ ||sθ(xt,t) - ∇ₓₜ log pₜ(xt|x0)||₂² ] dt, (4)

其中

∇ₓₜ log pₜ(xt|x0) = - (xt - αt x0) / σt². (5)

一旦sθ被训练,样本通过从t=T到t=0求解相应的反向SDE生成,由下式给出

dxt = [ -1/2 β(t) xt - β(t) sθ(xt,t) ] dt + √β(t) d\bar{w}_t, (6)

其中\bar{w}_t是时间反向的维纳过程。

这种基于分数的公式等价于DDPM中的噪声预测参数化εθ(xt,t)。两种表示通过下式关联

sθ(xt,t) = - εθ(xt,t) / σt. (7)

### 3.2 直接偏好优化

我们建立在直接偏好优化框架之上,这是一个用于将生成策略与偏好数据对齐的框架。DPO提供了对

相似文章

无漂移扩散策略优化

arXiv cs.LG

DiPOD通过交错自蒸馏与策略梯度更新来稳定扩散策略优化,保持紧凑的ELBO,防止双重漂移现象,在语言和连续控制任务中均能获得更高奖励。

xi-DPO:通过比率奖励边际的直接偏好优化

arXiv cs.LG

本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。

GroupDPO:内存高效的分组直接偏好优化

arXiv cs.CL

GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。

基于噪声追踪对的整流流离线偏好优化

Hugging Face Daily Papers

本文介绍了PNAPO,一种针对整流流模型的离线偏好优化框架,该框架通过噪声样本增强偏好数据,并采用动态正则化来提高训练效率和样本效率。