基于对抗学习的无分类器指导调度
摘要
本文提出使用对抗学习来学习扩散模型的动态无分类器指导调度,通过调整指导尺度以适应不同状态,从而提升文本到图像生成质量。
arXiv:2608.14038v1 公告类型:新
摘要:现代文本到图像扩散模型依赖于无分类器指导(CFG)来实现高图像保真度和文本对齐。然而,CFG通常对所有时间步、样本和条件应用静态、全局尺度——这一选择通常次优,并可能引入伪影,因为不同状态可能受益于不同水平的指导。虽然已知时间变化调度可以提升质量,但手动设计它们并非易事且依赖于具体应用。在本文中,我们学习指导调度作为扩散时间、条件和当前噪声样本的函数,以更好地将采样图像与文本提示对齐。我们将此框定为密度比率估计问题:训练一个判别器来估计真实和指导边际分布之间的时间相关对数密度比率,而一个轻量级生成器网络预测最优的、状态相关的指导尺度。实验表明,我们的方法在文本到图像生成基准测试上优于启发式CFG调度和先前学习动态指导的方法。
查看缓存全文
缓存时间: 2026/08/17 10:18
# 基于对抗学习的无分类器指导调度方案 来源:https://arxiv.org/html/2608.14038 Alexandre Galashov<sup>1</sup> <sup>1</sup> 单位:Google DeepMind, Gatsby UCL 邮箱:[[email protected]](mailto:[email protected]) Arnaud Doucet 单位:Google DeepMind 邮箱:[[email protected]](mailto:[email protected]) Mauricio Delbracio 单位:Google 邮箱:[[email protected]](mailto:[email protected]) Valentin De Bortoli 单位:Google DeepMind 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 现代文本到图像扩散模型依赖无分类器指导(CFG)来实现高图像保真度和文本对齐性。然而,CFG通常在所有时间步、样本和条件下应用一个静态的全局尺度——这种选择通常是次优的,且可能引入伪影,因为不同状态可能受益于不同的指导水平。虽然已知时间变化的调度方案能提升质量,但手工设计这些调度既非平凡也依赖于具体应用。在本文中,我们将指导调度学习为扩散时间、条件输入和当前噪声样本的函数,以便更好地对齐采样图像与文本提示。我们将此问题建模为密度比估计问题:训练一个判别器来估计真实分布与指导分布之间的时间相关对数密度比,而一个轻量级生成器网络则预测最优的、状态相关的指导尺度。实证表明,我们的方法在文本到图像生成基准测试中,优于启发式CFG调度和先前用于学习动态指导的方法。 ## 1 引言 扩散模型(Song & Ermon 2019;Song et al. 2021a;Song et al. 2021b)和流匹配模型(Lipman et al. 2023)已成为生成高保真图像和视频的最先进生成模型。这些模型令人印象深刻的性能很大程度上归功于采样过程中使用无分类器指导(CFG)(Ho & Salimans 2022)。对于流匹配,CFG用条件和无条件近似的线性组合取代了条件速度近似 \(v_{\theta}(x_t, t, c)\);即 \((1+\omega) v_{\theta}(x_t, t, c) - \omega v_{\theta}(x_t, t, \varnothing)\),其中 \(\omega\) 是指导权重。\(\omega=0\) 对应条件采样,\(\omega=-1\) 对应无条件采样。在实践中,大多数现代文本到图像(T2I)应用采用恒定的指导权重 \(\omega \approx 7.5\)(Rombach et al. 2022)。使用如此高的指导权重可以提高提示对齐度(即CLIP分数)并改善图像质量。然而,依赖恒定指导权重 \(\omega\) 可能导致生成图像出现伪影和过饱和(Saharia et al. 2022;Kynkäänniemi et al. 2024;Sadat et al. 2024)。手工设计的动态指导调度(Kynkäänniemi et al. 2024;Wang et al. 2024)已被证明可以缓解这些问题。但这些调度引入了难以在不同数据集间调优的超参数,并且通常与特定条件无关,无论文本提示的复杂性或特定类别标签如何,都应用相同的指导尺度。 最近,研究重点已转向学习适应不同条件信息的最优指导调度,从而提供更大的灵活性。Galashov et al. 2026 证明了可以学习时间与条件相关的指导权重,这些权重在保持与恒定CFG相当的文本对齐度的同时,改善了Fréchet初始距离(FID)相对于恒定CFG和手工设计的CFG调度基线的表现。他们的方法由*边际一致性条件*驱动,该条件鼓励真实噪声化分布与指导去噪分布的边际相匹配。然而,他们的实际实现依赖于一个更强的(在某种意义上蕴含*边际一致性*)*自一致性*目标,该目标虽然训练稳定,但在文本对齐方面未能超越恒定CFG。 在本文中,我们将重点从满足严格的自一致性条件转移到更弱的*边际一致性*条件。与先前通过能量距离核(Székely & Rizzo 2004)和最大均值差异(MMD)(Gretton et al. 2012)在原始潜变量上工作的方法不同,我们采用对抗框架来学习指导调度,通过在每个时间步将指导轨迹的边际分布与真实数据分布的边际进行匹配。我们证明该条件可以被表述为一个涉及密度比估计的目标,这自然地契合生成对抗网络(GAN)框架(Goodfellow et al. 2014)。在我们的设置中,判别器估计真实样本与无分类器指导样本之间的对数密度比,而生成器学习预测能最大化该比率的指导尺度。通过对整个采样轨迹优化边际一致性,我们的方法实现了良好的提示遵循度和样本质量,在T2I基准测试中超越了恒定指导和已学习的指导基线。 我们的主要贡献总结如下:第一,我们提出了一种基于边际一致性条件学习指导调度的方法,鼓励指导样本的分布在采样轨迹的每个时间步与真实数据分布相匹配。第二,我们使用对抗框架来估计密度比,并学习动态的、依赖于时间、条件和噪声样本的指导尺度。第三,我们证明了我们的方法在T2I基准测试中优于恒定和手工选择的指导调度基线以及先前的学习调度方案。 ## 2 背景 **符号。** 沿用流匹配(FM)的惯例(Lipman et al. 2023),我们的框架使用连续时间 \(t \in [0,1]\),其中 \(t=0\) 表示纯噪声,\(t=1\) 表示数据。去噪步骤从提议时间步 \(s\) 进行到目标时间步 \(t\)(\(s < t\)),更新公式为 \(x_t = x_s + (t - s) v_{\theta}(x_s, s, c)\)。从噪声样本 \(x_t\) 可以恢复预测的干净数据:\(\hat{x}_1(x_t, t, c) = x_t + (1 - t) v_{\theta}(x_t, t, c)\)。 **无分类器指导(CFG)。** 令 \(v_{\theta}(x_t, t, \varnothing)\) 为无条件速度(通过随机丢弃条件来训练),\(\omega\) 是指导权重。无分类器指导(Ho & Salimans 2022)用指导速度取代了条件速度: \(v_{\theta}^{\mathrm{cfg}}(x_t, t, c; \omega) = v_{\theta}(x_t, t, c) + \omega \left( v_{\theta}(x_t, t, c) - v_{\theta}(x_t, t, \varnothing) \right)\), 其中 \(\omega = -1\) 产生无条件采样,\(\omega = 0\) 产生条件采样,而 \(\omega > 0\) 放大条件。通常,\(\omega \approx 7.5\) 是T2I应用的标准值(Saharia et al. 2022;Rombach et al. 2022)。然而,在时间和条件上恒定的 \(\omega\) 可能导致伪影,如过饱和(Kynkäänniemi et al. 2024;Sadat et al. 2024)。 **动态指导调度。** CFG的一个自然扩展是允许指导权重 \(\omega\) 在采样轨迹中变化,即 \(\omega = \omega(t)\)。已经提出了几种启发式调度方案,包括将指导限制在时间区间内(LIG;Kynkäänniemi et al. 2024)、夹紧线性调度(CLG;Wang et al. 2024)以及时间相关重缩放(Sadat et al. 2025)。虽然这些方法可以优于恒定指导,但它们仍然对所有样本和条件全局应用相同的调度,并且需要针对每个模型和应用进行手动调整。 **可学习的指导调度与边际一致性。** 与其手工设计调度,不如*学习*指导权重 \(\omega_{c,(s,t)}\) 作为条件 \(c\) 和时间步 \(s, t\) 的函数。先前的工作(Galashov et al. 2026)将这些权重学习为时间与条件相关的函数,并展示了其在FID上的改进。他们的方法受到*边际一致性条件*的启发,该条件要求真实噪声化分布的边际与指导去噪分布的边际匹配。具体而言,他们通过优化以下目标来实现这一点: \(\mathcal{L}_{\text{marginal}} = \mathbb{E}_{s,t} \left[ \text{MMD}(p_t^{\text{true}}, p_t^{s, \omega}) \right]\), 其中 MMD 是最大均值差异。这种方法是有效的,但依赖于特定于潜空间的核选择,并可能难以扩展。 ## 3 方法 在本节中,我们形式化边际一致性条件,介绍我们的对抗框架,并描述指导学习算法。 ### 3.1 对抗指导学习 **目标。** 我们希望学习一个指导调度 \(\omega\),使得对于每个时间步 \(t\),指导分布 \(p_t^{s, \omega}(x_t)\) 的边际与真实分布 \(p_t^{\text{true}}(x_t)\) 的边际相匹配。为此,我们提出一个对抗框架,其中判别器区分来自真实分布和指导分布的样本,而生成器(即指导网络)学习产生能“欺骗”判别器的指导权重。 **判别器。** 判别器 \(d_{\phi}(x_t, s, t, c)\) 是一个卷积网络,其参数 \(\phi\) 通过优化对抗损失来学习。给定一个来自真实分布 \(p_t^{\text{true}}\) 的样本 \(x_t^{\text{real}}\),判别器的目标是预测一个分数,使其接近 1。给定一个来自指导分布 \(p_t^{s, \omega}\) 的样本 \(x_t^{\text{fake}}\),目标是预测接近 0 的分数。我们采用非饱和损失,并加入梯度惩罚项以实现稳定训练。判别器损失为: \(\mathcal{L}_{\text{disc}}(\phi) = \mathbb{E}_{x_t^{\text{real}}} [\log(d_{\phi}(x_t^{\text{real}}, s, t, c))] + \mathbb{E}_{x_t^{\text{fake}}} [\log(1 - d_{\phi}(x_t^{\text{fake}}, s, t, c))]\), 梯度惩罚项为(其中 \(\gamma > 0\) 是超参数): \(\mathcal{L}_{\text{reg}}(\phi) = \frac{\gamma}{2} \mathbb{E}_{x_t^{\text{real}}} [\|\nabla_{x_t} d_{\phi}(x_t^{\text{real}}, s, t, c)\|^2]\)。 判别器的总损失为: \(\mathcal{L}_D(\phi) = \mathcal{L}_{\text{disc}}(\phi) - \frac{\gamma}{2} \mathbb{E}_{x_t^{\text{real}}} [\|\nabla_{x_t} d_{\phi}(x_t^{\text{real}}, s, t, c)\|^2]\)。 **生成器。** 我们定义一个生成器或指导网络 \(\bm{\omega}^\psi_{x_s, c, (s, t)} = \bm{\omega}(x_s, s, t, c; \psi) > 0\),其参数为 \(\psi\),输出非负的指导权重。通过指导速度方程(6)使用这些权重,指定了指导边际分布 \(p_t^{s, \bm{\omega}}(x_t)\)(方程8)。我们在此记 \(x_t^{\text{fake}}(\psi) \sim p_t^{s, \bm{\omega}}\) 以突出其对参数 \(\psi\) 的依赖性。生成器通过优化以下损失进行训练: \(\mathcal{L}_{\text{gen}}(\psi) = \mathbb{E}_{p_t^{s, \bm{\omega}}} \left[ -d_{\phi}(x_t^{\text{fake}}(\psi), s, t, c) \right]\)。 为防止指导尺度爆炸或过度校正导致分布外,我们在生成器损失中引入一个稳定的 \(L_2\) 惩罚项,其权重随时间变化: \(\mathcal{R}(\bm{\omega}, t) = \lambda(t) \bm{\omega}^2\)。 在实践中,我们设置 \(\lambda(t) = a t^2\),其中 \(a\) 是超参数。 **基于奖励的正则化。** 与先前工作(Galashov et al. 2026)类似,我们引入一个基于奖励的损失项。我们使用 \(v_t^{\text{cfg}, \bm{\omega}}\) 计算干净数据的一阶近似: \(\hat{x}_1(\bm{\omega}) = x_s + (1 - s) \cdot v_t^{\text{cfg}, \bm{\omega}}(x_s, s, 1, c; \psi)\)。 我们将奖励损失定义为从业者定义的奖励函数 \(R(\hat{x}_1, c)\)(例如,文本到图像模型的 CLIP 分数)的负期望: \(\mathcal{L}_{\text{Reward}}(\bm{\omega}) = -\mathbb{E} \left[ R(\hat{x}_1(\bm{\omega}), c) \right]\)。 生成器的总损失为: \(\mathcal{L}_{\text{G}}(\psi) = \mathcal{L}_{\text{gen}}(\psi) + \mathcal{R}(\bm{\omega}, t) + \eta \mathcal{L}_{\text{Reward}}(\bm{\omega})\), 其中 \(\eta > 0\) 是超参数。在我们的框架中,对抗损失和正则化损失项确保样本保持在数据流形上,而奖励项推动更好的对齐。 ### 3.2 指导学习算法设置 **时间分布 \(p(s,t)\)。** 在我们的实验中,我们使用与 Galashov et al. 2026 之前相同的时间分布 \(p(s,t)\),并将其用流匹配符号重写。目标时间由 \(t \sim \mathcal{U}[\zeta + \delta, 1 - \zeta]\) 给出,其中 \(\zeta\) 是一个小常数,用作边界缓冲区,以防止优化过程中遇到极端噪声或纯数据极限处的数值奇异性或信号消失。在我们的实验中,我们将其设置为一个小常数 (\(10^{-2}\)),无需进一步调整。源时间步与目标时间步之间的步长为 \(\Delta s \sim \mathcal{U}[\delta, t - \zeta]\)。因此,源时间为 \(s = t - \Delta s\)。与先前观察类似,我们观察到 \(\delta = 0.1\) 略优于 \(\delta = 0.01\),即使推理时使用更小的步长。有关 \(\delta\) 的消融实验,请参见表4。这可能是因为较大的 \(\delta\) 为判别器提供了更鲁棒的信号。为确保生成器平滑地插值到推理时使用的小步长,我们使指导权重预测器更加鲁棒,它通过基于坐标不变几何统计量进行条件化,而不是原始的高维潜变量和用于时间步的傅里叶嵌入。有关网络参数化的讨论,请参见下文。在附录C中,我们讨论了时间分布的其他选择。 **网络参数化。** 判别器 \(d_{\phi}(x_t, s, t, c)\) 是一个具有参数 \(\phi\) 的卷积网络。指导网络 \(\bm{\omega}(x_s, s, t, c; \psi)\) 是一个具有参数 \(\psi\) 的轻量级多层感知器(MLP)。由于 \(x_s\) 是高维潜变量,将原始潜变量输入 MLP 在计算上效率低下。相反,我们计算一个摘要统计向量,以捕捉当前状态、条件和采样轨迹之间的关系。具体来说,我们提取以下统计量: 1. 条件速度的对数范数 \(\|v_{\theta}(x_s, s, c)\|\) 和 CFG 方向 \(\|v_{\delta}\|\),其中 \(v_{\delta} = v_{\theta}(x_s, s, c) - v_{\theta}(x_s, s, \varnothing)\)。 2. 当前潜变量 \(x_s\) 与指导方向 \(v_{\delta}\) 之间的余弦相似度,计算为 \(\frac{x_s \cdot v_{\delta}}{\|x_s\| \|v_{\delta}\|}\)。这捕捉了当前样本与预期条件信号的对齐程度。 3. 到数据流形的对数距离 \(\log(1 - s)\) 和当前跳跃的对数步长 \(\log(t - s)\)。 MLP 以这些值的拼接特征向量作为输入。此外,我们发现将 \(s, t\) 和 \(t - s\) 的傅里叶嵌入馈送到生成器是有用的。这有助于网络平滑地插值到推理时使用的小步长。我们在输出端应用 softplus 激活函数以确保严格非负的指导
相似文章
基于信息论的无分类器引导与自适应调度优化
提出了一种基于信息论的框架,用于优化扩散模型中的无分类器引导调度,在ImageNet和COCO基准上实现了条件一致性与样本多样性之间更优的权衡。
承诺先于实现:掩码扩散语言模型中无分类器引导何时不再必要
本文研究了在掩码扩散语言模型中,无分类器引导(CFG)在何种情况下真正必要。研究表明,对引导的依赖因提示而异,且通常可以在不损失约束满足能力的前提下移除引导,并由此定义了“承诺视界”(commitment horizon)。
面向扩散模型的类频率引导噪声调度
本文提出了一种面向扩散模型的类频率引导噪声调度,为低频类别分配更大尺度的噪声,以改善在不平衡数据集上的生成质量,相较于基线方法取得了显著提升。
重新思考策略内扩散蒸馏中的无分类器引导
本文识别了无分类器引导蒸馏中的一种失败模式,称为负分支不对称性(Negative Branch Asymmetry),其中正负CFG分支中的错误相互抵消,并提出了正方向匹配(Positive-Direction Matching)来分别监督分支,以获得更鲁棒的蒸馏模型。
冻结的像素空间扩散模型可利用自身样本进行自我引导
本文介绍了合成自引导(Synthetic Self-Guidance, SSG)方法,该方法将一个轻量级预测头附加到冻结的预训练像素空间扩散模型上,在采样过程中利用中间预测与最终预测之间的差异作为自引导。研究表明,模型生成的样本足以训练这个预测头,在无需分类器自由引导(CFG)的情况下,多个变体的FID降低了50%以上,并且增强了使用CFG的强基线。