从原子到熵:凸域中扩散训练的最优噪声分配

arXiv cs.LG 论文

摘要

本文构建了一个用于扩散模型训练中噪声水平最优分配的统计框架,表明在耦合机制下最优调度是原子化的,而在独立学习机制下遵循平方根熵代理,实验证实了这些预测。

arXiv:2607.20540v1 Announce Type: new 摘要:扩散模型应如何决定训练时使用哪些噪声水平以及分配多少权重?尽管这一选择至关重要,但当前的噪声调度主要基于启发式方法或经验调优。本文提出了一个通用统计框架,用于研究扩散训练中渐近最优的噪声水平分配。第一个主要结果针对完全耦合机制,其中信息可以在不同时间点之间传播。在凸性或Polyak-Lojasiewicz型假设下,我们证明优化后的训练调度存在一个原子化最小化器,集中于有限个噪声水平。第二个主要结果将该框架特化为理想化的独立学习机制,旨在建模神经网络中的时间特异性。在额外的特征-噪声解耦条件下,随机矩阵分析导出了一个信息论代理:解耦采样密度与生成熵率的平方根成正比,其中生成熵率是条件熵沿前向过程的增长速率。我们在受控设置中测试了这些预测,包括狄拉克混合、低维流形和MNIST,在这些设置中可以直接优化耦合目标。在这些设置中,优化的调度始终是有限支撑的,而平滑的熵代理能紧密跟踪神经网络模型中的原子最优值,并且主要在完全耦合参数化情况下失效,正如理论所预期。接着,我们在更大规模的实验(当前完全调度优化不可行)中评估了熵调度。结果表明,平方根熵调度能显著提高离散域上的训练效率,并且在连续图像上仍能与标准EDM风格启发式方法竞争。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:11

# 从原子到熵:凸域中扩散训练的最优噪声分配 来源:https://arxiv.org/html/2607.20540 Luca Ambrogioni¹, Giulio Franzese¹†, Alberto Foresti², Gabriel Raya³, Bac Nguyen⁴, Georgios Batzolis⁵, Yuhta Takida⁴, Naoki Murata⁴, Chieh-Hsin Lai⁴ 以及 Yuki Mitsufuji⁴·⁶ ¹拉德堡德大学 ²EURECOM ³蒂尔堡大学 & JADS ⁴索尼AI ⁵剑桥大学 ⁶索尼集团公司 ###### 摘要 扩散模型应如何决定训练哪个噪声级别以及训练多少?尽管这一选择至关重要,但当前的噪声调度主要基于启发式方法或经验调优。在此,我们开发了一个通用的统计框架,用于研究扩散训练中渐近最优的噪声级别分配。我们的第一个主要结果涉及完全耦合机制,其中信息可以在不同时间点之间传播。在凸性或Polyak–Łojasiewicz型假设下,我们证明优化后的训练调度具有一个原子最小化器,集中在有限个噪声级别上。我们的第二个主要结果将这一框架特化到一个理想化的独立学习器机制,旨在模拟神经网络中的时间特化。在额外的特征-噪声解耦条件下,随机矩阵分析引出一个信息论代理:解耦采样密度与生成熵率(条件熵沿前向过程增长的速度)的平方根成正比。我们在可控设置中测试这些预测,其中耦合目标可以直接优化,包括狄拉克混合、低维流形和MNIST。在这些设置中,优化后的调度始终具有有限支撑,而平滑的熵代理紧密跟踪神经网络模型中的原子最优值,并且主要在完全耦合的参数情形下失效,正如理论所表明的那样。然后,我们在更大规模的实验中对熵调度进行评估,在这些实验中,完整的调度优化目前难以处理。结果表明,平方根熵调度可以显著提高离散域上的训练效率,并且在连续图像上与标准的EDM风格启发式方法保持竞争力。 ## 1 引言 扩散模型已成为图像、音频及其他高维域中生成建模的领先框架(Sohl-Dickstein 等人,2015(https://arxiv.org/html/2607.20540#bib.bib28);Ho 等人,2020(https://arxiv.org/html/2607.20540#bib.bib11);Song 和 Ermon,2019(https://arxiv.org/html/2607.20540#bib.bib33);Song 等人,2021(https://arxiv.org/html/2607.20540#bib.bib12);Dhariwal 和 Nichol,2021(https://arxiv.org/html/2607.20540#bib.bib13))。其性能的核心是训练样本在噪声级别之间的分配方式。尽管已提出许多调度方案,从启发式设计(Nichol 和 Dhariwal,2021(https://arxiv.org/html/2607.20540#bib.bib14);Kingma 等人,2021(https://arxiv.org/html/2607.20540#bib.bib15))到经验调优分配(Karras 等人,2022(https://arxiv.org/html/2607.20540#bib.bib3))以及自适应或学习方法(Kingma 等人,2021(https://arxiv.org/html/2607.20540#bib.bib15);Hang 等人,2023(https://arxiv.org/html/2607.20540#bib.bib5);Raya 等人,2026(https://arxiv.org/html/2607.20540#bib.bib22)),但至今尚无被广泛接受的理论原理解释为何某些调度表现良好而其他调度则高度次优。在本文中,我们开发了一个通用的统计框架,用于在流式SGD(Robbins 和 Monro,1951(https://arxiv.org/html/2607.20540#bib.bib23);Polyak 和 Juditsky,1992(https://arxiv.org/html/2607.20540#bib.bib24);Bottou,1999(https://arxiv.org/html/2607.20540#bib.bib25))下研究扩散训练中渐近最优的噪声级别分配。为了在理论上易于处理,我们考虑全局最优值附近的凸损失景观,或更一般地,Polyak–Łojasiewicz假设(Polyak,1963(https://arxiv.org/html/2607.20540#bib.bib26);Karimi 等人,2016(https://arxiv.org/html/2607.20540#bib.bib27))。即使在这些限制下,我们也将表明,分析结果产生了一个非常丰富且反直觉的现象,其中耦合目标始终存在一个最优调度,该调度是原子的,支撑在有限个噪声级别上。在更大规模的实验中,我们将某些得出的公式启发式地应用于无约束深度学习训练。 ### 1.1 贡献 尽管本文包含了大量实验结果,从玩具模型到自然图像数据集,但我们的主要焦点在于理论分析,这为最优噪声分配的理论研究奠定了基础。我们将问题表述为选择训练调度,即噪声级别上的分布,以最小化ELBO加权的渐近预测误差。一个关键的概念问题是误差加权函数与最优训练调度之间的区别,这一区别在先前文献中部分被混淆,并且是我们的分析核心。我们工作的理论框架是对平衡机制下平均随机梯度下降的渐近分析,其中我们跟踪迭代的长期平均值以获得参数向量的稳定估计。这使我们能够量化在给定噪声级别上训练数据点如何渐近地减少沿完整去噪路径的预测误差。正如我们的分析所示,这导致了在直接减少困难噪声级别的误差与通过从更简单噪声级别采样“传播”信息到时间轴之间的权衡。虽然问题定义是通用的,但我们的主要结果是在冻结特征机制中推导的:围绕收敛参数(惰性/NTK机制(Jacot 等人,2018(https://arxiv.org/html/2607.20540#bib.bib17))的局部线性化,其中诱导的目标是凸的。在该机制中,我们的分析为任意目标噪声级别的预测误差作为训练调度的函数产生了一个显式渐近公式,捕捉了训练步骤如何高效地转化为沿去噪路径的去噪精度(第5节(https://arxiv.org/html/2607.20540#S5))。利用这一形式体系,我们刻画了两个主要机制: ##### 耦合机制:原子调度。 当网络学习的特征(或更一般地,参数模型的曲率几何)耦合不同时间点的推断时,我们证明了原子优化器的存在,即优化后的调度是集中在有限个噪声级别上的狄拉克混合。结果限制了原子的数量,但本身并未规定它们的位置,这些位置由模型的曲率和噪声几何决定,我们通过矩阵算法数值识别。 ##### 解耦机制:平方根密度。 当网络表现出**时间特化**,即网络用于在某个噪声级别上去噪的内部表示与在较远噪声级别上使用的内部表示基本独立时,耦合理论显著简化。在该机制中,分箱级别分配问题存在一个闭式(注水)最小化器;结合特征-噪声解耦近似,这产生了平方根熵调度 m∗(t)∝Enṫ[x0∣xt],其中 Enṫ[x0∣xt] 是条件熵增长的速度。这确定了一种风格化机制,其中 (Raya 等人, 2026(https://arxiv.org/html/2607.20540#bib.bib22)) 的基于熵的调度被证明是最优的,为该启发式方法提供了理论支持。耦合和解耦理论是互补的:前者给出了冻结特征设置中最优调度的一般刻画,而后者在简化条件下产生了显式的数据依赖公式。尽管这些条件很强,但它们隔离了扩散训练的内在信息几何,并引出了一个可解释的实际启发式方法。我们还将该理论启发式地应用于无约束机制中的实际深度学习训练,发现解耦熵调度在与高度优化的调度(如 Karras 等人(2022(https://arxiv.org/html/2607.20540#bib.bib3))提供的调度)相比时,具有高性能。 ## 2 相关工作 优化扩散模型如何在噪声级别之间分配训练或采样努力已从几个互补的角度进行了探索。早期理论工作从连续时间ELBO推导出原则性的时间加权。Kingma 等人(2021(https://arxiv.org/html/2607.20540#bib.bib15))表明,ELBO可分解为去噪损失按信噪比(SNR)加权的积分,这激发了广泛使用的基于SNR的损失加权。虽然这建立了有意义的时间重要性概念,但它并未产生数据依赖的最优采样密度。大量经验文献提出了改进的噪声调度。Nichol 和 Dhariwal(2021(https://arxiv.org/html/2607.20540#bib.bib14))引入了余弦调度,Karras 等人(2022(https://arxiv.org/html/2607.20540#bib.bib3))经验性地分析了扩散设计空间,推荐了提高稳定性和采样精度的特定噪声级别分布。基于感知和梯度稳定性的方案,如P2加权(Choi 等人,2022(https://arxiv.org/html/2607.20540#bib.bib4))和Min-SNR加权(Hang 等人,2023(https://arxiv.org/html/2607.20540#bib.bib5)),同样调整了训练期间对不同噪声区域的强调,通常优先考虑中等噪声区间。类似的基于SNR的方法在(Hang 等人,2025(https://arxiv.org/html/2607.20540#bib.bib30))中讨论。另一条工作线算法性地优化调度。Wang 等人(2023(https://arxiv.org/html/2607.20540#bib.bib6))将时间步选择框架化为强化学习问题,学习自适应采样调度;Liu 等人(2023(https://arxiv.org/html/2607.20540#bib.bib7))通过训练代理质量预测器搜索“模型调度”。这些方法表明时间分配影响性能,但它们提供的是程序性而非理论性解决方案,并且主要针对采样而不是训练时间分配。一组不同的工作涉及采样中的数值最优性。Lu 等人(2022(https://arxiv.org/html/2607.20540#bib.bib8))推导了用于扩散采样的高阶ODE求解器,隐式地引入非均匀步长分布;而Williams 等人(2024(https://arxiv.org/html/2607.20540#bib.bib9))从传输成本角度优化离散化,产生“分数最优”采样调度。关系最密切的是关于信息论时间重参数化的文献。Stančević 等人(2025(https://arxiv.org/html/2607.20540#bib.bib10))表明,条件生成熵及其速率可用于定义“熵时间”坐标,当在该变换空间中均匀放置步骤时,可改善采样。该方法最近被用于(Raya 等人,2026(https://arxiv.org/html/2607.20540#bib.bib22)),其中熵被启发式地用作噪声调度分布。我们的工作为后者的工作提供了理论依据,并表明该技术在强时间耦合下是次优的。 ## 3 生成扩散模型 为简化符号,我们将考虑前向过程由布朗动力学控制的生成扩散模型: dxt = a(t) dwt, 其中 a(t) 是正值噪声调度函数,wt 是维纳过程。本文中的所有结果都推广到一般线性前向过程。该模型的有限时间转移分布由公式给出: xt = x0 + σ(t) z, 其中 z ∼ N(0,1),σ²(t) 是噪声的累积方差: σ²(t) = ∫₀ᵗ a²(τ) dτ 现在考虑 t=0 时的数据从数据分布 φ(x0) 中采样。给定数据分布 φ,生成动力学,即所谓的**反向过程**,遵循反向时间随机微分方程(Anderson,1982(https://arxiv.org/html/2607.20540#bib.bib32)): dxt = (a²(t)/σ²(t)) (xt − E[x0 | xt, φ]) dt + a(t) dw̃ₜ (1) 其中 w̃ₜ 是另一个维纳过程。在生成扩散训练中,目标是通过有限数据集 D = {y¹, …, yᴺ}(从 φ 独立采样)学习如何从分布 φ 中采样。为此,训练去噪神经网络 sθ(xt, t) 以逼近去噪期望值 E[x0 | xt],然后用于积分反向动力学。对于给定时间 t,理想损失(密度)为: ℒₜ(θ) = Eₓₜ[ ‖ sθ(xt, t) − E[x0 | xt, φ] ‖² ] = ℒ̂ₜ(θ): 去噪自编码器损失 — c, (2) 其中最优误差 c 是一个与网络 sθ(xt, t) 无关的常数,因此在优化过程中可以忽略。注意,**去噪自编码器**误差密度 ℒ̂ₜ(θ)(Vincent,2011(https://arxiv.org/html/2607.20540#bib.bib31))可以通过对 xt 和 x0 的联合分布求平均从数据中估计。 ## 4 时间加权与最优采样密度 使用 ℒ̂ₜ 作为生成扩散模型的损失函数在理论上是合理的,但需要一种时间点之间相对重要性的度量。事实上,在生成扩散模型中,时间参数 t 最终是任意定义的,因此在时间变量变化下不是不变的。我们可以通过引入加权函数 w(t) 来在整个扩散轨迹上获得良好定义的损失,该函数可用于通过积分扩散区间 [0, T] 来定义全局误差。一个合理的加权由连续 ELBO 给出,它提供了负对数似然的上界(参见(Huang 等人, 2021(https://arxiv.org/html/2607.20540#bib.bib1))和补充材料 A(https://arxiv.org/html/2607.20540#A1)): ℒ_ELBO = ∫₀ᵀ ℒ̂ₜ SNṘ(t) dt (3) 其中,对于我们的前向过程,我们定义(带符号)SNR 速率为 SNṘ(t) = σ̇(t)/σ³(t)。将 SNṘ(t) 解释为时间采样密度是很诱人的。然而,最优采样必须与时间权重分开

相似文章

面向扩散模型的类频率引导噪声调度

arXiv cs.LG

本文提出了一种面向扩散模型的类频率引导噪声调度,为低频类别分配更大尺度的噪声,以改善在不平衡数据集上的生成质量,相较于基线方法取得了显著提升。