Diffusion模型在评分函数不敏感的情况下仍能准确恢复混合权重
摘要
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。
arXiv:2607.15485v1 公告类型:新
摘要:基于分数的生成模型表现出一种令人费解的行为:它们通常似乎覆盖了目标多峰分布的所有模式,但可能无法学习正确的相对模式幅度,这可以解释为混合权重。我们通过将扩散分数匹配(DSM)损失与从生成样本中估计混合权重的误差联系起来,解决了这个明显的悖论。我们表明,即使目标分数对混合权重不敏感,如果中间噪声级别的分数对权重具有信息性,生成的样本仍能准确恢复权重。因此,我们将扩散分数敏感性指数(DSSI)定义为DSM损失相对于参数变化的变化量。然后我们表明,DSSI决定了从生成样本中估计目标分布参数的精度。对于任意维度的高斯混合,我们证明在温和条件下,混合权重估计误差与DSM损失处于同一数量级。通过实验,我们展示了在典型噪声调度下基准数据分布的加噪过程中敏感性的出现,并且这些敏感性值预测了训练良好的模型恢复混合权重的效果。此外,我们表明噪声调度的选择可以降低扩散敏感性,从而导致模式放大。虽然我们关注混合权重,但所提出的敏感性框架决定了目标分布的任何定性参数的恢复。
查看缓存全文
缓存时间: 2026/07/20 09:28
# 扩散模型能够恢复准确的混合权重,尽管得分函数不敏感 来源: https://arxiv.org/html/2607.15485 Andrew Dennehy Corresponding Author: nishac@uchicago\.edu (https://arxiv.org/html/2607.15485v1/mailto:[email protected]) 计算与应用数学委员会,芝加哥大学 统计系,芝加哥大学 数据科学研究所,芝加哥大学 Rebecca Willett 计算与应用数学委员会,芝加哥大学 统计系,芝加哥大学 数据科学研究所,芝加哥大学 计算机科学系,芝加哥大学 NSF\-Simons 国家理论与数学生物学研究所 NSF\-Simons 国家人工智能天空研究所 Nisha Chandramoorthy 计算与应用数学委员会,芝加哥大学 统计系,芝加哥大学 NSF\-Simons 国家理论与数学生物学研究所 NSF\-Simons 国家人工智能天空研究所 ###### 摘要 基于得分的生成模型表现出一种令人费解的行为:它们通常似乎覆盖了目标多峰分布的所有模态,但却可能无法学习到正确的相对模态振幅,这可以解释为混合权重。我们通过将扩散得分匹配(DSM)损失与从生成样本中估计混合权重的误差联系起来,解决了这个明显的悖论。我们证明,即使目标得分对混合权重不敏感,如果中间噪声水平的得分能提供关于权重的信息,那么生成的样本也能准确地恢复权重。因此,我们将扩散得分敏感性指数(DSSI)定义为DSM损失相对于参数变化的变异性。然后我们证明,DSSI决定了从生成样本中估计目标分布参数的准确度。对于任意维度的高斯混合,我们证明在温和条件下,混合权重估计误差与DSM损失处于同一数量级。在经验上,我们展示了在典型噪声调度下,基准数据分布的加噪过程中敏感性的出现,并且这些敏感性值预测了一个训练良好的模型恢复混合权重的程度。此外,我们表明,噪声调度的选择可以减少扩散敏感性,从而导致模态放大。尽管我们专注于混合权重,但所提出的敏感性框架适用于恢复目标分布的任何定性参数。 ## 1 引言 生成模型是强大的工具,越来越多地用于科学研究[29 (https://arxiv.org/html/2607.15485#bib.bib4)、43 (https://arxiv.org/html/2607.15485#bib.bib18)、19 (https://arxiv.org/html/2607.15485#bib.bib17)]、医学[35 (https://arxiv.org/html/2607.15485#bib.bib16)、15 (https://arxiv.org/html/2607.15485#bib.bib15)、56 (https://arxiv.org/html/2607.15485#bib.bib14)]、司法系统[37 (https://arxiv.org/html/2607.15485#bib.bib12)、42 (https://arxiv.org/html/2607.15485#bib.bib13)]等。在这些及其他场景中,用户依赖生成模型来准确反映真实目标分布的定性性质。以往的工作指出,学习目标分布的得分可能不足以进行准确采样[27 (https://arxiv.org/html/2607.15485#bib.bib27)、11 (https://arxiv.org/html/2607.15485#bib.bib26)、34 (https://arxiv.org/html/2607.15485#bib.bib28)],特别是对于高斯混合等典型的多峰分布[3 (https://arxiv.org/html/2607.15485#bib.bib78)、60 (https://arxiv.org/html/2607.15485#bib.bib46)]。错误反映模态振幅或方差的生成模型[63 (https://arxiv.org/html/2607.15485#bib.bib58)、47 (https://arxiv.org/html/2607.15485#bib.bib8)、18 (https://arxiv.org/html/2607.15485#bib.bib10)]可能会阻碍不确定性量化和定性参数的恢复[8 (https://arxiv.org/html/2607.15485#bib.bib51)、1 (https://arxiv.org/html/2607.15485#bib.bib52)、38 (https://arxiv.org/html/2607.15485#bib.bib57)]。我们的工作提出通过参数恢复的视角对生成模型进行显式评估。这种评估补充了样本质量指标,如 Frechet Inception Distance (FID)[22 (https://arxiv.org/html/2607.15485#bib.bib31)],这些指标可能不会显式测试目标特定的结构,例如多模态性[48 (https://arxiv.org/html/2607.15485#bib.bib7)]。在这项工作中,我们提出了一种信息论机制,用于确定扩散模型何时能够准确表示这些关键参数。 在高斯混合设置中,即使得分匹配损失对混合权重不敏感,学习一个扩散模型会在扩散过程的各个步骤中退火得分匹配损失[52 (https://arxiv.org/html/2607.15485#bib.bib61)];这种退火导致对混合权重的敏感性,从而产生准确的估计,这是以往只关注(未退火的)得分匹配损失的分析所未能预料到的[27 (https://arxiv.org/html/2607.15485#bib.bib27)]。图1 (https://arxiv.org/html/2607.15485#S1.F1) 展示了这一思想。第一行绘制了两个高斯混合分布的得分函数,这两个分布除了混合权重γ外完全相同,并显示它们除了在一个概率质量非常低的区域外几乎相同。因此,我们不太可能有足够的训练样本让损失可靠地指示最能代表训练数据的γ值。然而,对于扩散过程中较大的t值(图中t=0.25或t=0.50),相应的分布分离度较低,并且得分函数在较高概率区域明显可区分。由于训练扩散模型使用跨越多个t∈[0,1]的得分,学习到的模型能够锁定正确的γ值。 参考标题 图1:不同扩散时间下得分对混合权重的敏感性。在t=0时,γ=0.8和γ=0.5的得分除了在低概率区域外几乎相同。在t>0时,混合分量的重叠更多,得分不同的区域具有显著更高的概率。 为了量化这种现象,我们测量扩散得分匹配损失lDSM(公式(8) (https://arxiv.org/html/2607.15485#S3.E8))对感兴趣参数变化的敏感性。具体来说,令{p(γ)}γ∈Γ为一系列参数化分布。令p(γ∗)为目标分布,具有目标参数γ∗。目标参数γ∗的扩散得分敏感性指数(DSSI)定义为: L(γ∗) = inf_{γ∈Γ} [ lDSM(p(γ), p(γ∗)) / (γ - γ∗)^2 ] (1) 我们注意到,lDSM和L(γ∗)都依赖于我们对噪声调度的选择。如果目标数据分布具有混合权重γ∗,并且我们学习了一个混合参数为γ的分布,那么混合权重估计的平方误差γ由扩散得分匹配损失除以DSSI所界。因此,当DSSI较小时,即使扩散得分匹配损失较低,我们学习到的分布也可能严重误代表γ∗。相反,当L(γ∗)较大时,我们知道小的扩散得分匹配损失意味着参数γ的误差很小。我们的主要贡献如下: - • 对于一般的双峰混合,我们证明了在使用仅限目标得分数据的估计器与能够访问中间、模态重叠噪声水平得分数据的估计器之间,混合权重恢复的严格极小极大分离。(定理3.5 (https://arxiv.org/html/2607.15485#S3.Thmtheorem5)) - • 对于高斯混合,我们证明了一个适用于任意维度的DSSI下界;因此,参数估计误差由DSM损失控制(定理4.1 (https://arxiv.org/html/2607.15485#S4.Thmtheorem1))。 - • 我们进一步在真实世界数据集上经验性地评估了DSSI。这些实验说明了与扩散模型训练和推理时采样调度相关的设计决策如何影响DSSI以及生成样本对训练数据分布的保真度。 ## 2 预备知识:基于得分的扩散模型 基于得分的扩散模型通过在Rd上追踪一个由扩散时间t索引的单参数分布族{pt}t∈[0,1]从目标分布中采样,其中p0是目标数据分布,p1≈N(0,I)是标准正态分布。*前向过程*沿着这个族逐步将来自p0的样本转换为来自p1的样本。*反向过程*从N(0,I)开始,使用学习的中间边际分布pt得分的近似值,沿前向过程反转密度。因此,基于得分的扩散有三个组成部分:(a) 前向扩散过程及其对应的反向过程,(b) 用于学习t∈[0,1]中间分布边际得分函数∇log pt的训练目标,以及(c) 在推理时用于近似生成目标数据分布样本的采样过程。在本节中,我们简要描述每个组成部分。 ##### 加噪过程。给定Rd上的数据分布p0,我们考虑的加噪过程是Song等人[53 (https://arxiv.org/html/2607.15485#bib.bib24)]提出的方差保持正向SDE(VP-SDE)。给定一个噪声调度{βt},其形式为: dxt = -½ βt xt dt + √βt dwt, x0 ~ p0, t∈[0,1], (2) 其中wt是标准d维维纳过程。我们用pt表示xt的边际分布。在(2 (https://arxiv.org/html/2607.15485#S2.E2))下,给定x0的xt的条件前向分布是高斯分布: pt(xt ∣ x0) = N(xt; √αt x0, (1-αt)I), (3) 其条件均值为√αt x0,条件协方差为(1-αt)I,其中αt = e^{-∫₀ᵗ βs ds}。222术语上略有滥用,序列{αt}和{βt}将可互换地称为“噪声调度”。 ##### 去噪过程。Anderson [4 (https://arxiv.org/html/2607.15485#bib.bib25)]证明了(2 (https://arxiv.org/html/2607.15485#S2.E2))的时间反转本身就是一个SDE: dxt = [ -½ βt xt - βt ∇x log pt(xt) ] dt + √βt dw̄t, x1 ~ p1, (4) 其中w̄t是反向时间维纳过程。从x1 ~ p1开始,使用精确的得分函数从时间t=1到t=0积分反向SDE,产生样本x0 ~ p0。在实践中,这个反向SDE是从x1 ~ N(0,I) ≈ p1开始模拟的,使用学习的近似值sθ: Rd×[0,1] → Rd,参数为θ∈Θ,训练使得sθ(x,t) ≈ ∇log pt(x)同时适用于所有噪声水平,以产生近似服从目标p0分布的样本。对于给定的训练好的得分模型{sθ(·,t)}t∈[0,1](或真实得分函数{∇log pt}t∈[0,1]),样本生成是一个推理任务:可以用任何一致数值积分方案[25 (https://arxiv.org/html/2607.15485#bib.bib5)]模拟(4 (https://arxiv.org/html/2607.15485#S2.E4))中的反向SDE。整个过程有两个不同的误差来源:学习得分产生的*近似误差*和采样算法选择(例如,离散化误差、有限时间步等)产生的*采样误差*。 ## 3 扩散模型参数估计的极小极大界 在本节中,我们证明,当加噪过程中的得分表现出对γ的敏感性时,仅从目标得分无法恢复γ的信息论障碍就被消除了。我们证明,当得分在某个噪声水平敏感时,与仅使用目标得分相比,我们得到更低的参数估计误差。虽然此处明确以混合权重为参数陈述,但本节的结果适用于任何参数。为简单起见,我们仅考虑双峰混合,但对分量不做分布假设。 ##### 混合族。令p(0)和p(1)为Rd上的两个固定概率分布。一个概率密度p(γ),γ∈Γ⊆(0,1),如果具有形式p(γ) ≔ (1-γ)p(0) + γp(1),那么它属于两分量混合族的一个成员。混合参数γ控制两个分量分布p(0)和p(1)的相对权重。 我们现在考虑混合分布p(γ)在基于得分的扩散模型中的加噪过程或前向过程中的演化。具体来说,当p0 ≡ p(γ)时,我们用pt(γ)表示xt遵循过程(2 (https://arxiv.org/html/2607.15485#S2.E2))的边际分布。令s(γ)表示密度p(γ)的得分,xt的边际密度类似: s(γ) := ∇log p(γ) 且 st(γ) := ∇log pt(γ). (5) 混合的相对权重在前向过程中保持不变:有噪声的边际分布pt(γ)本身就是有噪声的分量边际分布pt(0)和pt(1)的γ-混合(见引理D.1 (https://arxiv.org/html/2607.15485#A4.Thmtheorem1))。作为一个结果
相似文章
DiffScore:超越自回归似然性的文本评估
本文介绍了 DiffScore,这是一个基于掩码大型扩散语言模型(Masked Large Diffusion Language Models)的文本评估框架,通过利用掩码重建来解决自回归评分中的位置偏差问题。
从得分近似到基于得分的扩散模型中的分布近似
本文建立了神经网络得分函数近似与基于得分的扩散模型中分布近似之间的严格定量联系,证明了准确的得分近似可以导致KL散度下紧密的分布近似,并给出了显式界。
阐明扩散概率模型的SNR-t偏差
# 论文页面 - 阐明扩散概率模型的SNR-t偏差 来源:[https://huggingface.co/papers/2604.16044](https://huggingface.co/papers/2604.16044) ## 摘要 扩散概率模型在推理阶段存在SNR-timestep偏差,本文提出一种微分校正方法,对频率分量分别处理,以极低计算代价提升多种模型的生成质量。 [扩散概率模型](https://hugg
扩散模型中减少幻觉的分数控制
本文介绍了方差引导的分数调制(VSM),通过控制分数函数的平滑度来减少扩散模型中的幻觉,在保持图像质量的同时实现了高达约25%的减少。
流形假设下可证明的扩散模型学习:坍缩与精炼
本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。