从得分近似到基于得分的扩散模型中的分布近似
摘要
本文建立了神经网络得分函数近似与基于得分的扩散模型中分布近似之间的严格定量联系,证明了准确的得分近似可以导致KL散度下紧密的分布近似,并给出了显式界。
arXiv:2607.22199v1 Announce Type: new
摘要:基于得分的扩散模型在生成建模中取得了显著的经验成功,但其近似理论基础仍不完整。特别是,虽然经典通用近似定理保证神经网络可以逼近得分函数,但尚不清楚这种逼近保证是否能转化为由逆向扩散过程生成的概率分布的近似。在本文中,我们在两个概念之间建立了严格的定量联系。具体来说,我们证明,如果一个神经网络足够准确地逼近真实得分函数,那么相应的逆向扩散模型生成的概率分布与目标数据分布在Kullback-Leibler(KL)散度上接近,直到前向扩散过程的终末分布与用于初始化逆向过程的先验之间不可约的失配。更精确地说,我们根据得分逼近误差、扩散噪声调度和终末先验失配,推导出了分布逼近误差的显式上界。我们的分析结合了Hornik的通用逼近定理、路径空间的Girsanov定理以及相对熵的数据处理不等式。作为对最近在有限样本统计设置和数据分布结构假设下研究得分逼近的工作的补充,我们的工作基于经典神经网络逼近理论发展了一种逼近理论分析。由此得到的定理提供了一个简单而显式的保证,将神经网络对得分函数的逼近与逆向扩散模型生成的概率分布的逼近联系起来。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 从分数逼近到分数扩散模型的分布逼近 来源:https://arxiv.org/html/2607.22199 Lan V. Truong 计算机科学与工程学院 胡志明市理工大学 (HCMUT) 越南国家大学胡志明市分校 (VNU-HCM), 越南 [email protected] ###### 摘要 基于分数的扩散模型在生成建模方面取得了显著的实证成功,但其逼近理论基础仍不完整。特别是,尽管经典的通用逼近定理保证神经网络可以逼近分数函数,但这种逼近保证是否能转化为反向扩散过程生成的概率分布的逼近仍不清楚。在本文中,我们建立了这两个概念之间的严格定量联系。具体来说,我们证明如果一个神经网络足够准确地逼近真实分数函数,那么由相应反向扩散模型生成的概率分布在 Kullback-Leibler (KL) 散度上接近目标数据分布,除了正向扩散过程的终端分布与用于初始化反向过程的先验之间存在不可约的失配。更精确地说,我们推导出分布逼近误差的一个显式上界,该上界由分数逼近误差、扩散噪声调度和终端先验失配决定。我们的分析结合了 Hornik 通用逼近定理、路径空间上的 Girsanov 定理以及相对熵的数据处理不等式。作为对最近在有限样本统计设置和数据分布结构假设下研究分数逼近的补充,我们的工作基于经典神经网络逼近理论发展了一种逼近理论分析。由此产生的定理提供了一个简单而显式的保证,将神经网络对分数函数的逼近与反向扩散模型生成的概率分布的逼近联系起来。 ###### 目录 1. 引言 (https://arxiv.org/html/2607.22199#S1) 2. 相关工作 (https://arxiv.org/html/2607.22199#S2) 3. 背景 (https://arxiv.org/html/2607.22199#S3) 1. 3.1 正向扩散过程 (https://arxiv.org/html/2607.22199#S3.SS1) 2. 3.2 反向时间扩散 (https://arxiv.org/html/2607.22199#S3.SS2) 3. 3.3 问题表述 (https://arxiv.org/html/2607.22199#S3.SS3) 4. 假设 (https://arxiv.org/html/2607.22199#S4) 5. 从分数逼近到路径测度逼近 (https://arxiv.org/html/2607.22199#S5) 6. 从路径测度逼近到分布逼近 (https://arxiv.org/html/2607.22199#S6) 7. 从分数逼近到分布逼近 (https://arxiv.org/html/2607.22199#S7) 8. 扩展与未来方向 (https://arxiv.org/html/2607.22199#S8) 1. 8.1 替代概率度量 (https://arxiv.org/html/2607.22199#S8.SS1) 2. 8.2 逼近速率 (https://arxiv.org/html/2607.22199#S8.SS2) 3. 8.3 通用扩散模型 (https://arxiv.org/html/2607.22199#S8.SS3) 4. 8.4 欧氏数据之外 (https://arxiv.org/html/2607.22199#S8.SS4) 5. 8.5 扩散模型的学习理论 (https://arxiv.org/html/2607.22199#S8.SS5) 9. 参考文献 (https://arxiv.org/html/2607.22199#bib) ## 1 引言 基于分数的扩散模型最近已成为生成建模最成功的框架之一,在图像生成、音频合成、分子设计和科学机器学习中取得了最先进的性能。代表性例子包括去噪扩散概率模型 (DDPMs) 和通过随机微分方程 (SDEs) 表述的基于分数的生成模型。它们卓越的实证表现激发了对理解其数学基础的日益增长的兴趣。 基于分数的扩散模型中的核心对象是 *分数函数* s(x,t)=∇\_x log p\_t(x), 它表征了正向扩散过程对数密度的梯度。在实践中,这个分数函数是未知的,并通过使用去噪分数匹配训练的深度神经网络来逼近。因此,学到的生成模型的质量根本上取决于神经网络逼近真实分数函数的准确程度。 尽管经典的通用逼近定理保证神经网络可以逼近一大类函数,但这些结果只涉及函数逼近。它们并不直接意味着逼近分数函数就能精确逼近由反向扩散过程生成的概率分布。建立这种联系仍然是一个重要的理论挑战。 本文的目标是为基于分数的扩散模型建立分数逼近与分布逼近之间的严格定量关系。具体来说,我们证明在 L2 意义上对分数函数的任意精确逼近会导致目标数据分布与学习到的反向扩散过程生成的分布之间的 Kullback-Leibler (KL) 散度任意小。 我们的分析分两步进行。 首先,我们研究由真实和学到的反向时间随机微分方程诱导的路径测度。使用 Girsanov 定理,我们推导出相应路径测度之间 KL 散度的显式恒等式: KL(P ∥ Q\_θ) = KL(p\_T ∥ p\_prior) + 1/2 ∫\_0^T g²(t) E\_pt [‖s\_θ(X\_t, t) - s(X\_t, t)‖²] dt. 其次,我们应用相对熵的数据处理不等式来证明生成的分布之间的 KL 散度受路径空间散度的上界限制。将这两个结果与 Hornik 的通用逼近定理结合,我们得到主要结果:对于每个 ε > 0,存在一个神经网络满足 ‖s\_θ - s‖²\_{L²(μ)ᵈ} < ε, 使得 KL(μ ∥ μ\_θ) < δ + (1/2) g²\_max ε, 其中 δ = KL(p\_T ∥ p\_prior) 量化了正向扩散过程的终端分布与用于初始化反向过程的先验之间的差异。 最近 Chen 等人 [3 (https://arxiv.org/html/2607.22199#bib.bib3)] 的工作从统计学习角度研究了分数逼近与分布逼近之间的关系,在有限样本设置和底层数据分布的结构假设(包括低维线性子空间)下推导了逼近保证。我们的研究通过发展一种逼近理论视角来补充这一研究方向。我们不分析有限样本估计误差,而是结合神经网络逼近理论、随机分析和信息论的经典结果,推导出连接分数逼近与生成的概率分布逼近的简单显式定量界。这为神经分数模型的表达能力提供了数学证明,并为基于分数的扩散模型提供了逼近理论基础。 本文的其余部分组织如下。第 2 节讨论相关文献。第 3 节回顾了基于分数的扩散模型和相应的反向时间随机微分方程。第 4 节介绍了全文使用的假设,并讨论了它们在几个重要设置中的有效性。第 5 节建立了分数逼近与路径测度逼近之间的关系。第 6 节证明路径测度的逼近意味着生成的分布逼近。第 7 节将这些结果与 Hornik 的通用逼近定理结合,为反向扩散模型建立了我们的主要逼近定理。最后,第 8 节提出了所提框架的几种扩展,并讨论了未来研究的方向。 ## 2 相关工作 #### 基于分数的扩散模型。 扩散模型最近已成为生成建模的主要方法之一。早期的基于分数的生成模型由 Song 和 Ermon [12 (https://arxiv.org/html/2607.22199#bib.bib12)] 引入,他们提出使用去噪分数匹配学习扰动数据分布的分数函数。Ho 等人 [8 (https://arxiv.org/html/2607.22199#bib.bib8)] 随后引入了去噪扩散概率模型 (DDPMs),通过学习离散扩散过程的反向实现了显著的实证性能。Song 等人 [13 (https://arxiv.org/html/2607.22199#bib.bib13)] 将基于分数的模型和 DDPMs 统一到连续时间随机微分方程 (SDE) 框架下,表明样本生成可以被视为求解由分数函数驱动的反向时间 SDE。此后,SDE 表述已成为分析基于分数的扩散模型的标准数学框架。 #### 反向时间扩散过程。 基于分数的扩散模型的数学基础可以追溯到扩散过程时间反转的经典理论。Anderson [1 (https://arxiv.org/html/2607.22199#bib.bib1)] 首次推导了扩散过程的反向时间随机微分方程,表明反向漂移取决于演化概率密度对数的梯度。后来,Haussmann 和 Pardoux [6 (https://arxiv.org/html/2607.22199#bib.bib6)] 在合适的正则性条件下建立了反向时间扩散的严格概率论处理。这些结果为现代扩散模型中的反向 SDE 提供了理论基础。 #### 神经网络的通用逼近。 神经网络的表达能力在逼近理论文献中得到了广泛研究。Cybenko [5 (https://arxiv.org/html/2607.22199#bib.bib5)] 首先建立了单隐藏层神经网络的通用逼近性质。Hornik [9 (https://arxiv.org/html/2607.22199#bib.bib9)] 随后证明了更强的稠密性结果,表明在激活函数的温和假设下,标准前馈神经网络在 Lp(μ) 空间中是稠密的。这些结果保证了神经网络可以任意精确地逼近分数函数,但它们并不直接意味着反向扩散过程生成的概率分布的逼近。 #### 扩散模型的理论分析。 近年来,人们对为扩散模型建立严格的数学基础越来越感兴趣。Song 等人 [13 (https://arxiv.org/html/2607.22199#bib.bib13)] 推导了连续时间 SDE 公式以及相关的概率流常微分方程。De Bortoli 等人 [2 (https://arxiv.org/html/2607.22199#bib.bib2)] 研究了 Schrödinger 桥公式及其与基于分数的生成建模的联系。这些工作主要关注扩散模型中的随机动力学、采样算法和分数估计,为现代基于分数的生成方法提供了数学基础。 #### 扩散模型中的分布逼近。 最近,理论注意力转向理解学习到的分数函数中的逼近误差如何影响扩散模型生成的概率分布。特别是,Chen 等人 [3 (https://arxiv.org/html/2607.22199#bib.bib3)] 研究了分数逼近与分布逼近之间的关系,在低维线性子空间假设下的有限样本设置中建立了分数估计误差如何传播到生成分布的定量保证。他们的工作为基于分数的生成模型的统计复杂度提供了重要见解。 我们的工作是对这一研究方向的补充。我们不研究在数据分布结构假设下的有限样本统计估计,而是在一般欧几里得设置中研究神经网络对基于分数的扩散模型的逼近能力。通过结合 Hornik 的通用逼近定理、路径空间上的 Girsanov 定理和相对熵的数据处理不等式,我们建立了一个显式界,表明分数函数的 L2 逼近直接给出了目标分布与学习到的反向扩散模型生成的分布之间的 Kullback-Leibler 散度的定量上界。 #### 我们的贡献。 本工作为基于分数的扩散模型建立了分数逼近与分布逼近之间的严格理论联系。我们证明神经网络在 L2(μ) 中任意精确地逼近分数函数意味着真实数据分布与学习到的反向扩散模型生成的分布之间的 Kullback-Leibler 散度任意小。证明结合了逼近理论、随机分析和信息论的三个基本要素:Hornik 的通用逼近定理、用于路径测度变化的 Girsanov 定理,以及相对熵在可测投影下的收缩性质。这为反向扩散模型产生了一个通用的定量逼近定理,为将神经网络对分数函数的逼近与诱导概率分布的逼近联系起来提供了理论基础。 ## 3 背景 在本节中,我们简要回顾基于分数的扩散模型,并介绍全文使用的符号。 ### 3.1 正向扩散过程 设 其中 μ ∈ P(Rᵈ) 表示未知的数据分布。 正向扩散过程由 Itô 随机微分方程控制: dX\_t = f(X\_t, t) dt + g(t) dW\_t, t ∈ [0, T], 其中 - f: Rᵈ × [0,T] → Rᵈ 是漂移函数; - g: [0,T] → (0, ∞) 是扩散系数; - W\_t 是标准布朗运动。 令 p\_t(x) 表示 X\_t 的概率密度函数。随着 t 的增加,正向扩散逐渐将数据分布转化为一个易于处理的终端分布 p\_T。在实际扩散模型中,反向过程从一个预设的先验分布 p\_prior, 初始化,通常选择标准高斯分布。理想情况下,p\_prior 应与 p\_T 一致;然而,一般来说它们可能不同。在本文中,我们通过 Kullback-Leibler 散度 KL(p\_T ∥ p\_prior) 来显式量化这种失配。 与正向扩散相关的分数函数定义为 s(x,t) = ∇\_x log p\_t(x). 在本文中,我们假
相似文章
Diffusion模型在评分函数不敏感的情况下仍能准确恢复混合权重
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。
流形假设下可证明的扩散模型学习:坍缩与精炼
本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。
从近似到涌现:深度学习理论
本文提出了一个理论框架,将近似理论与深度学习中的涌现现象桥接起来,为神经网络如何学习提供了新的见解。
具有原始-对偶推断的约束扩散模型
本文提出了一种用于约束扩散模型的原始-对偶推断方法,通过双重条件得分网络联合推断最优分布及其对偶变量,并提供了收敛性保证,在无线资源分配和投资组合管理中有应用。
扩散、基于分数和流匹配生成模型的统一测度论视角
本预印本提出了一个统一的测度论框架,用于理解扩散、基于分数和流匹配生成模型。它通过连续性/福克-普朗克方程建立了这些方法之间的联系,并分析了它们的采样方案及其理论保证。