降噪得分匹配的损失下限:来自薛定谔桥的费希尔几何
摘要
本文隔离了降噪得分匹配训练损失中的不可约多余项,表明它等于沿扩散轨迹的Fisher-Rao度量的迹,连接了变分原理、潜在空间几何和信息论。
arXiv:2608.23916v1 公告类型:新
摘要:降噪得分匹配通过回归条件得分来训练扩散模型,尽管生成最终需要边际得分。两个目标共享相同的总体最小化器,但条件目标在固定噪声状态下仍然是随机的,并在训练损失中引入不可约多余项。我们隔离了这一多余项,并表明,对于在温和正则性假设下的通用污染核,它正是条件终点族的Fisher-Rao度量的迹,沿扩散轨迹积分。这给出了降噪目标的精确条件方差分解,并将扩散潜在空间中观察到的信息几何确定为训练损失的内在组成部分。我们从薛定谔桥变分原理推导出该结果,其中理想目标表现为多余路径空间相对熵。对于污染扩散,Fisher项与噪声状态失去关于干净数据的互信息速率成正比,将损失下限分离为由数据确定的信息流和由污染调度和目标确定的权重。在高斯情况下,这给出了下限的闭式解,恢复了连续时间目标的重参数化不变性,并将其高信噪比散度与数据的信息维度联系起来。最后,我们表明,使用不同噪声范围或权重的原始损失可能无法一致地排名模型,因为它们包含不同的可加下限,并对比了训练所见的二阶几何与进入数值采样误差的三阶条件统计量。
查看缓存全文
缓存时间: 2026/08/26 09:29
# 去噪分数匹配的损失下界:源于薛定谔桥的Fisher几何 来源:https://arxiv.org/html/2608.23916 **作者**:Avinash Raju **单位**:长城汽车股份有限公司 **所在地**:中国北京 **邮箱**:[[email protected]](mailto:[email protected]) **作者**:Kai Zhang **单位**:中国专利信息中心 **所在地**:中国北京 **邮箱**:[[email protected]](mailto:[email protected]) ###### 摘要 去噪分数匹配通过回归条件分数来训练扩散模型,而生成动力学最终需要边际分数。这两个目标具有相同的总体最小化器,但在固定含噪状态下条件目标仍是随机的,因此在训练损失中引入了一个不可约的额外项。我们分离出这一额外项,并证明在温和正则性假设下,对于一般污染核,它恰好是沿扩散轨迹积分的条件端点族Fisher-Rao度量的迹。该结果提供了去噪目标的精确条件方差分解,并将最近在扩散潜空间中观察到的信息几何识别为训练损失的固有组成部分,而非强加于模型的额外结构。我们从薛定谔桥变分原理推导出该结果,其中理想目标作为路径空间的超额相对熵出现。对于污染扩散,Fisher项与含噪状态丢失关于干净数据的互信息的速率成正比,从而将损失下界分离为由数据决定的信息流和由污染计划及训练目标决定的权重。在高斯情况下,这给出了损失下界的闭式解,恢复了连续时间目标的重参数不变性,并将其高信噪比发散与数据的信息维度相关联。最后,我们探讨了其对实践的影响。使用不同噪声范围或权重获得的原始训练损失包含不同的加性下界,且不一定能一致地排序模型;减去我们示例中的下界可恢复正确的排序。我们还对比了训练目标所见的二阶几何与进入数值采样误差的三阶条件统计量。这些结果共同连接了扩散动力学的变分起源、潜空间几何以及去噪分数匹配的信息论结构。 ## 1 引言 去噪扩散模型[1 (https://arxiv.org/html/2608.23916#bib.bib1), 2 (https://arxiv.org/html/2608.23916#bib.bib2), 3 (https://arxiv.org/html/2608.23916#bib.bib3), 4 (https://arxiv.org/html/2608.23916#bib.bib4), 5 (https://arxiv.org/html/2608.23916#bib.bib5)] 现已成为生成建模的标准框架,其应用涵盖图像合成[6 (https://arxiv.org/html/2608.23916#bib.bib6), 7 (https://arxiv.org/html/2608.23916#bib.bib7), 8 (https://arxiv.org/html/2608.23916#bib.bib8)]、视频与音频生成[9 (https://arxiv.org/html/2608.23916#bib.bib9), 10 (https://arxiv.org/html/2608.23916#bib.bib10), 11 (https://arxiv.org/html/2608.23916#bib.bib11), 12 (https://arxiv.org/html/2608.23916#bib.bib12)]、分子设计[13 (https://arxiv.org/html/2608.23916#bib.bib13), 14 (https://arxiv.org/html/2608.23916#bib.bib14)] 以及语言等离散领域[15 (https://arxiv.org/html/2608.23916#bib.bib15), 16 (https://arxiv.org/html/2608.23916#bib.bib16), 17 (https://arxiv.org/html/2608.23916#bib.bib17)]。其公式化现已从多个等效视角得到充分理解:时间反转随机微分方程[18 (https://arxiv.org/html/2608.23916#bib.bib18), 19 (https://arxiv.org/html/2608.23916#bib.bib19), 4 (https://arxiv.org/html/2608.23916#bib.bib4)]、变分目标[20 (https://arxiv.org/html/2608.23916#bib.bib20), 21 (https://arxiv.org/html/2608.23916#bib.bib21), 22 (https://arxiv.org/html/2608.23916#bib.bib22)]、流匹配与随机插值[23 (https://arxiv.org/html/2608.23916#bib.bib23), 24 (https://arxiv.org/html/2608.23916#bib.bib24), 25 (https://arxiv.org/html/2608.23916#bib.bib25)],以及基于Tweedie型恒等式的后验去噪[26 (https://arxiv.org/html/2608.23916#bib.bib26), 27 (https://arxiv.org/html/2608.23916#bib.bib27), 28 (https://arxiv.org/html/2608.23916#bib.bib28)]。所有这些视角的共同点在于,训练均通过去噪分数匹配进行[29 (https://arxiv.org/html/2608.23916#bib.bib29), 30 (https://arxiv.org/html/2608.23916#bib.bib30), 31 (https://arxiv.org/html/2608.23916#bib.bib31)]。然而,生成动力学需要含噪数据分布的*边际*分数 $\mathbf{s}(\mathbf{x},t) = \nabla_{\mathbf{x}} \log P_t(\mathbf{x})$,这通常是难以处理的。DSM通过回归污染核对于干净样本 $\mathbf{y}$ 的*条件*分数 $\mathbf{s}_{\rm cond}(\mathbf{x},t; \mathbf{y}) = \nabla_{\mathbf{x}} \log q(\mathbf{x},t \mid \mathbf{y})$ 来规避此问题[2 (https://arxiv.org/html/2608.23916#bib.bib2), 30 (https://arxiv.org/html/2608.23916#bib.bib30), 31 (https://arxiv.org/html/2608.23916#bib.bib31)]。条件分数是边际分数的无偏估计量,因此两个目标共享相同的总体最小化器;但在固定的 $\mathbf{x}$ 下,条件目标仍是随机变量,这种样本级的随机性带来的成本在标准推导中未被量化。该成本正是本工作的研究重点。 因为共享最小化器并不意味着共享损失值,用随机条件目标替代边际目标会因一项模型无法减少的项而放大目标函数。我们回答的问题是:这个不可约的额外项是什么,它依赖于什么? 我们的主要结果是该额外项具有精确的几何刻画。条件分数关于其后验均值的波动是条件端点分布 $p(\mathbf{y} \mid \mathbf{x},t) = \frac{P_{\rm data}(\mathbf{y}) q(\mathbf{x},t \mid \mathbf{y})}{P_t(\mathbf{x})}$ 关于潜坐标 $\mathbf{x}$ 的分数,因此其二阶矩根据定义是该族的Fisher信息,即信息几何的核心对象[32 (https://arxiv.org/html/2608.23916#bib.bib32), 33 (https://arxiv.org/html/2608.23916#bib.bib33), 34 (https://arxiv.org/html/2608.23916#bib.bib34)]。这给出了去噪目标的精确正交分解: $$ \Delta\mathcal{S}_{\rm DSM} = \Delta\mathcal{S}_{\rm ideal} + \frac{1}{2} \int_0^T \gamma(t) \, \mathbb{E}_{\mathbf{x}\sim P_t} \!\left[ \operatorname{tr} g(\mathbf{x},t) \right] dt, \tag{1.1} $$ 其中 $\Delta\mathcal{S}_{\rm ideal}$ 是理想的边际分数目标,$g(\mathbf{x},t)$ 是条件端点族的Fisher-Rao度量张量。第二项仅依赖于污染和数据,与模型无关:它是条件去噪分数匹配中固有的不可约损失下界。 薛定谔桥公式[35 (https://arxiv.org/html/2608.23916#bib.bib35), 36 (https://arxiv.org/html/2608.23916#bib.bib36), 37 (https://arxiv.org/html/2608.23916#bib.bib37), 38 (https://arxiv.org/html/2608.23916#bib.bib38), 39 (https://arxiv.org/html/2608.23916#bib.bib39)] 为逆扩散动力学提供了变分基础,并提供了两项的共同起源。薛定谔桥是参考路径测度在指定端点约束下的相对熵投影,其最优动力学由Doob h-变换[40 (https://arxiv.org/html/2608.23916#bib.bib40)]给出,其中参考核被一个强制执行终端边缘分布的正调谐函数扭曲;桥及其随机控制解释现已被广泛用于生成建模[41 (https://arxiv.org/html/2608.23916#bib.bib41), 42 (https://arxiv.org/html/2608.23916#bib.bib42), 43 (https://arxiv.org/html/2608.23916#bib.bib43), 44 (https://arxiv.org/html/2608.23916#bib.bib44), 45 (https://arxiv.org/html/2608.23916#bib.bib45), 46 (https://arxiv.org/html/2608.23916#bib.bib46)]。在此,相同的变分结构扮演不同角色:桥泛函的*第一*变分产生基于分数的生成漂移,从而产生理想目标 $\Delta\mathcal{S}_{\rm ideal}$;而*第二*变分产生二次型,其拉回到潜空间即为出现在下界中的Fisher度量。对于仿射高斯污染 $q(\mathbf{x},t \mid \mathbf{y}) = \mathcal{N}(\mathbf{x}; \alpha_t \mathbf{y}, \sigma_t^2 I)$,该度量简化为 $$ g_{ij}(\mathbf{x},t) = \frac{1}{\sigma_t^2} \delta_{ij} + \partial_i \partial_j \log P_t(\mathbf{x}), \tag{1.2} $$ 这恰好是最近在扩散潜空间中识别出的Hessian/Fisher几何[47 (https://arxiv.org/html/2608.23916#bib.bib47), 48 (https://arxiv.org/html/2608.23916#bib.bib48)]。因此,方程(1.1)为该几何提供了变分起源:它不是强加于模型的额外结构,而是训练损失中已存在的条件回归目标的方差。 下界也允许信息论评估。对于一般污染扩散 $d\mathbf{x}_t = f(\mathbf{x}_t, t) \, dt + \sqrt{D(t)} \, d\mathbf{W}_t$, $$ \mathbb{E}_{P_t} \!\left[ \operatorname{tr} g(\mathbf{x},t) \right] = -\frac{2}{D(t)} \frac{d}{dt} I(\mathbf{y}; \mathbf{x}_t), \tag{1.3} $$ 因此下界可分离为依赖于数据的信息流和依赖于调度的权重;当损失权重与扩散系数一致时,积分退化为互信息的差;在高斯情况下,通过I-MMSE关系[49 (https://arxiv.org/html/2608.23916#bib.bib49)] 退化为微分熵的差。 这些恒等式具有直接的实际意义。由于加性下界随信噪比范围、调度和损失权重而变化,不同训练配置下的原始训练损失不可直接比较;我们展示了一种可通过减去下界修复的排序反转现象。这种分离进一步区分了调度设计能影响和不能影响的方面,补充了最近关于基于信息的调度与噪声分配的工作[20 (https://arxiv.org/html/2608.23916#bib.bib20), 50 (https://arxiv.org/html/2608.23916#bib.bib50), 51 (https://arxiv.org/html/2608.23916#bib.bib51), 52 (https://arxiv.org/html/2608.23916#bib.bib52), 53 (https://arxiv.org/html/2608.23916#bib.bib53), 54 (https://arxiv.org/html/2608.23916#bib.bib54), 55 (https://arxiv.org/html/2608.23916#bib.bib55)]。 最后,训练目标仅探查条件端点律的二阶累积量,而生成动力学的数值积分也探查三阶累积量;我们利用这种对比作为诊断,以判断三阶几何效应何时变得显著。 ## 2 从路径空间熵到去噪分数匹配 本节从薛定谔桥变分原理推导扩散模型的训练目标。我们的表述分四步进行: (i) 桥问题通过相对熵最小化选择最优路径测度,其最优性条件采用Doob h-变换的形式; (ii) 超额路径熵相对于最优解可简化为二次分数目标; (iiii) 分数场的条件分解将该目标简化为去噪分数匹配。 下面的推导主要是为了确定分数匹配目标的变分起源。其作用虽小但有用,因为它提供了从路径空间熵到边际分数目标的直接路径,后者稍后将与去噪分数匹配进行比较。逆扩散问题在动作原理视角下的研究见[56 (https://arxiv.org/html/2608.23916#bib.bib56)],我们借用其符号。 ### 2.1 路径空间变分原理 我们的目标是通过随机过程将初始分布 $P_0 = P_{\rm prior}$ 转化为目标分布 $P_T = P_{\rm data}$。设 $\mathcal{G}$ 为参考路径测度,假定其为马尔可夫过程,并由其最后参数和初始参数的被杀正向和反向Kolmogorov方程支配。薛定谔桥问题[35 (https://arxiv.org/html/2608.23916#bib.bib35), 36 (https://arxiv.org/html/2608.23916#bib.bib36), 39 (https://arxiv.org/html/2608.23916#bib.bib39)] 源于一个大偏差问题:在由 $\mathcal{G}$ 的许多独立实现生成的经验路径测度中,当条件设为端点边缘分布为 $P_0$ 和 $P_T$ 时,哪一个占主导?根据Sanov定理,该定理将独立样本的经验测度赋予由相对熵给出的大偏差率[57 (https://arxiv.org/html/2608.23916#bib.bib57), 58 (https://arxiv.org/html/2608.23916#bib.bib58)],经验路径测度 $\mathcal{H}_n$ 渐近地携带大偏差权重 $\mathbb{P}(\mathcal{H}_n \simeq \mathcal{H}) \asymp \exp\left[-n D_{\rm KL}^{\rm path}(\mathcal{H} \, \| \, \mathcal{G})\right]$,因此条件设于端点约束将可容许测度限制在 $\mathcal{C} = \{\mathcal{H} : H_0 = P_0, \; H_T = P_T\}$,主导贡献是率函数在约束下的最小值: $$ \begin{split} \mathcal{H}^{*} &= \argmin_{\mathcal{H}: \, H_0 = P_0, \; H_T = P_T} D^{\rm path}_{KL}(\mathcal{H} \| \mathcal{G}), \\ D^{\rm path}_{KL}(\mathcal{H} \| \mathcal{G}) &= \int d\mathbf{x}_{0:N} \, \mathcal{H}(\mathbf{x}_{0:N}) \ln \frac{\mathcal{H}(\mathbf{x}_{0:N})}{\mathcal{G}(\mathbf{x}_{0:N})}. \end{split} $$
相似文章
用于去噪高维结构化表示的测地线流匹配
本文提出测地线流匹配(Geodesic Flow Matching),一种在环面流形上对空间语义指针(SSP)进行去噪的黎曼传输方法,并在脉冲神经SLAM系统中实现了72%的跟踪误差降低和40%的效率提升。
扩散和流匹配背后的几何:Wasserstein空间中的梯度流和测地线
本文揭示了扩散模型和流匹配是同一Wasserstein几何的两面:扩散遵循自由能梯度流(初值问题),而流匹配遵循Wasserstein测地线(边值问题),它们通过JKO格式统一起来。
Diffusion模型在评分函数不敏感的情况下仍能准确恢复混合权重
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。
Fisher宽度:局部学习几何与各向异性恢复
本文介绍了统计流形上的Fisher宽度和逆Fisher宽度,研究了它们在局部学习界限和各向异性恢复中的作用。证明了两者之间的互补关系,并基于Fisher几何获得了恢复估计。
别拦我:基于耗散黎曼力学的损失最小值采样
本文介绍了DiMS,一种动态系统采样器,能保证从神经网络最小损失解的子流形中精确采样,从而在贝叶斯推断中实现更好的不确定性量化。