滤波后验均值集合:扩散泛化分析模型的统一框架
摘要
本文介绍了滤波后验均值集合(FPMCs),一种用于扩散泛化分析模型的统一框架,整合了现有方法,并通过软松弛和源分布增强展示了改进效果。
arXiv:2605.24192v1 公告类型:新
摘要:作为图像扩散模型骨干的神经网络去噪函数,其泛化行为在各种网络架构和训练超参数下表现出显著的一致性。近期一系列研究试图通过聚合训练数据集补丁的后验加权平均来建模这些网络的输出。在本工作中,我们将这些方法整合成一个统一的模型类,称为滤波后验均值集合(FPMCs)。我们使用查询精度向量、响应权重和源分布来定义该模型类,并说明现有方法可通过这些设计轴的具体选择来恢复。逐一研究每个轴后,我们发现通过对先前的基于补丁的方法进行软松弛以及对源分布进行增强,可以提升FPMC的性能。将这些发现应用于现有的FPMC,我们在三个自然图像数据集上展示了持续一致的样本改进。
查看缓存全文
缓存时间: 2026/05/26 09:01
# 扩散泛化解析模型的统一框架 来源: https://arxiv.org/html/2605.24192 ## 滤波后验均值集合:扩散泛化解析模型的统一框架 Matthew Niedoba¹,² mniedoba@cs\.ubc\.ca &Berend Zwartsenberg² berend\.zwartsenberg@inverted\.ai&Frank Wood¹,²,³ fwood@cs\.ubc\.ca \\AFFS¹不列颠哥伦比亚大学,²Inverted AI,³阿尔伯塔机器智能研究所 ###### 摘要 作为图像扩散模型核心的神经网络去噪函数,其泛化行为在各种网络架构和训练流程超参数下表现出显著的稳定性。最近的研究方向试图通过聚合训练数据集块的加权后验平均值来建模这些网络的输出。在本工作中,我们将这些方法整合为一个统一的模型类,称为滤波后验均值集合(FPMCs)。我们使用查询精度向量、响应权重和源分布来定义这个模型类,并阐明现有方法可以通过这些设计轴的具体选择来恢复。通过依次研究每个轴,我们发现通过先前基于块方法的软松弛以及对源分布的增强,可以提高FPMC的性能。将这些发现应用于现有的FPMC,我们展示了在三个自然图像数据集上一致的样本改进。 ## 1 引言 扩散模型[24 (https://arxiv.org/html/2605.24192#bib.bib23),8 (https://arxiv.org/html/2605.24192#bib.bib24),26 (https://arxiv.org/html/2605.24192#bib.bib25)]是一类强大的生成模型,尤其在视觉数据领域,已被广泛用于图像[21 (https://arxiv.org/html/2605.24192#bib.bib33)]和视频[7 (https://arxiv.org/html/2605.24192#bib.bib34)]生成。这些模型使用神经网络参数化的去噪函数生成样本,该函数经过训练,能从被不同量加性高斯噪声损坏的数据中恢复干净数据。去噪分数匹配目标[29 (https://arxiv.org/html/2605.24192#bib.bib5)]的唯一最小化器是最优去噪器,即对训练数据集元素进行简单的加权后验平均[11 (https://arxiv.org/html/2605.24192#bib.bib1)]。然而,这个最小化器是一个糟糕的生成模型,无法泛化到经验训练分布之外[6 (https://arxiv.org/html/2605.24192#bib.bib6)]。因此,扩散模型的泛化能力意味着网络去噪器学习的是最优去噪器的有偏近似[32 (https://arxiv.org/html/2605.24192#bib.bib13),25 (https://arxiv.org/html/2605.24192#bib.bib26)]。在图像领域,这种偏差在各种超参数下表现出惊人的一致性[34 (https://arxiv.org/html/2605.24192#bib.bib2)]。这一观察引出了两条互补的研究路线。第一条试图理解导致去噪器收敛的归纳偏置[9 (https://arxiv.org/html/2605.24192#bib.bib3),20 (https://arxiv.org/html/2605.24192#bib.bib4),10 (https://arxiv.org/html/2605.24192#bib.bib7),1 (https://arxiv.org/html/2605.24192#bib.bib16),27 (https://arxiv.org/html/2605.24192#bib.bib14)],而第二条旨在通过无网络的解析近似来表征所得有偏去噪器的函数形式[23 (https://arxiv.org/html/2605.24192#bib.bib22),30 (https://arxiv.org/html/2605.24192#bib.bib20),19 (https://arxiv.org/html/2605.24192#bib.bib15),16 (https://arxiv.org/html/2605.24192#bib.bib21),10 (https://arxiv.org/html/2605.24192#bib.bib7),18 (https://arxiv.org/html/2605.24192#bib.bib8)]。在解析方法中,有几种方法试图通过训练数据集块的后验加权平均来近似去噪器偏差。其中包括Niedoba等人[20 (https://arxiv.org/html/2605.24192#bib.bib4)]提出的基于平均网络梯度的块,Kamb和Ganguli [10 (https://arxiv.org/html/2605.24192#bib.bib7)]利用的方形块和基于卷积网络归纳偏置的等变群,以及Lukoianov等人[18 (https://arxiv.org/html/2605.24192#bib.bib8)]从数据协方差特征分解中推导出的块。这些方法共同代表了目前最准确的网络去噪器行为的解析近似。然而,这些方法的设计空间缺乏清晰度,没有为模型改进提供明确方向。在本工作中,我们通过将先前方法整合为一个统一的模型类(我们称之为滤波后验均值集合(FPMCs)),直接解决了这个局限性。我们的框架使用查询精度序列Q\\mathcal\{Q\}(用于滤波后验均值)、响应权重R\\mathcal\{R\}(控制聚合)和源分布V\\mathcal\{V\}(改变平均的支持集)来定义FPMCs。这三个主要轴共同区分了先前的方法论,并构成了系统性改进模型性能的基础。我们依次研究FPMC设计轴,在每个案例中识别并放松了先前方法所做的假设。具体而言,我们通过学习先前基于块方法的软松弛,以及通过源分布的数据增强策略来改进FPMC去噪器。当共同应用时,这些修改在三个自然图像数据集上 consistently 提高了FPMC样本与扩散模型输出的相似度。我们的贡献总结如下: 1. 1\.我们提出了滤波后验均值集合(FPMCs),这是一个统一的分析去噪器框架,通过聚合修改后的最优去噪器来近似网络。我们阐明了Q\\mathcal\{Q\}、R\\mathcal\{R\}和V\\mathcal\{V\}是该模型类的主要设计轴。 2. 2\.我们证明了现有方法[20 (https://arxiv.org/html/2605.24192#bib.bib4),10 (https://arxiv.org/html/2605.24192#bib.bib7),18 (https://arxiv.org/html/2605.24192#bib.bib8)]是FPMCs,可以通过Q\\mathcal\{Q\}、R\\mathcal\{R\}和V\\mathcal\{V\}的具体选择恢复,从而阐明先前方法之间的异同。 3. 3\.我们研究了先前方法中基于二进制块的假设,观察到通过独立或联合端到端微调Q\\mathcal\{Q\}和R\\mathcal\{R\}可以减少FPMC估计误差。 4. 4\.我们研究了源分布增强的效果,发现只有水平翻转和合成增强 consistently 改进FPMC性能。 5. 5\.我们提出了一种基于联合微调Q\\mathcal\{Q\}和R\\mathcal\{R\}以及对V\\mathcal\{V\}进行数据增强的通用FPMC改进方法。将此方法应用于现有的FPMC,我们在CIFAR-10、FFHQ64×6464\\times 64和AFHQ64×6464\\times 64上实现了最先进的样本相似度改进。我们将在论文被接收后公开代码。 ## 2 背景 扩散模型以及许多基于流的生成模型的基础是一个随机前向过程,该过程通过加性高斯噪声逐渐扰动基础密度p\(x\),x∈Rdp\(\\mathbf\{x\}\),\\mathbf\{x\}\\in\\mathbb\{R\}^\{d\}。在本工作中,我们考虑宽度为WW、高度为HH的CC通道图像数据,对应d=W⋅H⋅Cd=W\\cdot H\\cdot C。扩散过程可以通过具有漂移函数f\(z,t\)\\mathbf\{f\}\(\\mathbf\{z\},t\)和扩散系数g\(t\)g\(t\)的随机微分方程(SDE)来定义,形式为 dz=f\(z,t\)dt\+g\(t\)dw\.d\\mathbf\{z\}=\\mathbf\{f\}\(\\mathbf\{z\},t\)dt\+g\(t\)d\\mathbf\{w\}\.\(1\)从初始值\(z,t\)=\(x,0\)\(\\mathbf\{z\},t\)=\(\\mathbf\{x\},0\)到任意t∈\(0,T\]t\\in\(0,T\]对等式(1)进行积分,会诱导出一个条件高斯分布pt\(z∣x\)p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}\\right\)。通过边缘化,可以得到随时间变化的分布pt\(z\)=∫pt\(z∣x\)p\(x\)dxp\_\{t\}\\left\(\\mathbf\{z\}\\right\)=\\int p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}\\right\)p\(\\mathbf\{x\}\)d\\mathbf\{x\},其中p0\(z\)=p\(x\)p\_\{0\}\(\\mathbf\{z\}\)=p\(\\mathbf\{x\}\)。虽然f\\mathbf\{f\}可以是任意函数,但选择仿射f\(z,t\)=f\(t\)z\\mathbf\{f\}\(\\mathbf\{z\},t\)=f\(t\)\\mathbf\{z\}很方便,这会导致pt\(z∣x\)=N\(z;α\(t\),σ\(t\)2Id\)p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}\\right\)=\\mathcal\{N\}\(\\mathbf\{z\};\\alpha\(t\),\\sigma\(t\)^\{2\}\\mathbf\{I\}\_\{d\}\),并具有闭合形式的α\(t\)\\alpha\(t\)和σ\(t\)\\sigma\(t\)[15 (https://arxiv.org/html/2605.24192#bib.bib28)]。通常选择f\(t\)f\(t\)和g\(t\)g\(t\)使得pT\(z\)≈π\(z\)p\_\{T\}\(\\mathbf\{z\}\)\\approx\\pi\\left\(\\mathbf\{z\}\\right\),这是一个易于处理的高斯先验分布¹¹¹除非另有说明,我们采用[11 (https://arxiv.org/html/2605.24192#bib.bib1)]的选择,取f\(t\)=0f\(t\)=0,g\(t\)=2tg\(t\)=\\sqrt\{2t\},得到α\(t\)=1,σ\(t\)=t\\alpha\(t\)=1,\\sigma\(t\)=t。。扩散模型旨在学习一个逆转等式(1)的过程。虽然这可以通过相应的逆向时间SDE实现,但我们将重点关注唯一确定性过程 dzdt=f\(z,t\)−12g\(t\)2∇zlogpt\(z\)\\frac\{d\\mathbf\{z\}\}\{dt\}=\\mathbf\{f\}\(\\mathbf\{z\},t\)\-\\frac\{1\}\{2\}g\(t\)^\{2\}\\nabla\_\{\\mathbf\{z\}\}\\log p\_\{t\}\(\\mathbf\{z\}\)\(2\)其边缘分布对于所有t∈\(0,T\]t\\in\(0,T\]也与等式(1)匹配。通过利用这个确定性概率流微分方程(PF-ODE),扩散模型可以通过数值积分技术求解逆初值问题来生成样本,即从z∼π\(z\)\\mathbf\{z\}\\sim\\pi\(\\mathbf\{z\}\)且t=Tt=T的初始条件出发,计算t=0t=0的解。关键的是,等式(2)的积分依赖于分数函数∇zlogpt\(z\)\\nabla\_\{\\mathbf\{z\}\}\\log p\_\{t\}\(\\mathbf\{z\}\)。扩散模型使用深度神经网络来近似这个函数。近似分数的一种常见方法是通过一个去噪网络DθD\_\{\\theta\},该网络通过目标函数优化 Ex,z∼pt\(z∣x\)p\(x\)t∼p\(t\)\[λ\(t\)‖Dθ\(z,t\)−x‖22\]\.\\mathop\{\\mathbb\{E\}\}\_\{\\begin\{subarray\}\{c\}\\mathbf\{x\},\\mathbf\{z\}\\sim p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}\\right\)p\(\\mathbf\{x\}\)\\\\ t\\sim p\(t\)\\end\{subarray\}\}\\left\[\\lambda\(t\)\\left\\lVert D\_\{\\theta\}\(\\mathbf\{z\},t\)\-\\mathbf\{x\}\\right\\lVert\_\{2\}^\{2\}\\right\]\.\(3\)去噪器在t∈\(0,T\]t\\in\(0,T\]上联合训练,其中t根据p\(t\)p\(t\)分布,并通过超参数λ\(t\)\\lambda\(t\)加权。从这个去噪模型,可以使用Tweedie公式估计分数 ∇zlogpt\(z\)=α\(t\)E\[x∣z,t\]−zσ\(t\)2≈α\(t\)Dθ\(z,t\)−zσ\(t\)2\\nabla\_\{\\mathbf\{z\}\}\\log p\_\{t\}\\left\(\\mathbf\{z\}\\right\)=\\frac\{\\alpha\(t\)\\mathbb\{E\}\\left\[\\mathbf\{x\}\\mid\\mathbf\{z\},t\\right\]\-\\mathbf\{z\}\}\{\\sigma\(t\)^\{2\}\}\\approx\\frac\{\\alpha\(t\)D\_\{\\theta\}\(\\mathbf\{z\},t\)\-\\mathbf\{z\}\}\{\\sigma\(t\)^\{2\}\}\(4\) ### 2\.1建模扩散泛化 参见标题图1:Lukoianov等人[18 (https://arxiv.org/html/2605.24192#bib.bib8)]的FPMC在CIFAR-10上t=3\.2t=3\.2时qq和rr的可视化。所有向量都重新缩放到\[0,1\]\[0,1\]以便可视化。响应权重rr:独热响应控制估计器的输出,这里是单个像素的一个通道。维纳滤波器:维纳滤波器的对应行表现出平滑的、空间定位的结构。Lukoianovqq:阈值化破坏了维纳滤波器的梯度结构。微调后的qq:优化恢复了更匹配底层维纳滤波器的软结构。值得注意的是,独立训练的、在相同数据分布上的图像扩散模型,当从相同的z\\mathbf\{z\}初始时,通过等式(2)通常会产生几乎相同的样本。这种行为对模型架构、训练过程和数值采样器具有鲁棒性[34 (https://arxiv.org/html/2605.24192#bib.bib2)],甚至当模型在相同训练数据集的不相交子集上训练时也是如此[9 (https://arxiv.org/html/2605.24192#bib.bib3)]。此外,这种一致性不仅限于样本本身,还扩展到去噪器函数本身[20 (https://arxiv.org/html/2605.24192#bib.bib4)]。这些发现共同表明,扩散模型中的泛化是来自π\(z\)\\pi\\left\(\\mathbf\{z\}\\right\)的一致映射的结果,该映射由去噪器神经网络的泛化行为参数化。为了深入了解这种泛化行为,人们提出了解析去噪器来近似黑盒神经网络去噪器。可以从等式(4)推导出一个这样的解析去噪器,它表明分数与后验均值E\[x∣z,t\]\\mathbb\{E\}\\left\[\\mathbf\{x\}\\mid\\mathbf\{z\},t\\right\]相关。对于一般的p\(x\)p\(\\mathbf\{x\}\),这个期望是难以计算的。然而,在有限训练集D=\{x\(1\),...,x\(N\)∣x\(i\)∼p\(x\)\}\\mathcal\{D\}=\\\{\\mathbf\{x\}^\{\(1\)\},\\ldots,\\mathbf\{x\}^\{\(N\)\}\\mid\\mathbf\{x\}^\{\(i\)\}\\sim p\(\\mathbf\{x\}\)\\\}和相应的经验数据分布pD\(x\)=1N∑x\(i\)∈Dδ\(x−x\(i\)\)p\_\{\\mathcal\{D\}\}\(\\mathbf\{x\}\)=\\frac\{1\}\{N\}\\sum\_\{\\mathbf\{x\}^\{\(i\)\}\\in\\mathcal\{D\}\}\\delta\(\\mathbf\{x\}\-\\mathbf\{x\}^\{\(i\)\}\)下,经验后验均值具有闭合形式 EpD\[x∣z,t\]\\displaystyle\\mathbb\{E\}\_\{p\_\{\\mathcal\{D\}\}\}\\left\[\\mathbf\{x\}\\mid\\mathbf\{z\},t\\right\]=∫pt\(x∣z\)xdx=∑x\(i\)∈Dpt\(x\(i\)∣z\)x\(i\),\\displaystyle=\\int p\_\{t\}\(\\mathbf\{x\}\\mid\\mathbf\{z\}\)\\ \\mathbf\{x\}\\ d\\mathbf\{x\}=\\sum\_\{\\mathbf\{x\}^\{\(i\)\}\\in\\mathcal\{D\}\}p\_\{t\}\(\\mathbf\{x\}^\{\(i\)\}\\mid\\mathbf\{z\}\)\\ \\mathbf\{x\}^\{\(i\)\},\(5\)pt\(x∣z\)\\displaystyle p\_\{t\}\(\\mathbf\{x\}\\mid\\mathbf\{z\}\)=pt\(z∣x\)pD\(x\)∑x\(i\)∈Dpt\(z∣x\(i\)\)pD\(x\(i\)\)\.\\displaystyle=\\frac\{p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}\\right\)p\_\{\\mathcal\{D\}\}\(\\mathbf\{x\}\)\}\{\\sum\_\{\\mathbf\{x\}^\{\(i\)\}\\in\\mathcal\{D\}\}p\_\{t\}\\left\(\\mathbf\{z\}\\mid\\mathbf\{x\}^\{\(i\)\}\\right\)p\_\{\\mathcal\{D\}\}\(\\mathbf\{x\}^\{\(i\)\)\}\)\}\.\(6\)尽管由等式(5)描述的这个*最优*去噪器是等式(3)[29 (https://arxiv.org/html/2605.24192#bib.bib5),11 (https://arxiv.org/html/2605.24192#bib.bib1)]的最小化器,但由于两个原因,它并不能很好地近似扩散模型的行为。首先,其估计值与神经网络去噪器的估计值不匹配[20 (https://arxiv.org/html/2605.24192#bib.bib4)];其次,最优去噪器无法在训练数据集之外生成样本[6 (https://arxiv.org/html/2605.24192#bib.bib6)]。为了解决这些不足,各种方法提出了对最优去噪器的修改,以更好地近似网络行为[23 (https://arxiv.org/html/2605.24192#bib.bib22),20 (https://arxiv.org/html/2605.24192#bib.bib4),10 (https://arxiv.org/html/2605.24192#bib.bib7),18 (https://arxiv.org/html/2605.24192#bib.bib8)]。 ## 3 滤波后验均值集合 表1:现有方法可以在特定的Q\\mathcal\{Q\}、R\\mathcal\{R\}和V\\mathcal\{V\}选择下重新表述为FPMCs。每种方法的更详细总结见附录A (https://arxiv.org/html/2605.24192#相似文章
扩散、基于分数和流匹配生成模型的统一测度论视角
本预印本提出了一个统一的测度论框架,用于理解扩散、基于分数和流匹配生成模型。它通过连续性/福克-普朗克方程建立了这些方法之间的联系,并分析了它们的采样方案及其理论保证。
基于扩散的数据驱动品类优化
提出了一种基于引导离散扩散的模型无关品类优化框架,将品类表示为二进制向量,并使用奖励引导的逆向扩散来避免组合枚举。展示了在高维场景下的鲁棒性和高质量解决方案。
离散扩散模型:从分词到生成的统一框架
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。
Christoffel-DPS:在任意分布的扩散后验采样中进行最优传感器放置
本文介绍了 Christoffel-DPS,这是一个用于扩散后验采样中最优传感器放置的无分布依赖框架,其性能优于传统的基于高斯假设的方法。它为使用生成式模型从复杂非高斯分布中重建状态提供了理论保证和实际改进。