基于方差缩减的零阶非对数凹采样及其在逆问题中的应用

arXiv cs.LG 论文

摘要

提出了一种用于非对数凹分布的方差缩减零阶朗之万采样方法,建立了首个非渐近收敛保证,并将其应用于基于分数的生成先验的逆问题中。

arXiv:2605.30573v1 公告类型:新 摘要:从具有未归一化密度的高维非对数凹分布中采样仍然是机器学习中的基本挑战,尤其是在梯度信息不可访问或计算成本高昂的黑箱设置中。虽然当梯度可访问时,朗之万动力学为采样提供了原则性框架,但其在黑箱设置中的扩展存在高方差问题,并且缺乏非对数凹采样的非渐近收敛保证。为解决这些限制,我们提出了一种方差缩减的零阶朗之万采样方法。我们的方法采用了一种梯度估计器,该估计器显著降低了经典批处理零阶估计器的方差,并消除了精确估计所需批大小的不利维度依赖性,从而实现实用且稳定的采样。我们在$\varepsilon$-相对Fisher信息以及庞加莱不等式假设下的平方全变差距离方面,建立了首个零阶非对数凹采样的非渐近收敛保证。我们进一步提出了ZO-APMC,一种用于具有预训练基于分数的生成先验的黑箱逆问题的后验采样算法,为此类方法建立了首个非渐近收敛保证。我们通过合成实验验证了我们的理论,并在实际线性和非线性逆问题上展示了强大的实证性能。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:27

# 零阶非对数凹采样:方差缩减及其在逆问题中的应用 来源:https://arxiv.org/html/2605.30573 ###### 摘要 从具有未归一化密度的高维、非对数凹分布中采样仍是机器学习中的一项基本挑战,尤其是在梯度信息不可访问或计算代价高昂的黑盒设置中。虽然当梯度可访问时,Langevin动力学为采样提供了原理性框架,但其向黑盒设置的扩展存在高方差问题,且缺乏非对数凹采样的非渐近收敛保证。为克服这些限制,我们提出了一种方差缩减的零阶Langevin采样方法。该方法采用梯度估计器,显著降低了经典批量零阶估计器的方差,并消除了精确估计所需批量大小与维度的不利依赖关系,从而实现了实用且稳定的采样。我们建立了首个针对零阶非对数凹采样的非渐近收敛保证:在ε\\varepsilon\-相对Fisher信息方面,以及在Poincaré不等式假设下的平方全变差距离方面。我们进一步提出了ZO-APMC,一种用于黑盒逆问题的后验采样算法,其采用预训练的基于分数的生成先验,并为这类方法建立了首个非渐近收敛保证。我们通过合成实验验证了理论,并在实际线性和非线性逆问题上展示了强大的实证性能。机器学习,ICML ## 1引言 我们研究从分布π∝exp\(−f\)\\pi\\propto\\mathrm\{exp\}\(\-f\)(势函数f:Rd→Rf:\{\\mathbb\{R\}\}^\{d\}\\rightarrow\{\\mathbb\{R\}\})中采样的问题,其中我们只能获得势函数的零阶(ZO)评估。当梯度不可用或代价过高时,该问题具有根本重要性,并已被近期的多项工作研究(Liu and Wang,2020 (https://arxiv.org/html/2605.30573#bib.bib74); Roy et al.,2022 (https://arxiv.org/html/2605.30573#bib.bib38); He et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib22))。在ff强对数凹且具有Lipschitz连续梯度的特殊情形下,该问题已有充分理解;例如,Roy等人(2022 (https://arxiv.org/html/2605.30573#bib.bib38))为Langevin Monte Carlo(LMC)采样建立了非渐近复杂度界。相比之下,据我们所知,非对数凹设置仍未得到充分探索。我们的**第一个主要贡献**是迈出了非对数凹零阶采样理论的第一步,提出了一种新颖的零阶估计器,使得能够从非对数凹分布中采样。主要挑战在于基于沿随机高斯方向的有限差分评估的标准零阶估计器具有高方差。控制这一方差通常需要批大小按采样变量维度dd缩放为O\(d\)\\mathcal\{O\}\(d\),这在高维设置中导致大量的函数评估和内存成本。为缓解此问题,我们提出了一种新颖的方差缩减零阶估计器,每次迭代仅使用O\(1\)\\mathcal\{O\}\(1\)次函数评估,使批大小与环境维度无关,并显著降低了相关的内存成本。我们的理论分析建立在Balasubramanian等人(2022 (https://arxiv.org/html/2605.30573#bib.bib34))开发的具有梯度访问的LMC框架之上,并基于采样版本的*驻点分析*,该技术在非凸优化中已被证明非常有效(Nesterov and others,2018 (https://arxiv.org/html/2605.30573#bib.bib88))。在基础采样设置之外,我们进一步将方法和理论分析扩展到后验采样,以解决使用基于分数的生成模型(SGM)先验的黑盒设置中的不适定逆问题,其中先验信息如前向模型的导数、伪逆(Song et al.,2023 (https://arxiv.org/html/2605.30573#bib.bib21))或参数化(Chung et al.,2023a (https://arxiv.org/html/2605.30573#bib.bib23))不可用或计算代价高昂。此类场景出现在广泛的应用中:前向算子可能通过大型基于PDE的模拟器定义,其导数或伪逆通常不可访问或未定义(Evensen and Van Leeuwen,1996 (https://arxiv.org/html/2605.30573#bib.bib26); Oliver et al.,2008 (https://arxiv.org/html/2605.30573#bib.bib24); Iglesias et al.,2013 (https://arxiv.org/html/2605.30573#bib.bib25));模拟器可能依赖于无法适应现代自动微分框架的遗留代码(Harbaugh et al.,2000 (https://arxiv.org/html/2605.30573#bib.bib79));前向模型可能是专有系统(闭源),如商业MRI扫描仪(Karakuzu et al.,2025 (https://arxiv.org/html/2605.30573#bib.bib80));底层物理可能涉及不连续性(Moës et al.,1999 (https://arxiv.org/html/2605.30573#bib.bib76); Tan et al.,2018 (https://arxiv.org/html/2605.30573#bib.bib77); Lopez-Gomez et al.,2022 (https://arxiv.org/html/2605.30573#bib.bib78));或者前向模型可能实现为基于规则的专家系统(Rotshtein and Rakytyanska,2012 (https://arxiv.org/html/2605.30573#bib.bib84); Huang et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib18); Gong et al.,2025 (https://arxiv.org/html/2605.30573#bib.bib85))。在此类不适定逆问题设置中,选择灵活且富有表现力的先验至关重要。SGM因其能够建模高维非对数凹数据分布,同时无需重新训练即可适用于各种逆问题,最近已成为强大的即插即用先验。它们在广泛的应用中展示了强大的实证性能,包括图像恢复(Wang et al.,2023 (https://arxiv.org/html/2605.30573#bib.bib7); Rout et al.,2023 (https://arxiv.org/html/2605.30573#bib.bib8))、医学成像(Song et al.,2022 (https://arxiv.org/html/2605.30573#bib.bib10); Sun et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib11))和音乐生成(Rout et al.,2025 (https://arxiv.org/html/2605.30573#bib.bib17)),其中通常假设可访问前向算子的梯度。最近,SGM被用于开发逆问题的黑盒后验采样方法,其中似然分数不可访问,显示出有希望的实证性能(Tang et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib31); Huang et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib18); Zheng et al.,2025a (https://arxiv.org/html/2605.30573#bib.bib27))。然而,这些方法依赖于启发式近似,目前缺乏在标准概率差异度量(如Fisher信息(FI)或全变差(TV)距离)下收敛到目标后验的严格保证。事实上,即使对于可访问似然分数的后验采样方法,严格的保证仍然罕见;即使存在,通常也依赖于诸如线性前向算子等限制性假设,这些假设在实践中经常被违反(Daras et al.,2024 (https://arxiv.org/html/2605.30573#bib.bib9))。附录A(https://arxiv.org/html/2605.30573#A1)中提供了对基于梯度和黑盒后验采样方法的更详细讨论,并在表3(https://arxiv.org/html/2605.30573#A1.T3)中与所提方法进行了补充比较。本工作的**第二个主要贡献**是开发了一种理论上基础的即插即用Monte Carlo(PMC)方法,仅使用前向模型评估和预训练的SGM先验来解决黑盒逆问题。我们将其定位为黑盒设置中后验采样的重要一步,提供了具有正式收敛保证的算法,并为未来进展奠定了坚实基础。在设计实用的零阶后验采样算法时,我们遇到两个关键挑战:标准LMC通常收敛缓慢,且零阶估计所需的批大小随问题维度缩放,导致高维设置中计算和内存成本过高。为应对这些挑战,我们将退火LMC与我们的方差缩减零阶估计器相结合,使得在每次迭代中使用实际数量的函数评估即可准确近似前向模型梯度。我们在后验采样的理论结果中纳入了退火调度和SGM估计误差对收敛的影响。具体地,本工作的主要贡献如下: - •我们建立了首个零阶采样的非渐近复杂度保证,在O\(1/ε4\)\\mathcal\{O\}\(1/\\varepsilon^\{4\}\)次迭代后达到ε\\varepsilon\-相对FI误差。在目标分布满足Poincaré不等式的假设下,该速率还产生平方TV距离的ε\\varepsilon\-精度。此外,通过衰减参数,我们展示了向目标分布的弱收敛。 - •我们提出了一种新颖的方差缩减零阶梯度估计器,每次迭代仅使用O\(1\)\\mathcal\{O\}\(1\)次函数评估即可实现上述收敛保证,消除了标准零阶估计器的O\(d\)\\mathcal\{O\}\(d\)批大小缩放。 - •我们提出了一种用于黑盒逆问题的方差缩减零阶退火PMC算法(ZO-APMC),基于退火LMC和预训练的SGM先验,并建立了非渐近和弱收敛保证。 - •我们通过数值和统计实验验证了理论发现,并进一步证明ZO-APMC在MRI重建和黑洞成像中持续优于现有黑盒后验采样方法,同时在Navier-Stokes逆问题上提供有竞争力的性能。 ## 2预备知识 ### 2\.1零阶采样 传统上,Langevin扩散定义为如下随机微分方程的解 dxt=−∇f\(xt\)dt\+2dBt,d\{\\bm\{x\}\}\_\{t\}=\-\\nabla f\(\{\\bm\{x\}\}\_\{t\}\)dt\+\\sqrt\{2\}d\{\\bm\{B\}\}\_\{t\},\(1\)在温和条件下,其唯一平稳分布为π∝exp\(−f\)\\pi\\propto\\mathrm\{exp\}\(\-f\),并且随着t→∞t\\rightarrow\infty收敛到该分布。这里,\(Bt\)t≥0\(\{\\bm\{B\}\}\_\{t\}\)\_\{t\\geq 0\}\)表示标准的dd维布朗运动。对该随机过程以步长γ\>0\\gamma\>0进行离散化,得到标准Langevin Monte Carlo(LMC)算法: x\(k\+1\)γ≔xkγ−γ∇f\(xkγ\)\+2\(B\(k\+1\)γ−Bkγ\),\{\\bm\{x\}\}\_\{\(k\+1\)\\gamma\}\\coloneqq\{\\bm\{x\}\}\_\{k\\gamma\}\-\\gamma\\nabla f\(\{\\bm\{x\}\}\_\{k\\gamma\}\)\+\\sqrt\{2\}\(\{\\bm\{B\}\}\_\{\(k\+1\)\\gamma\}\-\{\\bm\{B\}\}\_\{k\\gamma\}\),\(2\)在本工作中,我们假设对势函数ff具有黑盒访问权限;因此,无法计算梯度∇f\(xkγ\)\\nabla f\(\{\\bm\{x\}\}\_\{k\\gamma\}\)。相反,我们考虑其零阶估计(Nesterov and Spokoiny,2017 (https://arxiv.org/html/2605.30573#bib.bib32)),定义为 ∇~fμ\(x,u\)≔f\(x\+μu\)−f\(x\)μu,\\widetilde\{\\nabla\}f\_\{\\mu\}\(\{\\bm\{x\}\},\{\\bm\{u\}\}\)\\coloneqq\\frac\{f\(\{\\bm\{x\}\}\+\\mu\{\\bm\{u\}\}\)\-f\(\{\\bm\{x\}\}\)\}\{\\mu\}\\,\{\\bm\{u\}\},\(3\)其中u∼N\(0,I\)\{\\bm\{u\}\}\\\!\\\!\\sim\\\!\\\!\{\\mathcal\{N\}\}\(0,I\),μ\>0\\mu\\\!\>\\\!0是平滑参数。我们注意到零阶估计器有偏,因为∇fμ\(x\)≔Eu\[∇~fμ\(x,u\)\]≠∇f\(x\)\\nabla f\_\{\\mu\}\(\{\\bm\{x\}\}\)\\coloneqq\\mathbb\{E\}\_\{\\bm\{u\}\}\[\\widetilde\{\\nabla\}f\_\{\\mu\}\(\{\\bm\{x\}\},\{\\bm\{u\}\}\)\]\\neq\\nabla f\(\{\\bm\{x\}\}\)。然而,该偏差随着μ→0\\mu\\rightarrow 0而消失;参见附录B.1(https://arxiv.org/html/2605.30573#A2.SS1)中的引理1(https://arxiv.org/html/2605.30573#Thmlemma1)。将\(2\)中的∇f\(xkγ\)\\nabla f\(\{\\bm\{x\}\}\_\{k\\gamma\}\)替换为其零阶估计\(1/b\)∑i=1b∇~fμ\(xkγ,uki\)\(1/b\)\\sum\_\{i=1\}^\{b\}\\widetilde\{\\nabla\}f\_\{\\mu\}\(\{\\bm\{x\}\}\_\{k\\gamma\},\{\\bm\{u\}\}\_\{k\}^\{i\}\),得到朴素的ZO-LMC算法,其中bb是批大小。Roy等人(2022 (https://arxiv.org/html/2605.30573#bib.bib38))分析了该方法在强对数凹目标分布(该假设在实践中经常被违反)下的表现,并建立了Wasserstein-2收敛保证。然而,他们的分析要求批大小按O\(d\)\\mathcal\{O\}\(d\)缩放,导致高维设置中内存需求过大。在本工作中,我们转而针对非对数凹目标分布提供分析,并每次迭代使用O\(1\)\\mathcal\{O\}\(1\)次函数评估。该性质由所提出的方差缩减零阶估计器gk\{\\bm\{g\}\}\_\{k\}保证,其定义见第3节(https://arxiv.org/html/2605.30573#S3)。 参见说明 图1:PMC中加权退火的说明:通过加权后验\(πσk\(αk\)\)k=0N−1\\bigl\(\\pi\_\{\\sigma\_\{k\}\}^\{\(\\alpha\_\{k\}\)\}\\bigr\)\_\{k=0\}^\{N\-1\}\)。实线和阴影区域分别表示分布均值和密度,而非阴影区域对应于∇log⁡π\(x\)=0\\nabla\\log\\pi\(\{\\bm\{x\}\}\)=0。通过逐渐减小先验平滑参数σk\\sigma\_\{k\}及其相对于似然l\\ell的权重αk\\alpha\_\{k\},加权退火使PMC能够逃离∇log⁡π\(x\)\\nabla\\log\\pi\(\{\\bm\{x\}\}\)中的平坦区域。 ### 2\.2黑盒逆问题 在工作关于后验采样的部分,我们考虑一个一般的黑盒逆问题设置,建模为 y=A\(x\)\+ξ,x∈Rd,y,ξ∈Rm。\{\\bm\{y\}\}=\{\\bm\{A\}\}\(\{\\bm\{x\}\}\)\+\\xi,\\quad\{\\bm\{x\}\}\\in\{\\mathbb\{R\}\}^\{d\},\\;\\quad\{\\bm\{y\}\},\\xi\\in\{\\mathbb\{R\}\}^\{m\}\。\(4\)这里我们假设仅对前向模型A\(⋅\)\{\\bm\{A\}\}\(\\cdot\)具有黑盒访问权限。在此设置中,梯度信息不可用,并且A\{\\bm\{A\}\}只能通过输入-输出评估进行查询。算子A:Rd→Rm\{\\bm\{A\}\}\\\!:\\\!\{\\mathbb\{R\}\}^\{d\}\\to\{\\mathbb\{R\}\}^\{m\}对成像系统的响应进行建模,其中m≪dm\\\!\\ll\\\!d,ξ∈Rm\\xi\\in\{\\mathbb\{R\}\}^\{m\}表示测量噪声。目标是从带噪测量y\{\\bm\{y\}\}中恢复未知信号x\{\\bm\{x\}\}。在许多实际设置中,映射x→y\{\\bm\{x\}\}\\\!\\rightarrow\\\!\{\\bm\{y\}\}是多对一的,使得重建任务成为不适定逆问题,因为无法从y\{\\bm\{y\}\}唯一恢复x\{\\bm\{x\}\}。在贝叶斯框架中,可以引入p\(x\)∝exp\(−h\)p\(\{\\bm\{x\}\}\)\\propto\\mathrm\{exp\}\(\-h\)作为*先验*,并从*后验*π\(x\|y\)\\pi\(\{\\bm\{x\}\}\|\{\\bm\{y\}\}\)中采样,这通过贝叶斯规则正式建立:π\(x\|y\)∝l\(y\|x\)p\(x\)\\pi\(\{\\bm\{x\}\}\|\{\\bm\{y\}\}\)\\\!\\propto\\\!\\ell\(\{\\bm\{y\}\}\|\{\\bm\{x\}\}\)p\(\{\\bm\{x\}\}\),其中l\(y\|x\)∝exp\(−f\)\\ell\(\{\\bm\{y\}\}\|\{\\bm\{x\}\}\)\\propto\\mathrm\{exp\}\(\-f\)是由\(4\)导出的*似然*分布。因此,通过对\(2\)中的LMC迭代应用贝叶斯规则,并将∇f\(xkγ\)\\nabla f\(\{\\bm\{x\}\}\_\{k\\gamma\}\)替换为其朴素零阶估计,我们立即得到以下零阶后验采样LMC算法。 x\(k\+1\)γ≔xkγ\\displaystyle\{\\bm\{x\}\}\_\{\(k\+1\)\\gamma\}\\coloneqq\{\\bm\{x\}\}\_\{k\\gamma\}−γ\(1b∑i=1b∇~fμ\(xkγ,uki\)\+∇h\(xkγ\)\)\\displaystyle\-\\gamma\\biggl\(\\frac\{1\}\{b\}\\sum\_\{i=1\}^\{b\}\\widetilde\{\\nabla\}f\_\{\\mu\}\(\{\\bm\{x\}\}\_\{k\\gamma\},\{\\bm\{u\}\}\_\{k\}^\{i\}\)\+\\nabla h\(\{\\bm\{x\}\}\_\{k\\gamma\}\)\\biggr\)

相似文章

Implicit Variational Rejection Sampling

arXiv cs.LG

本文提出了隐式变分拒绝采样(Implicit Variational Rejection Sampling, IVRS),该方法将隐式分布与拒绝采样相结合,以改进变分推断中的后验近似,并引入了隐式重采样证据下界(Implicit Resampling Evidence Lower Bound, IR-ELBO)作为更紧的变分下界。