在混合线性回归中连接Score Matching、Maximum Likelihood与Expectation-Maximization
摘要
本文在混合线性回归中连接了Score Matching、Maximum Likelihood和Expectation-Maximization,提供了理论保证,并分析了扩散噪声水平下的梯度行为。
arXiv:2609.05688v1 公告类型:新
摘要:我们研究了在未知混合权重的混合线性回归(MLR)中响应的方差保持扩散。我们的分析将Score Matching的统计保证与固定扩散噪声水平下的损失几何和优化信号分离。KL散度将沿扩散路径积分的去噪Score Matching目标与似然性和终端差异联系起来。在温和的正则条件和终端调度下,所得估计量收敛到MLR的真实参数,其缩放误差收敛到最大似然估计量的高斯极限。在固定的扩散噪声水平尺度下,我们推导出一个分解,将Score Matching损失与交叉熵和Expectation-Maximization(EM)算子联系起来。该分解产生了一个与EM相关的低噪声梯度扩展,带有额外的潜在方差修正项。在高噪声极限下,我们进一步描述了各向同性协方差下对该极限损失的梯度下降。沿固定的高信噪比射线,Score Matching不平衡梯度和潜在方差项逐点趋于零。数值实验说明了我们的理论发现和统计保证。
查看缓存全文
缓存时间: 2026/09/10 08:23
# 连接得分匹配、最大似然与期望最大化在混合线性回归中的应用 来源:https://arxiv.org/html/2609.05688 罗占坤 (Zhankun Luo) [email protected] 附属机构: 阿博法兹勒·哈什米 (Abolfazl Hashemi) [email protected] 附属机构:电气与计算机工程学院 附属机构:美国印第安纳州西拉法叶普渡大学 ###### 摘要 我们研究了在混合权重未知的混合线性回归(MLR)中响应变量的保方差扩散。我们的分析将得分匹配的统计保证与固定扩散噪声水平下的损失几何和优化信号分离开来。KL散度将沿扩散路径积分的去噪得分匹配目标与似然性和终端差异联系起来。在温和的正则性条件和终端调度下,所得的估计量能收敛至MLR的真实参数,其缩放后的误差收敛到最大似然估计的高斯极限。在固定的扩散噪声水平尺度下,我们推导了一个分解,将得分匹配损失与交叉熵和期望最大化(EM)算子联系起来。该分解产生了一个与EM相关的低噪声梯度展开,并带有潜方差的额外修正项。在高噪声极限下,我们进一步描述了各向同性协方差下对这个极限损失的梯度下降行为。沿固定高信噪比射线,得分匹配不平衡梯度和潜方差项逐点趋于零。数值实验阐明了我们的理论发现和统计保证。 ††脚注:在稿件准备过程中,使用了大语言模型作为通用辅助工具进行语言编辑和代码辅助。作者独立验证了理论和实验结果,并对稿件承担全部责任。 ### 1 引言 对于具有多种模态的响应规律,其均值可能落入一个低概率区域,从而无法描述一个合理的观测结果(Bishop, 1994 (https://arxiv.org/html/2609.05688#bib.bib3); Han等, 2022 (https://arxiv.org/html/2609.05688#bib.bib32))。扩散模型则学习响应规律的高斯平滑版本的得分(Ho等, 2020 (https://arxiv.org/html/2609.05688#bib.bib35); Song等, 2021b (https://arxiv.org/html/2609.05688#bib.bib34))。条件变体保留协变量,同时向响应添加噪声。Batzolis等 (2021) (https://arxiv.org/html/2609.05688#bib.bib31) 为条件去噪得分估计提供了理论依据,而 Fu等 (2024) (https://arxiv.org/html/2609.05688#bib.bib33) 和 Tang等 (2025) (https://arxiv.org/html/2609.05688#bib.bib48) 在其各自的假设下建立了条件得分和分布估计的保证。基于这种分布视角,我们研究了结构化潜模型中的参数恢复、其与潜变量优化的联系,以及参数信息和梯度信号如何随扩散噪声水平和信号强度变化。我们在混合线性回归(MLR)这一经典潜模型(Quandt, 1972 (https://arxiv.org/html/2609.05688#bib.bib45); De Veaux, 1989 (https://arxiv.org/html/2609.05688#bib.bib2); Zilber与Nadler, 2023 (https://arxiv.org/html/2609.05688#bib.bib61))中研究这些问题。在响应的高斯扩散下,条件得分和潜符号的后验分布是显式的。在MLR模型中,我们将协变量记为 **x** ∈ ℝᵈ,响应记为 y₀ ∈ ℝ。真实回归参数 θ* 表示了分量之间的分离度,ν* 表征了真实混合权重 π* = (π*(1), π*(2)) := ((1+tanh ν*)/2, (1−tanh ν*)/2) 的不平衡性,响应的条件分布为: y₀ | **x** ∼ π*(1) 𝒩(⟨θ*, **x**⟩, 1) + π*(2) 𝒩(−⟨θ*, **x**⟩, 1)。(1) **问题:** 对于这个MLR模型,在什么条件下,路径积分的得分匹配估计器能够恢复回归参数和混合权重?得分匹配损失如何与期望最大化相关联?噪声水平和信号强度如何影响优化动态以及得分匹配保留的参数信息? ##### 得分匹配与混合学习 得分匹配最初是为未归一化模型提出的,与扰动下的最大似然相联系,并与去噪目标相关(Hyvärinen, 2005 (https://arxiv.org/html/2609.05688#bib.bib49); Lyu, 2009 (https://arxiv.org/html/2609.05688#bib.bib50); Vincent, 2011 (https://arxiv.org/html/2609.05688#bib.bib36))。基于变分方法和最大似然的分析,在其各自的逆模型和加权下,将扩散得分目标与似然联系起来(Huang等, 2021 (https://arxiv.org/html/2609.05688#bib.bib52); Song等, 2021a (https://arxiv.org/html/2609.05688#bib.bib53))。关于用得分学习密度和分布的结果进一步将积分得分目标与密度和参数估计联系起来(Li与Yan, 2024 (https://arxiv.org/html/2609.05688#bib.bib58); Chewi等, 2025a (https://arxiv.org/html/2609.05688#bib.bib18)),而针对高斯混合的结果为扩散和得分方法提供了端到端的分布学习保证(Chen等, 2025 (https://arxiv.org/html/2609.05688#bib.bib13); Gatmiry等, 2025 (https://arxiv.org/html/2609.05688#bib.bib14))。Shah等 (2023) (https://arxiv.org/html/2609.05688#bib.bib23) 分析了平衡的球面高斯混合。他们的大噪声证明使用了谱迭代,而小噪声证明则比较了梯度步长与期望最大化(EM)的M步。我们的条件高斯分量具有随 **x** 移动的中心,其回归参数和混合权重均未知。先前的工作通过可辨识性、谱方法和矩方法、凸形式、交替最小化、近似消息传递和EM研究了MLR(Hennig, 2000 (https://arxiv.org/html/2609.05688#bib.bib46); Chaganty与Liang, 2013 (https://arxiv.org/html/2609.05688#bib.bib4); Zhong等, 2016 (https://arxiv.org/html/2609.05688#bib.bib47); Yi等, 2014 (https://arxiv.org/html/2609.05688#bib.bib5); Chen等, 2018 (https://arxiv.org/html/2609.05688#bib.bib7); Tan与Venkataramanan, 2023 (https://arxiv.org/html/2609.05688#bib.bib62); Balakrishnan等, 2017 (https://arxiv.org/html/2609.05688#bib.bib6); Klusowski等, 2019 (https://arxiv.org/html/2609.05688#bib.bib8); Kwon等, 2021 (https://arxiv.org/html/2609.05688#bib.bib9); Kwon等, 2024 (https://arxiv.org/html/2609.05688#bib.bib16))。Zilber与Nadler (2023) (https://arxiv.org/html/2609.05688#bib.bib61) 研究了未知不平衡MLR的估计,而Luo与Hashemi (2025) (https://arxiv.org/html/2609.05688#bib.bib25); Luo与Hashemi (2026) (https://arxiv.org/html/2609.05688#bib.bib26) 刻画了回归参数和混合权重不平衡性的耦合EM算子。Ozkara等 (2026) (https://arxiv.org/html/2609.05688#bib.bib30) 使用了一种相关的条件扩散方法,在固定分量均值的一个噪声水平下估计双分量高斯混合中的客户端特定权重。我们的设置同时估计了依赖于协变量的中心以及混合权重的不平衡性。 ##### 得分盲区与噪声的作用 在高扩散噪声水平下,分量分离可以从得分中移除关于混合权重的信息,正如Wenliang与Kanagawa (2020) (https://arxiv.org/html/2609.05688#bib.bib55) 在一维高斯双混合示例中所确立的,当分离度增大时,两者之间的费雪散度消失。Zhang等 (2022) (https://arxiv.org/html/2609.05688#bib.bib56) 提出了一种混合费雪散度来缓解这种失效,而Koehler等 (2023) (https://arxiv.org/html/2609.05688#bib.bib54) 则将得分匹配效率与等周性质联系起来。Luo与Hashemi (2024) (https://arxiv.org/html/2609.05688#bib.bib24) 中相应的人口EM行为表明,在无噪声情况下,混合权重的EM更新独立于进入的混合不平衡性,但通过当前和真实回归参数的对齐,仍然提供了关于真实混合不平衡性的信息。对于具有已知混合权重和已知共享协方差的有限高斯混合,Qin与Risteski (2024) (https://arxiv.org/html/2609.05688#bib.bib57) 证明了使用连续回火(与退火得分匹配相关)的广义得分匹配目标拟合分量均值的统计复杂性的多项式渐近界。对于已知分量参数的双高斯族的混合权重,Lütke Schwienhorst等 (2026) (https://arxiv.org/html/2609.05688#bib.bib60) 表明,适当的水平调整消除了其有限样本误差界对分离度的依赖,而Dennehy等 (2026) (https://arxiv.org/html/2609.05688#bib.bib59) 表明,扩散噪声水平的模态重叠中间尺度可以保留关于混合权重的信息。 #### 1.1 技术概述与贡献 技术发展结合了相对熵和似然桥梁,遵循de Bruijn恒等式(Stam, 1959 (https://arxiv.org/html/2609.05688#bib.bib51))、期望最大化更新(Dempster等, 1977 (https://arxiv.org/html/2609.05688#bib.bib1))与耦合EM算子(Weinberger与Bresler, 2022 (https://arxiv.org/html/2609.05688#bib.bib12); Luo与Hashemi, 2025 (https://arxiv.org/html/2609.05688#bib.bib25)),以及标准的M估计论证(van der Vaart, 1998 (https://arxiv.org/html/2609.05688#bib.bib15); Chewi等, 2025b (https://arxiv.org/html/2609.05688#bib.bib17); Lütke Schwienhorst等, 2026 (https://arxiv.org/html/2609.05688#bib.bib60))。主要贡献如下。 - • **路径积分得分匹配:最大似然渐近性(第3节 (https://arxiv.org/html/2609.05688#S3))**:引理A.15 (https://arxiv.org/html/2609.05688#A1.Thmstyle15) 和A.16 (https://arxiv.org/html/2609.05688#A1.Thmstyle16) 建立了总体和经验似然桥梁,其中终端差异构成了路径积分目标与似然之间唯一依赖参数的差距。命题3.1 (https://arxiv.org/html/2609.05688#S3.Thmstyle1) 表明总体KL散度保持了可辨识性,主要定理3.2 (https://arxiv.org/html/2609.05688#S3.Thmstyle2) 证明,控制终端差异可以将一致性和具有逆费雪协方差的渐近正态性从最大似然传递到路径积分得分匹配估计器。 - • **固定尺度得分匹配:交叉熵与EM分解(第4节 (https://arxiv.org/html/2609.05688#S4))**:命题4.1 (https://arxiv.org/html/2609.05688#S4.Thmstyle1) 和4.2 (https://arxiv.org/html/2609.05688#S4.Thmstyle2) 识别了扩散MLR的期望最大化(EM)算子,并将交叉熵梯度表示为EM残差,而主要定理4.3 (https://arxiv.org/html/2609.05688#S4.Thmstyle3) 表明,固定尺度损失允许交叉熵和EM算子的等价分解。推论4.4 (https://arxiv.org/html/2609.05688#S4.Thmstyle4) 和4.5 (https://arxiv.org/html/2609.05688#S4.Thmstyle5),结合命题4.6 (https://arxiv.org/html/2609.05688#S4.Thmstyle6),将这些分解转化为精确的梯度恒等式,表明得分匹配梯度场涉及EM算子、算子导数和潜方差项。公式(15 (https://arxiv.org/html/2609.05688#S4.E15)) 以及命题4.7 (https://arxiv.org/html/2609.05688#S4.Thmstyle7) 和4.8 (https://arxiv.org/html/2609.05688#S4.Thmstyle8) 刻画了两个端点情况:低噪声梯度极限保留了这种与EM相关的修正结构,而高噪声极限目标则依赖于候选参数和真实参数。 - • **高噪声梯度动态与得分匹配盲区(第5节 (https://arxiv.org/html/2609.05688#S5))**:主要定理5.1 (https://arxiv.org/html/2609.05688#S5.Thmstyle1) 给出了当有效目标为零时的 𝒪(K⁻²) 损失界,其中K表示梯度下降迭代次数;对于一般初始化且有效目标非零时,给出了 𝒪(log(1/ε)) 的界,只有一个测度为零的例外集被吸引到鞍点。命题5.2 (https://arxiv.org/html/2609.05688#S5.Thmstyle2) 正式化了混合不平衡性的逐点盲区:当真实信号沿固定射线发散时,在固定扩散噪声水平尺度下,不平衡参数的梯度趋于零。 ##### 组织结构 第2节 (https://arxiv.org/html/2609.05688#S2) 阐述了MLR模型、得分匹配目标及相关EM算子。第3节 (https://arxiv.org/html/2609.05688#S3) 展示了似然桥梁如何将最大似然渐近性传递给路径积分得分匹配估计器。第4节 (https://arxiv.org/html/2609.05688#S4) 推导了精确的交叉熵和EM分解,并利用它们刻画了固定尺度损失和梯度在低噪声和高噪声区间的行为。第5节 (https://arxiv.org/html/2609.05688#S5) 分析了高噪声梯度动态和逐点得分匹配盲区。第6节 (https://arxiv.org/html/2609.05688#S6) 整合了相应的数值含义。附录A (https://arxiv.org/html/2609.05688#A1) 开发了主要证明中使用的辅助恒等式和界,附录B (https://arxiv.org/html/2609.05688#A2) 至D (https://arxiv.org/html/2609.05688#A4) 给出了第3 (https://arxiv.org/html/2609.05688#S3) 至5 (https://arxiv.org/html/2609.05688#S5) 节结果的证明。附录E (https://arxiv.org/html/2609.05688#A5) 记录了验证第3 (https://arxiv.org/html/2609.05688#S3) 至5 (https://arxiv.org/html/2609.05688#S5) 节理论发现的数值结果的实验细节。 ### 2 问题设置 本节指定混合线性回归(MLR)模型及其响应的保方差扩散。然后定义总体和经验得分匹配目标。还引入了交叉熵和EM算子以及估计和渐近分析所需的符号。以下方程的详细推导见附录A (https://arxiv.org/html/2609.05688#A1)。 #### 2.1 混合线性回归与保方差扩散 在双分量混合线性回归(MLR)模型中,响应 y₀ 根据回归参数 θ 和加性噪声 ε₀ 生成: y₀ = (−1)^(z+1)⟨θ, **x**⟩ + ε₀,(2) 其中 𝔼[**x****x**ᵀ] = Σ ≻ 0 且 ε₀ ∼ 𝒩(0, 1)。潜变量 z ∈ {1, 2} 具有概率 ℙ(z=1 | π) = π(1) 和 ℙ(z=2 | π) = π(2)。
相似文章
马尔可夫噪声下的高概率PL-SGD:最优混合与尾部依赖
本文为PL平滑目标在马尔可夫噪声下的随机梯度下降提供了最优高概率界,填补了期望保证与高概率保证之间的差距,并扩展到重尾设置,给出了匹配的下界。
通过平滑MMD对齐增强LLM中的数值预测
引入平滑最大均值差异(SMMD),一种损失函数,通过核匹配和基于图的平滑性将预测数值分布与目标对齐,提高了LLM在多个任务中的数值预测准确性。
DiffScore:超越自回归似然性的文本评估
本文介绍了 DiffScore,这是一个基于掩码大型扩散语言模型(Masked Large Diffusion Language Models)的文本评估框架,通过利用掩码重建来解决自回归评分中的位置偏差问题。
扩散、基于分数和流匹配生成模型的统一测度论视角
本预印本提出了一个统一的测度论框架,用于理解扩散、基于分数和流匹配生成模型。它通过连续性/福克-普朗克方程建立了这些方法之间的联系,并分析了它们的采样方案及其理论保证。
Diffusion模型在评分函数不敏感的情况下仍能准确恢复混合权重
本文解决了扩散模型在评分函数对混合权重不敏感时仍能准确恢复混合权重的悖论,引入了扩散评分敏感性指数(DSSI),并表明中间噪声级别为权重恢复提供了信息性信号。