非参数工具变量的微扰方法

arXiv cs.LG 论文

摘要

介绍了一种用于非参数工具变量估计的微扰方法,该方法通过高阶修正扩展了核岭回归方法,在高维设置中实现了预测误差高达99%的降低。

arXiv:2606.00322v1 Announce Type: new 摘要:我们提出了一种用于非参数工具变量(NPIV)估计的微扰方法。受物理学中微扰理论的启发,我们通过系统性的高阶微扰修正扩展了标准核岭回归方法,显著提高了估计精度。从谱的角度看,微扰引入了期望积分算子不同本征模之间的混合,这在积分方程不适定时尤其有用。这种不适定性的一个来源可能是维度灾难。我们的方法适用于各种维度区间,特别是当通过样本数$n$和维度$d$定义的维度参数$\beta$(满足$n^\beta = d$)变得很大时。实验结果表明,在高维不适定情形($\beta > 0.7$)下,与标准岭回归方法相比,我们的一阶微扰修正可将预测误差降低高达99%。在很宽的维度范围内,性能提升得以保持,并且随着维度增加,优势更加明显。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:41

# 非参数工具变量的微扰方法

来源:https://arxiv.org/html/2606.00322

###### 摘要

我们引入了一种用于非参数工具变量 (NPIV) 估计的微扰方法。通过借鉴物理学中的微扰理论,我们扩展了标准核岭方法,加入了系统性的高阶微扰修正,从而显著提高了估计精度。从谱的角度看,微扰引入了期望积分算子不同本征模之间的混合,这在积分方程病态时尤其有用。导致病态的一个可能原因是维度灾难。我们的方法在不同维度范围下均有效,特别是当维度参数 \(\beta\)(定义为样本量 \(n\) 和维度 \(d\),满足 \(n^\beta = d\))变大时。实验结果表明,与标准岭回归方法相比,我们的一阶微扰修正能将高维病态情形(\(\beta > 0.7\))下的预测误差降低高达 99%。这种性能改进在广泛的维度范围内得以保持,并且随着维度增加,优势变得更加明显。

机器学习,ICML

## 1 引言

非参数工具变量 (NPIV) 估计已成为存在未测量混杂因素情况下因果推断的基本工具。该方法利用工具变量——影响处理但并非直接影响结果的变量——来识别因果效应,而无需对因果关系的函数形式施加限制性的参数假设。尽管在理论上具有吸引力,NPIV 估计仍然是一个具有挑战性的问题,特别是在期望积分算子的条件数很高的情况下。这可能是多种因素共同作用的结果:弱工具变量、目标谱与核谱之间的错位,以及维度灾难。直观地说,当样本量相对于变量维度较小时,我们认为该设置是“高维”的。随着特征空间维度相对于样本量增加,估计精度通常会下降。

经典的 NPIV 估计方法通常将该问题表述为一个不适定的积分方程,其中因果函数通过求解条件回归问题来估计 (Newey and Powell, 2003 (https://arxiv.org/html/2606.00322#bib.bib21); Hall and Horowitz, 2005 (https://arxiv.org/html/2606.00322#bib.bib16))。基于核的方法,特别是那些使用再生核希尔伯特空间 (RKHS) 的方法,由于其灵活性和理论保证而被应用于非参数估计 (Darolles et al., 2011 (https://arxiv.org/html/2606.00322#bib.bib33); Singh et al., 2020 (https://arxiv.org/html/2606.00322#bib.bib19))。然而,当 \(\beta \gg 1\)(高处理维度)时,即使是在使用旋转不变核的普通核岭回归情形下,这些方法也会遇到根本性限制,导致核矩阵条件数差且估计不稳定 (Donhauser et al., 2021 (https://arxiv.org/html/2606.00322#bib.bib15))。核方法中的维度灾难以多种方式体现:核矩阵变得越来越病态,特征值谱呈指数衰减(高条件数),从而导致核岭解的性能下降 (Steinwart and Christmann, 2008 (https://arxiv.org/html/2606.00322#bib.bib34); Donhauser et al., 2021 (https://arxiv.org/html/2606.00322#bib.bib15))。这导致岭解主要保留高特征值模式,而丢弃低特征值方向,类似限制在低秩核近似中也被注意到 (Bach, 2013 (https://arxiv.org/html/2606.00322#bib.bib14))。

在 NPIV 估计的背景下,条件期望层增加了另一层复杂性。积分方程固有的病态性,即数据中的微小扰动可能导致估计的因果函数发生巨大变化 (Carrasco et al., 2007 (https://arxiv.org/html/2606.00322#bib.bib35))。积分方程的病态性可以简单地理解为尝试从卷积函数中恢复原始函数的信息,但对于一般的卷积核来说,这并非完全可逆。现有的正则化技术,如 Tikhonov 正则化,对核函数的所有不稳定本征方向提供一般性的抑制,可能导致过度平滑的估计,从而无法捕捉复杂的非线性关系。当这些本征方向与目标因果函数对齐时,这会阻碍性能提升¹¹ 与这里讨论的核谱不同,IV 中条件积分算子的特征谱错位在 (Meunier et al., 2025 (https://arxiv.org/html/2606.00322#bib.bib8)) 中进行了研究。。

最近在理解 NPIV 估计基本极限方面取得的进展凸显了多项式近似障碍,即标准核方法需要随维度呈多项式增长的样本量以维持估计精度 (Donhauser et al., 2021 (https://arxiv.org/html/2606.00322#bib.bib15))。这一极限激发了替代方法的发展,包括深度学习方法 (Xu et al., 2023 (https://arxiv.org/html/2606.00322#bib.bib36); Kim et al., 2025 (https://arxiv.org/html/2606.00322#bib.bib9)) 和其他正则化方案 (Muandet et al., 2020 (https://arxiv.org/html/2606.00322#bib.bib20))。

在本文中,我们引入了一种新颖的 NPIV 估计微扰重整化方法,该方法处理核矩阵低秩或条件数高(主要由高维度引起)的情况,同时保留核框架的理想性质。我们的方法借鉴了量子物理学的思想,其中微扰展开和重整化技术用于处理发散级数并从看似棘手的计算中提取有限且有意义的结果 (Peskin and Schroeder, 1995 (https://arxiv.org/html/2606.00322#bib.bib37); de Faria and de Melo, 2010 (https://arxiv.org/html/2606.00322#bib.bib44))。关键见解在于,NPIV 估计中的核系数可以展开为耦合参数的幂级数,从而允许对基础核岭回归解进行系统修正。

我们的方法包含三个主要组成部分:
(1) 一个微扰展开,引入高阶矩相互作用以捕捉高维空间中的复杂依赖性;
(2) 一个重整化程序,通过自适应地重新缩放幂级数中的高阶项来控制展开;
(3) 一种重生技术,处理朴素微扰级数变为阶乘发散的情况。
从谱的角度来看,我们展示了这些高阶矩相互作用如何有效地促进具有小特征值的本征模的贡献,并非线性地混合来自不同本征模的贡献²² 一种不同的尝试正则化核本征模的方法在核 MMD 流 (Chen et al., 2024 (https://arxiv.org/html/2606.00322#bib.bib13); Hagrass et al., 2024 (https://arxiv.org/html/2606.00322#bib.bib11)) 的背景下进行了讨论。。

我们通过大量具有挑战性的高维 NPIV 问题实验证明了我们方法的有效性。结果表明,高斯 RBF 核由于其在高维中几乎为零的旋转不变性而改进甚微,而分数布朗核族 (Sejdinovic et al., 2013 (https://arxiv.org/html/2606.00322#bib.bib31)) 则取得了显著的性能提升,与基础核岭回归相比,均方误差改进高达 99%。该方法在处理维度随样本量快速增长的区域尤为有效,而这正是传统 NPIV 方法最困难的地方。我们的方法为处理因果推断中的病态问题开辟了新的可能性,并暗示了微扰方法在机器学习中更广泛的应用。

本文的结构如下。在第 2 (https://arxiv.org/html/2606.00322#S2) 和 3 (https://arxiv.org/html/2606.00322#S3) 节中,我们介绍了使用核岭回归进行 NPIV 的基本方法。在第 4 (https://arxiv.org/html/2606.00322#S4) 节中,我们描述了添加到标准岭回归中的新颖微扰修正以及我们如何对结果进行正则化。在第 5 (https://arxiv.org/html/2606.00322#S5) 节中,我们讨论了微扰方法的实现,并在第 6 (https://arxiv.org/html/2606.00322#S6) 节中展示和讨论了实验结果。

### 1.1 相关工作

非参数工具变量估计在计量经济学和统计学中有着悠久的历史。早期的工作由 (Newey and Powell, 2003 (https://arxiv.org/html/2606.00322#bib.bib21)) 和 (Hall and Horowitz, 2005 (https://arxiv.org/html/2606.00322#bib.bib16)) 奠定了理论基础,而随后的研究则侧重于解决 NPIV 中固有的逆问题的不适定性。基于核的 NPIV 方法由 (Singh et al., 2020 (https://arxiv.org/html/2606.00322#bib.bib19)) 和 (Muandet et al., 2020 (https://arxiv.org/html/2606.00322#bib.bib20)) 开发,利用再生核希尔伯特空间 (RKHS) 来表示未知的结构函数。这些方法通常依赖 Tikhonov 正则化来确保稳定性,但其性能在高维下迅速下降。

高维核岭回归的挑战由 (Donhauser et al., 2021 (https://arxiv.org/html/2606.00322#bib.bib15)) 系统地分析,他们建立了极小极大最优速率,并确定了当维度参数 \(\beta\) 超过某些阈值时多项式近似方法性能的根本限制。他们的分析表明,随着维度的增加,标准方法面临“多项式近似障碍”。

在相关背景下,已经提出了各种方法来解决高维挑战。(Belloni et al., 2015 (https://arxiv.org/html/2606.00322#bib.bib22)) 开发了基于 LASSO 的高维工具变量方法,侧重于稀疏线性模型。神经网络方法由 (Hartford et al., 2017 (https://arxiv.org/html/2606.00322#bib.bib17))、 (Bennett et al., 2020 (https://arxiv.org/html/2606.00322#bib.bib23); Xu et al., 2023 (https://arxiv.org/html/2606.00322#bib.bib36); Kim et al., 2025 (https://arxiv.org/html/2606.00322#bib.bib9)) 进行了探索,利用了深度学习在工具变量估计中的表示能力。

我们的微扰重整化方法与现有方法不同,它系统地纳入了高阶修正,同时通过量子场论启发的重整化确保稳定性。这使得我们能够在传统方法难以应对的维度范围内实现性能提升,而不会牺牲可解释性或理论基础。

## 2 因果框架

我们考虑具有以下结构的因果模型:
\[
Z \rightarrow X \rightarrow Y \leftarrow U
\]
图 1:因果图:\(Z\) 是 \(X\) 的工具变量,而 \(U\) 代表 \(X\) 和 \(Y\) 之间未观测到的混杂因素。

在此框架中,\(Z\) 是一个工具变量,它影响 \(X\) 但不直接影响 \(Y\)。\(X\) 是处理/暴露变量,因果性地影响结果变量 \(Y\)。最后,\(U\) 代表同时影响 \(X\) 和 \(Y\) 的未观测混杂因素。关键假设是:
- \(Z\) 仅通过 \(X\) 影响 \(Y\)(排他性约束);
- \(Z\) 对 \(X\) 有非零效应;
- \(Z\) 与未观测混杂因素 \(U\) 独立:\(U \perp \!\!\! \perp Z\) 且 \(\mathbb{E}[U|Z] = 0\);
- \(U\) 对 \(Y\) 的混杂效应是可加的³³ 如果不是这种情况,可以使用代理学习 (Miao et al., 2018 (https://arxiv.org/html/2606.00322#bib.bib12)),这也会导致具有类似问题的积分方程,本文描述的算法也将提高性能。。

结果变量 \(Y\) 的结构方程可以写为:
\[
Y = g(X) + U,
\tag{1}
\]
其中 \(g(X)\) 是感兴趣的因果效应,\(U\) 是未观测混杂因素。我们的目标是估计表示 \(X\) 对 \(Y\) 因果效应的函数 \(g(X)\)。

## 3 非参数工具变量估计 (NPIV)

由于 \(U\) 的混杂作用,对 \(Y\) 关于 \(X\) 的标准回归无法识别因果效应 \(g(X)\)。相反,我们使用工具变量 \(Z\) 形成矩条件。关键矩方程是:
\[
\mathbb{E}[Y|Z] = \mathbb{E}[g(X)|Z],
\tag{2}
\]
这里利用了 \(U \perp \!\!\! \perp Z\) 和 \(\mathbb{E}[U|Z] = 0\) 的事实。

我们使用再生核希尔伯特空间 (RKHS) 方法表示未知函数 \(g(X)\)。在有限样本 \(n\) 的情况下,核岭回归的表示定理指出:
\[
g(x) = \sum_{i=1}^{n} \alpha_i K(x, x_i),
\tag{3}
\]
其中 \(K(x, x')\) 是一个正定核,\(x_i\) 是标准的二阶段方法中给定 \(Z\) 的第二阶段样本,\(\alpha_i\) 是根据标准表示定理 (Schölkopf et al., 2001 (https://arxiv.org/html/2606.00322#bib.bib10)) 需要确定的系数。

为了估计 \(g(X)\),我们制定以下目标函数:
\[
S_0 = \mathbb{E}\left[ \left( \mathbb{E}[Y|Z] - \int g(x) f(x|Z) dx \right)^2 \right],
\tag{4}
\]
其中 \(f(x|Z)\) 是给定 \(Z\) 下 \(X\) 的条件密度,外部期望是对 \(Z\) 取的。代入核表示,我们得到:
\[
S_0 = \mathbb{E}\left[ \left( \mathbb{E}[Y|Z] - \int \sum_{i=1}^{n} \alpha_i K(x, x_i) f(x|Z) dx \right)^2 \right].
\tag{5}
\]

为确保解的稳定性,我们添加一个二次正则化项:
\[
S_{\text{ridge}} = S_0 + \lambda \| g(x) \|_{\mathcal{H}}^2,
\tag{6}
\]
其中 \(\| g(x) \|_{\mathcal{H}}^2\) 表示 \(g(x)\) 的 RKHS 范数。

为了推导估计量,我们首先定义:
\[
h_i := \mathbb{E}\left[ \int K(x, x_i) f(x|Z) dx \cdot \mathbb{E}[Y|Z] \right];
\tag{7}
\]
\[
\widetilde{K}_{ij} := \mathbb{E}\left[ \iint K(x, x_i) K(x', x_j) f(x|Z) f(x'|Z) dx dx' \right];
\]
其中外部期望是对 \(Z\) 取的。现在我们可以重写目标函数为(省略与 RKHS 系数 \(\alpha_i\) 无关的 \(\mathbb{E}[Y|Z]^2\) 项):
\[
S_{\text{ridge}} = \sum_{i,j} \widetilde{K}_{ij} \alpha_i \alpha_j - 2 \sum_i \alpha_i h_i + \lambda \sum_{i,j} \alpha_i \alpha_j K_{ij},
\tag{8}
\]
其中 \(K_{ij}\) 是标准 Gram 矩阵元素,与密度平滑后的 \(\widetilde{K}_{ij}\) 完全不同。对 \(\alpha_i\) 取泛函导数并设为零⁴⁴ 关于泛函导数及其作用方式的详细讨论,请参考附录 D (https://arxiv.org/html/2606.00322#A4):
\[
\frac{\delta S_{\text{ridge}}}{\delta \alpha_i} = 0 \Rightarrow \sum_j \widetilde{K}_{ij} \alpha_j + \lambda K_{ij} \alpha_j = h_i.
\tag{9}
\]

相似文章

Bernstein-Schur 核:基于草图调制和径向随机化的随机特征

arXiv cs.LG

本文介绍了Bernstein–Schur核,这是一类介于平移不变模板和点积模板之间的非平稳核,并通过草图化有限调制和随机化完全单调径向因子,提供了一种随机特征构造方法。该方法能够生成无偏估计量,其算子范数界限由本征维度控制,并且实验在一个有偏核示例上验证了该方法。