当预测误差不足时:评估因果估计中的干扰函数预测

arXiv cs.AI 论文

摘要

本文评估了干扰函数的预测误差与因果估计器性能之间的关系,发现预测误差在诸如XGBoost和Double Machine Learning等方法中,并非因果偏差或置信区间覆盖范围的一致性度量。

arXiv:2609.00071v1 公告类型:新 摘要:预测误差广泛用于因果推断中评估干扰函数估计器,但其与因果估计器性能的关系可能因性能度量而异。我们使用蒙特卡洛模拟在部分线性模型中研究了这一问题。我们比较了普通最小二乘法(OLS)、广义加性模型(GAMs)、XGBoost和使用XGBoost的Double Machine Learning(DML-XGBoost),评估干扰函数预测误差、偏差、均方根误差(RMSE)和95%置信区间覆盖率。我们还检查了一个简单的联合误差度量,基于暴露和结果干扰函数估计误差的绝对交叉积。在模拟设置中,XGBoost在非Oracle方法中具有最低的RMSE,而DML-XGBoost通常提供更好的置信区间覆盖率。预测误差在不同方法和设置中并未一致追踪因果偏差,且具有最佳点估计性能的方法不一定具有最佳置信区间覆盖率。联合误差度量与因果偏差仅弱相关,未提供有用的独立因果性能度量。这些结果表明,预测误差对评估干扰函数估计有用,但不应被视为所得因果估计器质量的直接度量。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:56

# 当预测误差不足以评估因果估计中的干扰函数预测时  
来源:https://arxiv.org/html/2609.00071  
曹聪  
隶属机构:美国康涅狄格州纽黑文市耶鲁大学公共卫生学院生物统计系  
通讯作者:cong\.cao@yale\.edu  

###### 摘要  

预测误差广泛应用于因果推断中干扰函数估计量的评估,但其与因果估计量性能的关系可能因不同的性能度量而变化。我们通过蒙特卡洛模拟,在部分线性模型中研究了这一问题。我们比较了普通最小二乘法(OLS)、广义可加模型(GAM)、XGBoost以及基于XGBoost的双重机器学习(DML-XGBoost),评估了干扰函数的预测误差、偏差、均方根误差(RMSE)和95%置信区间覆盖率。我们还考察了一个简单的联合误差度量,该度量基于暴露和结果干扰函数估计误差的绝对交叉积。在所有模拟设置中,XGBoost在非Oracle方法中具有最低的RMSE,而DML-XGBoost通常提供更好的置信区间覆盖率。预测误差在不同方法和设置中并未一致地追踪因果偏差,且具有最佳点估计性能的方法并不一定具有最佳的置信区间覆盖率。联合误差度量与因果偏差的关联较弱,无法作为因果性能的独立有用度量。这些结果表明,预测误差对于评估干扰函数估计是有用的,但不应将其直接视为所得因果估计量质量的度量标准。  

关键词:因果推断;干扰函数;双重机器学习;因果估计  

## 1 引言  

利用观察性数据进行因果效应估计通常需要估计描述协变量、暴露和结果之间关系的干扰函数。灵活的回归和机器学习方法允许在不施加严格参数假设的情况下估计这些函数,目前已广泛应用于因果推断\[8 (https://arxiv.org/html/2609.00071#bib.bib4),9 (https://arxiv.org/html/2609.00071#bib.bib8)\]\。例如,双重机器学习(DML)将灵活的干扰函数估计与Neyman正交得分和交叉拟合相结合,以减少干扰估计误差对目标因果参数的影响\[3 (https://arxiv.org/html/2609.00071#bib.bib5),5 (https://arxiv.org/html/2609.00071#bib.bib1),12 (https://arxiv.org/html/2609.00071#bib.bib10),4 (https://arxiv.org/html/2609.00071#bib.bib9),1 (https://arxiv.org/html/2609.00071#bib.bib12)\]\。然而,在实践中,干扰模型通常使用与普通监督学习相同的预测指标来评估。这就提出了一个简单的问题:对干扰函数的更好预测是否也意味着更好的因果估计?  

预测误差是评估干扰模型的自然方式,因为估计干扰函数本身就是一个预测问题。交叉验证误差和均方误差常用于比较学习器并调整其超参数\[7 (https://arxiv.org/html/2609.00071#bib.bib3)\]\。近期研究也考虑了预测性能是否有助于因果分析。Bach等人\[2 (https://arxiv.org/html/2609.00071#bib.bib2)\]研究了双重机器学习中的学习器选择、超参数调整和数据分割决策。他们发现预测性能可用于模型选择,但其与因果性能的关系取决于学习器和因果设置。Doutreligne和Varoquaux\[6 (https://arxiv.org/html/2609.00071#bib.bib11)\]通过模拟和多个医疗保健数据集,比较了标准预测指标(包括均方误差)与更直接基于因果目标的指标。这些研究主要集中于利用预测性能选择模型或学习器。而我们则探究:已拟合干扰函数的预测误差能否用来预测所得因果估计量的表现?这个问题很重要,因为良好的预测性能并不一定意味着良好的因果估计量表现\[11 (https://arxiv.org/html/2609.00071#bib.bib7),10 (https://arxiv.org/html/2609.00071#bib.bib6)\]。  

当因果估计量依赖于多个干扰函数时,问题变得更加复杂。在具有连续暴露的部分线性模型中,暴露回归和结果回归都进入DML得分\[3 (https://arxiv.org/html/2609.00071#bib.bib5),4 (https://arxiv.org/html/2609.00071#bib.bib9)\]。因此,它们的误差可能共同影响因果估计量。正交性降低了干扰估计误差的主要一阶影响,但并未消除由干扰估计引起的有限样本差异\[3 (https://arxiv.org/html/2609.00071#bib.bib5),12 (https://arxiv.org/html/2609.00071#bib.bib10),1 (https://arxiv.org/html/2609.00071#bib.bib12)\]。因此,我们同时考察了每个干扰函数的预测误差以及它们联合误差的一个简单度量。然后我们探究这些度量是否与有限样本因果性能相关。预测误差是对干扰函数进行度量,而偏差、RMSE和置信区间覆盖率则是对因果估计量进行度量。因此,这两组度量捕捉了分析的不同部分。  

我们使用蒙特卡洛模拟,在具有连续暴露的部分线性因果模型中研究这些问题。我们比较了普通最小二乘法(OLS)、广义可加模型(GAM)、XGBoost以及基于XGBoost的双重机器学习(DML-XGBoost)。我们评估了干扰函数的预测误差、因果偏差、RMSE和95%置信区间覆盖率。我们还考察了干扰函数联合误差的简单度量是否与有限样本因果偏差相关。最后,我们考虑了一个具有簇级交叉拟合的聚类数据设置,以确定当簇内观测值相关时,主要发现是否会改变。  

## 2 方法  

### 2\.1 数据生成框架  

我们进行了一项蒙特卡洛模拟研究,以检验干扰函数预测精度是否与因果效应估计性能相关。该模拟比较了多种干扰函数估计方法和两种依赖设置下的预测误差、因果估计精度和推断性能。  

令\(X\_i\)表示连续暴露,\(Y\_i\)为结果,\(C\_i=\(C\_{i1},\\ldots,C\_{ip}\)^{\top}\)为观测基线协变量向量。我们从以下部分线性模型生成数据:  

\(X\_i=m\_0\(C\_i\)+\\epsilon\_{Xi}\)  
\(Y\_i=\\tau X\_i+g\_0\(C\_i\)+\\epsilon\_{Yi}\)  
其中  

\(m\_0\(C\_i\)=E\(X\_i\\mid C\_i\)\) 是暴露干扰函数,  
\(g\_0\(C\_i\)\) 是结果基线回归函数。  
因果效应\(\\tau\)在不同个体间恒定。我们假设  

\(E\(\\epsilon\_{Xi}\\mid C\_i\)=0\), \(E\(\\epsilon\_{Yi}\\mid X\_i,C\_i\)=0\)。  

对于进入部分线性正交得分的结果回归,相应的干扰函数是  

\(h\_0\(C\_i\)=E\(Y\_i\\mid C\_i\)=\\tau m\_0\(C\_i\)+g\_0\(C\_i\)\)。  

因此,因果估计器中使用的两个干扰函数是\(m\_0\(C\)\)和\(h\_0\(C\)\)。真实函数在构建时已知,因此可以直接评估预测误差,而无需通过有噪声的观测结果。  

### 2\.2 干扰函数误差与因果估计  

对于拟合的干扰函数\(\widehat{m}\(C\)\)和\(\widehat{h}\(C\)\),其中\(m\_0\(C\)=E\(X\\mid C\)\)且\(h\_0\(C\)=E\(Y\\mid C\)=\\tau m\_0\(C\)+g\_0\(C\)\),我们定义预测误差为  

\(\delta\_{m}\(C\)=\widehat{m}\(C\)\-m\_0\(C\)\),  
\(\delta\_{h}\(C\)=\widehat{h}\(C\)\-h\_0\(C\)\)。  

我们使用均方预测误差来总结干扰函数预测误差:  

\(\mathcal{E}\_{m}=E\\{\delta\_{m}\(C\)^{2}\\}\),  
\(\mathcal{E}\_{h}=E\\{\delta\_{h}\(C\)^{2}\\}\)。  

评估样本未用于拟合任何干扰模型或估计因果效应。因此,报告的干扰函数误差代表了相对于已知数据生成函数的样本外差异,而不是训练集预测误差。这些量衡量了在协变量分布上预测误差的平均大小,但不包含该误差发生位置的信息。  

我们还考虑了一个简单的干扰函数联合误差描述性度量:  

\(\mathcal{D}\_{\mathrm{joint}\}}=\\left\\|E\\{\\delta\_{m}\(C\)\\delta\_{h}\(C\)\\}\\right\\|\)。  

有符号量\(E\\{\\delta\_{m}\(C\)\\delta\_{h}\(C\)\\}\)描述了两个干扰函数误差之间平均对齐的方向,而\(\mathcal{D}\_{\mathrm{joint}\}}\)舍弃了这个方向,并总结其绝对大小。因此,接近零的值可能源于两个误差都很小,或者正负贡献在协变量分布上相互抵消。  

我们使用相同的残差化处理效应估计器,比较了三种干扰函数学习器——普通最小二乘法(OLS)、广义可加模型(GAM)和XGBoost。OLS提供了参数化基准,GAM允许非线性可加关系,XGBoost则允许非线性和交互作用。对于每个学习器,分别为暴露干扰函数\(m\(C\)\)和结果干扰函数\(h\(C\)\)拟合独立模型,并使用所得的残差化暴露和结果来估计\(\\tau\)。我们还考虑了基于XGBoost的双重机器学习(DML-XGBoost),其中在交叉拟合正交估计程序中使用相同的XGBoost学习器。因此,XGBoost与DML-XGBoost之间的比较不仅反映了干扰函数学习,还反映了交叉拟合和正交化的使用。  

对于OLS、GAM和XGBoost,干扰函数使用完整训练样本进行估计。对于DML-XGBoost,干扰函数使用交叉拟合折外的训练观测值进行估计。对于所有方法,预测误差均在同一个独立评估样本上进行评估。对于DML-XGBoost,预测误差的计算方式是将每个交叉拟合特定的干扰估计应用于独立评估样本,并对交叉拟合拟合产生的平方预测误差取平均。对于折\(k\)中的观测值\(i\),DML干扰预测  

\(\widehat{m}^{\(\-k\)}\(C\_i\)\) 和 \(\widehat{h}^{\(\-k\)}\(C\_i\)\)  
是使用折\(k\)之外的观测值获得的。然后,从交叉拟合的残差化变量  

\(\widetilde{X}\_{i\}=X\_{i\}\-\widehat{m}^{\(\-k\(i\)\)}\(C\_{i\}\)\),  
\(\widetilde{Y}\_{i\}=Y\_{i\}\-\widehat{h}^{\(\-k\(i\)\)}\(C\_{i\}\)\)  
估计因果效应,使用  

\(\widehat{\\tau\}}=\frac{\\sum\_{i=1\}^{n}\widetilde{X}\_{i\}\widetilde{Y}\_{i\}}{\\sum\_{i=1\}^{n}\widetilde{X}\_{i\}^{2}}\)。  

交叉拟合确保每个观测值使用未将其用于干扰模型拟合而获得的干扰估计进行评估。在聚类设置中,来自同一簇的所有观测值被分配到同一折中。  

我们还考虑了一个聚类数据生成设置,以评估在簇内依赖下干扰函数估计和因果推断的敏感性。令\(j\(i\)\)表示包含个体\(i\)的簇。我们生成  

\(X\_i=m\_0\(C\_i\)+u^{X}\_{j\(i\)}\+\\epsilon\_{Xi}\),  
和  
\(Y\_i=\\tau X\_i+g\_0\(C\_i\)+u^{Y}\_{j\(i\)}\+\\epsilon\_{Yi}\),  
其中\(u^{X}\_{j\}\)和\(u^{Y}\_{j\}\)是簇\(j\)内个体共享的簇级随机效应。这些项在暴露和结果中都引入了簇内依赖性,同时保持恒定的因果效应\(\\tau\)。簇级随机效应独立于协变量和个体级误差生成,且均值为零。  

对于聚类场景,训练样本包含1,000个观测值,组织成大小为10的簇。暴露和结果模型的簇级随机效应标准差均为0.8,个体级误差标准差为1.0。在簇级执行了五折交叉拟合,使得来自给定簇的所有观测值被分配到同一折中。因果推断使用簇级得分贡献进行方差估计。聚类场景被视为次级依赖结构分析,而非对聚类强度的系统性评估。  

### 2\.3 模拟设计和性能评估  

我们考虑了两个模拟场景。场景1代表具有独立观测值的基线设置。场景2代表聚类设置,其中观测值嵌套在簇内,簇级随机效应引起簇内依赖。对于每个场景,协变量向量\(C\_i\)从用于定义底层干扰函数的相同分布生成,因果效应设置为常数值\(\\tau\)。\(m\_0\(C\)\)和\(g\_0\(C\)\)的非线性分量在蒙特卡洛重复中固定,因此不同方法之间的差异反映了估计性能的变化,而非数据生成机制的变化。模拟围绕两个主要问题展开。首先,我们检验干扰函数预测误差是否对因果估计性能有参考价值。其次,我们检验干扰函数联合误差的简单摘要是否能提供超出边际预测误差的有限样本因果偏差信息。  

我们还考虑了拟合干扰函数在重复训练样本中的变化,作为干扰函数估计的补充性质,但未将其作为单独的模拟终点进行评估。聚类场景还在簇内依赖下评估了这些关系。两种场景的训练样本大小均为\(n=1000\)。在每个重复中,训练数据用于干扰函数估计和因果效应估计,而独立评估样本用于评估干扰函数预测误差与已知真实干扰函数的比较。在每个重复中,竞争方法之间使用相同的模拟数据集,以便于有限样本性能的比较。对于每种方法和模拟设置,我们记录了预测误差、联合干扰误差度量、偏差、RMSE、经验标准误、置信区间覆盖率和置信区间宽度。拟合干扰函数的样本间变化被视为干扰函数估计的补充概念性性质,但未在

相似文章

非线性时间序列中的函数值因果影响

arXiv cs.LG

本文认为非线性因果发现中的标量边分数掩盖了状态依赖效应,并提出使用Neural Additive Vector Autoregression和Individual Conditional Expectation的函数值因果影响。