不确定性引导的LLM语义增强用于异质性治疗效果估计

arXiv cs.LG 论文

摘要

本文提出CURL,一种即插即用适配器,利用估计器不确定性分配预训练LLM的语义能力,以改进异质性治疗效果(CATE)估计。它引入两种角色调节的提示,构建面向分配和异质性的表示,在四个基准上提升了十个宿主学习器的性能。

arXiv:2607.26599v1 Announce Type: new 摘要:估计异质性治疗效果对于定向干预(如个性化促销和精准医学)至关重要。我们关注条件平均处理效应(CATE),这是描述此类异质性的标准估计量。即使在标准识别条件下,有限样本的CATE估计也需要学习协变量调整和处理效应异质性的干扰结构,通常还需要结合X的有效表示。原始数值和类别编码可能使语义关系和高阶交互变得隐式,导致这一联合任务在局部不稳定。一项动机研究进一步表明,这种不稳定性通过部分可分离的分配侧和异质性侧通道表现出来。基于这一观察,我们提出CURL(因果不确定性引导的表示学习),这是一种即插即用适配器,利用估计器的不确定性将预训练语义能力分配给局部不稳定的单元。CURL通过两个角色调节的提示查询冻结的LLM,从观测到的协变量构建面向分配和异质性的表示,并通过分离的路径路由它们。在四个基准上,CURL在大多数设置中提升了十个宿主学习器的性能,同时消融、细化动态、路由重新分配和探针分析支持了两个通道的预期设计和作用。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:59

# 面向异质性处理效应估计的不确定性引导大语言模型语义增强
来源:https://arxiv.org/html/2607.26599
徐嘉璐  
工信部数据与决策智能重点实验室,北京航空航天大学,北京,中国  
[email protected] (https://arxiv.org/html/2607.26599v1/mailto:[email protected])  
梁梦坤  
工信部数据与决策智能重点实验室,北京航空航天大学,北京,中国  
[email protected] (https://arxiv.org/html/2607.26599v1/mailto:[email protected])  
刘冠男  
工信部数据与决策智能重点实验室,北京航空航天大学,北京,中国  
[email protected] (https://arxiv.org/html/2607.26599v1/mailto:[email protected])  
毛小介  
清华大学经济管理学院,北京,中国  
[email protected] (https://arxiv.org/html/2607.26599v1/mailto:[email protected])  
吴俊杰  
工信部数据与决策智能重点实验室,北京航空航天大学,北京,中国  
[email protected] (https://arxiv.org/html/2607.26599v1/mailto:[email protected])

###### 摘要

异质性处理效应估计是个性化干预(如精准营销和精准医疗)的核心任务。我们关注条件平均处理效应(CATE),这是刻画此类异质性的标准估计量。即使在标准识别条件下,有限样本CATE估计需要学习用于协变量调整和处理效应异质性的干扰结构,通常还伴随着对$X$的有效表示。原始的数值和类别编码可能隐含语义关系和高阶交互,使得这一联合任务在局部变得不稳定。一项动机研究进一步表明,这种不稳定性通过部分可分离的分配侧和异质性侧通道表现出来。基于这一观察,我们提出CURL(因果不确定性引导表示学习),一种即插即用的适配器,它利用估计器的不确定性将预训练的语义能力分配给局部不稳定的样本。CURL通过两个角色条件提示查询冻结的LLM,从观测协变量中构建面向分配和面向异质性的表示,并通过分离的路径进行路由。在四个基准测试上,CURL在大多数设置中提升了十种宿主学习器的性能,而消融分析、优化动态、路径重分配和探测分析支持了两个通道的预期设计和作用。

异质性处理效应, 因果机器学习, 大语言模型, 表示学习

## 1. 引言

异质性处理效应估计是个性化干预(如精准医疗、定向营销和政策评估)的核心任务;我们关注条件平均处理效应(CATE),它刻画了预期效应如何随观测协变量变化而变化 (Shalit et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib4); Künzel et al., 2019 (https://arxiv.org/html/2607.26599#bib.bib2); Nie and Wager, 2021 (https://arxiv.org/html/2607.26599#bib.bib26))。可靠的CATE估计要求协变量$X$既能支持混杂调整,又能揭示处理响应的系统性变化 (Imbens and Rubin, 2015 (https://arxiv.org/html/2607.26599#bib.bib45))。估计可能失败有两个原因:$X$中可能缺乏相关的个体水平因果信息,从而威胁识别;或者,尽管识别成立,$X$的原始编码可能使得有限样本学习器难以利用调整和异质性结构。本文关注第二种较少被研究的失败模式。我们将原始协变量编码与有限样本CATE学习的任务有效表示之间的差距称为**表示损失性**。这一概念是相对于编码、学习器和样本量而言的,并非$X$的内在信息损失或识别失败。例如,诊断代码可能省略语义邻近性,而客户类别可能掩盖共同塑造目标和响应的行为模式。

元学习、平衡表示和潜变量方法为CATE估计提供了灵活的工具 (Künzel et al., 2019 (https://arxiv.org/html/2607.26599#bib.bib2); Shalit et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib4); Shi et al., 2019 (https://arxiv.org/html/2607.26599#bib.bib5); Louizos et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib14)),但它们主要从观测样本中学习表示及相关函数。当语义关系和高阶交互隐含时,有限数据无法在相关观测之间有效共享统计强度,导致局部估计不稳定。这促使我们引入一种外部归纳偏置,在无需添加新个体事实的前提下重新组织观测信息。

参见图注
图1. 在IHDP上使用带有辅助倾向性头的S-Learner的动机研究。左图将样本置于倾向性-CATE不确定性平面中。Q1-Q4是四个角组,其余为中间组。右图报告了列归一化的T-Brier、Y-RMSE和CATE-PEHE。Q2受分配误差主导,Q3受效应估计误差主导,Q4受两者共同主导。

大语言模型(LLMs)提供了这样一种归纳偏置,因为预训练捕获了广泛的语义规则,这些规则可能难以从单个有限观测样本中学习,包括在结构化表格预测中 (Wen et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib57))。先前的工作已经探索了LLMs用于因果推理和发现 (Kıcıman et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib6); Du et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib8)),最近的估计器已经使用带有文本混杂因素或无结构记录的LLM预测 (Veljanovski and Wood-Doughty, 2024 (https://arxiv.org/html/2607.26599#bib.bib9); Dhawan et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib29); Chen et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib30))。然而,如何将预训练的语义知识融入结构化协变量的CATE估计器中仍然是一个开放问题。对每个样本应用通用嵌入成本高昂且可能引入无关变异,而无差别的表示可能混合了分配建模所需的信息和异质响应所需的信息。因此,一个有用的设计必须确定哪里需要语义能力,为不同的统计角色构建表示,并将它们路由到估计器的适当组件中。

图1 (https://arxiv.org/html/2607.26599#S1.F1) 为选择性和角色条件设计提供了经验支持。我们在IHDP上拟合了一个带有辅助倾向性头的S-Learner,从其处理条件结果预测中导出CATE,并通过蒙特卡洛(MC) dropout 估计两者的不确定性 (Gal and Ghahramani, 2016 (https://arxiv.org/html/2607.26599#bib.bib15))。Q2具有最大的归一化处理Brier误差但CATE误差低,而Q3呈现相反模式;Q4在两个维度上都困难。这些结果表明局部不可靠性在不同样本间变化,不能用单一分数捕捉。倾向性不确定性反映了与协变量调整相关的处理选择建模的不稳定性,而CATE不确定性反映了处理响应异质性的不稳定性。因此,我们将两者用作操作分配信号,而非缺失因果变量的证据,这与基于不确定性识别不可靠处理效应估计的先前工作一致 (Jesson et al., 2020 (https://arxiv.org/html/2607.26599#bib.bib47))。

受这些经验模式的启发,我们提出CURL,一种用于表示损失性下CATE估计的不确定性引导表示适配器。CURL使用倾向性和CATE不确定性来优先对固定比例的局部不稳定样本进行基于LLM的语义增强,然后从其观测档案中构建独立的面向分配和面向异质性的表示。前者改进共享的协变量表示,而后者作为单独的特征块进入效应组件,并且被排除在倾向性估计之外。增强集随着宿主估计器的演化而更新。这样,CURL在不改变观测信息集、目标估计量或识别假设的情况下扩展了有效假设类。

我们的贡献总结如下。
- • 我们将表示损失性与因果信息不足区分开来,将其刻画为有限样本中利用原始协变量编码隐含语义关系的瓶颈。
- • 我们开发了CURL,一种即插即用的适配器,使用不确定性来分配面向分配和面向异质性的语义表示,并通过非对称路由、渐进式细化和训练校准的测试时推理进行集成。
- • 我们在四个基准测试和十个CATE估计器上评估CURL,分析了预测性能、鲁棒性、细化动态和语义通道角色。

## 2. 相关工作

### 2.1. CATE估计的表示学习

CATE估计已经沿着三个主要范式发展。**元学习**方法将效应估计简化为监督预测,包括S-、T-和X-learners (Künzel et al., 2019 (https://arxiv.org/html/2607.26599#bib.bib2)) 以及R-learner (Nie and Wager, 2021 (https://arxiv.org/html/2607.26599#bib.bib26))。**平衡表示**方法学习处理不变的表示,如TARNet、CFRNet (Shalit et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib4))和DragonNet (Shi et al., 2019 (https://arxiv.org/html/2607.26599#bib.bib5))。**深度潜变量**方法从$X$中的代理推断隐藏因素,包括CEVAE (Louizos et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib14))、TEDVAE (Zhang et al., 2021 (https://arxiv.org/html/2607.26599#bib.bib18))、$\beta$-Intact-VAE (Wu and Fukumizu, 2022 (https://arxiv.org/html/2607.26599#bib.bib21))、CFDiVAE (Xu et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib22))和iVAE (Khemakhem et al., 2020 (https://arxiv.org/html/2607.26599#bib.bib20)),并进一步扩展到结构不确定性、调整特征选择以及解耦或鲁棒表示 (Tran and Zheleva, 2022 (https://arxiv.org/html/2607.26599#bib.bib52); Wang et al., 2023 (https://arxiv.org/html/2607.26599#bib.bib55); Zhong et al., 2022 (https://arxiv.org/html/2607.26599#bib.bib53); Li et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib44); Wang et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib56))。尽管取得这些进展,大多数表示主要从研究样本中学习,当$X$的编码与估计器的有效假设类不太对齐时,可能仍然不可靠。对模型误设定和代理构造的敏感性进一步促使使用预训练语义结构来帮助有限样本估计器利用$X$中已经包含的信息 (Rissanen and Marttinen, 2021 (https://arxiv.org/html/2607.26599#bib.bib27); Zhu et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib23))。

### 2.2. 用于因果增强的LLMs

最近的工作沿着两条线探索了LLMs用于因果分析。在**定性结构**方面,LLMs已被用于从文本中进行因果发现和推理 (Kıcıman et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib6); Liu et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib24))、因果图构建 (Ban et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib7); Du et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib8))以及正式因果查询基准 (Jin et al., 2023 (https://arxiv.org/html/2607.26599#bib.bib12)),尽管当前模型可能仍然依赖浅层的Rung-1关联 (Chi et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib28))。在**定量估计**方面,DoubleLingo使用基于LLM的干扰模型处理文本混杂因素 (Veljanovski and Wood-Doughty, 2024 (https://arxiv.org/html/2607.26599#bib.bib9));NATURAL利用从文本导出的LLM条件信息 (Dhawan et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib29));近端文本推断提取代理用于近端识别 (Chen et al., 2024 (https://arxiv.org/html/2607.26599#bib.bib30));GATE为小样本结构化数据生成反事实结果 (Huynh et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib43))。这些研究主要使用LLMs处理文本输入、构建辅助变量或直接预测因果量。较少关注将预训练语义结构用作归纳偏置,以帮助CATE估计器在有限数据下更好地利用结构化协变量。

### 2.3. 因果推断中的不确定性估计

认知不确定性在贝叶斯机器学习中已被长期研究,从拉普拉斯近似 (MacKay, 1992 (https://arxiv.org/html/2607.26599#bib.bib41)) 到MC dropout (Gal and Ghahramani, 2016 (https://arxiv.org/html/2607.26599#bib.bib15))、深度集成 (Lakshminarayanan et al., 2017 (https://arxiv.org/html/2607.26599#bib.bib31)) 和变分推断 (Blundell et al., 2015 (https://arxiv.org/html/2607.26599#bib.bib39)),Kendall and Gal (2017 (https://arxiv.org/html/2607.26599#bib.bib32)) 区分了偶然不确定性和认知不确定性。在决策中,不确定性支持通过UCB式强盗算法和汤普森采样进行探索 (Abbasi-Yadkori et al., 2011 (https://arxiv.org/html/2607.26599#bib.bib33); Zhou et al., 2020 (https://arxiv.org/html/2607.26599#bib.bib34); Xu et al., 2022 (https://arxiv.org/html/2607.26599#bib.bib40)),或用于离线设置中的保守主义 (An et al., 2021 (https://arxiv.org/html/2607.26599#bib.bib35); Bai et al., 2022 (https://arxiv.org/html/2607.26599#bib.bib37); Wu et al., 2021 (https://arxiv.org/html/2607.26599#bib.bib36))。更接近因果估计,Zhang等人 (2023 (https://arxiv.org/html/2607.26599#bib.bib38)) 在MSE最优重要性加权中考虑了日志策略不确定性,而CATE方法主要使用不确定性进行置信度量化、失败检测或预算样本获取 (Alaa and van der Schaar, 2017 (https://arxiv.org/html/2607.26599#bib.bib48); Jesson et al., 2020 (https://arxiv.org/html/2607.26599#bib.bib47); Wen et al., 2025 (https://arxiv.org/html/2607.26599#bib.bib59))。相比之下,CURL使用不确定性将语义增强分配给局部不稳定的样本。

## 3. 问题形式化

设 $D_n = \{ (X_i, T_i, Y_i) \}_{i=1}^n \sim P^n$ 为一个独立同分布的观测样本,其中 $X_i \in \mathcal{X} \subseteq \mathbb{R}^d$ 包含前处理协变量,$T_i \in \{0,1\}$ 是一个二元处理,$Y_i = T_i Y_i(1) + (1-T_i) Y_i(0)$。我们研究 CATE,即 $\tau(x) = \mathbb{E}[Y(1)-Y(0) \mid X=x]$。我们假设条件无混杂性 $\{Y(0),Y(1)\} \perp T \mid X$ 和重叠性 $\epsilon \leq e(x) \leq 1-\epsilon$,其中 $e(x) = \Pr(T=1 \mid X=x)$ (Imbens and Rubin, 2015 (https://arxiv.org/html/2607.26599#bib.bib45))。由于在观测数据中处理分配可能依赖于 $X$,$e(x)$ 总结了协变量空间上系统性的处理选择差异,并且取决于估计器,它支持加权、平衡或残差化用于协变量调整 (Rosenbaum and Rubin, 1983 (https://arxiv.org/html/2607.26599#bib.bib54); Nie

相似文章

GEM:用于最优LLM数据策展的几何熵混合

arXiv cs.LG

GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。