证据类型竞争:干预数据何时能教会语言模型因果方向?

arXiv cs.CL 论文

摘要

本文在受控的辛普森悖论世界中测试了预训练中增加干预数据是否能提升大语言模型的因果方向推理能力。研究发现,训练混合比例并不决定干预证据的使用,相反,推理时上下文中的证据类型才是决定性因素。

arXiv:2607.29484v1 公告类型:新 摘要:干预数据被广泛视为教会模型因果推理的金标准。我们在一个完全受控的合成环境中检验这一假设,将观测相关性与因果效应进行对比,并发现它以一种具有启发性的方式失效。在辛普森悖论世界中,两者的符号系统性地相反,增加预训练中干预样本的比例并不会改善因果方向:模型的do()响应的幅度单调增长,但其符号却复制自观测上下文。决定是否使用干预证据的并非训练混合比例,而是推理时上下文中存在的证据类型。在相同的训练方案下,纯观测上下文在29/50个世界中引发系统性符号反转,混合上下文为19/50,而仅使用对齐的干预探针时,41/50个世界正确。从上下文中移除观测证据会立即释放被抑制的因果插值能力(ratio_true = +0.56);四状态内容操控表明该切换是内容介导且渐进的。这种抑制在不同训练种子间稳定(11/11个强反转在匹配协议的第二个种子上仍然存在),并且在0.93B参数规模下作为比率具有稳健性(匹配的纯探针组中反转率为31.8% vs. 6%),即使绝对收益缩水四倍。对CLadder的外部审计揭示了一个具有两层结构的习得正效应先验:符号随机化重训练能在分布内移除它,但在分布外却无法移除。我们总结:能力存在于权重中;开关存在于上下文中,而激活修补将开关定位到中间层的观测行。我们进一步量化了基于探针的因果评估的采样噪声下限,以及一种将符号错误从26%降至9%的证据平均协议。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:37

# 干预数据何时能教会语言模型因果方向?
Source: https://arxiv.org/html/2607.29484
## 证据类型竞争:干预数据何时能教会语言模型因果方向?

###### 摘要

干预数据被广泛视为教会模型进行因果推理的金标准。我们在一个完全受控的合成环境中检验这一假设,让观测相关性与因果效应相互对抗,结果发现它以一种富有启发性的方式失效。在辛普森悖论世界中——两者的符号系统性地相反——提高预训练中干预样本的比例(\(\alpha\))并不会改善因果方向:模型的 do() 响应的幅度随 \(\alpha\) 单调增长,但其符号却复制自观测上下文。决定干预证据是否被使用的不是训练混合比例,而是推理时上下文中存在的证据类型。在完全相同的训练方案下,纯观测上下文在 29/50 的世界中诱发系统性符号反转,混合上下文在 19/50 中诱发,而仅使用对齐的干预探针则在 41/50 中正确,其余反转处于测量噪声底。推理时干预将现象定位:加倍探针剂量并不能解除抑制,而将观测证据从上下文中擦除会立即释放被抑制的因果插值能力(\(\mathrm{ratio\_true}=+0.56\),与仅用探针训练的模型一致);一个四状态内容操控表明该开关是内容介导且渐进的。这种抑制在不同训练种子上稳定存在——每个可测量的强反转(11/11)在匹配协议的第二颗种子上都持续存在——并且在 0.93B 参数规模上作为比率也保持稳健(31.8% vs. 匹配探针仅用组的 6% 反转),即使绝对干预收益缩小了四倍。对 CLadder 的外部审计进一步揭示了一个习得的正向效应先验,具有两层结构:符号随机化重训练能在分布内移除它,但在分布外却无法移除,正向默认在那里持续存在。我们总结:*能力存在于权重中;开关存在于上下文中*——激活修补将该开关定位到中间层的观测行。我们进一步量化了基于探针的因果评估的采样噪声底,以及一种将符号错误从 26% 降至 9% 的证据平均协议。

关键词:因果方向,语言模型,干预数据,辛普森悖论,证据类型竞争,激活修补

## 1 引言

干预数据假设。因果之梯(Pearl,2009)将干预置于观测之上:从相关性中识别因果效应原则上需要来自干预分布的数据。这一层级塑造了 LLM 时代的数据整理直觉。一个自然的假设——我们称之为 H1——认为提高预训练中干预数据的比例应当改善模型的因果推理。H1 隐含在许多数据混合实践中,但据我们所知,它从未在完全受控的条件下得到检验:已知的混杂结构、可计算的因果真值、无泄漏的协议。

一个比“错误”更具信息量的否定结果。我们在一个辛普森悖论世界族上检验 H1,其中 \(\mathrm{Corr}_\mathrm{obs}(X,Y)<0\),而真实因果效应 \(\mathrm{eff}(X\to Y)>0\),符号按构造相反。对干预比例 \(\alpha\in\{0,0.1,\dots,1.0\}\) 的六水平扫描显示,校正后的符号准确率没有单调趋势(0.5/0.3/0.2/0.4/0.4/0.4):H1 被证伪。失败的方式包含了真正的发现:模型的辛普森斜率*幅度*随 \(\alpha\) 单调增长(0.169→0.384),而其*符号*却始终错误。模型确实从干预数据中学到了某些东西——幅度——但方向却复制自观测上下文:这是一种幅度–方向二重性。

证据类型因素。如果混合比例不是起作用的变量,那是什么?我们隔离出一个一维因素——上下文中的证据类型——并将训练固定为 \(\alpha=1.0\)。在 50 个世界、证据平均的协议下,四路比较(表 1)揭示了一种上下文剂量梯度:上下文中的观测证据越多,对因果方向的抑制越强(平均 \(\mathrm{ratio\_true}\):纯观测 −0.288 → 混合 −0.092 → 纯探针 +0.418;配对 McNemar \(p\) 低至 \(1.1\mathrm{e}{-9}\))。

机制:开关在上下文中(图 1)。三个零训练成本、推理时的干预(E1)决定抑制是存在于训练中还是推理时。(i)加倍探针剂量并不能解除抑制。(ii)*擦除观测证据会立即释放被抑制的插值能力*(\(\mathrm{ratio\_true}\) 从 −0.09 升至 +0.56,与仅用探针的模型一致)。(iii)剂量滴定和内容操控(E5)表明该开关是*内容介导且渐进的*:一条观测记录几乎不产生抑制,两条产生稀释,四条实现捕获——*先稀释,后捕获*——并且移除观测*内容*会释放抑制,即使观测*格式*的 token 仍然保留。插值电路一直就在权重中;是上下文将它关掉了。

贡献。

1. 1.一个动机性否定结果。H1 在受控条件下被证伪,揭示了幅度–方向二重性(§5.1)。
2. 2.主要结果。证据类型因素与上下文剂量梯度:一个 50 世界四臂比较,附配对统计(§5.2,表 1)。
3. 3.机制贡献。推理时决策矩阵(E1、E5)将抑制定位为一种推理时、内容介导、渐进的现象(§5.3,§5.6)。
4. 4.方法论。量化基于探针的因果评估的采样噪声底:一个完美插值器单次会犯 26% 的符号错误;证据平均修复了这一问题(§4)。
5. 5.稳健性与边界条件。抑制在 0.93B 规模上的比率级持续性(§5.5);对 CLadder 的审计揭示了习得的正向效应先验及其在符号随机化下的两层结构(§5.7,§5.8)。

见图 1 说明:图 1:概览(示意)。A:一个隐藏混杂因子使观测相关性为负,而 \(X\) 对 \(Y\) 的真实效应为正(采样世界,\(\rho=0.9\);完整巡览见附录 A)。B:当上下文中存在观测记录时,答案遵循观测符号(19/50 反转);在推理时擦除它们会释放被抑制的插值能力(E1b:\(\mathrm{ratio\_true}=+0.56\);仅加倍探针剂量则不能,E1a)。

## 2 相关工作

LLM 的因果推理。CLadder(Jin 等,2023)系统地评估了 LLM 在因果之梯三个层级上的表现,发现正式因果查询的准确率下降;Corr2Cause(Jin 等,2024)发现从相关性陈述推断因果关系的表现接近随机;CausalPitfalls(Du 等,2025)审计了包括辛普森悖论在内的统计陷阱;Kıcıman 等(2023)报告了 GPT 系列模型在因果常识任务上的强劲表现。与这些*评估现有模型*的研究不同,我们*控制训练分布本身*。

摊销因果推断。一条互补的研究线在合成因果数据上从头预训练 Transformer,以在上下文中估计效应:Do-PFN(Robertson 等,2025)使用先验拟合网络从观测上下文预测干预结果;CausalPFN(Balazadeh 等,2025)在可忽略性下摊销 ATE 估计;Liang 等(2025)表明 Transformer 在面对上下文线性回归中的内生性时会模仿 2SLS。这些工作问的是 Transformer *能否*摊销因果估计;我们问的是,在混合观测–干预的预训练流中,*哪种证据类型*驱动干预答案,以及哪些仲裁者——剂量、内容和符号先验——决定了这场竞争。

通过训练数据教授因果能力。与我们的干预立场最接近的是,Vashishtha 等(2024)在因果公理(传递性、d-分离)的符号演示上从头训练 Transformer,并展示了对更复杂图结构的泛化;而 Lampinen 等(2023)表明,智能体可以从纯粹被动数据中获得主动因果策略——前提是它们在测试时*可以干预*,并且自然语言解释即使面对完全混杂的训练数据也能实现泛化。然而,两者都没有混合相互竞争的证据类型:前者教授显式符号规则;后者假设部署时存在主动实验通道。我们隔离了它们留下的空白——在观测证据与干预证据共存并矛盾的上下文中进行纯粹被动推断——并发现决定答案的是观测先验,而非能力缺失(§5.2,§5.6)。

上下文学习作为函数学习。Garg 等(2022)表明 Transformer 可以从上下文示例中学习线性和非线性函数类(我们的最小二乘插值基线即属此类);Akyürek 等(2023)将 ICL 与类梯度下降算法联系起来。我们的探针协议是这一范式的因果版本:探针在干预下提供(\(X\),其他变量的响应),查询要求在一个 do(X) 网格上进行插值。我们的否定结果也为这一范式划定了一条边界:当观测证据混入上下文时,ICL 选择了错误的函数类——不是学习失败,而是证据选择失败。

知识冲突。Longpre 等(2021)和 Xie 等(2024)等人研究了参数知识与上下文知识冲突时 LLM 的行为,发现对上下文的依赖随先验强度而变化。我们的是更尖锐的因果实例:冲突双方是两种*统计证据类型*,而非事实记忆。据我们所知,“干预证据在推理时被观测先验抑制”这一具体形式尚未被报道。

辛普森悖论。一个经典统计问题(Pearl,2009);在 NLP 中它主要出现在偏差审计中。我们将其重新用作一个联合受控的训练–评估工具:一个观测相关性与因果效应符号相反的世界族,使“复制观测”和“真实因果”在符号层面可以被机械地区分。

## 3 设置

合成世界生成器。每个世界都是一个参数化结构因果模型(SCM):\(n\) 个节点(\(n\in[5,12]\);新拓扑域使用 \([13,16]\)),Erdős–Rényi 或无标度图结构(等概率),以及混合线性–非线性机制。混杂强度参数 \(\rho\in\{0,.3,.6,.9\}\) 控制未观测混杂路径(\(Z\to X\),\(Z\to Y\))。评估族(SEED_TEST 域)使用 \(\rho=0.9\),并选择混杂三元组 \((Z,X,Y)\),使得观测相关性与因果效应具有相反符号(一个*辛普森陷阱*):在 50/50 的世界中,\(\mathrm{Corr}_\mathrm{obs}(X,Y)<0\) 而 \(\mathrm{eff}(X\to Y)>0\)(均值约 \(+0.57\);一个采样世界的端到端可视化见图 5,附录 A)。训练数据在线生成且无限新鲜,消除了固定语料记忆。

证据格式。每个训练/评估样本 = 一个上下文(\(k=4\) 条证据记录)+ 一条查询。五种证据类型:obs(观测样本);none(无上下文);int(对*随机*节点的干预记录);probe(对*查询*节点 \(X\) 的干预记录——do(X=v)→所有变量的响应,\(v\) 从双测范围中按 50/50 采样);obs_probe(一半 obs,一半探针)。查询形式为 do(X=x₀)→Y=?,网格为 \(x_0\in\mathcal{X}=\{-1,-0.5,0,0.5,1\}\)。

模型与训练。一个 25.7M 参数的 GPT 风格解码器(8 层,朴素注意力),词表 41,块大小 640。训练:20,000 步,batch 64,学习率 \(6\mathrm{e}{-4}\)(warmup 500)。\(\alpha\)-混合采样:每个样本以概率 \(\alpha\) 独立地从干预分布中抽取(严格二项混合)。种子域在训练/验证/测试/新域之间互不相交。

形式化表述。一个世界是一个 SCM \(W=(\mathcal{G},\

相似文章

相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

Cross-LLM推理一致性:来自共享交互的证据

arXiv cs.AI

本文利用基于交互的解释方法,研究了不同LLM在预测相同词元时是否共享共同的推理模式。结果表明,先进LLM展现出一致的交互模式,暗示它们隐式地优化到了共享的推理机制。

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。