CausalDS:在数据科学智能体中进行因果推理的基准测试
摘要
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
arXiv:2607.08093v1 公告类型:新
摘要:大型语言模型(LLM)越来越多地充当集成的数据科学智能体,结合抽象推理与高级工具使用。然而,相关的基准测试领域主要分为两类:要么是符号因果推理基准,但没有真实的数据分析;要么是数据分析基准,但没有原则性的因果数据生成结构。此外,现有的因果评估数据集通常局限于来自现有来源的精选示例,多样性来自有限的模板化变体,而非系统性地生成新的合成因果结构。我们介绍了CausalDS,一个用于评估智能数据科学工作流中因果推理的基准。每个基准实例是一个场景,包含一个采样的结构因果模型(SCM)及生成的观测数据,以及一个基于真实领域的合成自然语言故事。我们可以选择将基准组件的组成基于从真实世界数据集获得的经验分布,从而保留经验结构,同时通过完全合成生成降低“因果鹦鹉”风险。从每个场景中,我们推导出覆盖Pearl三阶梯的所有任务,典型的数据科学预测任务作为第一阶梯。大多数任务包含数据科学编码组件,由于频繁存在由观测模型生成的不完美观测,模型通常需要使用多种工具才能得出最终答案。此外,识别何时问题没有合理答案并弃权被视为一个一等评分结果。因此,该基准联合评估符号因果推理、数据科学、不确定性量化、弃权以及工具使用/编码。
查看缓存全文
缓存时间: 2026/07/10 06:07
# CausalDS:数据科学代理中因果推理的基准测试
来源:https://arxiv.org/html/2607.08093
Andrej Leban
密歇根大学统计系
美国密歇根州安娜堡
leban@umich\.edu
Yuekai Sun
密歇根大学统计系
美国密歇根州安娜堡
yuekai@umich\.edu
###### 摘要
大语言模型(LLMs)越来越多地作为集成的*数据科学代理*运作,将抽象推理与高级工具使用相结合。然而,相关的基准测试领域主要分为两类:一类是没有真实数据分析的符号化因果推理基准,另一类是没有原理性因果数据生成结构的数据分析基准。此外,现有的因果评估数据集通常局限于来自现有来源的精选示例,其多样性来自于有限的模板化变体,而非来自新颖合成因果结构的系统性生成。我们引入了CausalDS,这是一个用于评估*代理型数据科学工作流中因果推理能力*的基准测试。每个基准实例是一个*场景*,由一个采样的结构因果模型(SCM)、生成的观测数据以及一个基于真实领域、用自然语言编写的合成故事组成。我们可选地将基准组件的*构成*锚定在从真实世界数据集中获得的经验分布上,从而在降低“因果鹦鹉”风险的同时保留经验结构,这一切都通过完全合成生成实现。从每个场景中,我们推导出覆盖Pearl攀登阶梯所有三层级的任务,典型的数据科学预测任务出现在第一层级。大多数任务包含数据科学编程组件,模型通常需要使用多个工具才能得出最终答案,因为常常存在由观测模型生成的不完美观测。此外,识别何时问题没有合理答案并选择放弃也被视为一个一等计分结果。因此,该基准联合评估了符号因果推理、数据科学、不确定性量化、放弃决策以及工具使用/编程能力。
## 1 引言
现代LLM在代理场景中越来越强大,并经常用于数据科学工作流(Jing et al., 2025;Chan et al., 2025;Gu et al., 2024;Majumder et al., 2025)。然而,它们实际的*因果*推理能力仍然存在争议(Zecevic et al., 2023;Jin et al., 2023)。在现实的因果数据科学中,相关任务不仅仅是回答文本中的因果问题。分析师必须解释领域描述、推理隐含的因果结构、检查观测数据、判断什么是可识别的,然后要么估计目标量,要么在可用信息不足时拒绝回答。CausalDS¹¹github\.com/andleb/causalds 沿五个通常分开测试的维度评估这一设置。第一是符号因果推理:解释因果场景、在图结构上进行推理、并区分关联、干预和反事实目标。第二是数据科学执行:使用表格数据和标准分析工具来生成估计和预测。第三是不确定性量化:为这些估计附加校准的不确定性。第四是认知性放弃:识别何时请求的因果主张不被发布的数据和假设所支持。第五是工具使用和编程:在基于代理、文件支持的环境中通过代码进行分析。这些维度在原则上是可分离的,但现实的因果分析需要它们之间的交互。
现有评估倾向于孤立这个问题的各个部分。数据科学代理基准强调编程和开放式分析,但通常缺乏隐藏的因果数据生成结构(Lai et al., 2022;Jing et al., 2025;Chan et al., 2025;Qiang et al., 2025;Gu et al., 2024;Majumder et al., 2025)。因果推理基准测试图推理、干预或反事实逻辑,但通常仅在纯符号层面进行(Jin et al., 2023;Sheth et al., 2024;Chen et al., 2024;Zhou et al., 2024;Du et al., 2026)。基于已发布数据集或熟悉因果示例构建的基准增加了现实性,但这可能使得保证新颖性和避免污染变得困难:模型可能依赖*摊销因果推断*而非真正的结构敏感推理——即“因果鹦鹉”失败模式(Jin et al., 2023;Zecevic et al., 2023)。并行的结构保持探针使这一担忧变得具体:仅仅匿名化语义变量名,而保持因果任务固定,就会显著降低因果基准准确率(Yu and Zhou, 2026)。并行的交互式发现环境通过采样隐藏SCM并让代理进行干预,解决了另一部分差距(Yang et al., 2026);它们针对的是实验性机制恢复,而非对已发布的观测文件进行的因果数据科学分析。
另一方面,CausalDS通过生成合成因果数据科学场景来填补这一差距,这些场景具有私有的SCM推导的真相、自然语言问题描述、表格数据和确定性评分。我们在一个实际性锚定的CausalDS考试上评估当代代理,发现这些维度并未坍缩为单一能力:模型在内容正确性、不确定性量化、放弃识别和工具使用效率方面存在差异。
##### 主要贡献
- **基于SCM的合成场景,具有经验性锚定构成**。我们生成隐藏的因果图,实例化SCM,合成观测数据,并计算用于评估的私有真相。场景生成器是完全合成的,而基准构成可以沿着经验性维度锚定,如变量类型、图结构、可识别性、机制特征和观测复杂性。
- **忠于图结构的自由形式语言化**。CausalDS将抽象图节点映射到一致的领域变量(部分来自CauseNet(Heindorf et al., 2020))并生成描述所得因果设置的自然语言故事。变量映射和最终故事都针对隐藏图和整体叙事连贯性进行审核,使得该基准能够将现实的散文与可控的因果结构结合起来。
- **用于数据分析难度的单独观测层**。我们将概念性SCM与发布给代理的数据视图区分开来。除了干净的观测,CausalDS还可以用后者的噪声观测包替换概念性变量。这使得基准能够在不改变因果方面(如目标因果估计量或其可识别性状态)的情况下改变数据科学难度。
- **广泛的因果数据科学任务套件**。从每个场景中,CausalDS推导出覆盖Pearl层级体系的任务,包括预测、关联、图恢复、识别、效应估计、偏差诊断和反事实推理。由于任务共享一个隐藏的SCM,它们连接了语言解释、统计估计和形式化因果推理。
- **意识到放弃的确定性评估**。CausalDS根据隐藏真相评分提交的答案,包括故意不可识别的因果查询,其中正确的行为是放弃。我们在一个基于真实世界语料库构成性锚定的考试上评估当代代理,并展示模型性能在上述五个维度上分离。
## 2 背景
我们简要回顾基准所依赖的形式化方法、其测试的可识别性问题以及我们所说的*数据科学代理*的含义。
##### 因果图、SCM和Pearl层级体系
一个有向无环图(DAG)\(G\) 上的结构因果模型(SCM)在变量 \(V=(V_1,\dots,V_n)\) 上将每个节点分配一个结构方程 \(V_i=f_i(\mathrm{Pa}_i,U_i)\),从其图父节点 \(\mathrm{Pa}_i\) 和外生干扰项 \(U_i\);\(\{U_i\}\) 的联合分布与机制 \(\{f_i\}\) 一起诱导出观测分布 \(P(V)\)(Pearl et al., 2021)。相同的SCM定义了通过用常数 \(X=x\) 替换 \(f_X\) 得到的干预分布 \(P(V\mid\mathrm{do}(X=x))\),以及比较共享相同外生抽取 \(U\) 的多个“平行世界”的反事实量。我们使用Pearl的三层体系作为任务套件的组织轴:*第一层*(关联层 – \(P(V)\),包括通常的数据科学任务,如预测),*第二层*(干预层,\(P(Y\mid\mathrm{do}(X))\)),以及*第三层*(反事实层)。
##### 效应和可识别性
给定 \(G\),当相应的干预函数可以用纯观测项表达时,因果效应从 \(P(V)\) 中*可识别*。Pearl的do-演算与Shpitser和Pearl(2008)的ID算法一起给出了完整的决策程序;经典充分条件包括后门准则和前门准则(Pearl et al., 2021)。在第二层,目标是*总体*平均处理效应(ATE),\(\mathbb{E}[Y\mid\mathrm{do}(X=x_1)]-\mathbb{E}[Y\mid\mathrm{do}(X=x_0)]\),效应估计任务受*可识别性门控*:代理必须首先决定在故事隐含的图下,该总体估计量是否可以从概念观测律中识别,并在不可识别时放弃——即使始终提供了一个有限的观测样本。识别不可识别的情况本身就是一种与基准相关的技能,CausalDS评分规则(第3.7节)将不可识别估计量上的放弃视为一等结果——不可识别问题可能出现在所有设置中(参见第3.4节,其中不可识别性是可能的)。反事实推理(第三层)产生第二层效应无法表达的估计量,包括*对处理者的处理效应*(ETT)\(\mathbb{E}[Y_{x_1}-Y_{x_0}\mid X=x_1]\) 以及Pearl用于中介分析的*自然直接*和*自然间接*效应(NDE, NIE)(Pearl et al., 2021;Pearl, 2022)。这些估计量的可识别性由ID*/IDC*算法控制(Shpitser and Pearl, 2008)。特别地:一个使得第二层效应(例如平均处理效应ATE)可识别的图,不一定能产生可识别的ETT、NDE或NIE。因此CausalDS将第三层可识别性与第二层可识别性分开追踪。可识别性总是相对于概念变量,而非其噪声观测,后者在第3.2节中讨论。
##### 数据科学代理
我们所说的*数据科学代理*是指一个LLM,它通过读取基准提供的文件、执行代码、检查中间输出并写入答案文件来与沙盒环境交互。因此,每个CausalDS任务混合了语言理解、代码驱动的估计和基本的工具使用。
## 3 CausalDS基准
一个CausalDS数据集实例是一个*场景*,包含一个叙述性故事、一个表格数据集、一个轻量级数据模式和一个任务列表;真值量和隐藏测试分割分开存储用于评分。图1(https://arxiv.org/html/2607.08093#S3.F1)勾勒了生成流程,按顺序执行:(i) 采样一个因果图,通过基于共享锚节点的辅助主题的锚定*嫁接*可选地扩大;(ii) 在类型化的连续和二元机制特征下实例化结构因果模型,生成观测数据(第3.1节),可选地使用额外的*观测模型*(第3.2节);(iii) 将节点映射到基于合理领域的变量名并生成经过验证的叙述故事(第3.3节);(iv) 计算任务和真值(第3.4节);(v) 打包公开和私有的场景工件(第3.5节)。较大的生产运行使用蓝图驱动路径,其中*构成配置*指定了构成轴上的分布:主题、嫁接复杂度、可识别性体制、处理/结果类型、SCM特征和发布的观测模型变体。对于基准测试,代理仅接收公开场景目录并写入答案文件;评分器分别加载私有工件并确定性评分。图2(https://arxiv.org/html/2607.08093#S3.F2)展示了一个场景示例。
隐藏的因果世界 → 实际化的语言层 → 基准工件和评分
图1: CausalDS流程:从隐藏因果结构到基准执行。
场景示例(第二层偏差诊断,禁止控制输出变体;iv主题;困难观测变体)。
**故事**:半干旱地区的农民获得灌溉激活补贴(每公顷美元),该补贴从经济上激励是否在其农田上执行灌溉事件。该决定还取决于地下土壤渗透性——一个未被观测的属性(厘米/小时),这对农业经济学家来说是潜在的,但控制着水如何渗入土壤:足够的补贴加上可渗透的底土将二元变量“灌溉事件是否执行”设为1,而补贴不足或底土不可渗透则设为0。田间土壤侵蚀率(吨/公顷每年)是结果:执行灌溉事件机械地扰动并移动表层土壤,增加侵蚀,而地下土壤渗透性自身有直接效应——更高的渗透性最小化地表径流和土壤流失,更低的渗透性则加剧它。因此观测到的侵蚀率反映了……相似文章
CausaLab: 面向AI科学家的可扩展交互式因果发现环境
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。
代理时代的因果发现
本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。
[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。
这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。
Causal-Audit:通过目标感知因果链构建实现显式可审计的图推理
提出了Causal-Audit框架,该框架通过目标感知因果图构建和路径级证据聚合,实现大语言模型中显式且可审计的因果推理,在多个基准测试上优于现有方法。
DKCD:基于领域知识增强的非结构化数据因果发现
本文介绍了DKCD,这是一个通过整合领域知识图谱与基于LLM的推理来增强高专业领域(如医疗、金融、教育)中从非结构化数据进行因果发现的框架,旨在识别潜在因果因素并提高标注准确性。