从因果合理性到因果可靠性:评估大型语言模型作为校准的直接因果边分类器
摘要
本文系统评估了12个经过指令微调的开源权重大型语言模型在基准测试中的表现,以评估其在分类直接因果边方面的可靠性。研究发现,这些模型具有召回率主导的特点,常常过度自信,并且跨提示/模型一致性比语言化置信度能更好地改善校准。
arXiv:2608.23660v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地被用于为结构因果发现提供先验因果知识,但其直接边判断和置信度是否可信仍不清楚。我们系统评估了12个经过指令微调的开源权重模型在六个基准因果图、五种提示策略和四种置信度来源(语言化的、基于逻辑回归的、跨提示一致性和跨模型一致性)下的表现。在我们的纯语言成对协议下,评估得出三个关键发现。(i) 基于LLM的因果判断强烈以召回率为主:模型预测过于密集的图,包含许多假阳性边,而提示主要改变精确率-召回率权衡,而非解决过预测问题。模型规模的增益在最大的图中减弱,且未能消除校准不良。(ii) LLMs经常捕获因果相关性,但无法可靠地识别直接性或方向性。与已发布的参考图相比,模型将40.0%的间接非边和36.0%的反向非边误分类为直接边,而其他非边为28.2%。此外,80.8%和84.6%的这些假阳性获得至少80%的语言化置信度,显示出在结构不正确的预测中存在显著的过度自信。(iii) 传统的置信度估计不可靠,而一致性提供更有希望的信号。基于逻辑回归的置信度经常在1.0附近崩溃,无论正确与否,而跨提示和跨模型一致性实现更好的平均校准和判别力,尽管在Holm校正后其优势不具有统计显著性。基准熟悉性审计进一步确定了五个模型-数据集对中潜在的熟悉性,所有这些都涉及AsiaM。总体而言,我们的结果表明,LLMs最好被视为经过外部验证的软因果先验的来源,而非因果结构的直接证据。
查看缓存全文
缓存时间: 2026/08/26 09:22
# 从因果合理性到因果可靠性:评估LLM作为校准的直接因果边分类器
来源:https://arxiv.org/html/2608.23660
Elnur Adl Zarabi,隶属机构:美国德克萨斯A&M大学科珀斯克里斯蒂分校;Suranjana Trivedy,隶属机构:印度比尔拉理工学院果阿分校;Zhiqian Chen,隶属机构:美国密西西比州立大学;Lei Zhang,隶属机构:美国北伊利诺伊大学;Kaiqun Fu,隶属机构:美国德克萨斯基督教大学;Taoran Ji,隶属机构:美国德克萨斯A&M大学科珀斯克里斯蒂分校
###### 摘要
大型语言模型(LLMs)越来越多地被用于为结构因果发现提供先验因果知识,但其直接边判断及相关置信度是否可信仍不明确。我们系统地评估了12个指令微调的开源模型,涵盖六个基准因果图、五种提示策略和四种置信度来源:语言表述型、基于logit的、跨提示一致性和跨模型一致性。我们的评估得出三个关键发现。(i)基于LLM的因果判断表现出强烈的召回率主导特性。模型倾向于预测过于密集的图,产生许多假阳性边,而提示策略主要是在精确率与召回率的权衡中进行转移,而非持续解决过度预测问题。模型规模的提升在最大的图上效果也有所减弱,且无法消除校准不当的问题。(ii)LLM常常能捕捉因果关联性,但无法可靠地识别直接性或方向性。与已发表的参考图相比,模型将40.0%的间接非边和36.0%的反向非边错误地归类为直接因果边,而其他非边的错误归类率为28.2%。此外,80.8%和84.6%的这类假阳性被赋予至少80%的语言表述置信度,揭示了在结构错误预测中存在显著的过度自信。(iii)传统的置信度估计不可靠,而一致性提供了更有前景的信号。基于logit的置信度无论正确与否经常接近1.0,而跨提示和跨模型一致性则实现了更好的平均校准和区分能力,尽管这些优势在Holm校正后不具备统计显著性。基准熟悉度审计进一步发现五组模型-数据对可能存在熟悉度问题,均涉及AsiaM。总体而言,我们的结果表明,LLM更应被视为经外部验证的软性因果先验来源,而非直接的因果结构证据。复现材料可在GitHub获取(https://github.com/aamitssharma07/calibrated-llm-causal-discovery)。
## 1 引言
因果发现(CD)旨在推断变量间的有向因果关系,通常表示为因果图,以支持解释、干预分析和科学理解(30 (https://arxiv.org/html/2608.23660#bib.bib1))。例如,考虑一个简化的医学图:病毒暴露→感染→阳性检测(Viral Exposure→Infection→Positive Test)。在此图中,相邻变量由直接边连接,而病毒暴露仅通过感染间接影响阳性检测。传统方法,包括基于约束的方法(如PC和FCI(32 (https://arxiv.org/html/2608.23660#bib.bib4)))、基于评分的方法(如GES(10 (https://arxiv.org/html/2608.23660#bib.bib5))和NOTEARS(45 (https://arxiv.org/html/2608.23660#bib.bib6))),以及神经网络方法(如GraN-DAG(20 (https://arxiv.org/html/2608.23660#bib.bib7))),在关于数据生成过程的假设下对观测数据进行操作。然而,观测数据可能有限或不足以区分马尔可夫等价结构(13 (https://arxiv.org/html/2608.23660#bib.bib3)),这促使人们使用领域知识来引导或定向候选图(36 (https://arxiv.org/html/2608.23660#bib.bib8))。这类知识的获取成本往往很高,或在新领域中不可用。
参见图1标题:不可靠的成对直接边判断示例。实线箭头构成参考链;虚线箭头显示一个间接关系被预测为直接关系,以及一个反向关系。置信度值为示意性。大型语言模型(LLMs)为CD提供了一种互补的因果知识来源,近期的工作探索了直接因果推理(19 (https://arxiv.org/html/2608.23660#bib.bib32))、先验引导的结构学习(36 (https://arxiv.org/html/2608.23660#bib.bib8);6 (https://arxiv.org/html/2608.23660#bib.bib9);18 (https://arxiv.org/html/2608.23660#bib.bib10)),以及图定向与精化(24 (https://arxiv.org/html/2608.23660#bib.bib2);5 (https://arxiv.org/html/2608.23660#bib.bib11))。尽管LLMs在使用文本元数据的成对因果任务上表现出不俗的性能(19 (https://arxiv.org/html/2608.23660#bib.bib32)),但它们的预测可能依赖于预训练语料库中因果关系的频率,并随上下文变化而变化(12 (https://arxiv.org/html/2608.23660#bib.bib45))。提示风格和响应一致性也会影响置信度校准(40 (https://arxiv.org/html/2608.23660#bib.bib44))。现有工作表明,基于LLM的成对边分类可能导致较差的图恢复效果(4 (https://arxiv.org/html/2608.23660#bib.bib26)),但未能系统地识别这些错误的结构来源,或评估置信度是否反映了其正确性。因为此类判断被用作CD流程中的结构约束、优化先验和因果顺序信息(6 (https://arxiv.org/html/2608.23660#bib.bib9);18 (https://arxiv.org/html/2608.23660#bib.bib10);36 (https://arxiv.org/html/2608.23660#bib.bib8)),即使成对分类作为独立的CD方法不够充分,其可靠性仍然重要。
这一差距反映了因果合理性和因果可靠性之间的区别。对于查询变量A和B,一个可靠的直接边判断需要区分A→B、反向方向性、间接影响和无直接边。模型可能认识到因果关联性,却错误识别了直接性或方向性,在稀疏图中产生许多虚假边。因此,当LLM判断用于图学习时,置信度的可靠性与分类性能同等重要。图1(https://arxiv.org/html/2608.23660#S1.F1)说明了这一可靠性差距。
因此,我们的目标是刻画LLM辅助CD流程可能依赖的边判断的可靠性,而非提出新的CD方法。我们的贡献如下:
- •我们将成对直接因果边分类公式化为一个校准评估任务,联合评估在结构模糊性和严重类别不平衡下的边预测质量、图恢复和置信度可靠性。
- •我们开发了一个评估框架,涵盖六个基准因果图、五种提示策略、两个规模下的12个指令微调模型以及四种置信度来源:语言表述型、基于logit的、跨提示一致性和跨模型一致性。我们还评估了所有72个模型-数据对的潜在基准熟悉度。我们将发布代码和评估制品以支持可复现性。
- •我们表明,LLM边判断表现出召回率主导行为和提示敏感性。较大的模型在六个数据集中的五个上实现了更高的平均F1值,但在最大的图上仅提供边际收益,且未解决校准不当问题。与已发表的参考图相比,间接(40.0%)和反向(36.0%)非边的假阳性率高于其他非边(28.2%);间接和反向关系中超过80%的假阳性获得了至少80%的语言表述置信度。一项三方任务公式化消融研究进一步表明,这些错误并非完全由通过单独的二元查询评估两个方向所诱导。
- •我们发现,基于一致性的置信度在平均校准和区分能力上优于语言表述型和基于logit的置信度,尽管这些差异在Holm校正后不具有统计显著性,并且仍取决于模型和提示。
参见图2标题:用于成对直接边分类、图恢复、置信度校准和结构错误分析的评估流程。
## 2 评估设计
图2(https://arxiv.org/html/2608.23660#S1.F2)中的框架将LLMs视为校准的成对直接因果边分类器。在两个模型规模组、五种提示策略和四种置信度来源下,我们考察模型是否避免了边过度预测,是否能区分直接边与反向、间接和其他非边,以及分配的置信度是否反映其正确性。成对预测与已发表的参考图进行比较,并聚合成重构图以评估边分类和图恢复。结构错误分析、置信度阈值化、三方标签空间消融以及基准熟悉度审计进一步测试了这些可靠性问题。
### 2.1 提示风格
提示公式化影响LLM性能(39 (https://arxiv.org/html/2608.23660#bib.bib36);9 (https://arxiv.org/html/2608.23660#bib.bib37);31 (https://arxiv.org/html/2608.23660#bib.bib38))。我们借鉴先前因果推理和LLM引导结构发现工作中的成对因果提示(19 (https://arxiv.org/html/2608.23660#bib.bib32);36 (https://arxiv.org/html/2608.23660#bib.bib8)),将其应用于带有明确直接因果指令和语言置信度诱导的直接边分类(22 (https://arxiv.org/html/2608.23660#bib.bib34))。
我们评估了五种提供渐进式丰富指导的提示风格。**仅名称**提供数据集上下文和变量名,测试模型是否能仅从名称推断直接边。**元数据**额外提供变量定义以澄清其特定领域含义。**思维链(CoT)** 要求在预测前提供简要理由(38 (https://arxiv.org/html/2608.23660#bib.bib33))。**少样本(FS)** 提供五个标记的直接边示例,展示所需任务和输出格式(8 (https://arxiv.org/html/2608.23660#bib.bib35))。**少样本 + CoT(FS+CoT)** 将这些演示与简要推理相结合。所有风格均询问A是否直接导致B,并要求给出二元的“是”/“否”判断以及0-100的自报置信度分数。完整模板见附录A.1(https://arxiv.org/html/2608.23660#A1.SS1)。
### 2.2 直接边分类与图恢复
主要任务是二元直接边分类。给定一个有序对(A, B)和数据集上下文,模型预测A是否直接导致B,“是”为正类,“否”为负类。响应遵循标准化的答案-置信度格式,并进行确定性解析,优先选择标记字段,然后是答案在前的形式,同时忽略提示回显。缺失字段触发一次重试;少于0.2%的响应没有有效标签,被排除在分类之外。
对于每个模型-提示-数据集设置,所有正预测的有序对组合形成一个重构的有向图。我们使用第3.3节(https://arxiv.org/html/2608.23660#S3.SS3)定义的标准化结构汉明距离(nSHD)将此重构图与已发表的参考图进行比较。图恢复直接由成对预测诱导得出,并未强制执行诸如无环性等全局结构约束。
### 2.3 置信度估计任务
此任务评估在二元边分类中置信度是否反映正确性。令x表示输入查询,Y={是, 否}(\(\mathcal{Y} = \{\textsc{是}, \textsc{否}\}\))为标签集,\(\hat{y} \in \mathcal{Y}\)为预测标签。我们考虑四种置信度来源,均归一化至[0,1]区间。
##### 语言表述置信度(Verbalized confidence)。
模型报告一个置信度分数 \(s_{\mathrm{verb}} \in [0,100]\) 及其二元预测(22 (https://arxiv.org/html/2608.23660#bib.bib34);33 (https://arxiv.org/html/2608.23660#bib.bib40))。我们定义
\[ c_{\mathrm{verb}}(\hat{y}) = \frac{s_{\mathrm{verb}}}{100}。 \quad (1) \]
##### 基于logit的置信度(Logit-based confidence)。
我们聚合每个标签的有效表面形式,并对其在Y上的解码器logit进行归一化(17 (https://arxiv.org/html/2608.23660#bib.bib41);33 (https://arxiv.org/html/2608.23660#bib.bib40)):
\[ p(y \mid x) = \frac{\exp(z_y)}{\sum_{y' \in \mathcal{Y}} \exp(z_{y'})}。 \quad (2) \]
预测标签及其置信度为
\[ \hat{y} = \operatorname*{argmax}_{y \in \mathcal{Y}} p(y \mid x), \qquad c_{\mathrm{logit}}(\hat{y}) = \max_{y \in \mathcal{Y}} p(y \mid x)。 \quad (3) \]
##### 跨提示一致性(Cross-prompt agreement)。
对于K=5个提示特定的预测 \(y^{(1)}, \ldots, y^{(K)}\),令 \(\hat{y}\) 为多数标签。置信度为支持该标签的提示比例(37 (https://arxiv.org/html/2608.23660#bib.bib42);41 (https://arxiv.org/html/2608.23660#bib.bib43)):
\[ c_{\mathrm{prompt}}(\hat{y}) = \frac{1}{K} \sum_{k=1}^{K} \mathbf{1}\!\left[y^{(k)} = \hat{y}\right]。 \quad (4) \]
##### 跨模型一致性(Cross-model agreement)。
对于在固定提示下的M个预测 \(y_1, \ldots, y_M\),令 \(\hat{y}\) 为多数标签。在每个模型规模组内分别计算,置信度为(40 (https://arxiv.org/html/2608.23660#bib.bib44);44 (https://arxiv.org/html/2608.23660#bib.bib39))
\[ c_{\mathrm{model}}(\hat{y}) = \frac{1}{M} \sum_{m=1}^{M} \mathbf{1}\!\left[y_m = \hat{y}\right]。 \quad (5) \]
## 3 实验
### 3.1 模型
我们评估了来自五个系列的12个指令微调开源模型:Qwen、Gemma、Llama、Mistral和Phi(43 (https://arxiv.org/html/2608.23660#bib.bib16);42 (https://arxiv.org/html/2608.23660#bib.bib15);14 (https://arxiv.org/html/2608.23660#bib.bib12);15 (https://arxiv.org/html/2608.23660#bib.bib17);26 (https://arxiv.org/html/2608.23660#bib.bib14);27 (https://arxiv.org/html/2608.23660#bib.bib13);2 (https://arxiv.org/html/2608.23660#bib.bib18);1 (https://arxiv.org/html/2608.23660#bib.bib19)),通过Hugging Face访问。111 Hugging Face 模型:https://huggingface.co/models。为检查规模效应,我们按参数量对模型进行分组。
小型模型(4-14B):Qwen3-4B-Instruct, Qwen3-8B-Instruct, Gemma-4-E4B-IT, Llama-3.1-8B-Instruct, Ministral-8B-Instruct-2410, Phi-4-Mini-Instruct, 和 Phi-4。
大型模型(31-72B):Qwen3-32B-Instruct, Qwen2.5-72B-Instruct, Gemma-4-31B-IT, Llama-3.1-70B-Instruct, 和 Llama-3.3-70B-Instruct。
图中将Gemma-4-31B-IT缩写为Gemma-31B,Gemma-4-E4B-IT缩写为Gemma-E4B,Llama-3.1-8B-Instruct缩写为Llama-8B。
### 3.2 数据集
我们使用来自CausalGraphBench(4 (https://arxiv.org/html/2608.23660#bib.bib26))的六个图:AsiaM、River Status、COVID、Coal Gasifier、Hepar2 和 Munin1。它们跨越四个大小类别以及医学、生态、公共卫生和工业领域。数据集统计、基准ID和预处理细节见附录A.3(https://arxiv.org/html/2608.23660#A1.SS3),表A1(https://arxiv.org/html/2608.23660#A1.T1)。
这个子集提供了一个受控的大小和领域分层评估。成对分类的规模是 \(n(n-1)\),这六个图已经需要大约250万次查询,使得对全部35个图的完整评估变得相似文章
当多个答案都有效时,投票会失效:面向LLM的Best-of-K因果推理符号验证
本文介绍了CALVER,一种无需训练的符号验证器,它根据Pearl的因果准则对结构化因果推理轨迹进行评分,以选出最佳候选答案;在存在多个有效答案的因果推理基准上,其表现优于plurality投票和其他选择方法。
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。