基于证据链评估的校准式选择性事实核查
摘要
本文介绍了一种名为证据链评估(ECE)的选择性事实核查框架,该框架允许基于LLM的验证代理在证据薄弱、稀疏或不一致时放弃给出判断。在ECE-Bench上,ECE实现了93.7%覆盖率下的97.8%选择性准确率,展示了处理认知薄弱证据时面向安全性的权衡。
arXiv:2607.18240v1 公告类型: new
摘要: 大语言模型(LLM)能够实现较强的事实核查准确性,但强制性的二元判断掩盖了一个关键可靠性问题:即使支持证据薄弱、稀疏或内部不一致,系统也可能给出自信的判断。我们通过证据链评估(ECE)来解决这一问题,这是一种选择性事实核查框架,允许通过不确定的判断进行弃权,而非要求对每条主张做出真/假决策。评估的系统是一个使用工具的验证代理,它通过网络搜索、学术搜索和可执行检查来收集证据,然后返回带有置信度和来源级元数据的结构化判断。在ECE-Bench上,ECE在已回答的主张上实现了91.6%的标准准确率、93.7%的覆盖率和97.8%的选择性准确率。尽管ECE在期望校准误差、Brier分数或AURC等整体校准指标上并未超越最强的检索基线,但它提供了明确的选择性预测权衡:系统在已回答的主张上保持非常高的准确性,同时推迟了95个案例中的6个。这些被推迟的案例集中在可靠性较低的证据设置中(6个中的5个在来源级别L4),支持了弃权作为处理认知薄弱证据的安全导向机制的观点。代码可在 https://github.com/ cheshireyang/ECE.git 获取。
查看缓存全文
缓存时间: 2026/07/22 08:19
# 基于证据链评估的校准选择性事实核查 来源:https://arxiv.org/html/2607.18240 ###### 摘要 大型语言模型(LLMs)能够实现强有力的事实核查准确性,但强制性的二元决策掩盖了一个关键的可靠性问题:即使在支持证据薄弱、稀疏或内部不一致时,系统也可能发出自信的裁决。我们通过**证据链评估(ECE)** 解决这一问题,这是一种选择性事实核查框架,允许通过**不确定**裁决来弃权,而不是要求对每条声明做出真/假判断。被评估的系统是一个使用工具的验证代理,通过网页搜索、学术搜索和执行检查来收集证据,然后返回包含置信度和来源级别元数据的结构化裁决。在 ECE-Bench 上,ECE 的标准准确率达到 91.6%,覆盖率为 93.7%,已回答声明的选择性准确率为 97.8%。尽管 ECE 在总体校准指标(如预期校准误差、Brier 分数或 AURC)上并未超越最强的检索基线,但它展现出了清晰的**选择性预测权衡**:系统在保持已回答声明极高准确率的同时,将 95 个案例中的 6 个推迟处理。这些推迟处理的案例集中在可靠性较低的证据环境中(6 例中的 5 例属于来源级别 L4),这支持了弃权作为一种处理认识论薄弱证据的安全导向机制的观点。代码可在 https://github.com/cheshireyang/ECE.git 获取。 基于证据链评估的校准选择性事实核查 杨德坤 浙江大学 [email protected] ## 1 引言 大型语言模型(LLMs)已成为越来越有能力的事实核查助手,尤其是在与检索或工具结合使用时(Guo et al., 2022;Thorne et al., 2018)。然而,仅凭强大的顶尖准确率不足以实现可信部署。在现实世界的验证场景中,一个系统不仅应在证据充分时正确回答,还应在证据质量差、稀疏或矛盾时避免过度自信的判断(Xiong et al., 2024;Kadavath et al., 2022)。 选择性预测为该需求提供了一个自然的框架(Geifman and El-Yaniv, 2017;El-Yaniv and Wiener, 2010)。与其强制对每条声明做出预测,系统可以在缺乏足够支持时选择弃权。在高风险的验证流程中,这种行为可能比一个错误但自信的答案更可取。 本文研究**证据链评估(ECE)** 作为一个选择性事实核查系统。需要强调的是,被评估的系统不是密集检索或图构建流程。相反,它是一个**工具路由验证代理**,通过网页搜索、学术搜索和执行检查来收集证据,然后返回包含置信度分数和来源级别标签的结构化裁决。澄清这一点至关重要:论文的贡献应基于已实现的系统,而不是理想化的架构。 因此,我们主要的实证发现比宽泛的校准声明更精确:ECE 在 ECE-Bench 上实现了 **97.8% 的选择性准确率**,覆盖率为 **93.7%**。这个结果最好理解为一种选择性预测权衡。相对于强制回答的基线,ECE 为了提高已回答声明的准确性,在少数难以处理的声明上牺牲了覆盖率。与此同时,最强的检索基线在标准准确率和总体校准指标上仍然更优。 本文的贡献如下: - • 对已实现的 ECE 系统作为使用工具的选择性事实核查代理进行忠实描述。 - • 围绕覆盖率、选择性准确率和风险-覆盖率行为进行基准评估。 - • 一项分析表明,ECE 的弃权主要集中在低可靠性来源场景中,支持了一种安全导向的推迟解释。 ## 2 相关工作 ### 2.1 事实核查与验证 自动化事实核查研究涵盖基准构建(Vlachos and Riedel, 2014;Thorne et al., 2018;Aly et al., 2021)、端到端验证模型以及更广泛的错误信息检测综述(Guo et al., 2022)。先前的工作一致强调,强大的裁决准确性并不能消除对幻觉、证据质量和来源可信度的担忧(Huang et al., 2023;Maynez et al., 2020;Chen and Shu, 2023;Pennycook and Rand, 2021)。 ### 2.2 LLM 置信度与校准 近期工作表明,LLM 的置信度与正确性仅部分对齐(Kadavath et al., 2022;Xiong et al., 2024)。提出的补救措施包括置信度提示(Lin et al., 2022)、语言校准(Band et al., 2024)和事后分析(Guo et al., 2017;Jiang et al., 2021)。这些研究共同推动了不仅要评估准确性,还要评估置信度在不确定性下是否表现合理。 ### 2.3 选择性预测 选择性预测研究了回答更多示例与在已回答示例上减少错误之间的权衡(Geifman and El-Yaniv, 2017, 2019;El-Yaniv and Wiener, 2010)。同样的视角已被应用于 NLP 场景,如模棱两可的问答(Kamath et al., 2020)。本文在允许弃权的事实核查中采用了该框架。 ### 2.4 检索增强型事实核查 检索增强通过将模型暴露于外部证据来改善事实基础(Lewis et al., 2020;Gao et al., 2024)。诸如 WebGPT 和 Toolformer 之类的工具使用系统进一步表明,模型可以通过主动与搜索或其他外部工具交互来提高可靠性(Nakano et al., 2021;Schick et al., 2023)。我们评估的 ECE 系统属于这类工具使用验证代理的总体家族,同时特别关注选择性事实核查行为。 ## 3 背景:选择性事实核查指标 设 D = { (c_i, y_i) }_{i=1}^n 为一个声明基准,其中每条声明 c_i 都有黄金标签 y_i ∈ {true, false}。对于每条声明,事实核查系统输出一个裁决 v̂_i ∈ {confirmed, refuted, uncertain} 和一个置信度分数 p_i ∈ [0, 1]。 为了在数学上形式化正确性,我们定义一个匹配函数 M(v̂_i, y_i) ∈ {0, 1},将系统的裁决与黄金标签进行映射: M(v̂_i, y_i) = { 1 如果 (y_i = true ∧ v̂_i = confirmed) 或 (y_i = false ∧ v̂_i = refuted); 0 其他情况 } (1) 注意,在此定义下,一个 `uncertain` 裁决严格评估为 0(不正确),因为它未能承诺于真实的标签。 ### 3.1 标准准确率、选择性准确率和覆盖率 在我们的评估脚本中,标准准确率将 `uncertain` 裁决视为不正确的结果。形式上, Acc_std = (1/n) * Σ_{i=1}^n M(v̂_i, y_i)。 (2) 设 A = {i : v̂_i ≠ uncertain} 表示已回答子集(即系统承诺了二元裁决的声明)。选择性准确率和覆盖率随后定义为: Acc_sel = (1/|A|) * Σ_{i∈A} M(v̂_i, y_i), (3) Coverage = |A| / n。 (4) 这些指标将“系统经常回答”与“回答时有多准确”分离开来。 ### 3.2 校准与风险指标 我们从评估脚本中报告三个与不确定性相关的指标。首先,预期校准误差(ECE)衡量跨置信度分箱的置信度与经验准确性之间的差距(Guo et al., 2017)。这里,ECE 是使用模型的标量置信度分数 p_i 针对二元正确性指示器 M(v̂_i, y_i) 在所有 n 条声明上计算的。重要的是,`uncertain` 裁决以其相关的置信度值作为预测被保留在此计算中: ECE = Σ_{b=1}^B (|B_b|/n) * |acc(B_b) - conf(B_b)|, (5) 其中 B_b 表示置信度落入第 b 个分箱的声明索引集合,acc(B_b) 是该分箱中 M(v̂_i, y_i) 的均值,conf(B_b) 是平均置信度 p_i。 其次,我们报告 Brier 分数,这是一个关于概率预测的适当评分规则。为了计算 Brier 分数,我们将模型的输出映射为声明为真的隐含概率:如果 v̂_i = confirmed,则 P(true) = p_i;如果 v̂_i = refuted,则 P(true) = 1 - p_i;如果 v̂_i = uncertain,则 P(true) = 0.5。该分数是针对二元黄金标签的均方误差。 第三,我们报告风险-覆盖率曲线下的面积(AURC),通过按其置信度 p_i 降序排列所有 n 个预测来计算。经验风险随着覆盖率的扩展而被追踪,AURC 是这条曲线的积分。较低的值表示在高置信度操作点处累积风险较低。对于所有三个指标(ECE、Brier、AURC),数值越低越好。 ## 4 方法:实现的证据链评估 ### 4.1 评估流程 请参见图注 图 1:评估中使用的已实现 ECE 流程的系统概览。一条声明由工具路由验证代理处理,该代理通过网页搜索、学术搜索和执行检查收集证据,然后发出结构化裁决。关键的选择性预测行为是,当证据不确定时,代理可能返回 `uncertain`,而不是强制给出二元标签。本文的实验结果由 `eval/run_eval.py` 中 `run_ece` 调用的基于代理的流程产生。给定一条声明,系统实例化一个实现在 `ece/agent.py` 中的 `VerificationAgent`。图 1 总结了评估流程。代理遵循一个最多八轮交互的工具使用工作流: 1. 1. 它首先决定调用哪些工具来收集证据。 2. 2. 它从一个或多个外部工具积累证据。 3. 3. 它返回一个结构化的 `final_answer`,包含裁决、置信度、来源级别、推理字符串以及可选的来源引用。 这是在下面的基准结果中评估的系统。仓库还包含用于来源分类和置信度存储的较低层级启发式模块,但这些模块不是用于生成论文基准数字的主要流程。 ### 4.2 工具路由证据收集 代理使用通过函数调用暴露的四个工具:`web_search` 用于一般事实声明,`arxiv_search` 和 `semantic_scholar_search` 用于学术声明,`code_execute` 用于可直接检查的计算声明。 系统提示明确指示代理从网页搜索开始,对研究相关声明添加学术搜索,并优先对计算声明使用可执行验证。这种设计最好被描述为 **工具路由加上 LLM 证据合成**,而不是一个固定的检索栈。 ### 4.3 输出格式与弃权 收集证据后,代理发出一个结构化的最终答案,包含: - • 一个三元裁决(confirmed、refuted 或 uncertain); - • 一个 [0,1] 范围内的置信度分数; - • 一个来源级别标签; - • 一个简短的推理字段;以及 - • 可选的来源引用。 `uncertain` 裁决是本文研究的弃权机制。它不是由单独实现的分析不确定性公式产生的。相反,模型直接决定证据是否足够以承诺一个二元裁决。 ### 4.4 来源级别语义 评估系统中的来源级别遵循代理实现的标签集: - • L1:代码执行或其他直接的实际验证, - • L2:学术论文, - • L3:官方文档或书籍, - • L4:网页、新闻或论坛, - • L5:没有外部证据的模型内部知识。 这些来源级别由系统在推理过程中分配;它们**不是**基准 JSON 中的原生注释。因此,我们仅将它们用于对模型的证据概况和弃权行为进行事后分析。 ## 5 实验 ### 5.1 基准与基线 我们在 **ECE-Bench** 上进行评估,这是一个包含 95 条声明的基准,涵盖八个领域:科学、技术、历史、地理、医学、争议话题、数学和误解。该基准包含 57 条真声明和 38 条假声明。其难度元数据使用三个文本级别:easy、medium 和 hard。它**不**包含来源级别字段。 所有四种方法使用相同的模型后端(GPT-5.4,gpt-5.4-2026-03-05)。我们比较: - • Vanilla:直接 LLM 事实核查,不使用工具; - • CoT:思维链提示,无外部检索; - • Search:带有迭代网页搜索的 LLM 事实核查; - • ECE:上述工具路由选择性验证代理。 ### 5.2 指标 我们报告标准准确率、选择性准确率、覆盖率、宏平均 F1、ECE、Brier 分数和 AURC。对于三个不确定性指标(ECE、Brier、AURC),数值越低越好。对于基线,覆盖率为 100%,因此它们的选择性准确率在数值上与标准准确率相同。 ### 5.3 主要结果 表 1:ECE-Bench 上的主要结果。ECE 应被解读为一个选择性预测系统:它推迟了 95 条声明中的 6 条,在 93.7% 的覆盖率下对已回答声明达到了 97.8% 的准确率。Search 在标准准确率和总体校准指标上仍然是最强的基线。 表 1
相似文章
ScientistOne:通过 Chain-of-Evidence 实现人类级自主研究
ScientistOne 引入了 Chain-of-Evidence,这是一个面向自主研究代理的可验证性框架,确保每个声明都可追溯到证据来源。该框架实现了零幻觉引用、完美的分数验证,并在 75 篇论文中达到了最高的方法-代码对齐度,同时在五个前沿研究任务上达到或超过了人类专家水平。
部分证据基准:对智能体系统中授权受限证据的评估
本文提出了 Partial-Evidence-Bench,这是一个用于衡量智能体 AI 系统中“授权受限证据”失败模式的确定性基准测试。它评估模型在处理访问控制限制可见性的任务时的表现,重点考察其识别并报告信息不完整的能力,而非悄无声息地生成看似完整实则遗漏关键信息的回答。
Critic Experience Bank: 自演进的步骤级置信度估计用于LLM Agents
介绍Critic Experience Bank (CEB),一个用于LLM智能体逐步置信度估计的自我演进批评框架,利用过去判断和后果的记忆库来改进校准,无需训练。
从片段到语义:重新思考多语言事实核查的证据粒度
本文介绍了SEEK,一个用于多语言事实核查中语义证据提取的框架,该框架从完整文章中构建连贯的证据块,并使用LoRA微调多语言大语言模型,在宏观F1分数上相比基线提升了高达20%。
通过证据校准的查询聚类捕捉LLM能力
本文介绍了ECC算法,该算法通过有限模型比较校准语义嵌入,根据潜在能力需求对查询进行聚类,将LLM能力排名质量相较于基线提高了超过17个百分点。