证据账本裁决:实现主张-证据可追溯性
摘要
本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。
arXiv:2607.26512v1 公告类型:新论文
摘要:AI智能体生成主张的速度快于作者核查引用的或检索到的证据是否支持这些主张的速度。我们研究了证据账本裁决:一种主张-证据可追溯性工作流,它将每条主张与一个证据包配对,分配支持关系,并将不支持、矛盾或混合证据的主张返回给作者。实证核心是一个由AVeriTeC、CLIMATE-FEVER和SciFact中独立外部标签构建的2,335行盲测基准。在预测过程中,黄金关系及来源证据标签是隐藏的,仅在评分时合并。在该基准上,智能体证据账本条件实现了0.676的关系准确率和0.601的宏F1分数,而最佳非智能体基线仅为0.383的准确率和0.303的宏F1分数。此外,它还将1,270/1,435条黄金标签指示为矛盾、缺失证据或混合证据的主张返回,同时返回了295/900条受支持的主张。这些结果表明,证据账本裁决可以将异构证据包转化为可审计的可追溯层,用于AI辅助写作。
查看缓存全文
缓存时间: 2026/07/31 04:00
# 用于声明-证据可追溯性的证据账本裁决 来源:https://arxiv.org/html/2607.26512 Yongjie Yu 卡内基梅隆大学 Weiling Wang 雪城大学 2026年6月26日 ###### 摘要 AI 智能体生成声明的速度,可能比作者核验所引用或检索到的证据是否支持这些声明更快。本文研究证据账本裁决:一种声明-证据可追溯性工作流,它将每条声明与一个证据包配对,分配一个支持关系,并将缺乏支持、被反驳或证据混杂的声明路由回作者。实证核心是一个包含 2,335 行的盲测基准,基于 AVeriTeC、CLIMATE-FEVER 和 SciFact 中的独立外部标签构建。金标准关系和来源证据标签在预测阶段保持隐藏,仅在评分阶段合并。在该基准上,智能体证据账本条件达到了 0.676 的关系准确率和 0.601 的宏平均 F1,而最佳非智能体基线为 0.383 的准确率和 0.303 的宏平均 F1。此外,该条件将金标准标签为反驳、证据缺失或证据混杂的 1,435 条声明中的 1,270 条进行了路由,同时只路由了 900 条受支持声明中的 295 条。这些结果表明,证据账本裁决可以将异构的证据包转化为 AI 辅助写作中可审计的可追溯性层。 ## 1 引言 AI 辅助写作正在改变研究交流中的瓶颈。语言模型可以快速生成文献综述、声明草稿和引文形态的文本,但作者仍需要判断现有证据是否支持每一条声明。这个问题是实质性的,而非表面修饰:一句流利的句子可能缺乏支持、受到反驳,或仅被其引用的证据部分证实。审稿人往往在问题已经影响稿件的清晰度和可信度之后,才迟迟发现这些问题。 本文研究 AI 辅助写作中用于声明-证据可追溯性的证据账本裁决。该工作流记录一条声明、其证据包、预测的支持关系、作者审阅路由标志、置信度和简短理由。输出旨在供作者在声明仍处于成形阶段时阅读:受支持的声明可以留在草稿中,而缺乏支持、被反驳以及证据混杂的声明会被路由至修订、补充证据检索或删除。 核心实证问题是,这个面向作者的工作流能否跨独立标注的声明验证来源迁移。因此,我们使用来自 AVeriTeC (Schlichtkrulle 等人,2023 (https://arxiv.org/html/2607.26512#bib.bib2))、CLIMATE-FEVER (Diggelmann 等人,2020 (https://arxiv.org/html/2607.26512#bib.bib3)) 和 SciFact (Wadden 等人,2020 (https://arxiv.org/html/2607.26512#bib.bib1)) 的外部标签进行评估。由此得到的盲测基准包含 2,335 行测试数据,涵盖真实世界的事实核查、气候声明和科学声明。它使用四种归一化关系:支持、反驳、证据缺失和证据混杂。 我们做出三点贡献。 1. 我们定义了一种证据账本裁决工作流,将声明/证据包转化为明确的支持关系和作者审阅路由。 2. 我们基于 AVeriTeC、CLIMATE-FEVER 和 SciFact 构建了广泛的外部评估协议,金标准关系和来源证据标签在预测阶段保持隐藏。 3. 我们表明,在关系准确率、宏平均 F1 以及需要作者关注的声明的路由召回率上,智能体证据账本条件显著优于始终支持、词法以及 TF-IDF 逻辑回归基线。 ## 2 相关工作 ### 2.1 外部声明验证基准 SciFact 引入了针对引用文献证据的科学声明验证 (Wadden 等人,2020 (https://arxiv.org/html/2607.26512#bib.bib1))。AVeriTeC 通过来自专业事实核查情境的问答证据和判定标签,扩展了真实世界的声明验证 (Schlichtkrulle 等人,2023 (https://arxiv.org/html/2607.26512#bib.bib2))。CLIMATE-FEVER 聚焦于真实世界的气候声明和人工标注的证据句 (Diggelmann 等人,2020 (https://arxiv.org/html/2607.26512#bib.bib3))。这些数据集对本文很有价值,因为它们的标签是在独立于本工作流的情况下创建的。 ### 2.
相似文章
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
ForeSci:评估LLM代理的前瞻性AI研究判断
介绍了ForeSci,一个时间控制基准,用于评估LLM代理是否能够基于历史证据做出前瞻性研究判断。它包含跨越四个AI领域的500个任务,结果表明显式的证据组织提高了可追溯性,但揭示了反复出现的证据-决策解耦。
ToE:一种分层可解释的声明验证框架,具有动态多源证据检索与聚合
本文介绍了Tree of Evidence (ToE),一种利用强化学习动态检索和聚合多源证据的分层可解释声明验证框架。实验表明,与基线相比,性能提升4至24个百分点,尤其是在面对生成引擎优化(GEO)的对抗性投毒输入时。
ClaimReceipt:在代理评估中验证证据充分性和覆盖范围
本文介绍了ClaimReceipt,一种与声明相关的收据规范和验证器,用于验证代理评估中的证据充分性和覆盖范围,并通过历史记录和前瞻性审计的实验进行验证。
ScientistOne:通过 Chain-of-Evidence 实现人类级自主研究
ScientistOne 引入了 Chain-of-Evidence,这是一个面向自主研究代理的可验证性框架,确保每个声明都可追溯到证据来源。该框架实现了零幻觉引用、完美的分数验证,并在 75 篇论文中达到了最高的方法-代码对齐度,同时在五个前沿研究任务上达到或超过了人类专家水平。