代理科学合成中引用忠实性的评估与防护

arXiv cs.AI 论文

摘要

本文评估了代理科学合成系统中的引用忠实性,表明当前验证器的不可靠性,无支持引用率根据严格程度在3%到18%之间变化。它提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,该机制使用分裂共形预测为真正无支持的引用提供无分布界限。

arXiv:2607.20527v1 公告类型:新 摘要:代理LLM系统(如OpenScholar和PaperQA2)阅读科学文献并返回带引用的答案,并且这些系统及其基准已经通过固定的归因模型或人工评分员检查这些引用是否成立。但两者都没有审计这种检查本身的可靠性。我们表明它不可靠,且这很重要。在相同的代理输出上,测量的无支持引用率仅取决于验证器的严格程度,范围从约3%到约18%;尽管验证器在哪些引用有支持上意见一致,但在哪些需要标记上存在分歧(负特定一致性0.27到0.30),因此没有单一的标记集是可信的,在没有指定验证器和协议的情况下,跨论文比较无效。 我们提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,使这种行为可测量且有界。该协议验证验证器,测量重新归因,并根据人类黄金标准而非其他模型的判断来校准保证;验证器是一个可互换的工具,根据成本选择(在支持类别上的召回率为0.94,保留),重新归因是一个常规步骤,其中确定性BM25匹配最佳开源生成器。保护机制增加了一个分裂共形层,为真正无支持的引用(逃脱选定标记规则的)提供无分布、有限样本的界限,这是对捕获率的保证,而不是结论的正确性。该界限在保留的黄金标准上成立,我们识别并量化了控制其转移到部署的条件——校准负难度,并给出了具体的重新校准方法,这在先前的共形事实性工作中尚未测试。 在四个开源的27-35B模型和三个代理流水线上,使用公共基准(SciFact、QASA、PubMedQA)进行验证,每个标题数字都有置信区间,该协议和保护机制作为一个开源的单GPU工具包发布。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:05

# 评估与守护智能体科学综合中的引文忠实性
来源: https://arxiv.org/html/2607.20527
,Junsik Kim, 首尔大学, 韩国首尔;Kyulhee Han, BioNexus, 韩国水原;GwonYul Jo, BioNexus, 韩国水原;Jong\-Soo Kim, BioNexus, 韩国水原以及Tae\-Hyung Kim0000\-0001\-7280\-3978 (https://orcid.org/0000-0001-7280-3978)BioNexus, 韩国水原thkim@bionexus\.kr (https://arxiv.org/html/2607.20527v1/mailto:[email protected])

###### 摘要。

诸如 OpenScholar 和 PaperQA2 等智能体 LLM 系统会阅读科学文献并返回附带引文的答案,它们及其基准测试都会检查这些引文是否成立,通常使用固定的归因模型或人工评分员。但两者均未审计该检查本身的可信度。我们证明这并不可靠,且至关重要。在相同的智能体输出上,测得的无支持引文率仅因验证器的严格程度不同,即可从约 3% 变化至约 18%;并且,尽管验证器在哪些引文“有支持”方面达成一致,但在哪些应该被“标记”方面存在分歧(负例特定一致性 0.27 至 0.30)。因此,任何单一的标记集合都不可信,并且在未指明验证器及其协议的情况下,跨论文的比较是无效的。

我们提出了一种锚定黄金标准的评估协议和一个可部署的防护装置,使这种行为可被衡量且有界。该协议用于验证验证器、测量重新归因,并针对人工黄金标准而非另一个模型的判定来校准保证;验证器是一个可根据成本选择的可替换工具(在支持类上,保留数据的召回率为 0.94),而重新归因是一个常规步骤,其中确定性的 BM25 与最佳的开源生成器性能相当。防护装置增加了一个分裂共形层,对所选标记规则遗漏的真实无支持引文施加一个无分布假设的有限样本界限——这是对捕获率的保证,而非结论正确性。该界限在保留的黄金标准数据上成立,并且我们识别并量化了控制其向部署迁移的条件——“校准负例难度”,并提供了一种具体的重新校准方法,这在先前的共形事实性研究中未经测试。

该协议和防护装置已在四个开源 27–35B 模型和三个基于公共基准(SciFact, QASA, PubMedQA)的智能体流程上得到验证,每个关键数字均附有置信区间,并作为一套开源的单 GPU 工具包发布。

引文忠实性,归因评估,共形预测,LLM 评判的可靠性,可信赖 AI

††版权:无††期刊:TIST## 1. 引言

智能体文献综合系统,如 OpenScholar (Asai et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib1)) 和 PaperQA2 (Skarlinski et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib2)),如今在检索、推理和写作的闭环中运行,返回附带科学文献引文的答案。此类系统是迈向更广泛的面向科学智能体 AI 趋势的一部分 (Wang et al., 2023 (https://arxiv.org/html/2607.20527#bib.bib10); Gao et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib9); Gottweis et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib4); Ghareeb et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib8))。对这些智能体而言,引文是信任契约,告知读者特定主张有特定来源的支持。越来越多的工作自动检查这一契约,并报告 AI 引文经常无支持 (Gao et al., 2023 (https://arxiv.org/html/2607.20527#bib.bib36); Wu et al., 2025 (https://arxiv.org/html/2607.20527#bib.bib45)),且即使事实正确的引文也可能无法忠实反映模型实际使用的段落 (Wallat et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib42))。智能体系统本身也这样做。OpenScholar 使用固定的归因模型对引文支持度进行评分,PaperQA2 则使用人工评分员。然而,这些评估都把检查器的可靠性视为理所当然,在报告引文支持度数字时并未询问该判断本身是否可靠。

在部署规模上评估这种行为本身就是一个智能系统问题,因为此时判断必须由模型而非一次性基准测试能负担得起的人工评分员来做出。我们从一个令人不安的观察开始:*报告的无支持引文率取决于验证器,且验证器之间无法达成一致*。判断一段文本是否“支持”一个主张是一个主观判断,自动验证器在做出该判断时不一致且彼此之间存在分歧。这是已有文献记载的模型评分员脆弱性的一个实例 (Li et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib41); Haldar and Hockenmaier, 2025 (https://arxiv.org/html/2607.20527#bib.bib31)):每当评估将判断交给模型时,报告的指标就会继承该评判者的特质。由此,在为智能体引文忠实性建立基准时出现了三个差距。(G1) 报告的无支持引文率依赖于验证器,因此单一数字无法在不同研究之间进行比较。(G2) 验证器在何为“有支持”方面意见一致,但在何为应该“标记”方面存在分歧,因此任何单一的部署标记集合都不可信。(G3) 没有任何方法能对所选标记规则遗漏的真实无支持引文数量施加一个无分布假设的保证。我们的贡献不是对 G1 和 G2 背后的观察,而是其对基准测试的影响以及一个补救措施:将指标锚定在人工黄金标准上,使 G1 和 G2 可测量,并将不完美的验证器包裹在共形保证中,从而填补 G3。

如果部署判断不可信,负责任的举措是将评估锚定在人工黄金标准标签上,其中“有支持”具有可核查的含义。我们在三个点上这样做:我们*验证*验证器(根据黄金标准而非声誉选择);我们*测量*重新归因的准确性(针对黄金标准标注的支持段落而非另一个验证器);我们*校准*一个基于黄金标准的无分布假设保证。其结果既是一个评估协议,也是一个可部署的防护装置,它将不完美的验证器包裹在一个有限样本界限内。所有成果作为一套开源的单 GPU 工具包发布。图 1 (https://arxiv.org/html/2607.20527#S1.F1) 总结了端到端的设计。结果是针对科学综合智能体中一项关键的智能体行为——忠实引文——的新评估协议、基准方法和可靠性防护装置,该问题被视为一个智能系统评估问题,其中部署指标本身由模型产生。这项工作涵盖了形式化分析(一个附带证明的无分布假设有限样本保证)、评估方法(锚定黄金标准的协议)以及一个可部署系统(一套单 GPU 实验室审计工具包)。

#### 贡献。

- *一项智能体评估发现 (G1, G2)。* 在智能体科学综合中,我们量化了部署引文忠实性判断的不可靠程度:相同的智能体输出在五个经黄金标准验证的验证器上,无支持率得分从约 3% 到约 18% 不等;尽管验证器在引文是否“有支持”方面意见一致,但在应标记哪些方面存在分歧(三个连续评分验证器的负例特定一致性为 0.27 至 0.30)。模型评分员不完美是已知的;我们表明这导致没有任何单一的部署标记集合是可信的,并且在没有指明验证器和协议的情况下,跨论文的比较是无效的。
- *一种锚定黄金标准的评估协议。* 我们验证验证器、测量重新归因,并针对人工黄金标准标签而非另一个验证器的判定来校准保证,将一个不可靠的判断转化为可核查的测量。
- *一个无分布假设的防护装置 (G3)。* 基于黄金标准的**分裂共形校准**将不完美、一致性中等的验证器转化为对所选容差水平下未被标记的无支持引文的有限样本界限;该界限在保留的黄金标准数据上经验性地成立,并且我们证明其迁移受校准负例的难度控制,因此部署时需要在目标域负例上重新校准,而不是继承我们的阈值。
- *一个开放、可复现的工具包。* 协议和防护装置在单块 80GB GPU 或 CPU 上运行,并根据 MIT 许可证在 https://github.com/GooTec/citation-guard 发布,使得实验室可以在其现有硬件上审计智能体综合系统。

参阅图注图 1。研究设计。受审计的智能体系统(顶部)产生带引文的答案;四个评估阶段将依赖于验证器的指标锚定在人工黄金标准上,并保证捕获率。S1 比率:无支持引文率在不同验证器上没有单一值。S2 验证器:在 SciFact 黄金标准上,验证器在匹配的捕获率下分开时可比较,因此成本采用廉价的本地 AttrScore-3B。S3 校准:基于 QASA 黄金标准的分裂共形校准将验证器评分转化为无分布假设的捕获率保证(贡献)。S4 重新归因:恢复真实来源是一个可替换的通用步骤(CPU 上的词法 BM25,或 GPU 上的生成器)。采用的防护装置(验证 → 重新归因 → 标记)在一块 GPU 上运行。

## 2. 相关工作

### 2.1. 面向科学综合的智能体 AI

LLM 智能体越来越多地进行文献综合和发现,从 OpenScholar 和 PaperQA2 (Asai et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib1); Skarlinski et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib2)) 到自主化学和生物学智能体 (Boiko et al., 2023 (https://arxiv.org/html/2607.20527#bib.bib5); M. Bran et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib6); Swanson et al., 2025 (https://arxiv.org/html/2607.20527#bib.bib7); Ghareeb et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib8)),以及共同科学家系统 (Gottweis et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib4))。这些流程在循环中检索、推理和写作,通常带有自我反思 (Shinn et al., 2023 (https://arxiv.org/html/2607.20527#bib.bib14); Asai et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib12))、元知识引导的自我纠正 (Zhang et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib67)) 和纠正性检索 (Yan et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib13))。它们的科学价值依赖于忠实的引文,然而研究表明,智能体推理也可能产生看似自信、行文流畅但无支持的论断 (Messeri and Crockett, 2024 (https://arxiv.org/html/2607.20527#bib.bib11); Wallat et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib42))。

### 2.2. 评估与基准测试智能体系统

大量基准测试文献评估智能体在任务成功方面的表现:AgentBench (Liu et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib19)), GAIA (Mialon et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib20)), τ\\tau\-bench (Yao and others, 2024 (https://arxiv.org/html/2607.20527#bib.bib21)), AgentBoard (Ma et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib22)), 工具使用 (Patil and others, 2025 (https://arxiv.org/html/2607.20527#bib.bib23); Guo and others, 2024 (https://arxiv.org/html/2607.20527#bib.bib25)), 以及软件工程 (Jimenez et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib24)),调查文章广泛地描绘了 LLM 和 LLM 智能体评估的图景 (Chang et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib65); Guan et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib66))。最近的一项认证计划为基于 LLM 的应用提供了保证 (Bena et al., 2026 (https://arxiv.org/html/2607.20527#bib.bib64))。这些衡量智能体是否达成目标或认证高层级的应用属性。我们的关注点是正交且更细粒度的:不是智能体是否成功,而是它引用的证据是否实际支持它写的内容,并且关键是,*这个*衡量本身是否可靠。在认证计划证明任意应用层属性的地方,我们则对具体的、段落级别的量——无支持引文的遗漏率——施加无分布假设的有限样本界限,并将指标的可靠性视为一个一级对象。

### 2.3. LLM 评判的可靠性

模型评分评估现已无处不在 (Zheng et al., 2023 (https://arxiv.org/html/2607.20527#bib.bib28); Kim et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib30)),其已知的失败模式也是如此:自我偏好 (Panickssery et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib29)),对长度等伪特征的敏感性 (Dubois et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib32)),自我不一致性 (Haldar and Hockenmaier, 2025 (https://arxiv.org/html/2607.20527#bib.bib31)),以及自动归因评估的一般性困难 (Li et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib41))。提出的缓解措施包括专门的评判者 (Kim et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib30))、奖励模型基准 (Lambert et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib33))、评判者基准 (Tan and others, 2025 (https://arxiv.org/html/2607.20527#bib.bib34)),以及由不同模型组成的陪审团 (Verga et al., 2024 (https://arxiv.org/html/2607.20527#bib.bib35))。我们添加了对智能体输出上引文支持特定场景下评判者分歧的定量分析,并且与其寻求更好的评判者,不如将指标锚定在黄金标准上并对残余误差设界。让

相似文章

代理审核系统基准测试

arXiv cs.AI

本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。

构建即忠实:基于主张锚定的多文档摘要归因

arXiv cs.CL

本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。

通过结构化内联引用生成实现显式证据溯源

arXiv cs.CL

本文介绍了 FullCite,一个用于生成结构化内联引用的框架,该框架能将每个声明同时链接到其源文档和具体的证据跨度。在三个问答基准(ASQA、BioASQ、ExpertQA)上评估后发现,虽然 LLM 在文档级归因方面表现良好,但在精确的证据跨度识别上仍有困难。

信任却未验证:大型语言模型来源评估中的认知盲区

arXiv cs.LG

这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。

超越组件测试:验证智能体AI系统

arXiv cs.AI

本综述综合了257篇关于智能体AI系统验证的论文,提出了一个涵盖行为、安全、时间、监管和多智能体问题的五维分类法。它指出了时间有效性、运行时证据维护、监管可读性和开放式多智能体保障方面的空白,认为可信赖的部署需要在上下文中验证轨迹。