为可靠报告重新设计和审计深度研究写作
摘要
本文介绍了ClaimProbe,一个用于检测深度研究报告中幻觉和错误归因的声明级审计框架,以及ClaimWriter,一个分层写作者,可将幻觉减少高达4.5倍,同时提高事实召回率。
arXiv:2608.28643v1 Announce Type: new
摘要:基于标准的深度研究(DR)系统评估通常掩盖了生成报告中的细粒度事实错误。我们引入CLAIMPROBE,一个声明级审计框架,它将DR报告分解为声明,并针对检索到的证据测量幻觉、错误归因、引用规范性和必要事实召回。使用CLAIMPROBE,我们发现强大的DR管道即使在标准分数保持稳定的情况下,也可能遗漏关键证据并错误归因声明。然后我们提出CLAIMWRITER,一个基于声明的层次写作者,它提取源事实,将其映射到查询衍生的轮廓,并从源链接的声明表示中起草每个部分。在三个先前的DR框架中,仅用CLAIMWRITER替换报告写作者,可将幻觉减少2.6到4.5倍,并将必要事实召回提高1.2到1.7倍,同时基本保持整体报告质量。CLAIMWRITER还支持局部修订:当源信息变化时,它在更新方法中以最高速率将变化的源事实传播到修订报告中,同时也更具成本效益。
查看缓存全文
缓存时间: 2026/09/01 11:58
# 重新设计并审计深度研究报告以确保忠实性
来源:https://arxiv.org/html/2608.28643
###### 摘要
基于评分标准的深度研究系统评估往往会掩盖生成报告中细粒度的事实错误。我们提出 **ClaimProbe**,一个主张级审计框架,它将深度研究报告分解为各个主张,并基于检索到的证据测量幻觉、错误归因、引用规范性以及必要事实召回率。通过 **ClaimProbe** 我们发现,即使评分标准分数保持稳定,强大的深度研究流程也可能遗漏关键证据或错误归因主张。因此我们提出了 **ClaimWriter**,一个基于层级主张的撰写器,它从来源中提取事实,将其映射到基于查询生成的大纲,并利用与来源关联的主张表示来起草每个章节。在三个先前的深度研究框架中,仅将报告撰写器替换为 **ClaimWriter**,可将幻觉减少 2.6 倍–4.5 倍,并将必要事实召回率提高 1.2 倍–1.7 倍,同时很大程度上保持了整体报告质量。**ClaimWriter** 还支持局部修订:当来源变更时,它在更新方法中以最高的效率将变更的来源事实传播到修订后的报告中,同时更具成本效益。
## 1 引言
深度研究系统是智能体化的流程,它们跨异构来源进行搜索、提取证据、对证据进行推理,并综合生成带有引用的长篇报告(15 (https://arxiv.org/html/2608.28643#bib.bib12))。这些系统正越来越多地应用于企业工作流,例如销售演示文稿生成、市场与竞争对手分析以及客户研究(3 (https://arxiv.org/html/2608.28643#bib.bib1))。在这些场景中,最终报告是下游决策者使用的主要成果。因此,一份有用的报告必须同时做到三点:包含在收集的证据中可获得的、与决策相关的事实;将主张正确归因于相应来源;并且当仅有一小部分底层证据发生变化时,报告仍然易于维护。
现有的深度研究基准测试主要使用整体性评分标准来对最终报告进行评分(4 (https://arxiv.org/html/2608.28643#bib.bib2);20 (https://arxiv.org/html/2608.28643#bib.bib6);18 (https://arxiv.org/html/2608.28643#bib.bib18))。虽然这对整体质量评估有用,但这些分数常常掩盖了主张级别的失败:报告可能遗漏关键事实、引用不支持其主张的来源,或引入无依据的推断。在企业深度研究中,此类错误后果严重,但评分标准分数几乎无法揭示主张是否得到支持、是否正确归因,以及相对于可用证据是否完整(8 (https://arxiv.org/html/2608.28643#bib.bib13);11 (https://arxiv.org/html/2608.28643#bib.bib10);19 (https://arxiv.org/html/2608.28643#bib.bib4))。
我们通过 **ClaimProbe** 来解决这一差距,这是一个用于深度研究报告的主张级审计框架。**ClaimProbe** 将每份报告分解为各个主张,对照收集的来源证据进行检查,并衡量四个维度:幻觉、错误归因、引用规范性和必要事实召回率。然后,它将这些判断汇总为报告级别的指标,同时保留主张级别的诊断信息,从而能够识别哪些主张失败以及原因。该评估器是一个通过三轨人类研究校准并基于明确证据比较的 LLM 裁判(22 (https://arxiv.org/html/2608.28643#bib.bib11))。通过 **ClaimProbe**,我们发现强大的深度研究流程仍然会遗漏关键事实、错误归因证据,并引入无依据的主张,即使它们生成了流畅的报告。这些失败指向了直接从检索证据生成报告的局限性:事实可能在撰写过程中失去结构和溯源信息。
基于此发现,我们引入了 **ClaimWriter**,一个基于层级主张的撰写器,它仅替换现有深度研究系统的报告生成模块。**ClaimWriter** 首先将基于来源的事实组织成一个明确的主张层级结构,然后从该结构起草报告。通过将证据组织与报告生成分离,**ClaimWriter** 在保留主张与其支持来源之间联系的同时,提高了对重要事实的召回率。
我们通过仅替换三个深度研究宿主系统中的原始撰写器来评估 **ClaimWriter**:企业深度研究(3 (https://arxiv.org/html/2608.28643#bib.bib1))、NVIDIA AI-Q(16 (https://arxiv.org/html/2608.28643#bib.bib5))和 OpenDeepResearch(9 (https://arxiv.org/html/2608.28643#bib.bib3))。上游搜索和证据收集保持固定。在两种评估设置下,**ClaimWriter** 在主张级别质量上始终优于原始撰写器,减少了幻觉和错误归因,同时提高了必要事实召回率。这些改进在基于评分标准的分数中大部分被隐藏,后者仅有轻微变化。
除了单次生成,**ClaimWriter** 还支持在源证据变化时进行低成本的报告维护。它利用主张层级结构将变更的来源事实映射到受影响的主张,仅修订相应的章节,并保留报告的其余部分。这符合企业场景,其中任务和报告结构通常保持稳定,而单个事实会演变(14 (https://arxiv.org/html/2608.28643#bib.bib17))。在不同级别的源变更下,我们的更新系统在更新方法中以最高的效率将变更事实传播到报告中,同时保持输出 token 成本与单次基于差异的重写相当。
总而言之,我们做出了三个主要贡献:(1) 我们引入了 **ClaimProbe**,一个校准过的主张级审计框架,用于衡量深度研究报告中的忠实性、归因、引用质量和覆盖度。(2) 我们引入了 **ClaimWriter**,一个基于层级主张的撰写器,在深度研究宿主系统和撰写器模型中均能提供更优的主张级别报告质量。(3) 我们开发了一种增量修订方法,利用主张结构高效更新报告,并在来源变更时保留未受影响的内容。
## 2 ClaimProbe:一个主张级报告审计框架
**ClaimProbe** 是一个**四阶段流程**,它接收通过工具调用收集的输出(例如网络搜索),连同一份报告,评估报告中的每个主张与收集证据的一致性,并计算四个旨在捕捉商业答案引擎(19 (https://arxiv.org/html/2608.28643#bib.bib4);11 (https://arxiv.org/html/2608.28643#bib.bib10))和先前关于长篇事实性评估工作(13 (https://arxiv.org/html/2608.28643#bib.bib7);21 (https://arxiv.org/html/2608.28643#bib.bib8))中识别出的失败模式的报告级度量。
幻觉 (Hall↓):报告是否提出了没有任何检索到的来源支持的主张?
错误归因 (Mis↓):当报告引用来源 k 时,来源 k 是否真的支持该主张,还是该主张仅由其他检索到的来源支持?
未引用但被支持 (Unc):报告是否省略了对已检索来源支持的主张的引用?高 Unc 结合低 Hall 和 Mis 表明撰写器基于事实,但并非总是引用。
必要事实召回率 (Rec↑):在与任务高度相关的来源事实中,有多大比例出现在报告中?
企业深度研究 | NVIDIA AI-Q | 开放深度研究 宿主深度研究管道(可互换) | 来源事实 自包含、评分、去重 | 报告事实图 话题、章节、\{\{CITE:fN\}\} 标记 | 组装的报告 report\.md 带编号引用 \[N\]\[N\] | ClaimProbe 审计 Hall | Mis | Unc | Rec (+严格版, +直接版) | 事实级更新 fact\-patch, fact\-diff(仅触及变更的事实) | 更新后的报告 report\.md 带编号引用 \[N\]\[N\] | ClaimWriter 来源 → 组装 → 评估 → 来源差异
图 1:系统概览。选定的宿主深度研究管道向 **ClaimWriter** 提供来源,后者提取来源事实,使用 \{\{CITE:fN\}\} 标记具现化报告事实图,并组装面向用户的 report\.md。**ClaimProbe** 审计这种事实关联的表示(第 2 节 (https://arxiv.org/html/2608.28643#S2));当来源变更时,**ClaimWriter** 应用事实级更新并输出更新后的报告(第 6.2 节 (https://arxiv.org/html/2608.28643#S6.SS2))。
### 2.1 报告审计流程
**ClaimProbe** 首先分别处理收集的来源输出和报告,然后将报告主张与来源事实对齐,最后计算报告级度量。
**来源处理**:将收集的来源输出转换为标准格式,并提取简短、自包含的事实陈述。然后根据任务将每个事实标记为高度相关、相关或不相关。我们仅使用高度相关的事实来计算召回率。
**报告处理**:解析报告的参考文献块以恢复被引用的参考文献。然后按章节处理报告(排除参考文献章节),并使用 LLM 从每个章节中提取报告主张陈述及其引用的参考文献。
**对齐**:对于每个报告主张,**ClaimProbe** 使用 text-embedding-3-small 对主张和所有来源事实进行嵌入,通过余弦相似度检索 Top-K=20 来源事实,并使用 LLM 裁判将主张标记为受支持、部分支持或不受支持。对于召回率,它从每个来源事实开始,采用相同的检索和判断程序反向匹配到报告主张。主张到来源的匹配是严格的,要求精确的事实支持,包括数值。来源到报告的匹配则更宽松,当核心信息被保留时,将释义、总结和覆盖视为充分。
**度量计算**:使用缓存的对齐判断,**ClaimProbe** 计算四个报告级度量。对于报告到来源的度量,Hall 仅在报告主张不受任何检索到的来源事实支持时才将其视为幻觉(即主张被标记为不受支持);Hall_strict 则更严格,将部分支持和不受支持的报告主张都视为未完全基于事实。对于来源到报告的度量,Rec 在报告完全或部分覆盖高度相关的来源事实时给予信用,而 Rec_strict 仅对完全覆盖的来源事实给予信用。因此,默认度量在支持判定中同时计数支持和部分支持,但在对齐方向上相反:Hall 针对报告主张,Rec 针对来源事实。附录 A (https://arxiv.org/html/2608.28643#A1) 提供了度量定义和人类校准的更多细节。
**裁判校准**。我们将 GPT-5.4-mini 与人类标注进行了校准。三名标注者在盲测设置下,对来自分层任务样本(n=100)的不同子集进行了标注,涉及幻觉、错误归因和相关性。AI 裁判与全人类一致标签的 Cohen’s κ 为 0.484, 0.797, 0.743(详细信息见附录 B (https://arxiv.org/html/2608.28643#A2))。裁判被要求一次仅对一个主张与一个简短列表进行评分,这是 LLM-as-judge 校准最稳定的场景(22 (https://arxiv.org/html/2608.28643#bib.bib11))。
## 3 ClaimWriter:基于层级主张的撰写器模块
主张中心的审计自然催生了主张中心的撰写器。**ClaimWriter** 并非连接检索内容并使用长上下文 LLM 来综合报告,而是将*来源事实*视为一等公民。它在起草前将这些事实组织成结构化的主题层级,并生成带有明确*主张到来源链接*的报告文本,该链接仅在最终报告构建阶段才解析(6 (https://arxiv.org/html/2608.28643#bib.bib9))。
具体而言,**ClaimWriter** 首先**去重**检索到的来源内容,并直接从用户查询生成初始主题大纲,而不依赖于提取的证据。这一选择防止了部分检索覆盖率决定报告结构,并使大纲与查询的信息需求保持一致。然后,它并行地从每个来源页面**提取自包含事实**,评估其相关性和特异性,进行去重,并将每个事实分配给一个大纲主题。根据生成的主题和事实组织结构,**ClaimWriter** 使用事实级引用标记(例如 CITE:fN)独立起草每个章节,这些标记仅在构建报告时才转换为数字引用。系统然后通过连接各章节并将其解析为全局引用列表来构建**最终报告**。
**高效处理来源变更**
**ClaimWriter** 产生一种事实链接的报告表示,其中每个提取的事实都关联到一个主题分配、一个引用标记以及它所支持的章节。这种表示允许系统将更新仅限于受来源内容变化影响的章节,这与当前需要完全重新运行流程的深度研究管道不同。
对于每个变更的来源,**ClaimWriter** 将先前和更新的来源内容与从该来源先前版本提取的事实一起进行比较。然后确定哪些现有事实 ID 应该被更新或移除,以及哪些新事实应该被添加。对于更新或移除的事实,**ClaimWriter** 使用现有的事实到主题分配来识别受影响的大纲主题,并修订相应的报告章节。对于新添加的事实,**ClaimWriter** 将每个事实分配到现有大纲中的相应主题,并更新相应章节以纳入新信息。
此更新过程保留了报告结构,同时将重写限制在分配事实发生变更的章节,从而降低了 token 成本并避免了对未受影响文本的不必要编辑。
表 1:RACE 分数(n=100,裁判 GPT-5.5)。列为全面性、洞察力、指令遵循度、可读性和整体(越高越好)。
## 4 实验
我们报告三个主要实验,解决了行业采用者在部署深度研究栈之前会问的关键问题:(i) 撰写器能否在既定的评分标准下保持整体报告质量(第 5.1 节 (https://arxiv.org/html/2608.28643#S5.SS1))?(ii) 撰写器能否在不同宿主管道和撰写器模型下,保留必要事实而不捏造新事实(第 5.2 节 (https://arxiv.org/html/2608.28643#S5.SS2))?以及 (iii) 当来源变更时,系统能否快速、一致、准确地更新报告(第 6.2 节 (https://arxiv.org/html/2608.28643#S6.SS2))?
**设置**。我们在 DeepResearch Bench(4 (https://arxiv.org/html/2608.28643#bib.bib2))上进行实验,该基准包含 50 个英文和 50 个中文深度研究任务;每次评估的任务范围在下面具体说明。我们使用三个开源深度研究管道作为宿主系统进行来源整合:企业深度研究(EDR)(3 (https://arxiv.org/html/2608.28643#bib.bib1))、NVIDIA AI-Q(16 (https://arxiv.org/html/2608.28643#bib.bib5))和 OpenDeepResearch(ODR)(9 (https://arxiv.org/html/2608.28643#bib.bib3))。对于每个管道,我们用提出的 **ClaimWriter** 替换其原始的报告撰写步骤以生成最终报告。我们使用 GPT-5.5 作为所有管道组件(包括报告生成)的基础模型。
**评估**。对于基于 **ClaimProbe** 的评估,我们使用 text-embedding-3-small 作为嵌入模型,将两个方向的检索都设置为 K=20,并使用单个 LLM 裁判。我们使用两个主干 LLM 评估 **ClaimProbe**:在所有 100 个任务(ID 1–100)上使用 GPT-5.4-mini,在 10 个任务子集(ID 1–5, 51–55)上使用 GPT-5.5。表 2 (https://arxiv.org/html/2608.28643#S5.T2) 中的所有结果使用微平均法,通过汇总一次运行中任务的分子和分母计算得出。我们还在所有 50 个英文任务上使用原始的 GPT-5.5 裁判配置报告了 RACE 分数(4 (https://arxiv.org/html/2608.28643#bib.bib2))。相似文章
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
分解蕴含用于事实性检查与幻觉检测
本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。
HalluPeer:一个基于分类体系的科学同行评审幻觉检测基准测试
本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。
有源可查,否则未曾发生:一种用于检测引用幻觉的多智能体框架
本文介绍了 CiteTracer,这是一个用于检测大语言模型(LLM)生成的科学写作中引用幻觉的多智能体框架,在合成和真实世界基准上均实现了高精度。
Grounded Optimization:一种用于减少自动个人文档重写中LLM幻觉的分层工程框架
本文提出了Grounded Optimization,一个五层框架,用于减少自动个人文档重写中的LLM幻觉。实验表明,在各种模型和温度设置下,幻觉率显著降低。