构建即忠实:基于主张锚定的多文档摘要归因
摘要
本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。
arXiv:2606.23989v1 公告类型:新
摘要:端到端的大语言模型(LLM)能够生成流畅的多文档摘要,但依然容易产生幻觉,并且它们提供的归因通常比较粗糙(整篇文档或段落),且是事后生成的,导致每个摘要陈述难以验证。我们重新审视了模块化的“提取-选择-重写”范式,并将其中间表示重新定义归因单元。我们提出了 CAMS,一个基于主张锚定的多文档摘要框架,它(i)从每篇源文档中提取带有词元级来源的原子性主张,(ii)对跨文档的等价主张进行聚类,同时标记源间冲突,(iii)选择具有支持度和显著性的子集,以及(iv)将选择结果重写为摘要,其中每个句子都锚定到一个经支持检查的主张,该主张可链接回一个或多个源片段。由于内容在实现之前已被局部化,该流水线在构建上即面向归因且面向忠实度:它在结构上保留了细粒度、多源的可追溯性,同时使用支持感知的选择、约束重写和验证来鼓励(而非保证)事实忠实度。我们在 MultiNews 上评估质量、忠实度和本地化程度,在 DiverseSumm 上分析冲突处理,在 WCEP 上测试零样本迁移,采用双机制协议,将无参考引用质量与黄金对齐的本地化精度分开,并增加了一个评估器解耦的审计,使用从未用于选择或验证的支持模型来测试引用精度。CAMS 在摘要质量上与强大的端到端和跨度归因基线相当,同时大幅提升了忠实度和引用精度,将多源归因准确率提高了约三分之二,并揭示了一个可控的忠实度-覆盖度权衡,而端到端模型则将其隐含化。
查看缓存全文
缓存时间: 2026/06/24 07:44
# 基于声明锚定的证据:面向忠实性的多文档摘要 来源:https://arxiv.org/html/2606.23989 ## 通过构造实现归因:面向忠实性的多文档摘要中的声明锚定证据 ###### 摘要 端到端大语言模型(LLM)生成的流畅多文档摘要仍然容易出现幻觉,且其提供的归因通常较为粗糙(整篇文档或段落),并且是事后生成的,导致每个摘要陈述难以验证。我们重新审视模块化的“抽取–选择–重写”范式,并将其中间表示重构为归因单元。我们提出CAMS,一种声明锚定的多文档摘要框架,该框架能够:(i)从每篇源文档中提取带有令牌级别溯源的原子声明;(ii)在跨文档间对等价声明进行聚类,同时标记源间冲突;(iii)选择支持意识强且显著的子集;(iv)将所选内容重写为摘要,其中每个句子都锚定在一个经过支持检查的声明上,该声明能回溯至一个或多个源片段。由于内容在生成前已被定位,该流水线通过构造实现了归因导向和忠实性导向:它在结构上保留了细粒度的多源可追溯性,同时利用支持意识选择、约束性重写和验证来鼓励(而非保证)事实忠实性。我们在MultiNews上评估了质量、忠实性和定位能力,在DiverseSumm上分析了冲突处理能力,并在WCEP上测试了零样本迁移。我们采用双机制协议,将独立于参考的引用质量与基于黄金标准的定位准确性区分开来,并添加了评估器解耦的审计,该审计使用从未参与选择或验证的支持模型来测试引用精度。CAMS在摘要质量上与强大的端到端和片段归因基线持平,同时显著提升了忠实性和引用精度,将多源归因准确性提升约三分之二,并揭示了一个可控的忠实性–覆盖率权衡,而端到端模型对此是隐式处理的。 通过构造实现归因:面向忠实性的多文档摘要中的声明锚定证据 Shuo Guan UBS AG 纽约,10010 [email protected] ## 1 引言 多文档摘要(MDS)将一组主题相关的文档压缩成简练连贯的摘要(Fabbriet al.,2019 (https://arxiv.org/html/2606.23989#bib.bib1))。现代LLM是强大的抽象式摘要器,但在多源场景中仍存在两个尤为突出的问题。第一,*忠实性*:抽象式系统可能产生输入中不支持甚至矛盾的幻觉内容(Maynezet al.,2020 (https://arxiv.org/html/2606.23989#bib.bib2);Goyal and Durrett,2022 (https://arxiv.org/html/2606.23989#bib.bib3))。第二,*可验证性*:即使系统引用了来源,这些引用通常也很粗糙——指向整篇文档或段落——并且是在生成后产生的,因此读者仍需筛选无关文本来确认任何给定陈述(Gaoet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib4);Slobodkinet al.,2024 (https://arxiv.org/html/2606.23989#bib.bib5))。 MDS加剧了这两个问题。相同事实在不同来源中重复出现(冗余),不同来源存在分歧(冲突),而单个摘要陈述往往同时需要从多篇文档中提取证据支持(多源支持)。端到端模型倾向于扁平化处理这些现象:它们默默去重、掩盖分歧,并在支持证据分布时给出指向单篇最佳文档的归因(Huanget al.,2024 (https://arxiv.org/html/2606.23989#bib.bib6))。 我们认为,具有结构化中间表示的模块化流水线尤其适合应对这些挑战。基于“抽取–选择–重写”范式(Guan and Padmakumar,2023 (https://arxiv.org/html/2606.23989#bib.bib7)),我们将其中间表示重构为验证和归因的单元。我们的框架CAMS将摘要分解为:(1)带有令牌级别溯源的原子声明抽取;(2)跨文档声明聚类与冲突检测;(3)忠实性和显著性感知的内容选择;(4)可归因的重写,其中每个生成的句子都带有指向其所实现声明的指针——进而指向源片段。一个轻量级的验证步骤会拒绝偏离所选声明的重写结果。 因此,该流水线*通过构造实现了归因导向*:每个生成的句子都必须解析为所选的声明标识符,而这些标识符能确定性地映射回源片段。相反,忠实性被视为一个*目标*而非保证的不变量——通过自我支持评分、聚类时的双向蕴含检查以及重写后验证来鼓励——因为每个学习步骤仍可能失败:抽取器可能误读段落,去上下文化可能恢复错误的实体,引文匹配仅表明引文出现在源中,聚类可能合并非等价声明,NLI验证器可能错误分类支持。因此,我们将溯源视为结构性不变量,而将忠实性视为可测试的目标,使用与选择和验证分离的支持模型进行审计。与基于片段的归因(Slobodkinet al.,2024 (https://arxiv.org/html/2606.23989#bib.bib5))不同,后者将生成锚定在原始片段上,而我们的声明是规范化、可重组、跨文档合并且单独检查的单元,从而桥接了引用式归因(Gaoet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib4);Rashkinet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib8))与原子事实事实性评估(Minet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib9))。 我们的贡献在于:(i)一种声明锚定的模块化MDS框架,其中间表示同时充当归因锚点和验证单元;(ii)显式的跨文档声明聚类与冲突处理,实现多源、片段级别的引用;(iii)内容选择接口,将忠实性–覆盖率权衡转变为可控的旋钮;(iv)一种双机制评估协议,清晰分离引用质量与定位准确性,包括模型解耦的引用检查和多源归因指标,旨在测试结构化声明是否优于基于片段的基线。 ## 2 相关工作 #### 忠实摘要及其评估。 抽象式摘要的忠实性已得到广泛研究(Maynezet al.,2020 (https://arxiv.org/html/2606.23989#bib.bib2);Kryscinskiet al.,2020 (https://arxiv.org/html/2606.23989#bib.bib10))。评估已从n-gram重叠(Lin,2004 (https://arxiv.org/html/2606.23989#bib.bib11))转向基于蕴含和问答的一致性指标(Labanet al.,2022 (https://arxiv.org/html/2606.23989#bib.bib12);Fabbriet al.,2022 (https://arxiv.org/html/2606.23989#bib.bib13);Zhaet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib14);Honovichet al.,2022 (https://arxiv.org/html/2606.23989#bib.bib15)),最近则转向分解为原子事实(Minet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib9))。我们的中间表示与原子事实评估自然对齐:我们生成的单元正是这些指标所评分的单元。 #### 归因文本生成。 越来越多的研究工作要求模型在生成文本的同时提供支持证据(Rashkinet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib8);Bohnetet al.,2022 (https://arxiv.org/html/2606.23989#bib.bib16))。ALCE(Gaoet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib4))引入了一个可重复的基准,包含基于NLI的引用精确率和召回率,但大多数系统在生成后才在段落粒度上进行引用。与我们最接近的工作是“先归因,后生成”(Slobodkinet al.,2024 (https://arxiv.org/html/2606.23989#bib.bib5)),它在生成前选择源片段并将其重用为归因。我们在中间表示类型上有所不同:我们使用规范化的原子声明而非原始片段,这使我们能够合并跨文档的等价证据并生成多源引用——这对MDS至关重要——并且能独立验证每个声明。 #### 模块化摘要。 流水线方法以牺牲部分端到端性能为代价,换来了模块化、可解释性和可控性。“抽取–选择–重写”方法(Guan and Padmakumar,2023 (https://arxiv.org/html/2606.23989#bib.bib7))抽取关系三元组,选择子集,并通过微调的重写器实现它们。我们将此范式扩展到多文档场景,用基于LLM的原子声明分解(带有溯源)替代脆弱的现成抽取,并增加了跨文档聚类、冲突检测和验证循环。 #### 多文档摘要。 MDS需要对跨文档关系、冗余和覆盖范围进行建模(Fabbriet al.,2019 (https://arxiv.org/html/2606.23989#bib.bib1);Xiaoet al.,2022 (https://arxiv.org/html/2606.23989#bib.bib17))。经典系统使用诸如MMR(Carbonell and Goldstein,1998 (https://arxiv.org/html/2606.23989#bib.bib18))等标准来平衡相关性和冗余;最近的基准则强调跨来源的多样性和冲突信息(Huanget al.,2024 (https://arxiv.org/html/2606.23989#bib.bib6))。我们的聚类和冲突检测模块直接处理这些问题,并将其暴露在归因层中。 ## 3 方法 ### 3.1 概览与符号 给定一组源文档D={d1,...,dK},CAMS生成摘要Y,并为每个摘要句子附带一组支持源片段。我们将令牌片段记为c=(doc,start,end)。流水线包含五个阶段(图1 (https://arxiv.org/html/2606.23989#S3.F1)):声明抽取、跨文档聚类与冲突检测、内容选择、可归因重写以及验证。 ### 3.2 带有溯源的声明抽取 对于每篇文档dk,我们提示一个大语言模型将其内容分解为一组原子声明——最小、自包含的命题(Minet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib9))。直接要求字符或令牌偏移并不可靠:指令微调的模型经常错误计数位置并产生幻觉片段。因此,我们将*声明内容*与*声明位置*进行解耦。抽取器为每个声明返回一个结构化记录⟨ti, qi, k⟩,包含(去上下文化的)声明文本ti、从dk复制并授权该声明的*逐字*引文qi,以及文档ID k;它从不报告偏移。然后通过将qi在dk中定位来确定性地*解析*溯源,得到令牌片段ci=(k,start,end)和候选集Ck={(ti,ci)}。这解决了引文的位置,但本身并不保证ti由qi蕴含;该支持在选择过程中评分,并在重写后重新检查。与先前模块化工作(Guan and Padmakumar,2023 (https://arxiv.org/html/2606.23989#bib.bib7))中使用的现成OpenIE(Angeliet al.,2015 (https://arxiv.org/html/2606.23989#bib.bib19))不同,LLM分解提高了召回率,生成了流畅且规范化的声明,同时仍在第一阶段将每个声明锚定到其来源,而不是事后恢复。 #### 去上下文化。 原子声明必须在其段落之外独立存在,因此抽取提示要求*去上下文化*的命题(Choiet al.,2021 (https://arxiv.org/html/2606.23989#bib.bib26)):代词和桥接指代被解析,省略的主语、时间和地点被恢复(例如,“他说将派兵”变为“国防部长X周二表示将派兵”)。该指令在抽取过程中内联发出;关键是,逐字引文qi被单独存储,因此为自包含性重写声明时绝不会破坏用于定位的字符串。由于去上下文化可能引入错误的填充,声明和引文被保留为单独、分别进行支持检查的字段,而非视为等价。 #### 长文档。 当dk超过模型上下文窗口时,我们按段落边界将其拆分为重叠的块(使用滑动窗口),对每块进行抽取,并在合并前将每块的全局字符偏移加回已解析的片段,从而使溯源以完整文档的坐标系表示。重叠区域中重复的声明在聚类阶段(§3.3 (https://arxiv.org/html/2606.23989#S3.SS3))移除。 #### 引文到片段解析。 给定qi,我们使用三层匹配器(算法1 (https://arxiv.org/html/2606.23989#alg1),附录C (https://arxiv.org/html/2606.23989#A3))在dk中定位它。首先尝试精确子串匹配。如果失败——通常是由于LLM的轻微规范化,如智能引号、合并空白或冠词遗漏——我们回退到基于规范化形式(大小写、空白和标点规范化)的近似匹配,使用窗口化相似度搜索(rapidfuzz/difflib),接受规范化插入相似度超过ρ的最佳窗口。最后通过分词器的offset_mapping将匹配的字符区间转换为令牌片段,得到(k,start,end),与定位指标使用的令牌网格一致(§4.3 (https://arxiv.org/html/2606.23989#S4.SS3))。引文无法在ρ以上匹配的声明被丢弃,从而在牺牲少量召回率的情况下保持溯源的精确性。 ### 3.3 跨文档聚类与冲突检测 并集C=⋃kCk包含许多近乎重复的声明。我们使用句子双编码器(Liet al.,2023 (https://arxiv.org/html/2606.23989#bib.bib27))嵌入声明文本,并在余弦距离阈值下通过凝聚聚类进行分组,使得语义等价的声明合并为一个簇g,其溯源为成员片段并集spans(g)=⋃i∈g{ci},可能跨越多个文档。我们使用*平均*链接(完整链接行为近乎相同;避免单链接因其链式效应)。由于嵌入邻近性将等价与相关性混淆——甚至矛盾,因为“30人死亡”和“47人死亡”位置相近——我们通过来自三分类NLI模型的*双向*蕴含确认每次合并,拒绝非相互蕴含的合并。这防止了错误合并,而非证明等价,因此对聚类敏感的多源归因需单独评估(§4.3 (https://arxiv.org/html/2606.23989#S4.SS3),§5.4 (https://arxiv.org/html/2606.23989#S5.SS4))。 #### 冲突检测。 在所有(∥C∥2)对上运行NLI是二次且浪费的。我们改为构建候选池:嵌入相似但*未*合并的跨簇对,以及声明提及相同命名实体或数值量(廉价NER和数字匹配)的对。仅候选对被三分类NLI模型评分;任一方向标记为矛盾的标签且超过置信度阈值的对,会在其簇之间建立冲突链接(例如,不同的伤亡数字)。聚类产生了去重的、多源证据单元,使得分布式归因成为可能。
相似文章
忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
检测、重新掩码、修复:面向演变上下文的忠实摘要的扩散编辑
本文提出了Detect–Remask–Repair,一种基于扩散的框架,用于在上下文演变时进行摘要中的局部忠实性修复,并引入了StreamSum基准来评估此类设置。实验表明,它在忠实性、速度和内容保留之间提供了可控的权衡。
代理科学合成中引用忠实性的评估与防护
本文评估了代理科学合成系统中的引用忠实性,表明当前验证器的不可靠性,无支持引用率根据严格程度在3%到18%之间变化。它提出了一种以黄金标准锚定的评估协议和一个可部署的保护机制,该机制使用分裂共形预测为真正无支持的引用提供无分布界限。
Faithful-MR1: 通过锚定与强化视觉注意实现可信的多模态推理
Faithful-MR1 是一个训练框架,通过 <Focus> 令牌锚定视觉注意,并利用反事实图像干预强化可信使用,从而提升多模态大语言模型(MLLM)中可信的多模态推理能力。它在使用更少训练数据的情况下,在 Qwen2.5-VL 骨干网络上的表现优于基线模型。
通过偏好学习从多个不完美指标优化摘要的事实一致性
本文介绍了一种通过偏好学习聚合多个弱指标的分数来提高文本摘要事实一致性的方法,在各种语言模型上实现了一致的事实性提升。