ScholarSum:基于知识图谱推理与反思式优化的师生式抽象摘要生成

arXiv cs.CL 论文

摘要

ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。

arXiv:2606.18850v1 公告类型:新 摘要:抽象摘要生成在帮助高效理解科学文献方面起着关键作用,但它天然要求同时具备语言流畅性和事实忠实性。现有方法往往无法兼顾这两方面。抽取式方法依赖于僵硬的句子拼接,破坏了宏观层面的逻辑连贯性,而基于大语言模型(LLM)的生成式方法虽然语言流畅,但事实一致性有限。在这项工作中,我们提出了ScholarSum,一个层次化反思图框架,模拟师生写作过程,用于生成流畅且忠实的科学摘要。ScholarSum首先将文档分割成语义连贯的单元,组织成层次化知识图谱,其多层社区结构捕获全局逻辑和宏观主题。在该全局结构引导下,学生生成初稿,随后通过细粒度的证据检索进行优化。为确保事实一致性,一个类似教师的审阅者迭代检查初稿,识别无依据的内容,并触发针对性的重新检索和重写,直到摘要达到严格的质量标准。大量实验表明,ScholarSum在完整性和忠实性方面均显著优于现有基线。我们的代码可在 https://github.com/Xiaoyu-Tao/ScholarSum 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:46

# ScholarSum:基于知识图谱推理与反思性精炼的学生-教师生成式摘要方法
来源:https://arxiv.org/html/2606.18850
陶晓宇* 程明月† 刘慧杰 刘淇 认知智能国家重点实验室,中国科学技术大学 {zbhustc, txytiny, lhj33}@mail.ustc.edu.cn, {mycheng, qiliuql}@ustc.edu.cn

###### 摘要

生成式摘要在实现科学文献的高效理解中扮演着关键角色,但它本质上同时要求语言流畅性和事实忠实性。现有方法常常无法协调这两个要求。抽取式方法依赖于僵硬的句子拼接,破坏了宏观层面的逻辑连贯性;而基于大型语言模型(LLM)的生成方法,尽管掌握了语言流畅性,但在事实一致性上表现有限。在这项工作中,我们提出了 ScholarSum,一个模拟学生-教师写作过程的层次化反思性图框架,用于生成流畅且忠实的科学摘要。ScholarSum 首先通过将文档分割成语义连贯的单元来组织成层次化知识图谱,其多层社区结构捕捉了全局逻辑和宏观主题。在该全局结构的引导下,学生模型生成初稿,随后通过细粒度的证据检索进行精炼。为了确保事实一致性,一个类似教师的审阅者会迭代检查草稿,识别出无证据支持的内容,并触发有针对性的重新检索和重写,直到摘要满足严格的质量标准。大量实验表明,ScholarSum 在完整性和忠实性方面均显著优于之前的基线方法。我们的代码可在 https://github.com/Xiaoyu-Tao/ScholarSum 获取。

22footnotetext:通讯作者:程明月。

## 1 引言

生成式摘要对于在医学、计算机科学和自然科学等领域高效理解科学文献至关重要 Cohan et al. (2018 (https://arxiv.org/html/2606.18850#bib.bib6)); Zhou et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib38))。在实践中,有效的生成式摘要不仅需要产生语言流畅的文本,还必须保持对原始科学主张的事实忠实性 Gao et al. (2023 (https://arxiv.org/html/2606.18850#bib.bib10))。从根本上说,生成式摘要可以视为学习将文档级信息重新组织和压缩成一个连贯且忠实的文本表示 Nan et al. (2021 (https://arxiv.org/html/2606.18850#bib.bib20))。

参考图注图 1:展示了 ScholarSum 如何使用基于图的迭代方法模拟人类学生-教师写作过程。生成式摘要领域经历了不同的技术发展阶段。早期研究主要集中在抽取式方法上,这些方法依赖统计启发式从源文本中选择代表性句子 Erkan and Radev (2004 (https://arxiv.org/html/2606.18850#bib.bib9))。尽管这类方法倾向于保留事实内容,但它们对句子选择的依赖常常限制了语言流畅性。深度学习的出现将焦点转向了生成式摘要,其中编码器-解码器模型(如 BART 和 T5)显著提高了生成文本的流畅性和表现力 Lewis et al. (2020a (https://arxiv.org/html/2606.18850#bib.bib13)); Raffel et al. (2020 (https://arxiv.org/html/2606.18850#bib.bib23))。最近,LLMs 通过展现出强大的零样本能力并在无需特定任务训练的情况下生成连贯叙述,进一步改变了这一领域 Brown et al. (2020 (https://arxiv.org/html/2606.18850#bib.bib4))。然而,尽管在语言流畅性方面取得了这些进展,确保事实忠实性仍然是一个重大挑战。这一观察提出了一个基本问题:生成式摘要能否完全调和语言流畅性与事实忠实性?

受此问题启发,如图 1 (https://arxiv.org/html/2606.18850#S1.F1)(左)所示,我们观察到在现实世界的写作实践中,学生通常首先通过将其关键思想组织成层次化的心理表征来阅读和内化一篇论文,然后产生一个初始摘要,随后通过教师的迭代反馈进行精炼。这个过程通常产生的摘要既能保持语言流畅性,又能逐步提高事实准确性 Xu et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib34))。受此观察启发,如图 1 (https://arxiv.org/html/2606.18850#S1.F1)(右)所示,我们探索了一种尚未充分研究的方法,该方法将生成式摘要表述为由 LLMs 引导的层次化内容理解和生成问题。其基本直觉是:建模文档级结构确保了全局连贯性,而迭代精炼则逐步纠正缺失或无证据支持的内容。然而,这种方法引入了几个不小的挑战。首先,构建一个忠实地反映文档逻辑结构的层次化表征并非易事,尤其是对于长篇且复杂的科学文本 Liu et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib18))。其次,即使有结构引导,有效整合局部证据以确保事实精确性仍然困难,因为全局结构连贯性并不能保证细粒度的事实依据 Sun et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib27))。

为了解决这些挑战,我们提出了 ScholarSum,一个受学生-教师写作过程启发的层次化反思性图框架,旨在生成既语言流畅又事实忠实的摘要。具体来说,ScholarSum 首先通过将文档分割成语义连贯的单元来组织成层次化知识图谱,其中多层社区结构对应于语义连贯的主题,并为摘要规划提供了全局概要。在这种层次化结构的引导下,学生模型生成初稿,确保表达流畅和结构连贯。为了系统地强制执行事实一致性,一个类似教师的审阅者会迭代检查草稿,识别缺失或无证据支持的内容,并触发有针对性的重新检索和重写,直到摘要满足严格的质量标准。这种层次化和反思性的设计使得 ScholarSum 能够充分利用 LLMs 在语义理解、上下文推理和连贯文本生成方面的能力,同时明确解决流畅性和忠实性的双重需求。在基准科学摘要数据集上进行的大量实验表明,ScholarSum 显著优于之前的基线方法。

## 2 相关工作

在本节中,我们回顾与生成式摘要相关的先前工作,重点关注两个主要研究方向。

### 2.1 传统生成式摘要

早期的摘要方法严重依赖抽取式方法,其中句子使用统计或神经指标进行评分,然后将排名最高的句子拼接成摘要。虽然这些方法在捕捉显著内容方面很有效,但常常导致叙述支离破碎、连贯性有限、重复以及风格流畅性差 Erkan and Radev (2004 (https://arxiv.org/html/2606.18850#bib.bib9))。基于预训练语言模型(PLM)的生成方法通过实现端到端的抽象部分缓解了这些问题。序列到序列架构提高了表面流畅性,而带有覆盖机制的指针生成器有助于平衡抽象和复制 See et al. (2017 (https://arxiv.org/html/2606.18850#bib.bib25))。进一步的微调方法,包括特定任务的预训练目标(如间隔句子预测)和统一的文本到文本框架,在科学摘要数据集上建立了强基线 Zhang et al. (2020a (https://arxiv.org/html/2606.18850#bib.bib36)); Raffel et al. (2020 (https://arxiv.org/html/2606.18850#bib.bib23))。受人类写作过程启发的迭代精炼策略引入了起草、批判和修改的循环 Sun et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib27)); Li et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib15))。相关的自我精炼框架也证明了显式反馈循环对于提高事实一致性的价值 Madaan et al. (2023 (https://arxiv.org/html/2606.18850#bib.bib19))。然而,这些基于 PLM 的方法在长文档上仍然难以保持连贯和全局一致的摘要,尤其是在需要跨部分集成时。

### 2.2 基于 LLM 的摘要方法

基于 LLM 的方法利用大规模模型处理更长上下文并提高语篇层面的流畅性。一种代表性策略将摘要生成分解为中间推理步骤,从而能够输出更连贯和结构化的结果。逐步分解和提示链优于单次生成,特别是对于科学和技术文本 Xu et al. (2023 (https://arxiv.org/html/2606.18850#bib.bib33))。另一项工作采用检索增强生成(RAG),其中 LLMs 在推理之前检索相关文档的关键片段或子图 Asai et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib1)); Sarthi et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib24))。图感知检索进一步利用文档结构,如引用和语篇关系,以支持多跳推理并改善全局连贯性 Edge et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib8)); Peng et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib22))。相关的基于图的规划和检索方法进一步突显了结构化证据组织的优势 Hu et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib12)); Chen et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib5))。最近关于科学论文挖掘的研究表明,显式搜索和工具使用可以增强文献理解 Wang et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib32)); Pan et al. (2026 (https://arxiv.org/html/2606.18850#bib.bib21))。记忆增强生成也表明结构化记忆可以改善下游推理和个性化生成 Tao et al. (2026 (https://arxiv.org/html/2606.18850#bib.bib29)); Yu et al. (2026 (https://arxiv.org/html/2606.18850#bib.bib35))。

将图约束纳入的微调方法进一步将结构先验引入生成过程。通过使用子图级计划或关系约束引导解码,这些方法将 PLMs 的流畅性与证据感知生成相结合 Li et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib16)); Peng et al. (2025 (https://arxiv.org/html/2606.18850#bib.bib22))。尽管在流畅性方面取得了显著改进,基于 LLM 的方法仍然容易出现幻觉和证据依据薄弱的问题,特别是当摘要必须忠实地反映复杂的科学证据时。这一挑战突显了对不仅提升生成质量,而且强制执行显式验证和逻辑连贯性的机制的需求。最近的验证导向方法通过提示模型通过显式验证步骤生成、检查并修正自身输出,进一步减少了幻觉 Dhuliawala et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib7)); Gou et al. (2024 (https://arxiv.org/html/2606.18850#bib.bib11))。

## 3 方法论

在本节中,我们首先定义问题,然后概述所提出的方法,最后详细描述各个组件。

### 3.1 问题定义

给定一篇源论文 \(D\),科学摘要的目标是生成一个摘要 \(S\),该摘要能保留文档的逻辑拓扑和事实细节。为了实现这一目标,ScholarSum 将摘要表述为一个迭代精炼过程。具体来说,ScholarSum 最多进行 \(T\) 次迭代。在第 \(i\) 次迭代中,学生模型通过对文档派生的知识图谱 \(G\) 进行推理,并受上一轮教师的结构化反馈 \(F_T^{(i-1)}\) 的条件约束,生成候选摘要 \(S_{\text{student}}^{(i)}\)。然后,教师模型评估 \(S_{\text{student}}^{(i)}\),返回质量分数 \(\sigma^{(i)}\) 和更新后的反馈 \(F_T^{(i)}\)。该过程在 \(\sigma^{(i)} \geq \theta\) 或达到迭代预算 \(T\) 时终止。

参考图注图 2:用于生成流畅且忠实科学摘要的 ScholarSum 概览:(a) 构建层次化图以建模文档级结构,(b) 学生生成摘要,通过结构引导产生逻辑连贯的草稿,(c) 教师式精炼,通过迭代自纠错消除事实幻觉。
### 3.2 概述

图 2 (https://arxiv.org/html/2606.18850#S3.F2) 展示了用于生成流畅且忠实科学摘要的 ScholarSum 框架。它通过三个主要步骤进行。首先,层次化图构建从源句子中提取实体和关系以形成子图,捕捉文档级结构。其次,学生生成摘要,在这些子图的引导下产生连贯的草稿摘要。第三,教师式精炼使用检索到的相似文章迭代评估和修改草稿,校准科学写作风格、预期内容覆盖范围和语篇组织。

### 3.3 层次化图构建

学生模型通过操作源自源论文的显式语义工作空间来起草候选摘要。关键思想是利用文档结构进行规划,利用文本证据进行验证,确保流畅性和事实性相互加强而非此消彼长。

为了提供论文核心主张的可操作表征,我们为给定论文 \(D\) 构建一个知识图谱 \(G = (V, E)\)。我们首先将 \(D\) 分割成句子级或段落级文本单元,并使用指令微调的 LLM 和约束 JSON 模式来提取科学实体 \(V\)。实体被分类为科学写作中常见的类别,包括任务、方法、数据集和指标。对于关系检测,我们枚举相同或相邻文本单元内的实体对,并将它们分类为有类型的关系,例如 addresses, uses, evaluates-on, reports, 和 compares-with。通过将论文外部化到这个结构化工作空间中,我们同时实现了全局规划和局部证据选择,为连贯摘要的生成提供了清晰的基础。科学论文通常包含多个连贯的线索,包括问题动机、方法设计和实证发现。为了识别这些主题线索,我们使用社区发现算法 Traag et al. (2019 (https://arxiv.org/html/2606.18850#bib.bib30)) 对 \(G\) 进行划分:

\[
\{G_1, G_2, \dots, G_k\} = \text{Leiden}(G),
\] (1)

其中每个社区 \(G_i\) 对应于一个聚焦的主题。小型社区被移除,高度重叠的社区被合并,以产生一个既非碎片化也非过于粗糙的稳定计划。这种主题规划确保了生成的摘要尊重论文的内部结构,并保持跨不同部分的连贯性。

### 3.4 学生生成摘要

直接单次生成一篇科学摘要可能会导致

相似文章

从无查询摘要数据集生成查询聚焦摘要数据集

arXiv cs.CL

本文提出了一种基于证据的模型,可从无查询摘要数据集中自动生成查询关键词,从而创建查询聚焦摘要数据集。实验结果表明,使用基于证据的查询生成的摘要与原始查询生成的摘要相比,获得了具有竞争力的ROUGE分数。

评估文本摘要的抽象性度量:一种改进的公式及其经验验证

arXiv cs.CL

本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。

基于外部子图生成的大语言模型逐步推理增强

arXiv cs.CL

本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。