评估文本摘要的抽象性度量:一种改进的公式及其经验验证
摘要
本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。
arXiv:2607.10806v1 公告类型:新提交
摘要:量化生成摘要的抽象性对于超越ROUGE等表面度量来评估摘要模型至关重要。我们引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)——一组原则性的启发式度量,用于衡量摘要与源文本抽取式复制的偏差程度。该公式采用文档长度的调和均值,并由三次非重叠因子进行调节,从而产生维度一致、有界且对抽取-生成边界具有非线性敏感性的输出。在100个XSUM文档上对四种摘要模型(BART-large-cnn、Pegasus-xsum、DistilBart、MT5-small)进行的评估表明,这些度量成功区分了抽取式模型(SA约0.12-0.26)和生成式模型(SA约0.96-1.77),并且抽象比率能够识别需要人工评估潜在幻觉的摘要。代码和结果可在https://github.com/katweNLP/AbstractionStudy获取。
查看缓存全文
缓存时间: 2026/07/14 04:22
# 评估文本摘要的抽象性度量:一种精炼公式与实证验证 **来源:** https://arxiv.org/html/2607.10806 **作者:** Praveenkumar Katwe¹,Rakesh Chandra Balabantaray¹,Kali Prasad Vittala² ¹印度布巴内什瓦尔国际信息技术学院计算机科学与工程系 ²Salesforce India Pvt Ltd,印度班加罗尔 [email protected] ###### 摘要 量化生成摘要中的抽象性对于评估摘要模型至关重要,这超越了 ROUGE 等表面层面的指标。我们引入了**参考抽象度 (RA)**、**摘要抽象度 (SA)** 和**抽象比 (AR)**——这是一组基于原则的启发式度量,用于衡量摘要偏离源文本抽取式复制的程度。该公式使用文档长度的调和平均数,并通过立方非重叠因子进行调制,从而得到维度一致、有界输出,并在抽取-抽象边界上具有非线性灵敏度。在四个摘要模型(BART-large-cnn、Pegasus-xsum、DistilBart、MT5-small)上对 100 个 XSUM 文档进行的评估表明,这些度量能够成功区分抽取式模型(SA≈0.12–0.26)和抽象式模型(SA≈0.96–1.77),并且抽象比能够识别需要人工评估是否存在潜在幻觉的摘要。代码和结果可在 https://github.com/katweNLP/AbstractionStudy 获取。 ## 1 引言 抽象式摘要会生成新颖文本,捕捉源文档的要点。与逐句复制的抽取式方法不同,抽象式模型会进行释义、概括,有时还会产生幻觉——引入源文本中没有的内容。虽然流畅性和信息性有成熟的度量指标(ROUGE [1]、BERTScore [2]),但**抽象性本身**——摘要偏离抽取式复制的程度——一直缺乏有原则的定量度量。先前的工作采用新颖 n-gram 比率 [3] 作为近似指标,但这种二元性的词元级度量没有考虑文档长度不对称性,也无法在不同重叠水平上提供渐进的区分。 我们提出了三个互补的度量——RA、SA 和 AR——通过一种结合调和平均长度加权与立方非重叠放大的公式来解决这些局限性。这些度量作为**筛查工具**:高 RA 表明参考本身高度抽象(可能包含幻觉);不匹配的 AR 值则标记需要人工评估的摘要。这些度量是实体幻觉指数 (EHI) [4] 的基础和前置环节,后者提供细粒度的幻觉分解。 ## 2 相关工作 ### 2.1 基于参考的质量度量 摘要评估的主流范式依赖于将生成文本与人工撰写的参考进行比较。ROUGE [1] 衡量生成摘要与参考摘要之间的 n-gram 重叠,提供面向召回的质量分数。虽然 ROUGE 仍然是基准测试的事实标准,但它从根本上奖励抽取式复制——一个逐字复现参考的模型无论是否忠实反映源文档,都能获得完美分数。BERTScore [2] 通过上下文嵌入计算语义相似度,解决了表面层面匹配的局限性,但仍然基于参考:它衡量生成摘要与人类期望的匹配程度,而非其是否以源文档为依据。 所有基于参考的度量都有一个关键局限性:无法检测**忠实性**违反。一个摘要可以通过捕捉与参考相同的内容选择,同时引入源中不存在的幻觉细节,从而获得高 ROUGE 分数。质量与忠实性之间的这种脱节已由 Fabbri 等人 [5] 通过实验证明,他们发现在 SummEval 基准中,自动度量(包括 ROUGE 和 BERTScore)与人类对忠实性的判断之间相关性较差。 ### 2.2 忠实性与事实性 Maynez 等人 [6] 提供了首个大规模关于抽象式摘要幻觉的研究,发现超过 30% 的生成摘要包含幻觉内容(内在或外在)。关键是,他们证明了 ROUGE 分数不与忠实性相关——模型可以在 ROUGE 上表现良好同时生成不忠实的摘要。这一发现推动了基于源依据的度量,这些度量评估生成文本与**源文档**之间的关系,而非与参考的关系。 FactCC [7] 通过自然语言推理 (NLI) 处理忠实性,将每个生成的句子分类为源文档蕴含或不蕴含。虽然作为二元检测器有效,但 FactCC 不提供渐变——它无法区分轻度释义的句子和完全虚构的句子。Nan 等人 [8] 提出了实体级事实一致性,衡量摘要中的命名实体是否以源文档为依据。这提供了可解释的信号,但将忠实性简化为单一实体重叠分数,没有按实体类型或严重性进行分解。 ### 2.3 抽象性近似指标 Narayan 等人 [3] 在 XSUM 数据集论文中引入了新颖 n-gram 百分比作为抽象性的简单近似指标。虽然对数据集特征描述有用,但该度量在词元层面是二元的(每个 n-gram 要么新颖要么不新颖),并且没有考虑源文档与摘要之间的长度不对称性。一个 20 词的摘要,无论源文档是 100 词还是 10,000 词,若其 50% 的一元词是新异的,则被同等对待。 ### 2.4 我们工作的定位 我们提出的度量(RA、SA、AR)在该领域中占据了一个独特的生态位。与 ROUGE 和 BERTScore 不同,它们是**基于源依据**的度量,衡量生成文本与源文档之间的关系。与 FactCC 不同,它们提供**连续分数**并带有可解释的阈值,而非二元分类。与新颖 n-gram 比率不同,它们通过调和平均纳入**长度归一化**,并通过立方放大实现**非线性灵敏度**。表 1 总结了定位。 **表 1:摘要评估方法的比较** | 类别 | 度量示例 | 依据 | 分数类型 | 长度感知 | 非线性 | |------|----------|------|----------|----------|--------| | 表面重叠 | ROUGE | 参考 | 连续 | 否 | 否 | | 语义 | BERTScore | 参考 | 连续 | 否 | 否 | | 忠实性 | FactCC | 源 | 二元 | 否 | 否 | | 实体忠实性 | Nan 等人 | 源 | 连续 | 否 | 否 | | 抽象性(我们) | RA, SA, AR | 源 | 连续 | 是 | 是 | ## 3 度量定义 ### 3.1 变量定义 **表 2:变量定义及其定义域** | 变量 | 含义 | 定义域 | |------|------|--------| | O | 源文档长度(词数) | ℕ⁺ | | R | 参考摘要长度(词数) | ℕ⁺ | | S | 生成摘要长度(词数) | ℕ⁺ | | c_R | 参考相对于源文档的归一化重叠 | [0,1] | | c_S | 生成摘要相对于源文档的归一化重叠 | [0,1] | | ε | 防除零的小常数 | ℝ⁺(建议值 1e-8) | 注:归一化重叠 c 定义为[摘要与源文档的共有词单元数]除以[摘要中的词单元总数],可在一元词、二元词或最长公共子序列 (LCS) 粒度上计算。 ### 3.2 公式 **RA = HM(R, O) × (1 − c_R)³ = (2RO)/(R+O) · (1 − c_R)³** (1) **SA = HM(S, O) × (1 − c_S)³ = (2SO)/(S+O) · (1 − c_S)³** (2) **AR = (1 − c_S)³ / [(1 − c_R)³ + ε]** (3) 关于 AR 公式的说明:虽然 RA 和 SA 纳入调和平均数以提供绝对抽象性分数(以词数单位),但 AR 定义为**纯无量纲比率**,仅使用归一化非重叠因子。这一设计选择确保了: 1. AR 在阈值 1.0 附近具有可解释性(AR≈1 表示抽象性相等); 2. AR 独立于绝对文档长度(HM(R,O) 和 HM(S,O) 不会干净地抵消,因为 R≠S); 3. AR 保持有界,且可在不同大小的文档对之间进行比较。 ### 3.3 设计原理 **表 3:逐项论证** | 成分 | 作用 | 动机 | |------|------|------| | 调和平均数 HM(L,O) | 长度归一化 | 对较短的(摘要)和较长的(源)长度赋予相等权重,避免大文档支配度量 | | 立方 (1 − c)³ | 非线性放大 | 在重叠高时(抽取式)惩罚严重,在重叠低时(抽象式)奖励温和;为边界区域提供梯度 | | 比率形式 (AR) | 跨文档可比性 | 消除绝对长度,直接比较非重叠比例 | | ε | 数值稳定性 | 防止除零(c_R=1 时) | ### 3.4 数学性质 - **维度一致性**:HM(R,O) 具有词数单位;(1 − c_R)³ 无量纲。RA 和 SA 具有词数单位——可解释且一致。AR 纯无量纲。 - **单调行为**:高重叠 ⇒ c_R → 1 ⇒ (1 − c_R)³ → 0 ⇒ RA → 0(抽取式)。低重叠 ⇒ c_R → 0 ⇒ RA = HM(R,O)(最大抽象性)。 - **有界**:RA ∈ [0, HM(R,O)]。SA ∈ [0, HM(S,O)]。AR ∈ [0, ∞),AR=1 表示抽象性相等。 - **无除零**:(1 − c_R)³ 是 RA/SA 中的乘数,从不作为分母。AR 中的 ε 防范参考完全抽取式(c_R=1)的边缘情况。 - **AR 的可解释性**:由于 AR 仅使用无量纲的 (1 − c)³ 因子,它直接比较非重叠**比例**的三次方。AR=1 表示无论文档长度如何,抽象性相同。这分离了**比较**功能 (AR) 与**测量**功能 (RA, SA)。 ## 4 实验设置 ### 4.1 数据集 我们在两个具有对比参考风格的数据集上进行评估: - **XSUM** [3]:50 个验证文档,具有高度抽象的单句参考(平均 c_R=0.61,即 39% 新颖内容)。选择用于测试 AR<1 的行为。 - **CNN/DailyMail**:50 个验证文档,具有抽取式多句参考(平均 c_R=0.83,即仅 17% 新颖内容)。选择用于测试 AR>1 的行为和幻觉检测。 ### 4.2 模型 四个摘要模型覆盖抽取-抽象谱系: 1. **facebook/bart-large-cnn** [9]:在 CNN/DailyMail 上预训练(偏向抽取式) 2. **google/pegasus-xsum** [10]:专门为极端摘要预训练 3. **sshleifer/distilbart-cnn-12-6**:蒸馏版 BART(偏向抽取式) 4. **google/mt5-small**:多语言 T5(零样本,倾向于输出较短的抽象式内容) ### 4.3 重叠计算 对每个文档-摘要对,我们在三个粒度上计算归一化重叠: - **一元词 (c₁)**:词元级多重集交集,按摘要长度归一化 - **二元词 (c₂)**:二元词组交集,按摘要中二元词组数归一化 - **最长公共子序列 (cL)**:最长公共子序列长度,按摘要长度归一化 ## 5 结果 ### 5.1 参考抽象度 (RA):数据集特征分析 RA 刻画了金标准参考的固有抽象性: **表 4:按数据集划分的参考抽象度(各 50 篇文章)** | 粒度 | XSUM | CNN/DailyMail | |------|------|---------------| | Unigram (RA₁) | 3.55 | 0.61 | | Bigram (RA₂) | 4.82 | 1.12 | | LCS (RAL) | 2.10 | 0.35 | XSUM 参考的抽象性显著更高(RA₁=3.55),而 CNN/DM 参考的抽象性较低(RA₁=0.61),证实了这两个基准在已知设计上的差异。 **图 1:每篇文章的参考抽象度 (RA):XSUM(左,抽象式)vs CNN/DailyMail(右,抽取式)** ### 5.2 摘要抽象度 (SA) **表 5:按模型和数据集划分的摘要抽象度(各 50 篇文章)** | 模型 | XSUM SA₁ | XSUM SA₂ | CNN/DM SA₁ | CNN/DM SA₂ | |------|----------|----------|------------|------------| | BART-large-cnn | 0.26 | 0.23 | 0.12 | 0.09 | | Pegasus-xsum | 1.77 | 1.52 | 1.14 | 0.87 | | DistilBart-cnn | 0.26 | 0.22 | 0.12 | 0.08 | | MT5-small | 1.35 | 1.37 | 0.96 | 0.81 | SA 在两个数据集上清楚地区分抽象式模型(Pegasus, MT5)和抽取式模型(BART, DistilBart)。值得注意的是,无论数据集期望抽象(XSUM)还是抽取(CNN/DM),BART/DistilBart 都保持较高的抽取性(c_S≈0.97)。 **图 2:各文章的摘要抽象度:XSUM(上排)vs CNN/DailyMail(下排)** ### 5.3 抽象比 (AR):关键发现 AR = (1 − c_S)³ / (1 − c_R)³ 衡量生成摘要的抽象性与参考相比如何。双数据集评估揭示了完整的 AR 谱系: **表 6:抽象比(中位数):AR<1 = 抽取式,AR≈1 = 匹配,AR>1 = 过度抽象** | 模型 | XSUM AR₁ | XSUM AR₂ | CNN/DM AR₁ | CNN/DM AR₂ | |------|----------|----------|------------|------------| | BART-large-cnn | 0.02 | 0.02 | 0.02 | 0.01 | | Pegasus-xsum | 0.57 | 0.92 | 12.37 | 16.89 | | DistilBart-cnn | 0.02 | 0.02 | 0.01 | 0.01 | | MT5-small | 0.27 | 0.75 | 10.53 | 14.21 | 关键观察: - **在 XSUM 上**(抽象式参考):所有模型 AR<1——没有一个达到参考的抽象水平。Pegasus 最接近(AR₂=0.92)。 - **在 CNN/DailyMail 上**(抽取式参考):Pegasus 和 MT5 实现 AR>1,表明它们比参考**更抽象**。这标记了潜在的幻觉——模型引入了超出人类认为必要范围的新颖内容。 - **BART/DistilBart** 在两个数据集上保持抽取式(AR≈0),与其 CNN/DM 预训练偏差一致。 **图 3:抽象比:XSUM(上,所有 AR<1)vs CNN/DailyMail(下,抽象式模型超过 AR=1)。红色虚线标记抽象性相等。** ### 5.4 通过 AR 进行幻觉检测 我们根据二元词 AR₂ 阈值对每个生成摘要进行分类: - **AR > 2.0**:高幻觉风险(模型远超参考抽象度) - **1.2 < AR ≤ 2.0**:中度风险(需要审查) - **AR ≤ 1.2**:低风险(与参考相当或更抽取式) **表 7:基于 AR₂ 的幻觉风险分类** | 模型 | 高 (AR>2.0) | 中 (1.2<AR≤2.0) | 低 (AR≤1.2) | |------|-------------|-----------------|-------------| | BART-large-cnn (XSUM) | 0% | 0% | 100% | | Pegasus-xsum (CNN/DM) | 48% | 24% | 28% | | MT5-small (CNN/DM) | 24% | 36% | 40% | **图 4:按数据集和模型划分的幻觉风险分布:XSUM(左)与 CNN/DailyMail(右)** ### 5.5 分解:按模型展示 AR **图 5:每篇文章的抽象比,按模型分列:XSUM(上排)与 CNN/DailyMail(下排)。水平蓝色线标记 AR=1。** ## 6 讨论 **为什么 AR 在 XSUM 上始终 <1?** XSUM 参考(平均 c_R=0.61)本身高度抽象。即使是最具抽象能力的生成模型也未能完全匹配这个水平——一个合理的解释是,模型倾向于在保持实质信息的同时引入一些抽取式片段,而人类则更自由地改写。 **为什么 AR 在 CNN/DailyMail 上达到 ∼17?** CNN/DM 参考(平均 c_R=0.83)主要是抽取式的;c_R=0.83 意味着 1 − c_R = 0.17。如果生成摘要的 c_S=0.5,那么 AR = (0.5)³/(0.17)³ ≈ (0.125)/(0.0049) ≈ 25.5——一个很大的数字。这种对模型过度抽象性的高灵敏度被视作一个特征:它作为一个**早期预警系统**,标记那些大幅偏离参考预期的摘要。 **为什么不使用单一百分比?** 一个简单的非重叠百分比,例如 (1 − c_S),在面对长度不对称性时无法提供可比性。AR 的立方和比率形式确保了可解释的边界(AR=1 意味着抽象性匹配)并且对低的 c_R 具有鲁棒性。 **局限性**:当摘要几乎纯粹抽取式(c_S > 0.95)时,由于立方的存在,AR 会迅速趋近于零——重叠上的微小差异会导致 AR 的巨大差异。这是设计使然(在抽取边界上具有灵敏度),但也意味着 AR 对于抽象范围内的模型(c_S < 0.8)最有信息量。 ## 7 结论 我们提出了参考抽象度 (RA)、摘要抽象度 (SA) 和抽象比 (AR) 作为量化文本摘要中抽象性的有原则的启发式度量。该公式——文档长度的调和平均数乘以归一化立方非重叠——实现了维度一致性、有界输出以及在抽取-抽象边界上的非线性灵敏度。在 XSUM 上对四个模型的评估表明,该度量能够清楚地区分抽取式系统(BART, DistilBart)和抽象式系统(Pegasus, MT5)。这些度量提供了一个用于识别潜在幻觉摘要的筛查工具,推动通过实体和关系幻觉度量进行更深入的分析。 ### 代码可用性 代码和结果可在 https://github.com/katweNLP/AbstractionStudy 获取。 --- ## 参考文献 - [1] Chin-Yew Lin. ROUGE: A package for automatic evaluation of summaries. In *Text Summarization Branches Out*, pages 74–81. Association for Computational Linguistics, 2004. - [2] Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, and Yoav Artzi. BERTScore: Evaluating text generation with BERT. *arXiv preprint arXiv:1904.09675*, 2019. - [3] Shashi Narayan, Shay B. Cohen, and Mirella Lapata. Don’t give me the details, just the summary! Topic-aware convolutional neural networks for extreme summarization. In *Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing*, pages 1797–1807, 2018. - [4] Praveenkumar Katwe, Rakesh Chandra Balabantaray, and Kali Prasad Vittala. Entity hallucination index in abstractive summarization – a metric. In *2023 International Conference on Communication, Circuits, and Systems (IC3S)*, pages 1–5. IEEE, 2023. - [5] Alexander R. Fabbri, Wojciech Kryściński, Bryan McCann, Caiming Xiong, Richard Socher, and Dragomir Radev. SummEval: Re-evaluating summarization evaluation. *Transactions of the Association for Computational Linguistics*, 9:568–600, 2021. - [6] Joshua Maynez, Shashi Narayan, Bernd Bohnet, and Ryan McDonald. On faithfulness and factuality in abstractive summarization. In *Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics*, pages 1906–1919. Association for Computational Linguistics, 2020. - [7] Wojciech Kryściński, Bryan McCann, Caiming Xiong, and Richard Socher. Evaluating the factual consistency of abstractive text summarization. In *Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing*, pages 9332–9346. Association for Computational Linguistics, 2020. - [8] Feng Nan, Ramesh Nallapati, Zhiguo Wang, Cicero Nogueira dos Santos, Henghui Zhu.
相似文章
抽象摘要中关系级幻觉评估的基于依据的分解框架
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。
通过偏好学习从多个不完美指标优化摘要的事实一致性
本文介绍了一种通过偏好学习聚合多个弱指标的分数来提高文本摘要事实一致性的方法,在各种语言模型上实现了一致的事实性提升。
ScholarSum:基于知识图谱推理与反思式优化的师生式抽象摘要生成
ScholarSum是一个层次化反思图框架,用于科学文献的抽象摘要生成,模拟了师生写作过程。它利用层次化知识图谱捕获全局结构,生成初稿,并通过证据检索和类似教师的审阅迭代地优化摘要,以提高流畅性和事实忠实性。
基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成
提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。
基于微调PEGASUS的抽象摘要优化
本文展示了在XL-Sum英语语料库上微调PEGASUS的方法,在ROUGE评分上相比基线mT5模型取得了显著提升,达到了当前最优结果。