抽象摘要中关系级幻觉评估的基于依据的分解框架

arXiv cs.CL 论文

摘要

本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。

arXiv:2608.08180v1 公告类型:新 摘要:抽象式文本摘要系统经常通过捏造或扭曲实体与事件之间的关系来生成流畅但不忠实的摘要。这种关系级幻觉削弱了生成摘要的可靠性,尤其是在高风险领域。在本工作中,我们提出了一个精炼且基于依据的框架,用于评估抽象式摘要中的关系幻觉。我们通过引入一种依赖感知的关系抽取算法来呈现经验性的关系幻觉指数(RHI),该算法结合了基于词形归一的标准化、命名实体锚定的主语消解、被动语态施事恢复、否定感知的动词建模、转述动词过滤、名词性关系回退、子句传播和系统性去重。这些增强提高了抽取关系三元组的结构保真度,并减少了评估中的虚假匹配。此外,我们引入了RHI的标准化公式,以确保数据集和模型之间的尺度不变比较。修订后的指标将幻觉分解为可解释的组成部分,并将关系幻觉指标聚合为标准化的关系忠实度分数。在多个最先进的摘要模型上进行的大量评估表明,基于依据的抽取过程能产生更稳定、更具区分度的幻觉测量。所提出的框架推进了自动化的关系级忠实度评估,并支持连贯性感知、幻觉敏感的模型分析。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:07

# 一个基于依据且可分解的抽象式摘要关系级幻觉评估框架
来源:https://arxiv.org/html/2608.08180
Rakesh Chandra Balabantaray,Kali Prasad Vittala,Naman Kabadi

###### 摘要

抽象式文本摘要系统经常生成流畅但不忠实的摘要,因为它们会捏造或扭曲实体与事件之间的关系。这种关系级幻觉会削弱生成摘要的可靠性,尤其是在高风险领域。在本工作中,我们提出了一个面向抽象式摘要中关系幻觉评估的、经过改进且基于依据的框架。

我们通过引入一种依存感知的关系提取算法,提出了经验性的关系幻觉指数(RHI)。该算法整合了基于词形还原的规范化、命名实体锚定的主语解析、被动语态施事恢复、否定感知的动词建模、转述动词过滤、名词性关系回退、从句传播以及系统去重。这些改进提高了所提取关系三元组的结构保真度,并减少了评估过程中的虚假匹配。

此外,我们引入了RHI的归一化形式,以确保数据集与模型之间的尺度不变比较。修订后的指标将幻觉分解为可解释的组成部分,并将关系幻觉指标聚合为归一化的关系忠实度分数。

对多个最先进摘要模型的广泛评估表明,基于依据的提取过程能够产生更稳定且更具区分度的幻觉测量。所提出的框架推进了自动化的关系级忠实度评估,并支持连贯性感知、幻觉敏感的模型分析。

## I 引言

自然文本生成领域的最新进展显著提高了自动生成摘要的流畅性和可读性。

相似文章

幻觉检测引导的临床摘要偏好优化

arXiv cs.CL

介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

arXiv cs.CL

本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。

评估文本摘要的抽象性度量:一种改进的公式及其经验验证

arXiv cs.CL

本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。

面向NMT与抽象式摘要中幻觉检测的逐层最优传输

arXiv cs.CL

本文将对基于最优传输的幻觉检测扩展到NMT和抽象式摘要中的所有解码器层,发现检测主要集中在早期层,并且由于忠实性失败无法通过注意力集中检测到,几何信号在摘要任务中迁移效果不佳。

分解蕴含用于事实性检查与幻觉检测

arXiv cs.CL

本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。