信息满意度:以读者为中心的摘要评估维度
摘要
本文提出信息满意度作为以读者为中心的摘要评估维度,指出当前指标未能捕捉用户特定的信息需求,且与人类判断的一致性较差。
arXiv:2608.14457v1 新闻类型:新
摘要:大多数摘要评估工作关注通用摘要质量(如ROUGE、BERTScore)或特定期望属性(如可读性、事实性)。然而,这些指标无法衡量摘要对单个用户的效用。例如,了解最新疫苗研究的生物医学研究人员与家庭医生具有不同的信息需求。查询摘要捕捉了部分需求,但实践中用户很少在查询中陈述所有相关信息:单个简短查询可能不足以区分研究人员与医生的需求。相比之下,读者的背景或角色(其职能与专业知识)在不同查询间相对稳定,并能恢复大量缺失的上下文,这使其成为评估摘要是否满足该读者需求的实用信号。本研究评估了流行摘要指标对信息差异与角色差异的敏感性,发现许多主流指标(包括强大的LLM-as-judge指标)在信息内容的基本扰动测试中表现不佳。我们还进行了专家人类评估,根据特定个人的背景与用例测量基于信息满意度的摘要偏好。研究发现,传统指标和基于LLM的指标均不足以衡量信息满意度,且与人类判断的一致性较差。
查看缓存全文
缓存时间: 2026/08/17 09:58
# 面向读者的摘要评估维度 来源:https://arxiv.org/html/2608.14457 ## 信息满意度:面向读者的摘要评估维度 会议:2026 ACM人机互补与对齐会议;2026年9月27日至30日;美国弗吉尼亚州亚历山大市 2026 ACM人机互补与对齐会议(HCOMP 2026),2026年9月27日至30日,美国弗吉尼亚州亚历山大市 DOI:10.1145/3834580.3838749 (https://doi.org/10.1145/3834580.3838749) ISBN:979-8-4007-2894-5/2026/09 CCS:信息系统 摘要生成 CCS:以人为中心的计算 用户研究 CCS:计算方法学 自然语言处理 CCS:计算方法学 机器学习 Isabel Cachola 隶属机构:美国德克萨斯州奥斯汀圣爱德华大学 注:研究在约翰霍普金斯大学完成。邮箱:[email protected] William Walden 隶属机构:美国马里兰州巴尔的摩约翰霍普金斯大学人类语言技术卓越中心 Reno Kriz 隶属机构:美国马里兰州巴尔的摩约翰霍普金斯大学人类语言技术卓越中心 Mark Dredze 隶属机构:美国马里兰州巴尔的摩约翰霍普金斯大学 2026;© cc ###### 摘要 大多数摘要评估工作关注整体摘要质量(如ROUGE、BERTScore)或特定期望属性(如可读性、事实性)。然而,这些指标未能衡量摘要对个体用户的效用。例如,了解最新疫苗研究的生物医学研究员与家庭医生的信息需求是不同的。查询聚焦摘要捕捉了部分需求,但在实践中,用户很少在查询中陈述所有相关信息:一个简短的查询很可能不足以区分研究员和医生的需求。相比之下,读者的背景或*角色画像*——其角色和专业知识——在不同查询间相对稳定,并能恢复大量缺失的上下文,这使其成为评估摘要是否满足该读者需求的实用信号。在本研究中,我们评估了流行的摘要指标对信息差异和角色画像差异的敏感程度,发现包括强大的LLM裁判指标在内的许多流行指标未能通过信息内容的基本扰动测试。我们还进行了专家人工评估,在给定特定人物背景和用例的前提下,衡量基于信息满意度的摘要偏好。我们发现,传统指标和基于LLM的指标均不足以衡量信息满意度,且与人类判断的一致性较差。 ###### 关键词: 摘要评估,查询聚焦摘要,信息满意度,读者画像,评估指标,LLM裁判,人工评估,指标相关性,以用户为中心的NLP ††cc-license:by ## 1. 引言 摘要的价值很少是内在的;相反,它只有在摘要帮助特定读者实现特定目标时才得以实现。然而,自动摘要长期以来一直通过旨在捕捉摘要本身作为属性的通用质量概念的指标进行评估。如ROUGE这样的词汇重叠度量将候选摘要与参考文本进行比较(36 (https://arxiv.org/html/2608.14457#bib.bib1));如BERTScore这样的基于嵌入的方法评估语义相似度(63 (https://arxiv.org/html/2608.14457#bib.bib4));而更针对性的指标则评估特定维度,如事实一致性、连贯性或可读性(31 (https://arxiv.org/html/2608.14457#bib.bib44); 59 (https://arxiv.org/html/2608.14457#bib.bib8); 13 (https://arxiv.org/html/2608.14457#bib.bib32); 41 (https://arxiv.org/html/2608.14457#bib.bib29))。最近,大语言模型(LLMs)被用作评判者,承诺提供接近人类评估水平的更细致的评估(65 (https://arxiv.org/html/2608.14457#bib.bib14); 38 (https://arxiv.org/html/2608.14457#bib.bib11))。然而,在指标激增的情况下,质量被视为一种可以依据黄金标准或参考标准集来衡量的固定属性,而与读者是谁无关。 这种框架掩盖了关于摘要的一个基本事实:摘要只有在服务于读者的信息需求时才有用。考虑一篇关于mRNA疫苗开发的最新论文。生物医学研究员可能需要一个保留方法细节、统计结果以及与先前文献联系的摘要,而阅读同一篇论文的家庭医生可能最受益于强调临床意义、患者指导和禁忌症的摘要。源文档在两种情况下是相同的,为某一受众编写的参考摘要可能在标准指标下得分很高,却完全无法满足另一读者的需求。大多数现有评估范式对此不匹配几乎无话可说,因为它们要么根本不考虑读者(36 (https://arxiv.org/html/2608.14457#bib.bib1); 63 (https://arxiv.org/html/2608.14457#bib.bib4)),要么只关注读者的风格偏好,而非信息需求(38 (https://arxiv.org/html/2608.14457#bib.bib11); 61 (https://arxiv.org/html/2608.14457#bib.bib66))。 为了捕捉这种以读者为中心的效用概念,我们引入了**信息满意度**作为摘要评估的一个维度。信息满意度衡量的是摘要在多大程度上解决了促使读者查阅源文档的特定信息需求——在本研究中,通过查询和描述读者角色与专业知识的*角色画像*来操作化。理论上,足够详细的查询可以编码关于读者的所有信息,从而无需角色画像。但在实践中,读者很少在请求中提供此类信息,使得读者的背景、专业知识和目的成为隐含信息。角色画像恰好恢复了这种缺失的上下文,并且由于读者的角色和专业知识在他们发出的众多查询中相对稳定,可以一次指定并重复使用,而无需为每个请求重新获取。因此,我们将查询和角色画像视为互补:查询表达即时问题,角色画像提供查询未言明的相对静态的读者上下文。一个摘要可以流畅、事实准确、忠实于其源文档,却仍然未能满足读者的需求。相反,一个风格上粗糙的摘要可能完全满足具有合适背景的读者的当前查询。通过突出查询及其背后的读者,信息满意度将评估重新围绕读者的目的,而非摘要的表面属性。 基于这种重新定位,我们提出现有摘要指标是否具备衡量信息满意度的能力。我们围绕两个研究问题展开调查: #### RQ1 评估指标对信息内容和读者角色画像的变化是否敏感? 一个能有效追踪信息满意度的指标,应该在摘要中的信息相对于读者需求发生变化时做出响应——要么因为摘要内容发生变化,要么因为消费它的角色画像发生变化。我们通过系统地改变这两个维度并测量流行的自动指标(包括传统的基于参考的度量和LLM裁判方法)对扰动的响应情况来探测这一特性。 #### RQ2 评估指标与人类对信息满意度的判断是否一致? 即使一个指标对内容和角色画像变化敏感,也只有在其判断与真实读者的判断一致时才有用。我们进行了一项专家人工评估,标注员根据指定的查询和角色画像对摘要进行评分,并测量这些人类判断与自动指标产生分数之间的相关性。 在此,我们表明许多流行的指标,包括强大的LLM裁判指标,未能通过针对摘要信息内容的简单扰动测试。因此,我们进一步观察到相同的指标与人类对信息满意度的评判一致性较差,这并不令人意外。综合来看,我们的结果表明,传统指标和基于LLM的指标均未能充分捕捉信息满意度,而面向用户的摘要进展需要明确建模摘要为谁而做以及他们想了解什么的评估框架。 ## 2. 相关工作 **自动摘要评估**历史上一直以与参考摘要的n-gram重叠度为中心,最著名的是ROUGE(36 (https://arxiv.org/html/2608.14457#bib.bib1))。尽管简单且可重现,ROUGE奖励表面重叠而非语义等价,并且与人类对质量的判断相关性较弱(37 (https://arxiv.org/html/2608.14457#bib.bib2); 4 (https://arxiv.org/html/2608.14457#bib.bib3))。基于嵌入的度量,如BERTScore(63 (https://arxiv.org/html/2608.14457#bib.bib4))和MoverScore(64 (https://arxiv.org/html/2608.14457#bib.bib5)),通过比较上下文化表示来解决这个问题,而学习型度量如BLEURT(50 (https://arxiv.org/html/2608.14457#bib.bib6))则直接在人类评分上训练。另一条平行的工作线针对摘要质量的特定方面,特别是事实一致性,度量包括FactCC(32 (https://arxiv.org/html/2608.14457#bib.bib7))、QAGS(59 (https://arxiv.org/html/2608.14457#bib.bib8))、QuestEval(48 (https://arxiv.org/html/2608.14457#bib.bib9))和SummaC(34 (https://arxiv.org/html/2608.14457#bib.bib10))。最近,大语言模型被直接用作摘要质量的评估者,并被证明在摘要评估的多个方面优于早期的自动指标(38 (https://arxiv.org/html/2608.14457#bib.bib11); 15 (https://arxiv.org/html/2608.14457#bib.bib12); 7 (https://arxiv.org/html/2608.14457#bib.bib13))。这些指标共享一个共同假设,即摘要质量可以独立于读者进行评估,而这正是我们所质疑的假设。 **查询聚焦摘要(QFS)**生成针对用户提供的查询定制的摘要,而不是产生通用的概要(10 (https://arxiv.org/html/2608.14457#bib.bib15); 9 (https://arxiv.org/html/2608.14457#bib.bib16)),其方法范围从早期根据查询相关性评分句子的抽取式方法(58 (https://arxiv.org/html/2608.14457#bib.bib17); 44 (https://arxiv.org/html/2608.14457#bib.bib18))到生成查询条件抽象摘要的神经网络系统(3 (https://arxiv.org/html/2608.14457#bib.bib19); 62 (https://arxiv.org/html/2608.14457#bib.bib20); 55 (https://arxiv.org/html/2608.14457#bib.bib21); 17 (https://arxiv.org/html/2608.14457#bib.bib61)),并有QMSum(66 (https://arxiv.org/html/2608.14457#bib.bib22))和AQuaMuSe(33 (https://arxiv.org/html/2608.14457#bib.bib23))等数据集支持。另一条平行的工作线根据读者属性调整摘要,包括指定长度、风格或重点的可控系统(14 (https://arxiv.org/html/2608.14457#bib.bib24); 24 (https://arxiv.org/html/2608.14457#bib.bib25))、针对儿童、专家或外行等群体的受众自适应方法(6 (https://arxiv.org/html/2608.14457#bib.bib26); 1 (https://arxiv.org/html/2608.14457#bib.bib27); 20 (https://arxiv.org/html/2608.14457#bib.bib28); 41 (https://arxiv.org/html/2608.14457#bib.bib29))以及基于角色的大语言模型提示(12 (https://arxiv.org/html/2608.14457#bib.bib30); 26 (https://arxiv.org/html/2608.14457#bib.bib31))。然而,QFS评估在很大程度上依赖于应用于查询特定摘要的基于参考的指标(66 (https://arxiv.org/html/2608.14457#bib.bib22); 55 (https://arxiv.org/html/2608.14457#bib.bib21));我们的工作通过将每个查询与一个明确的读者角色画像配对并探究现有指标是否能检测信息内容的查询条件差异来扩展这一框架。 **人工评估**已有许多包含摘要质量人工标注的数据集发布,实现了自动指标的元评估。SummEval(13 (https://arxiv.org/html/2608.14457#bib.bib32))提供了系统在CNN/DailyMail上输出的专家评分,涵盖连贯性、一致性、流畅性和相关性。FRANK(45 (https://arxiv.org/html/2608.14457#bib.bib33))贡献了细粒度的事实错误标注,而53 (https://arxiv.org/html/2608.14457#bib.bib34)则将其扩展到更多摘要器和数据集的错误标注。最近的基准测试通过系统输出的两两比较引出偏好判断(21 (https://arxiv.org/html/2608.14457#bib.bib35); 39 (https://arxiv.org/html/2608.14457#bib.bib36))。在这些资源中,标注的收集未参考特定读者的目标;我们的评估将判断锚定于指定的角色画像和查询,从而能够直接测量信息满意度。 ## 3. 实验设置 **RQ1** (https://arxiv.org/html/2608.14457#S1.SS0.SSS0.Px1) 我们通过将对照扰动应用于参考摘要并测量每个指标是否按预期方向响应,来评估自动摘要指标的鲁棒性。 我们从4个科学摘要语料库中抽取样本,这些语料库涵盖不同领域、文档长度和目标受众。arXiv和PubMed(8 (https://arxiv.org/html/2608.14457#bib.bib55))提供带有摘要的长文档科学文章,而SciTLDR(5 (https://arxiv.org/html/2608.14457#bib.bib56))提供了计算机科学论文的极端单句TL;DR摘要。eLife包含生物医学文章的编辑撰写的科普摘要(20 (https://arxiv.org/html/2608.14457#bib.bib28))。对于每个数据集,我们使用测试集并子抽样N=50篇文档用于实验。 我们评估了涵盖摘要文献中使用的主要类别的广泛指标集。对于与参考摘要的词汇重叠,我们包括ROUGE-1/2/L(36 (https://arxiv.org/html/2608.14457#bib.bib1))、BLEU(46 (https://arxiv.org/html/2608.14457#bib.bib57))、chrF(47 (https://arxiv.org/html/2608.14457#bib.bib37))和METEOR(2 (https://arxiv.org/html/2608.14457#bib.bib38))。我们还报告了一组摘要本身的表层统计数据,通过DataStats(23 (https://arxiv.org/html/2608.14457#bib.bib42))计算:抽取覆盖率、抽取密度、压缩率、相对于源文档的新颖1/2/3-gram百分比以及摘要长度。一个基于spaCy(25 (https://arxiv.org/html/2608.14457#bib.bib48))的句法复杂性度量(以单词和句子为单位测量)作为仅捕捉摘要表层属性的无参考基线包含在内。我们使用SumEval包计算上述指标(13 (https://arxiv.org/html/2608.14457#bib.bib32))。 对于非词汇、基于嵌入和基于模型的评估,我们包括BERTScore(63 (https://arxiv.org/html/2608.14457#bib.bib4)),它使用上下文化嵌入计算令牌级的余弦相似度。111我们使用默认的RoBERTa-large模型进行BERTScore。我们进一步包括了无参考指标SUPERT(18 (https://arxiv.org/html/2608.14457#bib.bib39))、SummaQA(49 (https://arxiv.org/html/2608.14457#bib.bib40))和BLANC(54 (https://arxiv.org/html/2608.14457#bib.bib41)),这些指标仅根据源文档对摘要进行评分。 对于基于LLM的评估,我们在两个评判者下运行每个指标:一个较大的Llama-3.3-70B模型222meta-llama/Llama-3.3-70B-Instruct和一个较小的Prometheus-7B模型333prometheus-eval/prometheus-7b-v2.0(28 (https://arxiv.org/html/2608.14457#bib.bib58); 22 (https://arxiv.org/
相似文章
评估文本摘要的抽象性度量:一种改进的公式及其经验验证
本文引入了参考抽象度(RA)、摘要抽象度(SA)和抽象比率(AR)等度量指标,通过使用文档长度的调和均值与三次非重叠因子来量化文本摘要中的抽象性。在XSUM数据集上对四种模型进行的经验评估表明,这些度量能够有效区分抽取式摘要和生成式摘要,并能识别潜在的幻觉问题。
通过偏好学习从多个不完美指标优化摘要的事实一致性
本文介绍了一种通过偏好学习聚合多个弱指标的分数来提高文本摘要事实一致性的方法,在各种语言模型上实现了一致的事实性提升。
SCURank:利用摘要内容单元对多个候选摘要进行排序,提升摘要质量
SCURank 引入“摘要内容单元”对候选摘要打分,使从多个大模型蒸馏出的小模型超越传统指标与单一模型蒸馏效果。
文本语义信息的几何轮廓:框架条件唯一性与标量摘要的权衡三角形
本文开发了一个几何框架,利用句子嵌入来衡量文本的语义内容,提出了一个三维语义轮廓(新颖性、广度、整合性)和一个标量权衡三角形,并在合成类别和小说中进行了验证。
抽象摘要中关系级幻觉评估的基于依据的分解框架
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。