平均偏差:人类忠实性标注并非局部忠实
摘要
本文来自石溪大学,识别了文本摘要人类忠实性标注中的“平均偏差”:全局人类标签与逐句LLM判断的平均值之间的相关性,优于与严格合取规则的相关性,这意味着即使摘要包含局部事实错误,人类也常常将其标注为忠实。
arXiv:2608.00205v1 公告类型:新
摘要:文本摘要的忠实性评估将模型生成的摘要视为忠实,仅当其每个句子都得到源文档支持:这是一种严格的合取规则,在该规则下,一个不支持的句子就会使整个摘要变得不忠实。然而,大多数忠实性基准只为每个摘要收集一个全局人类标注标签。我们询问这些全局人类标签是否真的实现了合取规则。我们假设,标注者可能在大多数句子忠实时(而非所有句子都忠实时)就接受摘要为忠实。为了验证这一假设,我们使用五个大型语言模型(LLM)评判器作为逐句评分器,覆盖四个广泛使用的忠实性基准。我们发现,全局人类标签与逐句LLM判断的平均值的相关性,优于与严格合取规则实现的相关性。人工审查证实,相当一部分被人类标注为忠实的摘要包含真实的局部事实错误。我们将这种倾向称为平均偏差(Averaging Bias)。我们的结果表明,广泛使用的忠实性基准上的人类标签包含可测量的平均偏差,这呼吁为可信的人类标注设计精心结构化的方案。
查看缓存全文
缓存时间: 2026/08/04 07:39
# 平均偏差:人类忠实性标注并非局部忠实
来源:https://arxiv.org/html/2608.00205
Huajian Zhang†,Yiyang Feng†,Jiawei Zhou
† 表示同等贡献。
{huajzhang, yiyfeng, jiawei.zhou.1}@cs.stonybrook.edu
Stony Brook University
###### 摘要
文本摘要的忠实性评估将模型生成的摘要视为忠实的,仅当它的*每一个*句子都得到源文档支持:这是一种严格的*合取规则*,在此规则下,一个没有支持的句子就足以使相似文章
构建即忠实:基于主张锚定的多文档摘要归因
本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。
测量AI的忠实度——无论好坏
本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。
忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
忠实性度量并不衡量忠实性:基于真实标注的元评估
本文介绍了BonaFide基准,包含来自13个任务和10个模型的3,066个标注的思维链示例,并系统评估了忠实性度量,结果表明大多数度量表现接近随机,且在可靠性和效率方面存在显著局限。
信任却未验证:大型语言模型来源评估中的认知盲区
这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。