忠实性度量并不衡量忠实性:基于真实标注的元评估
摘要
本文介绍了BonaFide基准,包含来自13个任务和10个模型的3,066个标注的思维链示例,并系统评估了忠实性度量,结果表明大多数度量表现接近随机,且在可靠性和效率方面存在显著局限。
查看缓存全文
缓存时间: 2026/05/26 06:42
论文页面 - 忠实度指标并非衡量忠实度:一项基于真实标签的元评估
来源:https://huggingface.co/papers/2605.25052
摘要
研究人员创建了一个包含 3,066 个标注思维链示例的基准测试,涵盖 13 个任务和 10 个模型,系统评估了忠实度指标,结果显示大多数指标表现接近随机,且在可靠性与效率方面存在显著局限。
思维链(Chains of thought, CoTs)已成为解释和审计大语言模型行为的核心工具。然而,越来越多的证据表明,这些推理轨迹往往无法忠实地反映模型预测背后的计算过程。已有多种忠实度指标被提出,但它们是否真的衡量了忠实度仍不得而知。回答这一问题需要真实标签,而由于内部计算不可直接观测,这类标签难以获取。因此,大多数提出指标的论文仅报告绝对分数或与先前指标的比较,而现有少数基准测试则依赖于可解释性或重要性等替代指标,这些属性与正交于忠实度,可能误导对 CoT 是否可信的判断。我们通过构建任务来应对这一挑战,这些任务的输出能够揭示哪些中间计算必然产生了它们,并开发了一条自动化标注流水线,在步骤级别和 CoT 级别生成忠实度的真实标签。基于这一方法论,我们提出了 BonaFide——一个包含 3,066 个标注 CoT 的基准测试,覆盖 13 个任务和 10 个模型,并利用它首次对主流忠实度指标进行了系统评估。我们的实验表明,大多数指标表现接近随机水平,存在强烈的预测偏差,且在较长 CoT 上性能下降。最佳指标在 CoT 级别仅达到 0.70 的 AUROC,而在步骤级别另一指标达到 0.59,且两者均无法跨设置迁移,同时计算成本高昂。我们的结果揭示了当前忠实度评估中的根本性缺陷,并呼吁开发更可靠、更高效的指标。
查看 arXiv 页面(https://arxiv.org/abs/2605.25052)查看 PDF(https://arxiv.org/pdf/2605.25052)项目页面(https://huggingface.co/collections/yoavgurarieh/bonafide)GitHub1(https://github.com/yoavgur/BonaFide)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.25052)
在您的代理中获取此论文:
hf papers read 2605.25052
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.25052 以从此页面链接。
引用此论文的数据集2
yoavgurarieh/BonaFide-Extended 查看器• 约2小时前更新 • 19.5k • 280 • 1 (https://huggingface.co/datasets/yoavgurarieh/BonaFide-Extended)
yoavgurarieh/BonaFide 查看器• 约2小时前更新 • 3.07k • 102 • 1 (https://huggingface.co/datasets/yoavgurarieh/BonaFide)
引用此论文的 Spaces1
包含此论文的合集1
相似文章
测量AI的忠实度——无论好坏
本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。
忠实性作为信息流:评估与训练忠实的思维链推理
本文提出一个框架,通过控制信息流来评估和提升思维链推理的忠实性,使用基于熵、KL散度和梯度的诊断方法,并引入训练干预措施(注意力掩码、梯度掩码、对抗扰动),使推理更加透明,减少对捷径的依赖。
思维链不忠实性的两种模式:模型出错时行为检测失效
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
精确性不等于忠实性:使用完整Oracle进行覆盖感知的接地生成评估
本文指出了无参考忠实性指标中的一个盲点:它们只衡量精确性(即声明是否得到支持),而不衡量召回率(即相关事实的覆盖程度)。作者引入了一种使用Formula 1遥测数据和天气数据的完整Oracle评估,表明高精确度模型往往覆盖不佳,并提出了一个组合指标。
论提高文档生成播客的忠实度
本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。