仅凭表面判断:清理LLM真实性基准以避免表面特征泄露
摘要
本文识别了如TruthfulQA等真实性基准中的表面特征泄露问题,在此问题中,模型可以通过利用答案形式差异来作弊,并介绍了Audit-Prune来清理基准,确保更可靠的评估。
查看缓存全文
缓存时间: 2026/09/14 08:42
# 以貌取机:清理大语言模型真实性评估基准中的表层特征泄露问题 来源:https://arxiv.org/html/2609.13003 Remy Ogasawara 附属机构:犹他大学 Amirali Abdullah 附属机构:Thoughtworks Cullen Anderson 附属机构:马萨诸塞大学阿默斯特分校 Narmeen Fatimah Oozeer 附属机构:Martian AI Jeff M. Phillips 附属机构:犹他大学 邮箱:[[email protected]](mailto:) ###### 摘要 二选一的真实性基准要求模型在正确与错误答案间做出选择,但如果两个答案在表层特征上存在系统性差异,模型无需进行预期推理也能超越随机水平。我们证明了这种失效模式可以被检测到,并且能被下游分类器所利用。在 TruthfulQA 基准中,一个简单的六特征逻辑回归分类器就能以显著精度区分正确与错误答案。我们进一步展示了其他基准中也存在类似的表层特征伪影。为此,我们开发了一种通用机制,通过移除最易加剧泄露的问题对来清理这些基准。我们发布了一个表层特征泄露已降低至接近随机水平的 TruthfulQA 版本,并提供了 Audit-Prune 机制,以便在数据集发布前进行清理。 ## 1 引言 一个基准测试的分数只有在其真正测试了它声称要测试的内容时,才具有可解释性。在二选一评估中,这一条件可能悄然失效:如果正确与错误的答案在表层形式上存在系统性差异,模型无需进行任何预期推理就能超越随机准确率。这可能导致模型通过“黑入”基准来人为提升排行榜分数,却缺乏相应能力,并且这种情形对基于标准准确率的评估不可见;只有当答案文本本身被深入探查时才会暴露。或者更糟的是,在基准上训练或许能提高模型的分数,但*并非真正提升*其能力。 这一问题在二选一设置中尤为突出,即使标签精心平衡的评估,如果每对中的某一方在系统性书写方式上不同,也依然脆弱。TruthfulQA(Lin 等人,2022 (https://arxiv.org/html/2609.13003#bib.bib32))是评估语言模型是否会复现常见人类虚假信息的公认基准,它针对的是模型规模扩展本身无法解决的弱点。它作为真实性标准基线的地位体现在其被广泛用于各大测试管道,包括 lm-evaluation-harness(Gao 等人,2024 (https://arxiv.org/html/2609.13003#bib.bib18))和 OpenCompass 安全指标(OpenCompass Contributors, 2023 (https://arxiv.org/html/2609.13003#bib.bib42))。由于它还被嵌入众多评估套件(Biderman 等人,2023 (https://arxiv.org/html/2609.13003#bib.bib6); Maia Polo 等人,2024 (https://arxiv.org/html/2609.13003#bib.bib35); Liang 等人,2023 (https://arxiv.org/html/2609.13003#bib.bib31))和公开排行榜(LLM-Stats, 2026 (https://arxiv.org/html/2609.13003#bib.bib34); Beeching 等人,2023 (https://arxiv.org/html/2609.13003#bib.bib4)),表层伪影带来的风险极高。如果 TruthfulQA 包含答案形式的捷径,这些伪影可能会扭曲广为宣传的模型比较结果。 认识到其原始的多项选择格式允许使用捷径启发式(如“奇数排除”推理和干扰项间的释义消除),作者近期发布了一个改进的二选一版本(Lin 等人,2025 (https://arxiv.org/html/2609.13003#bib.bib33)),为每个问题配对一个正确答案和一个最佳错误答案。这一重新设计解决了其针对的多项选择伪影问题,但并不能保证配对的参考答案本身在形式上是平衡的。我们表明,二选一版本仍可通过另一类捷径(Geirhos 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib21))被利用:如果正确和错误答案在表层形式上持续存在差异(如否定词开头、模糊表达、长度不同),基准分数可能在一定程度上反映的是风格不对称性而非与真实性相关的能力。 先前的研究已表明,多种标注伪影能够仅凭浅层词汇信息在若干基准家族中支持超越随机水平的预测(Gururangan 等人,2018 (https://arxiv.org/html/2609.13003#bib.bib23); McCoy 等人,2019 (https://arxiv.org/html/2609.13003#bib.bib37); Webson 和 Pavlick, 2022 (https://arxiv.org/html/2609.13003#bib.bib56); Le Bras 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib28))。更近期的研究中,Anderson 等人(2026)(https://arxiv.org/html/2609.13003#bib.bib1) 论证了构建伪影也可能扭曲用于大语言模型指导的训练数据。这些发现共同表明,数据集审计不仅应询问一个基准是否具有挑战性,还应关注在任何预期推理发生之前,模型可以获得何种信息。 在本文中,我们使用一个刻意简单的分类器对 TruthfulQA 和另外十三个基准的表层特征进行审计,并证明检测到的捷径可以被下游分类器所利用。我们演示的泄露使用了六个可解释的表层特征(主要是否定词)应用于答案字符串。仅凭这些特征,逻辑回归在 TruthfulQA 上以分组交叉验证准确率 0.689 区分正确与错误答案,远超随机水平。我们可以将这些相同特征应用于其他几个基准。在我们考察的 14 个基准中,有几个显示出显著泄露,其中两个(HaluEval QA 和 MedHallu)甚至超过了 TruthfulQA。我们的工作扩展了先前关于标注伪影的发现(Gururangan 等人,2018 (https://arxiv.org/html/2609.13003#bib.bib23); McCoy 等人,2019 (https://arxiv.org/html/2609.13003#bib.bib37); Schuster 等人,2019 (https://arxiv.org/html/2609.13003#bib.bib50)),表明表层泄露不仅可检测,而且可以通过分类器引导的清理过程加以解决。 图 1:Audit-Prune 概览。左:四个 TruthfulQA 问题对,突出显示线索词及其 Surface6 特征向量。中:迭代评分、移除、重新拟合和添加回溯。右:保留的问题对构成 TruthfulQA-476。 最终,我们有三个主要贡献。 (1) 检测 TruthfulQA 中的严重泄露。此数据集对 AI 安全至关重要,我们证明了仅考虑表层特征(Surface6)——这些特征并非设计用于评估陈述的*真实性*——就能达到显著的准确率。 (2) 一种清理此类数据泄露的通用机制。我们的通用机制 Audit-Prune 通过识别并移除最易强化这些特征的问题对来清理数据集;参见图 1 (https://arxiv.org/html/2609.13003#S1.F1)。由此产生的数据集该泄露程度已得到控制且可接受。其他数据集也可以用我们的 Surface6 进行审计,该机制同样适用。 (3) 一个已清理的 TruthfulQA 数据集。我们发布了一个新的清理版 TruthfulQA-476 数据集。它是 TruthfulQA 二选一数据集的一个子集,包含 476 个问题对,但六特征审计几乎无法区分其答案(AUC 0.528,p=0.048)。我们证明了它在评估真实性方面与完整 TruthfulQA 具备同等能力,同时在对抗性设置下更不易受骗。 https://huggingface.co/datasets/foadnamjoo/audit-prune ### 1.1 相关工作 标注伪影和数据集捷径一直是 NLP 评估中的持续关注点(Gururangan 等人,2018 (https://arxiv.org/html/2609.13003#bib.bib23))。这一普遍现象现被称为捷径学习(Geirhos 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib21); Du 等人,2024 (https://arxiv.org/html/2609.13003#bib.bib16));Niven 和 Kao (2019) (https://arxiv.org/html/2609.13003#bib.bib41)、Gardner 等人 (2021) (https://arxiv.org/html/2609.13003#bib.bib20) 和 Pacchiardi 等人 (2024) (https://arxiv.org/html/2609.13003#bib.bib44) 将伪影形式化为与能力无关但能预测标签的特征。我们专注于使用简单的固定六特征族对配对的二选一设置进行审计,并提供修剪补救措施。Gururangan 等人 (2018) (https://arxiv.org/html/2609.13003#bib.bib23) 表明仅假设模型在 SNLI 上达到约 67% 的准确率,Poliak 等人 (2018) (https://arxiv.org/html/2609.13003#bib.bib47) 将这一发现推广到十个 NLI 数据集;我们在 2.2 节 (https://arxiv.org/html/2609.13003#S2.SS2) 的结构性表层特征探针下复制了这一发现,在 SNLI 和 MultiNLI 上获得了适度的超越随机水平的提升,McCoy 等人 (2019) (https://arxiv.org/html/2609.13003#bib.bib37) 则证明了 NLI 模型利用的是句法启发式而非真正的推理。 #### 数据集过滤 对抗性过滤(AFLite)由 Sakaguchi 等人 (2021) (https://arxiv.org/html/2609.13003#bib.bib49) 提出,并由 Le Bras 等人 (2020) (https://arxiv.org/html/2609.13003#bib.bib28) 推广,旨在在数据集构建时移除此类伪影。它训练一个线性分类器集成,基于固定神经嵌入,并迭代丢弃最易预测的实例。AFLite 使用不透明嵌入,并最小化在这些嵌入下的可预测性,而我们的 Audit-Prune 使用一小组潜在可解释的表层特征,并针对指定的泄露阈值进行清理,同时保持模型排名。此外,我们的特征可以被设计成绝不编码任务的有效性。我们在 3.3 节 (https://arxiv.org/html/2609.13003#S3.SS3) 中直接将两者作为清理器进行比较。另一个相关的数据集级过滤器是数据集图谱(Swayamdipta 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib52)),它使用训练动态,因此需要运行训练过程,这与我们基于冻结评估集的审计不同。Webson 和 Pavlick (2022) (https://arxiv.org/html/2609.13003#bib.bib56) 表明基于提示的模型可以利用虚假的模板线索。最近,Brown II 等人 (2026) (https://arxiv.org/html/2609.13003#bib.bib9) 使用 k 折纯文本诊断法迭代修剪图像和视频基准,扩展了部分输入基线研究(Gururangan 等人,2018 (https://arxiv.org/html/2609.13003#bib.bib23); Poliak 等人,2018 (https://arxiv.org/html/2609.13003#bib.bib47); Belinkov 等人,2019 (https://arxiv.org/html/2609.13003#bib.bib5));与 Audit-Prune 不同,两者均未考虑配对特性,也未设定预先声明的残余泄露目标。 #### 数据集调整 修剪是解决数据集偏差的几种补救措施之一;其他方法包括重新加权或重采样示例(Li 和 Vasconcelos, 2019 (https://arxiv.org/html/2609.13003#bib.bib30)),在训练时折扣已知偏差(Clark 等人,2019b (https://arxiv.org/html/2609.13003#bib.bib13); He 等人,2019 (https://arxiv.org/html/2609.13003#bib.bib24); Utama 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib55)),或重写项目使表层线索不再能预测标签(Kaushik 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib26); Gardner 等人,2020 (https://arxiv.org/html/2609.13003#bib.bib19))。训练时去偏差并未修复评估集本身,而重写会产生需要重新验证真实性标签的新文本;修剪则仅保留原始、已验证的问题对。 #### 真实性与事实验证 一个相关但不同的类别是过滤那些预训练大语言模型仅凭选项就能回答的项目(Gupta 等人,2025 (https://arxiv.org/html/2609.13003#bib.bib22); Cao 等人,2026 (https://arxiv.org/html/2609.13003#bib.bib10));在真实性配对上,这主要反映世界知识而非表层形式,这种门控可能无法迁移到更强的保留模型(Ovcharov, 2026 (https://arxiv.org/html/2609.13003#bib.bib43))。在事实验证领域,Schuster 等人 (2019) (https://arxiv.org/html/2609.13003#bib.bib50) 表明 FEVER 标签可仅从主张文本中预测,其中否定是主要线索,这启发了 FeverSymmetric 构建。Schuster 等人 (2021) (https://arxiv.org/html/2609.13003#bib.bib51) 提出对比修订作为一种去偏差策略,本研究也对此进行了审计。Turner 和 Kurzeja (2025) (https://arxiv.org/html/2609.13003#bib.bib54) 发现原始的多项选择 TruthfulQA 可以通过应试启发式被“玩转”,具体表现为“奇数排除”和“释义消除”行为,这使得一个无需访问问题的小型分类器也能达到接近最先进的准确率。TruthfulQA 作者对此作出回应,发布了二选一版本(Lin 等人,2025 (https://arxiv.org/html/2609.13003#bib.bib33)),并推荐将其作为默认评估设置,当代模型在其上已接近人类基线。Chandak 等人 (2025) (https://arxiv.org/html/2609.13003#bib.bib11) 随后表明,一个作为仅选项分类器微调的语言模型(Qwen3-4B),从未看到问题,在 TruthfulQA-v2 上达到 83% 的准确率,并在其他多项选择基准上也获得高准确率,他们提出答案匹配作为补救措施;我们的审计针对配对二选一格式,使用六个可解释特征,并修复现有基准而非替换其格式。Balepur 等人 (2024 (https://arxiv.org/html/2609.13003#bib.bib2); 2025 (https://arxiv.org/html/2609.13003#bib.bib3))也得出了类似观察。通过直接使用语言编码器,这些结果证明了泄露的存在,但其方式比我们的方法更像黑箱且诊断性较弱。选项顺序也可能使多项选择评估产生偏差(Zheng 等人,2024 (https://arxiv.org/html/2609.13003#bib.bib58))。 #### 我们的工作通过识别一个更易解释的捷径家族,补充了这一研究方向。虽然我们构建它是为了理解 TruthfulQA,但这些特征在不同程度上也适用于其他评估家族——在许多情况下同样显示出泄露。这使得可以对这些评估集(第 2.2 节 (https://arxiv.org/html/2609.13003#S2.SS2))进行审计以诊断泄露的性质。此外,由于这些特征是有限且固定的,我们可以用它们来清理评估集,生成更平衡的子集,而不会实质性改变其含义(除非为了避免这种泄露)。 图 2:用于检测表层泄露的所有六个特征仅从答案字符串计算得出。 ## 2 检测表层泄露 我们开发了一小组表层文本特征,称为 Surface6(图 2 (https://arxiv.org/html/2609.13003#S1.F2)),适用于短文本问答——这是大语言模型评估集的常见格式。我们认为这些特征通常与正确答案相关,但不编码任何关于正确性的明确信息。这些特征涉及否定、模糊表达和长度,但不使用嵌入、语义表示或预训练模型。 ### 2.1 审计 TruthfulQA 我们专注于 TruthfulQA(Lin 等人,2022 (https://arxiv.org/html/2609.13003#bib.bib32); Lin 等人,2025 (https://arxiv.org/html/2609.13003#bib.bib33)),这是 AI 安全评估中最突出的数据集。特别是,我们关注近期重新发布的(Lin 等人,2025 (https://arxiv.org/html/2609.13003#bib.bib33))二选一形式111。原始 TruthfulQA 报告了 38 个类别的 817 个问题。官方的 TruthfulQA.csv 提供了 37 个类别的 790 个问题对,因为 27 个问题没有精心策划的“最佳错误答案”而被排除在二选一子集之外。我们使用的是...
相似文章
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
TruthfulQA:衡量模型模仿人类虚假信息的程度
# TruthfulQA:衡量模型模仿人类虚假信息的程度 来源:[https://openai.com/index/truthfulqa/](https://openai.com/index/truthfulqa/) ## 摘要 我们提出了一个基准来衡量语言模型在生成问题答案时是否真实。该基准包含817个问题,跨越38个类别,包括卫生、法律、金融和政治。我们精心设计了一些问题,其中一些人会因为错误的信念或误解而错误地回答。要表现良好,模型必须
我们形式化基准测试中的缺陷:Lean定理证明的数据集缺陷和评估失败
本文对五个广泛使用的Lean定理证明基准进行了审计,发现了398个机械可验证的问题,例如反例、空洞定理和不健全的公理。它提出了一个故障分类法、自动化检查器和发布标准,以提高评估的可靠性和可信度。
知其形,不知其用:自动审计法律基准中的答案与权威依据脱钩
本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。
[论文] 主要基准测试被发现存在污染,多达12%的问题有缺陷
本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。