Know2Guess:一种面向大型语言模型知识边界评估的污染感知多区域基准
摘要
本文介绍了Know2Guess,一种污染感知的多区域基准,旨在评估大型语言模型从可回答知识到预期拒答的转换,解决数据污染、提示敏感性和拒绝行为问题。作者评估了FLAN-T5、Qwen2.5-Instruct和Llama-3-Instruct模型,发现更强的模型表现出选择性但不完全的拒答。该基准和数据集已公开发布。
查看缓存全文
缓存时间: 2026/06/26 05:13
# Know2Guess:面向大语言模型知识边界的污染感知多区域基准评估
来源:https://arxiv.org/html/2606.26101
11institutetext:安徽大学,合肥,中国
11email:R32314095@stu\.ahu\.edu\.cn, wd2324041@stu\.ahu\.edu\.cn
*共同贡献Bowen Zhang*Jian WangXican WangHaoyi WuXuanyan QiuShengan Yang
###### 摘要
对大型语言模型进行可靠评估,需要将基于知识的回答与缺乏支持的猜测区分开来,同时避免将二者与数据污染、提示特异性或通用拒绝行为相混淆。本文提出一个具有污染意识的多区域基准,用于衡量在冻结的构建时标签下,从可回答知识到预期弃权的未知信息的过渡。该基准包含跨五个领域的1,200个项目,明确标注了弃权预期、污染风险元数据,并配备了官方严格解析器和标准化鲁棒解析器的双重解析机制。我们使用固定的“回答或弃权”提示、纯回答控制以及提示模板变体,评估了FLAN-T5、Qwen2.5-Instruc和Llama-3-Instruc系列模型。该基准并未因通用无回答行为而被破解:FLAN基线在有效弃权方面仍然薄弱,而更强的指令调优模型则显示出从回答到弃权的选择性但不完全的转变。Qwen2.5-3B-Instruc模型在整体可靠性上表现最佳,但预期回答的区域仍然困难,校准效果依然不佳,且良性项目拒绝行为依旧存在。提示和解析器鲁棒性分析保持了主要排序和定性结论。因此,该基准提供了一个可复现的协议,用于审计可回答性、弃权、拒绝和污染作为LLM可靠性中不同但相互作用的维度。数据集公开可见于 https://github.com/renweimeng/Know2Guess-A-Contamination-Aware-Multi-Zone-Benchmark。
## 1引言
大型语言模型能生成流畅的答案,远超其知识支持的边界。当模型正确时,此行为有用;但当无根据的猜测以不当自信表达时,代价高昂。因此,评估不能再仅仅归结为原始答案准确率。真实性、幻觉、校准和选择性弃权对于面向部署的可靠性都很重要,然而它们常常在各自不兼容的假设下用不同的协议进行衡量[13 (https://arxiv.org/html/2606.26101#bib.bib1),9 (https://arxiv.org/html/2606.26101#bib.bib2),12 (https://arxiv.org/html/2606.26101#bib.bib3),8 (https://arxiv.org/html/2606.26101#bib.bib4),6 (https://arxiv.org/html/2606.26101#bib.bib6)]。一个仅对答案评分的基准可能奖励自信的捏造;一个不加区分地奖励无回答行为的基准则可能将认知谨慎与通用拒绝混为一谈。
近期的评估工作取得了实质性进展,但仍存在重要空白。真实性和幻觉基准揭示了模型生成虚假或无法验证内容的频率[13 (https://arxiv.org/html/2606.26101#bib.bib1),9 (https://arxiv.org/html/2606.26101#bib.bib2)]。HELM等广泛评估套件表明,模型质量是多维度的,仅凭准确率隐藏了重要的权衡[12 (https://arxiv.org/html/2606.26101#bib.bib3)]。动态或时间敏感的评估减少了数据泄露并更直接地衡量新鲜度[10 (https://arxiv.org/html/2606.26101#bib.bib19),19 (https://arxiv.org/html/2606.26101#bib.bib20)]。提示敏感的知识边界研究进一步表明,模型的表观知识可能因释义或查询优化而改变[23 (https://arxiv.org/html/2606.26101#bib.bib21)]。然而,这些研究路线未能共同提供一个冻结的协议,以区分可回答项与预期弃权的未知项、将污染作为元数据追踪、区分基准弃权与策略拒绝,并报告对提示和解析的鲁棒性。
第二个困难是概念性的。弃权不仅仅是未给出答案。在选择性预测中,系统只应在错误风险足够高时拒绝回答[4 (https://arxiv.org/html/2606.26101#bib.bib5),18 (https://arxiv.org/html/2606.26101#bib.bib17)]。在语言模型中,这一决策进一步与自我认知、自信激发、对齐和安全性风格纠缠在一起[8 (https://arxiv.org/html/2606.26101#bib.bib4),6 (https://arxiv.org/html/2606.26101#bib.bib6),21 (https://arxiv.org/html/2606.26101#bib.bib18)]。模型可能知道它不知道,但也可能出于与认知不确定性无关的策略原因而拒绝回答。相反地,模型可能产生符合解析器要求的答案,但语义上却缺乏支持。如果目标是理解知识与幻觉之间的边界,这些情况不应被归入单一的“无回答”类别。
本文通过一个具有污染意识的多区域基准和锁定的评估协议来解决这个问题。该基准包含跨五个领域的1,200个项目,并为每个项目分配一个固定的构建时区域。区域A–C是预期回答的,但在答案流行度和边界难度上有所不同;区域D是预期弃权的,构造为风格匹配的合成未知项。每个项目发布时附带来源、污染风险元数据和审查注释。评估使用结构化的“回答或弃权”提示、纯回答控制、官方严格解析器以及用于鲁棒性的标准化解析器。主要指标是可靠性,它对预期回答项的正确回答和预期弃权项的正确弃权给予奖励,同时单独报告有效弃权、拒绝、校准和边界清晰度。
我们的实证主张是刻意有限的。该基准在预先声明的协议下是可执行、可审计且信息丰富的。更强的指令调优模型确实表现出从回答到弃权的选择性转变,但这种行为既非微不足道也未得到解决。FLAN基线在有效弃权方面仍然薄弱。在“回答或弃权”提示下,Qwen2.5-3B-Instruc模型以0.3657的可靠性表现最佳,区域D有效弃权率为0.9249,而Llama-3-8B-Instruc模型对可回答的公开项更准确,但在未知项上选择性较差。在纯回答控制下,两个Qwen检查点性能急剧下降,Llama也出现实质退化。解析器标准化、提示变体和成本敏感评分保持了主要排序和定性结论。同时,预期回答的区域A–C仍然困难,ECE保持高位,良性项目拒绝仍是一个真实的失败模式。因此,不应将本基准解读为弃权问题已解决的证据,而应视为衡量当前模型仍在哪里失败的一种更严格的协议。
## 2相关工作
##### 真实性和幻觉基准。
大量工作评估语言模型是否生成虚假、误导或无法验证的内容。TruthfulQA衡量模型是否更倾向于复现流行的误解而非真实答案[13 (https://arxiv.org/html/2606.26101#bib.bib1)]。HaluEval专注于在指令遵循设置和人工标注输出中进行幻觉识别[9 (https://arxiv.org/html/2606.26101#bib.bib2)]。HELM通过标准化跨不同场景的多指标评估拓宽了视野[12 (https://arxiv.org/html/2606.26101#bib.bib3)]。FreshQA及相关动态事实性基准强调快速变化的知识和错误前提问题,表明当预训练后的世界知识发生变化时,事实性会下降[19 (https://arxiv.org/html/2606.26101#bib.bib20),10 (https://arxiv.org/html/2606.26101#bib.bib19)]。总之,这些基准确立了超越纯准确率进行评估的必要性,但它们通常未能在固定决策协议下隔离预期弃权的未知项。
##### 选择性预测、自我认知与弃权。
选择性预测研究模型何时应回答、何时应弃权[4 (https://arxiv.org/html/2606.26101#bib.bib5),18 (https://arxiv.org/html/2606.26101#bib.bib17)]。在语言模型中,相关工作询问模型是否知道它们所知道的,以及引发出的自信是否足以校准以支持弃权决策[8 (https://arxiv.org/html/2606.26101#bib.bib4),6 (https://arxiv.org/html/2606.26101#bib.bib6)]。近期的综述工作认为,应将弃权作为一种独特能力来分析,该能力由查询、模型和人类价值观共同塑造,而非安全调优的副作用[21 (https://arxiv.org/html/2606.26101#bib.bib18)]。该文献推动我们将弃权视为一等输出,但大多数方法要么假设特定任务的校准,要么评估弃权时未将策略拒绝与认知不确定性明确分开。
##### 动态、新鲜与提示敏感的知识评估。
为了减少污染和陈旧性,近期基准从最近的文档或不断发展的来源构建问题[10 (https://arxiv.org/html/2606.26101#bib.bib19),19 (https://arxiv.org/html/2606.26101#bib.bib20)]。一个相关的研究路线认为,基于单一提示的知识估计是不完整的,因为语言模型可能对释义和查询形式敏感[23 (https://arxiv.org/html/2606.26101#bib.bib21),8 (https://arxiv.org/html/2606.26101#bib.bib4),12 (https://arxiv.org/html/2606.26101#bib.bib3)]。这些研究很重要,因为它们表明模型表观知识不仅取决于存储的事实,还取决于查询的提出方式。然而,动态新鲜度评估和提示敏感边界评估针对的问题略有不同:前者侧重于时间新颖性,后者强调提示依赖性。两者本身都不能产生一个具有污染意识的弃权协议,该协议带有固定的可回答性标签和明确的拒绝核算。
##### 污染分析与数据集文档。
数据污染已成为LLM评估的核心问题,因为基准泄露可能夸大报告性能并模糊记忆与泛化之间的区别[11 (https://arxiv.org/html/2606.26101#bib.bib22),15 (https://arxiv.org/html/2606.26101#bib.bib23),10 (https://arxiv.org/html/2606.26101#bib.bib19)]。近期工作提出了公开污染报告、污染模式分类以及减少时间泄露的基准构建策略[11 (https://arxiv.org/html/2606.26101#bib.bib22),15 (https://arxiv.org/html/2606.26101#bib.bib23),10 (https://arxiv.org/html/2606.26101#bib.bib19)]。与此同时,数据集文档工作认为,发布的基准应暴露来源、范围和已知风险,而非将其视为非正式背景知识[3 (https://arxiv.org/html/2606.26101#bib.bib7)]。这一观点推动了现代评估数据集中明确的污染风险字段、冻结的构建时规则和可审计元数据的发展。
## 3问题形式化与任务定义
我们研究知识边界评估:语言模型是否能回答可回答项目,对故意未知项目弃权,并避免将认知不确定性与策略拒绝混淆。现有基准未能在单一固定协议下共同控制污染风险、弃权预期和拒绝[13 (https://arxiv.org/html/2606.26101#bib.bib1),9 (https://arxiv.org/html/2606.26101#bib.bib2),12 (https://arxiv.org/html/2606.26101#bib.bib3),8 (https://arxiv.org/html/2606.26101#bib.bib4),2 (https://arxiv.org/html/2606.26101#bib.bib8)]。我们的目标是衡量在冻结的构建时标签下,从有支持的回答到无支持的猜测的转变。
每个项目是
xi = \(qi, Gi, zi, ei, oi, ri\),
其中 qi 是问题,Gi 是黄金答案集和评分规则,zi ∈ {A, B, C, D} 是区域标签,ei ∈ {0, 1} 是否预期弃权,oi ∈ {real_public, synthetic_unknown} 是项目来源,ri ∈ {low, medium, high} 是污染风险标签。区域 A–C 为预期回答;区域 D 为预期弃权。区域分配在评估前固定。
解析器将每个补全映射到
ŷi ∈ {ANSWER, ABSTAIN, REFUSE}。
如果 ŷi = ANSWER,则还会提取最终答案 âi 和置信度 ĉi ∈ [0, 1]。REFUSE 表示策略性拒绝,不计入有效弃权。
我们的主要指标是可靠性:
Rel = 1/N Σ_{i=1}^{N} [ 1(ei=0 ∧ ŷi=ANSWER ∧ âi ∈ Gi) + 1(ei=1 ∧ ŷi=ABSTAIN) ]。
它对预期回答项的正确回答和预期弃权项的正确弃权给予同等奖励,因为该基准评估的是知识边界处的决策正确性。为了测试结论是否依赖于这种选择,第7节(https://arxiv.org/html/2606.26101#S7)报告了成本敏感变体。
我们额外报告已答准确率 Acc_ans、弃权率、区域 D 上的有效弃权、拒绝率、已答项上的预期校准误差 ECE([6] (https://arxiv.org/html/2606.26101#bib.bib6))以及边界清晰度
BS = Rel_D - Rel_C,
该指标衡量困难可回答项与预期弃权未知项之间的分离程度。
## 4方法论
### 4.1 来源池与标准化
该基准包含跨五个领域的 1,200 个项目:常识、通用知识问答、医学、多跳推理和科学。真实公开池源自 CommonsenseQA、TriviaQA、MedMCQA、HotpotQA 和 SciQ [17 (https://arxiv.org/html/2606.26101#bib.bib9), 7 (https://arxiv.org/html/2606.26101#bib.bib10), 14 (https://arxiv.org/html/2606.26101#bib.bib11), 22 (https://arxiv.org/html/2606.26101#bib.bib12), 20 (https://arxiv.org/html/2606.26101#bib.bib13)]。所有候选项目被标准化为共享模式,包含问题文本、标准答案、别名、评分规则、来源、领域、污染元数据和审查注释。移除存在未解决歧义、评分不稳定或来源损坏的项目。
从 2,846 个标准化候选项目开始,我们应用精确匹配去重、近似重复过滤和人工合并。最终构建包含 1,200 个项目,使用种子 1337 分为 120 个开发和 1,080 个测试项目。构建时区域计数为 A=420, B=300, C=240, D=240;测试集包含 A=377, B=272, C=218, D=213。
### 4.2 构建时区域分配
区域系统旨在实现分级过渡,而非简单的已知/未知二分。
##### 区域 A。
区域 A 包含预期回答的真实公开项目,且答案流行度相对较高。我们定义
s_pop = 1/3 (s_src + s_alias + s_pilot),
其中 s_src 是源池中的答案频率百分位数,s_alias 是别名覆盖率百分位数,s_pilot 是试点熟悉度。每个领域内得分最高的波段被分配到区域 A。相似文章
Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection
This paper proposes a nuisance-controlled residual-stream probing protocol to detect benchmark contamination in language models, showing that naive probing fails and their corrected method controls false positives while achieving reasonable power.
大型语言模型文化禁忌安全中的“知识-行为差距”
本文介绍了CulShield,这是首个专门用于评估和提升大型语言模型文化禁忌安全性的公开基准,涵盖77个国家和2,020多项禁忌,揭示了模型在交互中未能应用已知禁忌的“知识-行为差距”。
多大型语言模型基准测试的可证明联合去污
提出联合包络符合选择(JECS),一种用于多模型基准去污的符合程序,可证明地控制全局污染率,同时保持比基线更高的统计功效。
WuYuEval:面向固体废物管理的大语言模型多层级基准
WuYuEval 是一个用于评估固体废物管理领域大语言模型的多层级基准,涵盖基础知识、领域推理和专家决策。它包含 4,590 道多选题和 247 道基于场景的开放式问题,并报告了 33 个 LLM 的表现。
LLM弃权的两个维度:答案正确性与问题可回答性
本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。