无标签策略下准确性与顺序敏感性出现分化

arXiv cs.CL 论文

摘要

本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。

arXiv:2608.11947v1 公告类型:新 摘要:多项选择基准被广泛用于评估大型语言模型,但 MCQ 分数将知识与对选项顺序的敏感性混为一谈,使其成为不可靠的模型知识度量。在本文中,我们测试了在模型确定答案时阻止其看到选项标签是否能消除位置影响,并进而提升性能。我们评估了两种不同的偏差缓解策略。第一种采用先生成后匹配的方法,第二种则对选项进行独立评分,这种方法在构造上就是位置无偏的。两者都无法可靠地提高准确性。完整的分解分析表明,瓶颈在于隐藏选项,而非匹配步骤。唯一能持续匹配基线的配置是向模型展示所有选项并搭配 LLM 匹配器的设置。然而,完全消除位置影响仍然不能可靠地带来准确性提升,而循环排列往往能够改善准确性。对于两阶段提示,召回不平衡的聚合度量以及逐问题的直接顺序敏感性度量都无法显示可靠的去偏效果。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:29

# 无标签策略下准确率与顺序敏感性出现分化

Source: https://arxiv.org/html/2608.11947

Chen Feng  
所属机构:Queen's University Belfast  
邮箱:[[email protected]](mailto:)

###### 摘要

选择题基准被广泛用于评估大语言模型,但选择题分数将知识与对选项顺序的敏感性混为一谈,因此无法可靠衡量模型知识。本文检验一个前提:如果模型在作答时看不到选项标签,能否消除位置影响并进而提高性能。我们评估了两种不同的偏差缓解策略。第一种是“先生成后匹配”(generation-then-matching)方法;第二种是对选项进行孤立评分,该策略在构造上就无位置偏差。两种策略都不能可靠地提高准确率。完整的分解分析表明,瓶颈在于不提供选项,而不是匹配步骤。唯一能持续接近基线的配置,是向模型展示所有选项并配合 LLM 匹配器。然而,完全消除位置影响仍然不能可靠地带来准确率提升,而循环置换反而经常能提升准确率。对于两阶段提示,一个聚合的召回不平衡指标和一个直接的逐问题顺序敏感性指标,都无法显示可靠的去偏效果。

## 1 引言

选择题(MCQ)基准是占主导地位的评估格式之一[6](https://arxiv.org/html/2608.11947#bib.bib9);[3](https://arxiv.org/html/2608.11947#bib.bib10),因为与其他格式相比,它们运行成本低,并且可以自动评分。然而,分数的可信度取决于评估的稳健性。模型在 MCQ 基准上的准确率并不能区分知识与对选项顺序的敏感性[11](https://arxiv.org/html/2608.11947#bib.bib2);[15](https://arxiv.org/html/2608.11947#bib.bib1);[14](https://arxiv.org/html/2608.11947#bib.bib6)。这促使人们研究一系列减少选项顺序效应的方法。许多这类缓解策略要么带来成本,要么带来访问权限要求。假设 k 表示每道题的选项数量,循环置换和全置换不需要访问 logits,但每道题分别需要 k 次和 k! 次调用,这并非总是可行。PriDe[15](https://arxiv.org/html/2608.11947#bib.bib1) 每道题只需一次调用,外加固定的校准开销,但它要求 logits 访问,而许多提供商并不暴露 logits。这些限制促使人们从提示设计(prompt design)入手获得稳健性,而不是通过重复查询或 logits 访问。本文检验一个前提:如果模型在作答时从未看到选项标签,那么选项顺序就无法影响预测。第一种策略是两阶段提示。模型首先只收到问题并生成自由文本答案。然后,在第二阶段,模型将该自由文本答案与最接近的选项进行匹配。第二种策略是独立假设评分(independent hypothesis scoring),其思路不同。模型被提示 k 次;每次调用呈现问题和一个选项,并要求模型为其评分。所有选项评分完毕后,选择得分最高的选项。该策略在构造上就无位置偏差,因为每次调用都是孤立的,没有位置影响响应。我们在两个基准上测试了六个模型,涵盖专有和开放权重系统。我们发现这两种策略都不能可靠地提高准确率。两阶段提示几乎对所有“模型–基准”组合都会降低准确率;独立假设评分则更为复杂:它降低大多数模型的准确率,但提高了 Llama-local,且提升集中在 ARC-Challenge 上。我们沿两个因素对两阶段提示进行分解:第一阶段选项是隐藏还是可见,以及第二阶段使用 LLM 调用还是基于嵌入的语义匹配。分解显示,当第二阶段 LL

相似文章

论大型语言模型评估中提示排名的稳定性

arXiv cs.CL

本文系统研究了常见变异来源下,大型语言模型评估中提示排名的稳定性,发现表现最佳的提示经常发生变化。为此,提出了一种基于下置信界的稳定性感知选择策略,以提高鲁棒性。

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……