大型语言模型系统性地偏爱流行选项:在多项选择题中的证据与缓解措施

arXiv cs.CL 论文

摘要

本文识别了大型语言模型中的流行度偏见,即它们在多项选择题中系统性地偏爱流行但不正确的选项,并提出了一种名为PopDebias的缓解技术。

arXiv:2608.29257v1 Announce Type: new Abstract: 多项选择题(MCQs)是评估大型语言模型(LLMs)的标准格式,然而答案选项的流行度可能会混淆评估。现代大型语言模型系统性地偏爱流行但不正确的选项,而非不太流行但正确的选项,这种脆弱性我们称之为\textbf{流行度偏见}。这种模式与置信度校准不良一致:即使流行选项的准确率崩溃,模型置信度仍然很高。为了系统地隔离这种现象,我们引入了\textbf{PopMCQ},一个包含六种控制策略的基准,这些策略在保持正确答案固定的情况下改变选项流行度。在我们最具对抗性的设置中,当所有干扰项都比正确选项更流行时,模型有66%的时间选择流行但错误的答案。为了缓解这种偏见,我们提出了\textbf{PopDebias},一种轻量级的推理时校正方法,它从模型预测中估计并移除流行度先验。它不需要微调,在测试时是无标签的(仅使用一个小的校准集进行参数拟合),并且增加的计算成本可以忽略不计。在22个开源大型语言模型(0.5B到32B参数)上的实验显示了持续改进,在强流行度压力下准确率提升高达54.1个百分点。代码和数据可在 https://github.com/DataScienceUIBK/PopMCQ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:20

# 大语言模型系统性地偏好流行选项:多项选择题中的证据与缓解策略  
来源:https://arxiv.org/html/2608.29257  
Mohammed Ali  
单位:因斯布鲁克大学  
邮箱:[adam\.jatowt@uibk\.ac\.at](mailto:)  
Bhawna Piryani  
单位:因斯布鲁克大学  
Mahmoud Abdalla  
单位:忠北大学  
Adam Jatowt  
单位:因斯布鲁克大学  

###### 摘要  
多项选择题(MCQs)是评估大语言模型(LLMs)的标准格式,但选项的流行度可能混淆评估结果。现代大语言模型系统性地偏好流行但错误的选项,而非较不流行的正确选项——我们将这种漏洞称为**流行度偏差**。这一模式与置信度校准失调一致:即使对于流行选项的准确率下降,模型置信度仍保持较高水平。为系统性地隔离这一现象,我们引入了**PopMCQ**基准,包含六种受控策略,在保持正确答案固定的同时改变选项流行度。在最具对抗性的设置中,当所有干扰项都比正确选项更流行时,模型有66%的时间选择流行但错误的答案。为缓解此偏差,我们提出**PopDebias**——一种轻量级的推理时校正方法,通过估计并移除模型预测中的流行度先验。该方法无需微调,在测试时无标签依赖(仅使用小型校准集进行参数拟合),且增加的计算开销可忽略不计。在22个开源大语言模型(参数量0.5B至32B)上的实验显示一致的改进,在强流行度压力下准确率提升高达54.1个百分点<sup>1</sup>。

代码和数据可在以下地址获取:https://github.com/DataScienceUIBK/PopMCQ。

## 1 引言  
大语言模型(LLMs)对流行实体的事实回忆比对不太知名的实体更准确<sup>2</sup>,其中**流行度**指通过标准化维基百科页面浏览量衡量的实体外部熟悉度(与模型无关的代理指标;参见§3.2)。但当流行度与**真实性**发生冲突时会怎样?在多项选择场景中,看似合理的错误答案与正确答案竞争,这种习得的倾向成为问题:模型选择知名但错误的选项,而非较不知名但正确的答案——我们将此行为称为**流行度偏差**。图1说明了这一点:在多跳问题中,DeepSeek-V2-Lite选择了玛格丽特·德·瓦卢瓦(流行度=1.00;概率=0.276)而非正确选项玛丽·德·美第奇(流行度=0.356)。这种现象具有系统性:表1显示,在保持问题固定的情况下改变干扰项流行度会导致准确率大幅波动和强烈的负相关性——正确性与流行度之间呈负相关。由于实体/事实答案MCQ格式支撑着主要基准测试(如MMLU、AGIEval、C-Eval)和高风险应用,此偏差直接威胁评估可靠性。

**图1**:一个MuSiQue问题,其中DeepSeek-V2-Lite选择了最流行的错误选项(玛格丽特·德·瓦卢瓦,流行度=1.00)而非正确但较不知名的答案(玛丽·德·美第奇,流行度=0.356)。

实体频率与大语言模型的回忆准确率相关,数据集不平衡是机器学习中的已知问题。我们研究了一个独特的后果:当流行但错误的实体作为MCQ干扰项出现时,**熟悉度**会主动与**正确性**竞争。与基于重训练的方法不同,我们在**推理时**诊断并修正这一混淆,使用受控策略(S1–S6;§2.2)在保持问题固定的同时隔离流行度。为做出**受控声明**,我们构建了**PopMCQ**基准,在保持问题和正确答案固定的同时改变选项流行度(§2),包含从最大流行度压力到反向控制的六种策略。此设置使我们能回答三个关键问题:
- • 研究问题1:大语言模型在MCQ设置中是否使用实体流行度作为正确性的捷径?
- • 研究问题2:流行度偏差的潜在机制是什么?
- • 研究问题3:我们能否在不重新训练的情况下缓解它?

最后一个问题很重要,因为许多模型是闭源或已部署的,且流行度有时是有益的(S5),使得简单的惩罚方法有害。我们在四个数据集上对22个大语言模型的实验(§3)表明,流行度偏差普遍且可预测:在对抗条件下,正确性与所选选项流行度之间的**ρ = −0.89**,与置信度校准失调强烈相关。我们还提出了**PopDebias**(§4),这是一种无需微调的推理时方法,将流行度视为可分离的先验并将其移除。PopDebias在**所有4个数据集上的所有22个模型**中均有所改进,准确率提升高达54.1个百分点,并持续降低高流行度选项的选择率。

#### 贡献摘要:
1. 1. 我们引入**PopMCQ**——首个通过MCQ场景中的受控干预**系统性**测量流行度偏差的基准,包含六种受控策略和四个问答数据集。
2. 2. 我们提供了大规模证据(22个模型 × 4个数据集 × 6种策略),表明大语言模型始终偏好流行干扰项,并通过开放回忆诊断确认这是决策时现象,而非知识缺乏。
3. 3. 我们发现流行度偏差与置信度校准失调强烈相关:置信度–准确率差距随所选选项流行度增加而急剧扩大。
4. 4. 我们提出**PopDebias**——一种免训练方法(测试时无标签),在所有测试设置下均有效且额外计算开销极小。

## 2 数据集与策略构建  
我们构建**PopMCQ**基准,将选项流行度作为自变量操纵,同时保持问题和正确答案固定。图2展示了构建流程。

**图2**:PopMCQ构建与评估流程概述。我们从四个源数据集采样问题,使用GPT-4o为每个问题生成20个候选答案(针对不同流行度水平),根据维基百科页面浏览量对每个候选答案评分,并组装六种策略变体(S1–S6),它们在干扰项流行度上有所不同。模型在所有策略上接受评估,PopDebias作为无标签、推理时校正方法应用。

### 2.1 源数据、候选答案与过滤  
现有基准未控制干扰项流行度。我们从四个问答数据集构建PopMCQ:MuSiQue、Natural Questions、EntityQuestions和WebQuestions,保留满足以下条件的问题:存在标准答案、至少有四个候选答案可用,且核心策略(S1、S2、S6)可满足(附录B.1)。表2总结了正确答案的流行度分布:EntityQuestions和MuSiQue呈长尾分布(中位数0.087/0.102;>49%低于0.1),而NQ和WebQuestions分布较高(中位数0.170/0.160;>0.7≈10%)。由于正确答案主要为低流行度,偏好流行选项直接损害准确率——在S2–S5中加剧。

对于每个问题,我们使用GPT-4o生成20个候选错误答案(附录B.2),涵盖高(6–8个)、中(6–8个)和低(4–6个)流行度层级,每个答案包含合理性评分(0–100)和理由说明。大语言模型仅生成此候选池——策略选择(S1–S6)**完全基于维基百科流行度分数确定**,而非大语言模型判断,确保操纵独立于候选生成模型和评估模型。我们验证流行度与合理性基本正交(斯皮尔曼**ρ < 0.24**;附录D.2),排除合理性作为混淆因素。

**表1**:MuSiQue上的选项流行度变化(DeepSeek-V2-Lite)。S1–S4诱导强烈的正确性–流行度负相关;S5逆转该效应。S6的负ρ是结构性的(“以上均无”的Pop=0);需通过准确率和高流行度选择率(HPSR)解读S6。数值显示指标值及其相对于S1的变化(Δ)。

| 策略   | S1 基准 | S2 陷阱 | S3 梯度 | S4 直接 | S5 逆向 | S6 无   |
|--------|---------|---------|---------|---------|---------|---------|
| 准确率(%) | 31.2 (0.0) | 31.1 (−0.1) | 33.9 (+2.6) | 27.3 (−3.9) | 30.9 (−0.3) | 68.6 (+37.4) |
| 相关性 (ρ) | −0.23 (0.00) | −0.89 (−0.66) | −0.66 (−0.42) | −0.49 (−0.26) | +0.19 (+0.42) | −0.95 (−0.72) |
| HPSR(%) | 49.9 (0.0) | 66.0 (+16.1) | 51.4 (+1.5) | 55.7 (+5.8) | 50.9 (+1.0) | 22.2 (−27.7) |

**表2**:各数据集正确答案的流行度统计。Med. = 中位数;IQR = 四分位距;%<0.1 和 %>0.7 = 低流行度和高流行度尾部比例。

| 数据集         | N   | Med. | Mean | IQR  | Skew | %<0.1 | %>0.7 |
|----------------|-----|------|------|------|------|-------|-------|
| EntityQuestions | 958 | 4    | 0.087| 0.201| 0.279| 1.475 | 2.9   | 6.8  |
| NQ             | 105 | 0    | 0.170| 0.281| 0.449| 0.913 | 7.7   | 10.0 |
| MuSiQue        | 874 | 0    | 0.102| 0.204| 0.258| 1.364 | 9.8   | 4.2  |
| WebQuestions    | 702 | 0    | 0.160| 0.265| 0.388| 1.053 | 8.6   | 10.3 |

**图3**:不同策略和数据集上的流行度偏差(正确性与所选选项流行度的斯皮尔曼ρ)。负值(红色)表示偏差;正值(绿色)表示对齐。ρ = −0.5的虚线为中度至强相关参考线(仅作视觉引导,非学习或数据依赖阈值)。S2(流行陷阱)显示最强偏差,而S5(逆向控制)翻转为正值。完整结果见附录M。

### 2.2 策略生成  
每个基础问题生成六种MCQ变体,**仅**在干扰项流行度上不同。所有MCQ包含四个选项(一个正确,三个干扰项),位置随机分配至{A, B, C, D}。设**C**(q)为候选池,**pop**(a⋆)为正确答案的流行度。六种策略如下:  
**S1(基准)**:3个随机干扰项,无流行度约束。  
**S2(流行陷阱)**:top-3最受欢迎的候选答案(**pop > pop**(a⋆)),最大化流行度压力。  
**S3(梯度)**:3个干扰项,流行度严格递减且均高于**pop**(a⋆)。  
**S4(直接竞争)**:1个最高流行度候选 + 2个中流行度干扰项。  
**S5(逆向控制)**:3个流行度低于**pop**(a⋆)的干扰项。  
**S6(无)**:正确答案替换为“以上均无”(选项D),流行度定义为0。

## 3 实验设置  
### 3.1 模型与数据集  
我们在22个开源大语言模型上评估,参数量从0.5B到32B不等,包括Llama-3系列(8B、70B)、Qwen2.5系列(7B、14B、32B、72B)、DeepSeek系列(V2-Lite、V2、V3)、Gemma-2(2B、9B、27B)、Mistral-7B、Phi-3-mini、Yi-1.5、InternLM2.5等。所有模型使用其默认提示格式(通常为“Question: [问题] A. [选项A] ... 回答:”),温度设为0以确保可重复性。

### 3.2 评估指标  
我们采用以下指标:  
**流行度偏差相关性 (ρ)**:正确性(0/1)与所选选项流行度的斯皮尔曼相关系数。负值表示偏好流行错误选项。  
**高流行度选择率 (HPSR)**:选择流行度>0.5的选项的比例。  
**流行度差距 (PopGap)**:所选选项流行度与正确选项流行度的平均差值。正值表示模型系统性地选择比真实答案更流行的选项。  
**准确率 (Acc)**:正确预测的比例。

我们还测量**置信度**(所选选项的平均概率)和按流行度分桶的**过度置信度**,以检验熟悉度是否驱动校准失调(图4)。完整指标定义见附录E。

### 3.3 关键发现  
图3展示了两个代表性模型在所有数据集和策略上的结果。模式一致:在流行度压力下(S2–S4),相关性强烈为负;在逆向控制下(S5),相关性翻转为正。表3报告了四个模型在MuSiQue上的准确率;完整结果见附录M。

**表3**:基于MuSiQue问题构建的PopMCQ实例上的准确率(%),干扰项由GPT-4o生成并组装为六种流行度控制策略变体(S1–S6),针对代表性模型。

| 策略            | Llama-3-8B | Qwen2.5-7B | DeepSeek-V2-Lite | Gemma-2-9b |
|-----------------|------------|------------|------------------|------------|
| S1:基准         | 44.9       | 41.0       | 31.2             | 29.3       |
| S2:流行陷阱     | 45.5       | 42.0       | 31.1             | 33.6       |
| S3:梯度         | 43.1       | 40.8       | 33.9             | 32.0       |
| S4:直接竞争     | 40.3       | 34.8       | 27.3             | 26.1       |
| S5:逆向控制     | 44.9       | 41.8       | 30.9             | 31.0       |
| S6:无          | 23.2       | 3.2        | 68.6             | 6.5        |

#### 流行度压力下的系统性负相关  
对于MuSiQue,所有22个模型的平均数据集级ρ值分别为:−0.234(S1)、−0.864(S2)、−0.704(S3)、−0.520(S4)、+0.202(S5)、−0.449(S6)。S6的负ρ是结构性的(“以上均无”的Pop=0);我们通过准确率和HPSR解读S6。在S2/S3下,Llama-3-8B和Qwen2.5-7B准确率变化不大(44.9→45.5/43.1 和 41.0→42.0/40.8),而Gemma-2-9b有所提升(29.3→33.6/32.0)——在S2下准确率可能上升,因为全局知名但问题无关的干扰项可能比S1中采样的局部合理项更容易排除(附录C.3)——但在S6下崩溃(6.5%)。DeepSeek-V2-Lite在S6下显著提升(68.6%)。**HPSR**通过衡量原始选择频率来补充ρ:在S1中接近随机(≈50%);在S2中在MuSiQue上升至66.0%;在S5中返回基线。

#### 逆向控制证实效应  
S5可靠地产生正相关(MuSiQue平均+0.202),伴随轻微准确率提升(Llama-3.1-8B:42.8%→43.2%;Qwen2.5-7B:41.0%→41.8%)和较小的**PopGap**(+0.026)。跨数据集差异反映了底层流行度分布(表2):EntityQuestions和MuSiQue(中位数<<0.11)表现出更强的易感性,而NQ和WebQuestions(IQR>0.38,>0.7≈10%)效应减弱。

**图4**:置信度与准确率按流行度分桶。流行度桶:*低* ≤0.3,*中* (0.3, 0.7],*高* >0.7。

#### 流行度偏差反映决策时吸引,而非单纯知识缺乏  
受控设计(S1–S5相同问题与标准答案)已显示干扰项流行度(而非问题难度)驱动该效应。为将流行度驱动的错误与知识差距分离,我们进行**开放回忆诊断**:每个模型首先在无MCQ选项情况下回答(自由生成),并通过标准化精确/别名匹配验证正确性。然后仅在模型开放回忆中回答正确的项目上评估S2——一个保守的“已知答案”子集。表4显示,在这一子集上流行度偏差仍然存在,表明即使模型知道答案,仍可能因选项流行度而选择错误答案。这证实流行度偏差是决策时现象,而非简单知识缺乏的结果。

---
<sup>1</sup> 原文为脚注格式,此处保留为上标标注。  
<sup>2</sup> 原文引用编号,此处保留为上标标注。

相似文章

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……

无理解的模仿:大语言模型中决策偏差的起源

arXiv cs.CL

本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。