每个错误答案都算数:LLM 多选题基准的选项级心理测量学

arXiv cs.CL 论文

摘要

本文介绍了 LLM-NRM,一种用于多选题基准的选项级心理测量框架,它对答案选择的完整分布进行建模,而不是二元正确性,表明错误回答携带了有用的测量信息,并提高了能力估计和基准测试的效率。

arXiv:2608.02966v1 公告类型:新 摘要:大多数多项选择题(MCQ)基准仅根据大语言模型(LLM)是否选择正确答案来评估它们。这种二元计分将所有错误回答一视同仁,尽管 LLM 在错误选项之间的偏好可能包含关于其行为和能力的系统性有用信息。我们提出了 LLM 名义反应模型(LLM-NRM),这是一种选项感知的心理测量框架,对答案选择的完整分布进行建模,以联合估计 LLM 能力和选项级题目特征,同时分离模型特定的响应校准锐度、位置偏好和依赖难度的回退行为。在来自 14 个基准的 189 个 LLM 和 31,554 个题目上,LLM-NRM 比二元项目反应模型和常规名义反应基线更准确地预测了留出的 LLM-题目交互,其能力估计与外部人类偏好 Arena.ai Elo 排行榜达到了最强的 Spearman 相关性 0.920。干扰项身份在每个题目上比正确性额外贡献了 +101% 的 Fisher 信息,仅凭错误回答就能以 Spearman 0.943 恢复全信息能力估计。学习到的题目参数还实现了高效基准测试,其中 41 个选定题目以 Kendall 相关性 0.85 保持了完整题库排名,相当于减少了 770 倍。总之,我们表明错误回答携带了独特且有价值的测量信息,而非代表等价的错误。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:42

# 面向LLM多项选择基准的选项级心理测量学
来源:https://arxiv.org/html/2608.02966
## 每个错误答案都很重要:面向LLM多项选择基准的选项级心理测量学

###### 摘要

大多数多项选择题(MCQ)基准仅根据大型语言模型(LLM)是否选择正确答案来对其进行评估。这种二元计分将所有错误回答等同对待,尽管LLM在错误选项之间的偏好可能蕴含关于其行为和能力的系统性且有用的信息。我们提出了LLM名义反应模型(LLM-NRM),一种选项感知的心理测量框架,该框架对答案选项上的完整分布进行建模,以联合估计LLM能力和选项级条目特征,同时分离模型特定的反应校准锐度、位置偏好和依赖难度的回退行为。跨189个LLM和来自14个基准的31,554个条目,LLM-NRM在预测留出LLM-条目交互方面比二元项目反应模型和常规名义反应基线更准确,其能力估计与外部人类偏好Arena.ai Elo排行榜达到了0.920的最强Spearman相关性。干扰项身份在正确性之外每个条目额外提供了+101%的Fisher信息,而仅凭错误回答就能以Spearman 0.943恢复全信息能力估计。学习到的条目参数还实现了高效基准测试,其中41个精选条目以Kendall’s相关0.85保持了完整题库排名,对应770倍的缩减。总之,我们表明错误答案携带了独特且有用的测量信息,而非代表同等的错误。

## 引言

参见图注图1:一个ARC-Challenge MCQ条目的真实示例,附带来自我们LLM-NRM拟合的条目特征曲线。\(a\) 在此条目中,“土星”是一个合理的干扰项,反映了LLM考生的部分知识,而“太阳”是正确答案。\(b\) 二元计分将所有三个选项归为相同的“错误”结果,但选项级建模在LLM能力谱系θ\\theta上为每个选项分别估计一条独立的反应曲线。\(c\) 由于这些干扰项偏好随能力变化,其身份提供了正确性所不保留的Fisher信息。大型语言模型(LLM)基准测试通常使用准确率分数来评估标准多项选择题(MCQ)基准上的性能(Wang等,2024(https://arxiv.org/html/2608.02966#bib.bib22);Rein等,2024(https://arxiv.org/html/2608.02966#bib.bib23))。然而,准确率是模型能力的一种有限度量,因为它与特定基准绑定:原始分数取决于其条目构成,而经验性条目难度取决于所评估的模型群体。因此,模型排名可能因基准、计分协议或比较集合的变化而改变(Lalor等,2016(https://arxiv.org/html/2608.02966#bib.bib59);Perlitz等,2024(https://arxiv.org/html/2608.02966#bib.bib60);Alzahrani等,2024(https://arxiv.org/html/2608.02966#bib.bib61))。单个准确率值还将每个回答压缩为二元结果,隐藏了模型置信度和系统性错误模式(Zhu等,2023(https://arxiv.org/html/2608.02966#bib.bib6))。它本身无法量化测量不确定性(Perlitz等,2024(https://arxiv.org/html/2608.02966#bib.bib60)),并且随着最强模型接近基准饱和,它会失去区分力(Wang等,2024(https://arxiv.org/html/2608.02966#bib.bib22))。

项目反应理论(IRT)为解决其中一些局限性提供了一个原则性框架,通过对潜在能力与条目特征之间的交互进行建模(Rasch,1960(https://arxiv.org/html/2608.02966#bib.bib37);Lord和Novick,1968(https://arxiv.org/html/2608.02966#bib.bib38);Birnbaum,1968(https://arxiv.org/html/2608.02966#bib.bib16))。近期研究将心理测量模型应用于LLM评估,用于基准分析、自适应测试、难度估计和多语言评估(Zhou等,2026(https://arxiv.org/html/2608.02966#bib.bib45);Land和Bikel,2026(https://arxiv.org/html/2608.02966#bib.bib51);Zhuang等,2025(https://arxiv.org/html/2608.02966#bib.bib42);Li等,2025(https://arxiv.org/html/2608.02966#bib.bib44);Zhu等,2025(https://arxiv.org/html/2608.02966#bib.bib46);Lior等,2026(https://arxiv.org/html/2608.02966#bib.bib43);Zhang等,2026(https://arxiv.org/html/2608.02966#bib.bib58))。这些方法揭示了基准饱和、条目质量问题以及具有相似准确率分数的模型之间的差异(Vania等,2021(https://arxiv.org/html/2608.02966#bib.bib41);Zhou等,2026(https://arxiv.org/html/2608.02966#bib.bib45);Land和Bikel,2026(https://arxiv.org/html/2608.02966#bib.bib51))。然而,它们通常将反应缩减为二元正确性,丢弃了多项选择预测中所包含的选项级信息。

与此同时,LLM响应包含超出正确性的更丰富行为信号,包括选项选择偏差、位置偏好、自我评估和响应一致性模式(Zheng等,2024(https://arxiv.org/html/2608.02966#bib.bib55);Yang等,2025(https://arxiv.org/html/2608.02966#bib.bib56);Kadavath等,2022(https://arxiv.org/html/2608.02966#bib.bib47);Wu等,2025(https://arxiv.org/html/2608.02966#bib.bib52);Chaudhury等,2026(https://arxiv.org/html/2608.02966#bib.bib53))。然而,这些信号通常与潜在能力和条目特征分开分析,导致完整响应结构未被充分利用。

在本文中,我们证明LLM在多项选择选项上产生的概率分布本身就是一种心理测量反应。这自然地联系到人类测试中的名义反应模型(NRM),这是IRT的一种分类扩展,用于建模潜在能力与反应选项偏好之间的关系(Bock,1972(https://arxiv.org/html/2608.02966#bib.bib1))。与仅按正确性对每个响应评分的二元IRT不同,NRM赋予每个选项自己的区分度和吸引力,捕捉每个干扰项的吸引力如何随能力变化,从而从每个条目中提取比单纯正确性更多的测量信息。

我们提出了LLM名义反应模型(LLM-NRM),它通过建模潜在能力、条目特征和LLM特定行为因素来使NRM适应LLM评估。我们的贡献如下:

- •据我们所知,本工作首次将名义反应模型(NRM)应用于LLM,揭示了基准MCQ答案选项之间的潜在响应偏好,并提供了超越答案正确性的更丰富模型行为视角;
- •我们提出了一种LLM适配的NRM公式,融合了校准锐度、能力门控猜测和位置偏差等行为因素,超越了传统项目反应建模,迈向LLM决策过程的更丰富表示;
- •通过在14个基准上对189个LLM和31,554个MCQ条目的大规模实验,我们表明LLM-NRM改进了留出响应预测,产生了与外部人类偏好排名最匹配的能力估计,并确立了干扰项选择足以恢复能力并将基准压缩数个数量级。

## LLM名义反应模型

我们引入了LLM名义反应模型(LLM-NRM),这是Bock’s NRM的一种选项感知扩展,用于分析LLM对多项选择题的响应。与仅保留最可能选项正确性的传统评估不同,LLM-NRM对所有有效选项的完整响应分布进行建模。这保留了关于干扰项偏好以及选项吸引力如何在不同能力模型之间变化的更丰富信息。

LLM-NRM保留了MCQ条目的原始NRM参数化(Penfield,2014(https://arxiv.org/html/2608.02966#bib.bib5)),而是通过额外对LLM中常见的经验性特征所驱动的潜在响应过程来增强受访者模型:\(i\) 响应校准锐度,\(ii\) 位置偏好,以及 \(iii\) 依赖难度的回退行为。这些LLM特定扩展分别捕捉了原本会被吸收到考生能力和条目建模中的系统性响应变异。与人类测试通常每个条目记录一个分类响应(Thissen和Steinberg,1984(https://arxiv.org/html/2608.02966#bib.bib2);Suh和Bolt,2010(https://arxiv.org/html/2608.02966#bib.bib3))不同,LLM评估在大型条目库上提供了完整的选项分布,使得这些受访者特定过程能够被估计。

### 问题表述

令J\\mathcal\{J\}表示作为考生的LLM集合,I\\mathcal\{I\}表示MCQ条目集合。每个MCQ条目i∈Ii\\in\\mathcal\{I\}呈现KiK\_\{i\}个答案选项,由Ki=\{1,...,Ki\}\\mathcal\{K\}\_\{i\}=\\\{1,\\ldots,K\_\{i\}\\\}索引,对应于提示中显示的答案位置,如A、B、C和D。令gi∈Kig\_\{i\}\\in\\mathcal\{K\}\_\{i\}表示正确选项的索引,并定义Kmax=maxi∈I⁡KiK\_\{\\max\}=\\max\_\{i\\in\\mathcal\{I\}\}K\_\{i\}为所有条目中最大的选项数。

LLM对MCQ条目的响应本质上是分布式的,因为每个自回归步骤都会产生下一个标记的概率。因此,当LLMj∈Jj\\in\\mathcal\{J\}回答MCQ条目i∈Ii\\in\\mathcal\{I\}时,它对每个可用选项表达了一定程度的偏好。我们将这个观察到的偏好pjiobs\\mathbf\{p\}^\{\\mathrm\{obs\}\}\_\{ji\}表示为:

pjiobs=\(pji1obs,...,pjiKiobs\)∈ΔKi−1,\\mathbf\{p\}^\{\\mathrm\{obs\}\}\_\{ji\}=\\left\(p^\{\\mathrm\{obs\}\}\_\{ji1\},\\ldots,p^\{\\mathrm\{obs\}\}\_\{jiK\_\{i\}\}\\right\)\\in\\Delta^\{K\_\{i\}\-1\},(1)其中pjikobsp^\{\\mathrm\{obs\}\}\_\{jik\}是选项kk的归一化偏好,ΔKi−1\\Delta^\{K\_\{i\}\-1\}是概率单纯形。

LLM-NRM将pjiobs\\mathbf\{p\}^\{\\mathrm\{obs\}\}\_\{ji\}视为观察到的响应,而不是将其缩减为一个二元指示符,即最可能选项是否等于gig\_\{i\}。

### Bock’s NRM

Bock’s NRM(Bock,1972(https://arxiv.org/html/2608.02966#bib.bib1))通过为每个考生j∈Jj\\in\\mathcal\{J\}分配潜在能力θj∈R\\theta\_\{j\}\\in\\mathbb\{R\},并为每个选项k∈Kik\\in\\mathcal\{K\}\_\{i\}分配区分度参数aik∈Ra\_\{ik\}\\in\\mathbb\{R\}和截距cik∈Rc\_\{ik\}\\in\\mathbb\{R\}来对无序响应选项进行建模。区分度控制选项的相对吸引力如何随能力变化,而截距捕捉其基线吸引力。由此产生的响应分布为

pjikNRM=exp⁡\(aikθj\+cik\)∑k′∈Kiexp⁡\(aik′θj\+cik′\)。p^\{\\mathrm\{NRM\}\}\_\{jik\}=\\frac\{\\exp\\left\(a\_\{ik\}\\theta\_\{j\}\+c\_\{ik\}\\right\)\}\{\\sum\_\{k^\{\\prime\}\\in\\mathcal\{K\}\_\{i\}\}\\exp\\left\(a\_\{ik^\{\\prime\}\}\\theta\_\{j\}\+c\_\{ik^\{\\prime\}\}\\right\)\}。 (2)
由于softmax对其效用中的条目级平移不变,因此施加识别约束:

∑k∈Kiaik=0,∑k∈Kicik=0,\\sum\_\{k\\in\\mathcal\{K\}\_\{i\}\}a\_\{ik\}=0,\\qquad\\sum\_\{k\\in\\mathcal\{K\}\_\{i\}\}c\_\{ik\}=0,(3)并通过先验θj∼N\(0,1\)\\theta\_\{j\}\\sim\\mathcal\{N\}\(0,1\)锚定能力尺度。

经典NRM对人类测试非常强大,但LLM在三个系统性方面违反了其假设:

- •分布锐度的差异可能反映校准而非知识(Kadavath等,2022(https://arxiv.org/html/2608.02966#bib.bib47);Zhu等,2023(https://arxiv.org/html/2608.02966#bib.bib6)),
- •对显示位置的内容无关偏好(Zheng等,2024(https://arxiv.org/html/2608.02966#bib.bib55);Pezeshkpour和Hruschka,2024(https://arxiv.org/html/2608.02966#bib.bib7);Attali和Bar-Hillel,2003(https://arxiv.org/html/2608.02966#bib.bib8)),
- •以及对相对于模型能力而言较难的条目的回退猜测模式(Ivgi等,2024(https://arxiv.org/html/2608.02966#bib.bib9))。

直接拟合NRM会将这些非能力效应吸收到θj\\theta\_\{j\}和选项参数中,可能使两者都有偏。

### 响应锐度和位置偏差

我们首先用全局响应锐度和内容无关位置偏好增强NRM能力驱动的效用。

##### 响应锐度。

具有相同选项偏好排序的两个LLM,由于校准而非知识的差异,可能产生浓度显著不同的分布(Kadavath等,2022(https://arxiv.org/html/2608.02966#bib.bib47);Zhu等,2023(https://arxiv.org/html/2608.02966#bib.bib6))。经典NRM没有考生特定参数能在保持选项排序的同时改变浓度,因此这种变异可能被吸收到θj\\theta\_\{j\}和条目区分度中。

我们用每个LLM的正锐度参数来捕捉这种变异的全局成分:

sj∈R\+。s\_\{j\}\\in\\mathbb\{R\}^\{\+\}。(4)
在数学上,sjs\_\{j\}是一个每个LLM的逆温度,它改变分布浓度而不改变选项排序:sj\>1s\_\{j\}\>1锐化分布,而sj<1s\_\{j\}<1则使其平坦化。因此,sjs\_\{j\}在条目特定知识之外,捕捉了模型级校准,即LLM在多大程度上表达其偏好的置信度。

##### 位置偏差。

LLM可能表现出对显示答案位置或其标签的系统性偏好,这与选项内容无关,并且重新排列相同选项可以显著改变测量的准确率(Pezeshkpour和Hruschka,2024(https://arxiv.org/html/2608.02966#bib.bib7))。由于NRM截距cikc\_\{ik\}在所有LLM之间共享,经典NRM无法将这些模型特定的位置效应与选项吸引力分开。

我们不是通过计算昂贵的排列协议来控制位置偏差(Zheng等,2024(https://arxiv.org/html/2608.02966#bib.bib55)),而是将其与能力联合估计:

δj=\(δj1,...,δjKmax\)∈RKmax,\\boldsymbol\{\\delta\}\_\{j\}=\\left\(\\delta\_\{j1\},\\ldots,\\delta\_\{jK\_\{\\max\}\}\\right\)\\in\\mathbb\{R\}^\{K\_\{\\max\}\},(5)其中δjk\\delta\_\{jk\}表示LLM jj对显示位置kk的内容无关偏好。

结合模型特定的锐度和位置偏差,我们将能力驱动的响应对数几率定义为

ujik=sj\(aikθj\+cik\+δjk\)。u\_\{jik\}=s\_\{j\}\\left\(a\_\{ik\}\\theta\_\{j\}\+c\_\{ik\}\+\\delta\_\{jk\}\\right\)。(6)

### 难度门控猜测回退

经典NRM通过相同的能力驱动选项效用来表示所有响应。然而,当条目相对于LLM能力较难时,其选项偏好可能越来越多地反映模型特定的回退策略,如标签先验或选项启发式,而不是条目内容(Ivgi等,2024(https://arxiv.org/html/2608.02966#bib.bib9);Zheng等,2024(https://arxiv.org/html/2608.02966#bib.bib55);Balepur等,2024(https://arxiv.org/html/2608.02966#bib.bib15))。二元3PL-IRT引入了每个条目的下渐近线(Birnbaum,1968(https://arxiv.org/html/2608.02966#bib.bib16)),但它既不对选项上的完整回退分布建模,也不允许回退行为在不同LLM之间变化,而且其猜测参数通常难以识别(Barton和Lord,1981(https://arxiv.org/html/2608.02966#bib.bib19);Maris和Bechger,2009(https://arxiv.org/html/2608.0

相似文章

使用项目反应理论审计LLM基准测试

arXiv cs.CL

本文介绍了一种基于项目反应理论的方法,能够以95%的准确率检测LLM基准测试中的错误标注示例,并将错误追溯到标注启发式方法和注释问题。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

易于完成,难以选择:探究LLM在ProverbIT基准上的表现

arXiv cs.CL

本文介绍了ProverbIT,一个包含100道多选题的新型意大利语基准,用于测试LLM完成谚语的能力。通过对13个模型的评估,研究发现,在没有正确答案的多选题格式中,模型性能显著下降,这表明模型依赖记忆模式而非深层的语义理解。