没有中性评测配置:现代LLM排行榜由配置敏感项塑造

arXiv cs.AI 论文

摘要

本文研究了LLM评估基准对不同评测配置的敏感性,发现配置敏感项对模型间性能差距的影响不成比例,且评测配置的选择可以决定排行榜排名。

arXiv:2608.21382v1 公告类型:新 摘要:多项选择基准固定了问题和正确答案,但没有固定评测配置:选项的顺序、提示的措辞,以及语言模型的答案是从生成文本中读取还是从每个选项的可能性中读取。关于这种评测配置敏感性的研究将其报告为总体分数方差,但未审查方差落在哪些项目上,以及这些项目是否是区分模型间差异的项目。我们将大型语言模型(LLMs)的评测配置视为一个独立变量,并将其影响解析到单个项目。我们引入了\textit{脆弱性网格}:来自4个家族的12个开源指令调优LLMs在26个同样合理的评测配置下回答来自4个基准(ARC、HellaSwag、MMLU、TruthfulQA)的相同3,679个项目,记录每个模型、项目和配置的一个正确性位。比较是匹配的,因为项目、权重和贪婪解码保持固定,只有评测配置变化。在网格下,模型的得分是一个范围而不是一个点:gemma4-31b的得分仅在评测配置不同的情况下从31%到89%不等。得出三个结果。在两个相邻模型都稳定回答的项目上,这对模型是平局,配置敏感项平均承担这对模型差距的95.7%。12个模型中有4个在某些配置下达到第一名,因此评测配置选择了赢家。项目区分度,即基准压缩方法最大化的属性,与脆弱性的相关性为0.28(95%置信区间0.25到0.30),因此压缩保留了脆弱项目而不是移除它们。评分选择,而不是协议通常固定的选项顺序,是承载负荷的轴。我们发布了每个项目的记录和分析脚本,所有数字都可以在CPU上几秒钟内重新生成,并将脆弱性网格定位为排行榜在报告顺序之前可以运行的检查。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:13

# 现代大语言模型排行榜由配置敏感项所驱动
来源:https://arxiv.org/html/2608.21382

## 没有中立的评测框架:现代大语言模型排行榜由配置敏感项所制造

###### 摘要
多选基准测试会固定问题和正确答案,但不会固定选项顺序、提示词表述方式,或大语言模型的答案是从生成文本中读取还是基于各选项的似然度计算得出。现有研究通常从整体分数或整体排名的层面来衡量这种敏感性,并将其作为需要控制的方差来报告。这导致了项目层面的分析缺失,因此我们不知道这些方差具体落在哪些题目上,也不知道这些题目是否正是区分不同模型的关键。我们将评测框架视为自变量,并将影响分解到单个题目层面。我们引入了脆弱性网格,其中来自4个系列的12个开源指令微调语言模型,在26种同样合理的评测框架配置下,回答来自4个基准测试的相同3,679道题目,记录每个模型、每道题、每种配置下的一个正确性比特。该比较是匹配的,因为题目、模型权重和贪心解码保持固定,仅框架发生变化,并且网格中的任何配置都不是对抗性的。在该网格下,一个模型的分数表现为一个区间而非一个点。gemma4-31b在固定权重和固定题目的情况下,仅因评测框架的不同,分数就可能在31%到89%之间波动。由此得出三个结论。对于两道相邻模型都稳定答对的题目,这两个模型在这道题上打平。11对相邻模型中有5对的回答完全一致,另有4对仅在一道题上存在差异,但在完整题目集上存在的每一个排名差距,其排序结果仍然成立,并且配置敏感题平均承担了模型对之间95.7%的差距。12个模型中有4个在某种配置下排名第一,8个进入前三名,因此评测框架的选择决定了优胜者。题目区分度——基准压缩方法所最大化的特性——与配置敏感性的相关系数为0.28(95%置信区间为0.25至0.30),最具区分度的题目对96%的模型表现为配置敏感,而整个基准测试的平均比例为85%,因此压缩保留了脆弱题目而非移除它们。真正起决定性作用的是评分选择,而非协议通常固定的选项顺序或提示词表述方式。我们公开了逐项记录和分析脚本,论文中的所有数据均可通过这些材料在CPU上于几秒内重新生成,并将脆弱性网格定位为排行榜在发布排名前可以运行的一种检验工具。

关键词:大语言模型、评估、基准测试、排行榜、多选问答、提示词敏感性、鲁棒性

## 1 引言
基准测试分数通常被作为模型的属性来报告。从业者将MMLU或ARC的准确率视为系统的事实,比较两个数字,并将较大的那个视为更好的模型。这个数字是由一个包含自由参数的流程产生的,而基准测试并未固定这些参数。选项可以用字母或数字标记,可以按原始顺序展示,也可以打乱顺序。答案可以从生成的文本中解析出来,也可以选择最高似然度的选项。每种选择都是合理的,并且出现在人们使用的评测代码中。已知这样的选择会影响分数,并且这些基准测试是否测量了其分数被认定的含义本身也存在争议(Bowman and Dahl, 2021 (https://arxiv.org/html/2608.21382#bib.bib2))。现有针对敏感性的研究在扰动对象上各不相同,涵盖了提示词格式(Sclar et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib25))、指令改写(Mizrahi et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib18))、选项顺序(Pezeshkpour and Hruschka, 2024 (https://arxiv.org/html/2608.21382#bib.bib20))以及整个评测设置(Alzahrani et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib1))。这些研究共享一个结构性特点:它们都在整体(分数或排名)上测量敏感性,并将其作为需要通过固定协议来确定的方差进行报告。当问题仅仅是分数是否嘈杂时,整体方差是足够的。但当问题在于某个排序是否真实时,它就不足了。一个噪声均匀分布在整个基准测试上的嘈杂分数,与一个噪声恰好集中在区分两个相邻模型的题目上的嘈杂分数,是不同的对象。在整体层面上两者无法区分,但对于排行榜而言,它们有着相反的后果。要区分它们,必须深入到题目层面。我们提出的问题是:当评测框架改变排名时,哪些题目承载了两个模型之间的差距?当排除这些题目后,排序是否依然成立?我们通过将评测框架从一个隐式选择提升为一个受控变量来回答这个问题。该工具是脆弱性网格[^1]:一个由26种评测框架配置构成的集合,这些配置基于评估者需要在三个轴上做出的选择构建,即选项顺序、提示词格式和评分方法。每个模型在每种配置下回答每道题目,从而为每个模型、题目、配置的三元组生成一个正确性比特。该网格的设计刻意保持简单。它不引入新方法或新基准测试,其唯一任务就是固定题目、权重和解码方式,让评测框架成为唯一变化的因素。该工具的价值在于对基准测试进行了划分。对于一个模型而言,当某道题目在所有26种配置下的正确性都相同时,它就是**稳健**的;而当其正确性发生变化时,它就是**配置敏感**的。有了这种划分,排行榜上的每个差距就可以分解为由两个模型都稳定答对的题目所支撑的部分,和由配置敏感题目所承载的部分。这种划分是不均衡的。图1 (https://arxiv.org/html/2608.21382#S4.F1)展示了第一个推论:一个模型的准确率是一个区间而非一个点。gemma4-31b在相同的权重和题目下,在一种配置下得分为31%,在另一种配置下得分为89%。在整个模型名单中,一个模型被判定为正确的答案中,有85%可以通过一种同样合理的配置被翻转为错误。第二个推论对排名更为重要。在两个相邻模型都稳定答对的题目上,它们是平局的。排行榜所打印出的排序是由它们最不确定的题目所决定的。我们的贡献如下:
- •相邻模型的排序并非由稳定题目所决定。在相邻模型对都稳定答对的题目上,11对中有5对的回答逐题完全一致,有4对在75到158道可用题中仅有一题不同,其余2对则正负差异相互抵消。所有10个在完整题目集上存在非零差距的模型对,其排序结果仍然成立,并且配置敏感题平均承担了模型对之间95.7%的差距,当合并题目而非平均模型对时,这一比例上升至99.7%。据我们所知,这是首次将排行榜差距分解为稳健部分和脆弱部分。
- •选择评测框架就是选择优胜者。12个模型中有4个在网格的某种配置下排名第一,8个进入前三名。mixtral-8x7b在参考框架下排名第11(共12个模型),而在另一种框架下排名第一。这是一个关于合理优胜者集合的存在性声明,而非对排名漂移程度的测量。我们附上了每个第一名身后的差距:在26种配置中赢得24种的两个模型,其中位数领先幅度分别为181.5和98.5道题(共3,679题);另外两个模型各赢得一种配置,领先幅度分别为1题和3题。
- •基准压缩保留了脆弱题目。题目区分度——项目反应理论压缩方法所最大化的量——与配置敏感性的相关系数为0.28(95%置信区间为0.25至0.30),最具区分度的题目的平均脆弱度为0.96,而整个基准测试为0.85。压缩至100道题将冠军模型的数量从完整基准测试上的4个,提升到该大小随机子集的5.1个,而按区分度选择这100道题则进一步将其平均提升至5.7个,在定义不明确的截止值下,通过不同随机种子处理并列情况后的范围为4到7个。相关性与脆弱度差距不依赖于这种并列处理方式,我们以此作为论证依据。
- •评分轴起决定性作用。在保持其他轴为参考设置的情况下,对评分选择的平均准确率鲁棒性为0.31,低于提示词格式的0.40和选项顺序的0.60。生成与解析对比基于似然度的选择,而非协议通常固定的选项打乱,对最多被判为正确的答案造成了破坏。

[^1]: 代码、逐项记录和分析脚本:https://github.com/NikolaTesla-007/fragility-grid

## 2 相关工作
分数对呈现方式的敏感性。一条发展充分的线索表明,语言模型的分数取决于任务的呈现方式。Sclar et al. (2024 (https://arxiv.org/html/2608.21382#bib.bib25)) 在保持意义的前提下改变提示词格式,发现准确率的波动足以重新排序系统,且没有一种格式总是最佳的。Mizrahi et al. (2024 (https://arxiv.org/html/2608.21382#bib.bib18)) 为每个任务运行许多改写的指令,表明单一提示词给出的只是应该完整报告的分布中的一个点。对于多选题,Pezeshkpour and Hruschka (2024 (https://arxiv.org/html/2608.21382#bib.bib20)) 记录了对选项顺序的敏感性,并将其与模型在其领先选项之间不确定的题目联系起来,这正是我们结果所构建的机制。另一条相关线索将原因追溯到预测中的位置和标签偏差,以及上下文示例的顺序(Zhao et al., 2021 (https://arxiv.org/html/2608.21382#bib.bib30); Lu et al., 2022 (https://arxiv.org/html/2608.21382#bib.bib17))。这些研究证实了分数会变化,并在整体上测量了这种变化。具体是哪些题目发生了变化,以及这些题目是否正是区分两个模型的关键,这个问题仍然悬而未决。
排行榜扰动与排名移动。精神上最接近的是 Alzahrani et al. (2024 (https://arxiv.org/html/2608.21382#bib.bib1)),他们扰动了某个公开排行榜背后的评测设置,报告称模型排名移动了多个位置。整体评估提出了互补的观点,即单一设置提供的是局部视角,而许多条件应该一起报告(Liang et al., 2023 (https://arxiv.org/html/2608.21382#bib.bib15)),基于偏好的排行榜则面临其自身的聚合问题(Chiang et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib4))。这些工作报告了排名漂移的距离,这是一个离散度统计量。离散度统计量并不能说明某个特定排序是否得到数据支持,也不能说明有多少不同的模型各自可能是合理的优胜者。报告的差距是否大到足以被视为真实存在,这是一个统计功效问题,而这在语言模型比较中常常缺失(Card et al., 2020 (https://arxiv.org/html/2608.21382#bib.bib3)),我们的稳健项目测试正是对此的一个回答。
作为未记录选择的评分方法。答案是生成后解析还是基于似然度选择,本身就是一个评测框架决策,它会改变哪个模型看起来更强(Robinson and Wingate, 2023 (https://arxiv.org/html/2608.21382#bib.bib23))。选项的似然度与其表面形式的原始频率相竞争,因此最高概率的选项并不总是预期的答案(Holtzman et al., 2021 (https://arxiv.org/html/2608.21382#bib.bib12)),然而,即使在校准不佳时,各选项概率仍然对正确性有信息量(Plaut et al., 2025 (https://arxiv.org/html/2608.21382#bib.bib21))。两种路径都不能被简单地视为读取噪声。似然度路径是广泛使用的评测代码中的默认选项(Gao et al., 2023 (https://arxiv.org/html/2608.21382#bib.bib9)),而生成文本并解析答案是聊天式系统的标准做法,论文中经常省略使用了哪种方法。这条线索确立了评分选择的重要性。但它没有将评分选择与其他评测框架轴在共同的题目集上进行排名,而这正是我们的轴分解所做的。
基准压缩。一条富有成效的线索是使用项目反应理论将基准测试压缩为少量信息丰富的题目,表明大约一百道精心挑选的题目可以重现完整基准测试的分数和排名(Polo et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib22); Embretson and Reise, 2000 (https://arxiv.org/html/2608.21382#bib.bib8))。项目反应理论已被用于比较测试集,并根据题目对系统间的区分度来重新加权排行榜中的示例(Vania et al., 2021 (https://arxiv.org/html/2608.21382#bib.bib27); Rodriguez et al., 2021 (https://arxiv.org/html/2608.21382#bib.bib24)),而高效基准测试的工作则选择信息子集以降低评估成本(Perlitz et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib19))。选择标准是题目区分度,验证是在固定的评测框架下进行的。保留的题目是否能经受住评测框架变化的考验并未被测试。而我们发现,被保留下来的恰恰是那些脆弱的题目,这使得压缩后的基准测试在配置间比其替代的原始基准测试更不稳定。
我们的立场,以及我们不声称的内容。纵观这些研究线索,评测框架被当作整体分数上一个方差的来源,被报告或最小化,而这个方差从未被分解到它所作用的题目层面。这种分解正是脆弱性网格所增加的,结果由此得出:差距分解、优胜者数量、压缩与脆弱性的联系,以及对评测框架轴相互重要性的排序。这项工作的危险解读应当被明确拒绝。我们不声称这些模型能力相当,也不声称多选基准测试不携带任何关于能力的信息。我们仅声称,在单一评测框架下,相邻模型的**排序**并非由这些模型稳定答对的题目所决定,并且顶级模型的身份是一个很少被报告的配置选择的函数。

## 3 脆弱性网格

### 3.1 模型
模型名单包括来自4个系列的12个指令微调模型,参数量从30亿到700亿不等,涵盖稠密模型和混合专家架构。Qwen提供了qwen3-4b, qwen3-14b, qwen3-32b,以及混合专家模型qwen3-30b-a3b(Yang et al., 2025 (https://arxiv.org/html/2608.21382#bib.bib28))。Llama提供了llama3.2-3b, llama3.1-8b, 和llama3.3-70b(Grattafiori et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib10))。Gemma提供了gemma4-e4b, gemma4-12b, gemma4-31b,以及混合专家模型gemma4-26b-a4b(Team et al., 2025 (https://arxiv.org/html/2608.21382#bib.bib26))。Mistral的代表是mixtral-8x7b(Jiang et al., 2024 (https://arxiv.org/html/2608.21382#bib.bib13))。这种跨系列和规模的选择是刻意的,以确保一个在所有12个模型上都成立的结果,不可能是某个特定训练配方或某个尺寸特有的现象。另外两个Mistral模型已准备就绪,但在推理引擎初始化过程中卡住而被放弃,这是基础设施故障,并非其答案的特性。

### 3.2 基准测试与题目
我们使用了四个标准的多选基准测试:ARC(Clark et al., 2018 (https://arxiv.org/html/2608.21382#bib.bib5))、HellaSwag(Zellers et al., 2019 (https://arxiv.org/html/2608.21382#bib.bib29))、MMLU(Hendrycks et al., 2021 (https://arxiv.org/html/2608.21382#bib.bib11))和TruthfulQA(Lin et al., 2022 (https://arxiv.org/html/2608.21382#bib.bib16))。从每个基准测试中以固定种子抽取最多1,000道题。TruthfulQA提供了679道题。

相似文章

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。

不是能力问题:LLM智能体层级间的控制敏感度是非单调的

arXiv cs.AI

本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。