量化LLM基准中的排名不确定性

arXiv cs.LG 论文

摘要

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

arXiv:2607.16259v1 Announce Type: new 摘要:预训练模型通常按多任务排行榜排名,以评估它们在不同任务上的有效性。最近引入了排名置信区间作为一种通过聚合成对假设检验来量化这些排名不确定性的方法。本文分析了知识评估基准MMLU中不确定性的来源,并展示了如何修改假设检验以考虑其影响。我们证明,不同MMLU主题间的排名变异性很大,在比较LLM或识别表现最佳的模型时应予以考虑。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# 量化LLM基准中排名的不确定性 来源:https://arxiv.org/html/2607.16259 ###### 摘要 预训练模型通常通过多任务排行榜进行排名,以评估其在不同任务上的有效性。最近,排名置信区间被引入作为一种方法,通过聚合成对假设检验来量化这些排名的不确定性。在这项工作中,我们分析了知识评估基准MMLU中不确定性的来源,并展示了如何修改假设检验以考虑其影响。我们证明,MMLU各学科间的排名变异性很大,在比较LLM或识别表现最佳的模型时应予以考虑。 机器学习,ICML,人工智能,排行榜,排名 ## 1 引言 模型排名的实践已通过公开排行榜(例如 Hugging Face 开放 LLM 排行榜 (Fourrier et al., 2024 (https://arxiv.org/html/2607.16259#bib.bib1)))而正式化,该排行榜提供了模型在不同任务上排名的概览。因此,排行榜已成为研究人员报告实证进展的主要方式,排名标志着进步并促进竞争。对于每个基准,模型会在多个任务和提示上进行评估。由于评估指标使用不同的数值尺度 (Demšar, 2006 (https://arxiv.org/html/2607.16259#bib.bib2); Longjohn et al., 2025 (https://arxiv.org/html/2607.16259#bib.bib5)),通常会总结一个性能指标,并将其排序后呈现为排名。这些排名随后指导模型的比较和选择。 尽管排名被广泛采用,但仍存在重要局限性。排行榜结果可能因评估集和评估方法的一致性而有显著差异 (Rising, 2021 (https://arxiv.org/html/2607.16259#bib.bib3))。此外,排名通常以单一值呈现,没有任何对其不确定性的量化 (Miller, 2024 (https://arxiv.org/html/2607.16259#bib.bib4); Ackerman et al., 2025 (https://arxiv.org/html/2607.16259#bib.bib7))。这种不确定性量化的缺失可能会掩盖模型在不同任务或提示上的性能巨大差异,尤其是对于大型通用预训练模型(如LLM)。虽然模型得分的置信区间很常见,但为了支持识别显著的模型差异,需要其排名的置信区间 (Foucart et al., 2025 (https://arxiv.org/html/2607.16259#bib.bib6); Valdeira and Soares, 2025 (https://arxiv.org/html/2607.16259#bib.bib9))。 在本文中,我们讨论方向性成对检验和排名置信区间如何改进排名的估计不确定性。我们在大规模多任务语言理解(MMLU)基准 (Hendrycks et al., 2021 (https://arxiv.org/html/2607.16259#bib.bib8); Polo et al., 2024 (https://arxiv.org/html/2607.16259#bib.bib10)) 上展示了这些检验的作用,该基准包含涵盖广泛学科的多项选择题。我们的重点是构建排名置信区间的假设检验选择及其对所得区间的影响。使用这些工具,我们识别了排名不确定性的来源,表明学科间的变异性超过了提示变体间的变异性,并强调了学科层面分析对于检测模型间性能差异的重要性。我们分析的代码公开于 quantifying-rank-uncertainty (https://github.com/BityaNeuhof/quantifying-rank-uncertainty.git)。 ## 2 排名置信区间 在本节中,我们描述一种从配对样本构建排名置信区间的方法 (Holm, 2013 (https://arxiv.org/html/2607.16259#bib.bib16); Al Mohamad et al., 2021 (https://arxiv.org/html/2607.16259#bib.bib12); Neuhof and Benjamini, 2024 (https://arxiv.org/html/2607.16259#bib.bib11); Foucart et al., 2025 (https://arxiv.org/html/2607.16259#bib.bib6))。排名置信区间提供了一种原则性的方式来传达模型排名中的不确定性,这是仅报告原始排名所无法捕捉的。这里,我们将不确定性来源或聚合层级视为已知。在下一节中,我们检查这一选择如何影响对结果的解释。 ### 2.1 术语和定义 设 M\\mathcal{M} 为一个模型集合,包含 N M N_{\mathcal{M}} 个模型。为简单起见,假设设计平衡,即对于每个模型 m j m_j,我们观察到一个每单元性能得分向量 s i j s_ij,对应单元 y i y_i,i=1,...,n i=1,\ldots,n。得分越高表示性能越好。观察到的模型得分 μ ^ = ( μ ^ 1 , . . . , μ ^ N M ) \hat{\mu}=(\hat{\mu}_1,...,\hat{\mu}_{N_{\mathcal{M}}}) 是通过对单元求平均得到的: μ ^ j = 1 n ∑ s i j \hat{\mu}_j=\frac{1}{n}\sum s_ij。原始观察排名 r ^ = ( r ^ 1 , . . . , r ^ N M ) \mathbf{\hat{r}}=(\hat{r}_1,\ldots,\hat{r}_{N_{\mathcal{M}}}),其中 r ^ j ∈ { 1 , . . . , N M } \hat{r}_j\in\{1,\ldots,{N_{\mathcal{M}}}\},是通过对 μ ^ \mathbf{\hat{\mu}} 排序来分配的,使得最高得分获得排名 N M {N_{\mathcal{M}}},最低得分获得排名 1 1。 令 μ j \mu_j 表示模型 m j m_j 的真实性能得分, μ ^ j \hat{\mu}_j 表示其有噪声的估计。模型 m_j 的真实排名由 μ_j 在真实得分 ( μ 1 , . . . , μ N M ) (\mu_1,\ldots,\mu_{N_{\mathcal{M}}}) 中的相对位置决定。当没有平局时,m_j 的真实排名可以用两种等价方式表示: r j \displaystyle r_j = 1 + \# { μ k > μ j : k ≠ j } \displaystyle=1+\#\{\mu_k>\mu_j:k\neq j\} (1) = N M − \# { μ k < μ j : k ≠ j } \displaystyle=N_{\mathcal{M}}-\#\{\mu_k<\mu_j:k\neq j\} 第一个表达式计算有多少模型优于 m_j;第二个表达式计算有多少模型劣于 m_j。这种等价性使得能够通过方向性成对比较构建排名置信区间:我们不依赖于确切的真实得分,而是依赖统计证据来识别显著优于或劣于 m_j 的模型。这些识别出的组提供了 m_j 可能排名的上限和下限。 排名区间可用于传达真实排名的不确定性。设 [ L j , U j ] [L_j,U_j] 为模型 m_j 的排名置信区间,其中 α \alpha 为错误覆盖率。这里,r_j 表示模型 m_j 的真实排名。如果真实得分中存在平局,则 r_j 可能是一组可能的排名,而不是单个值。在这种情况下,下面的覆盖定义将 r_j 视为一个集合,并检查它是否包含在区间内。 ###### 定义 2.1. (有效的排名置信区间) 模型 m_j 的排名区间是有效的,如果真实排名 r_j 不包含在区间 [ L j , U j ] [L_j,U_j] 内的概率最多为 α \alpha。 P ( r j ⊆ [ L j , U j ] ) ≥ 1 − α . \displaystyle\mathbb{P}\big(r_j\subseteq[L_j,U_j]\big)\geq 1-\alpha. (2) 一组有效的排名置信区间可以保证每个模型单独的覆盖(边际覆盖)或所有模型同时的覆盖(同时覆盖)。参见附录A (https://arxiv.org/html/2607.16259#A1) 获得正式定义。 我们使用成对位置检验构建排名置信区间,扩展了排序原始得分的标准方法。此方法允许控制排名错误,无论是在单个模型层面还是跨所有模型 (Holm, 2013 (https://arxiv.org/html/2607.16259#bib.bib16); Al Mohamad et al., 2022 (https://arxiv.org/html/2607.16259#bib.bib13))。对于每一对模型,其真实得分为 μ_j 和 μ_k,我们检验两个单侧假设: H j k ; 0 : μ j ≤ μ k vs H j k ; 1 : μ j > μ k , 并且 \displaystyle H_{jk;0}:\mu_j\leq\mu_k\text{ vs }H_{jk;1}:\mu_j>\mu_k,\text{ 并且 } (3) H k j ; 0 : μ k ≤ μ j vs H k j ; 1 : μ k > μ j . \displaystyle H_{kj;0}:\mu_k\leq\mu_j\text{ vs }H_{kj;1}:\mu_k>\mu_j. 每个假设检验的结果是一个 p 值 p_{jk},对应于每一对有序模型 (m_j, m_k)。对于 N M N_{\mathcal{M}} 个模型,共有 N M ( N M − 1 ) N_{\mathcal{M}}(N_{\mathcal{M}}-1) 个这样的成对比较。 真实排名的置信区间是通过“计数”拒绝假设来获得的,同时控制族系错误率(FWER)。FWER 控制可以针对单个模型的决策进行 (Holm, 2013 (https://arxiv.org/html/2607.16259#bib.bib16); Mogstad et al., 2024 (https://arxiv.org/html/2607.16259#bib.bib14)),也可以同时跨所有模型进行 (Al Mohamad et al., 2022 (https://arxiv.org/html/2607.16259#bib.bib13); Neuhof and Benjamini, 2024 (https://arxiv.org/html/2607.16259#bib.bib11))。 给定一组假设 { H j k ; 0 , j ≠ k } \{H_{jk;0},j\neq k\},排名的上下界为: L j = 1 + \# { k ≠ j : H j k ; 0 被拒绝 } , \displaystyle L_j=1+\#\{k\neq j:H_{jk;0}\text{ 被拒绝}\}, (4) U j = M − \# { k ≠ j : H k j ; 0 被拒绝 } . \displaystyle U_j=M-\#\{k\neq j:H_{kj;0}\text{ 被拒绝}\}. 因此,下限和上限排名是通过以相反方向应用相同逻辑获得的:其他模型更好的显著证据会将 U_j 向下移动至更差(更低)的排名,而其他模型更差的显著证据会将 L_j 移动至更好(更高)的排名。在我们的实现中,我们使用 Holm 校正来控制多重比较 (Holm, 1979 (https://arxiv.org/html/2607.16259#bib.bib15))。从成对比较构建排名置信区间的算法以及有效性证明详见附录A (https://arxiv.org/html/2607.16259#A1)。 ### 2.2 平衡设计中的统计选择 从成对位置检验构建排名置信区间留下了核心的统计问题:应检验哪些假设,应考虑哪个总体,以及应控制哪种错误。这些选择对应于不同的概率空间,并产生对所得排名区间的不同解释。重要的是,这些抽象选择直接决定了统计程序和结果解释;例如,总体的选择会影响哪些单元被比较,而错误控制目标则塑造了置信保证。本文的其余部分将利用这一区别来阐明正在量化的是哪种排名不确定性,以及为什么假设检验程序和错误控制目标的选择不仅仅是一个技术细节,而是所做出的推断主张的一个组成部分。 我们通过配对 t 检验展示不同形式的不确定性以及它们如何转化为成对比较。在数据近似正态分布的平衡设计中,定义 p 值 p_{jk} 为 p_{jk} = T_{n-1}(t),其中 t = d ̄ n s d ( d ̄ ) t=\frac{\bar{d}}{\sqrt{n}sd(\bar{d})}。这里,d ̄ \bar{d} 是样本均值之差,n 是样本量,sd(d ̄) 是差值的样本标准差。T_{n-1} 表示自由度为 n-1 的 t 分布的累积分布函数。稳健的替代方案使用 t 的变体并从样本中估计其分布,例如使用 bootstrap 或置换方法 (Wilcox, 2023 (https://arxiv.org/html/2607.16259#bib.bib19));更多细节和示例见附录A (https://arxiv.org/html/2607.16259#A1) 和 5 (https://arxiv.org/html/2607.16259#A2.F5)。我们用 n 表示正在比较的单元数量,但 n 会随单元的定义而变化。在非平衡设计中,类似的方法也可以应用于随机效应或混合效应模型 (Bates et al., 2015 (https://arxiv.org/html/2607.16259#bib.bib20))。 ## 3 排名置信区间在 MMLU 上的应用 MMLU 基准 (Hendrycks et al., 2021 (https://arxiv.org/html/2607.16259#bib.bib8)) 通过多项选择题评估 LLM 在广泛学科(涵盖 STEM、人文学科和社会科学)中的知识和问题解决能力。我们使用 MMLU 的 PromptEval 扩展 (Polo et al., 2024 (https://arxiv.org/html/2607.16259#bib.bib10)),该扩展提供了一个包含 100 种提示变体、15 个模型和 57 个学科的正确性矩阵,每个学科至少有 100 个问题。该数据在 Hugging Face 上公开可用(MIT 许可)111https://huggingface.co/datasets/PromptEval/PromptEval_MMLU_correctness。PromptEval 旨在评估模型对提示变化的敏感性,为每个学科引入了两个主要的变异性来源:跨提示和跨问题。此外,我们预计学科间存在变异性,并且模型相关性可能因学科而异。 在像 MMLU 这样复杂的基准中,仅依赖跨学科的平均准确率可能会掩盖学科间和学科内的变异性。这种变异性源于学科领域、问题内容以及每个学科问题数量的差异。为了使学科具有可比性,我们随机从每个学科中抽取 100 个问题。 我们通过构建模型的排名置信区间来衡量变异性,使用第 2 节(方程 3)中描述的假设检验。令 M \mathcal{M}、T \mathcal{T}、Q ( T ) \mathcal{Q}(\mathcal{T}) 和 V \mathcal{V} 分别表示模型、学科、问题和提示变体的集合。定义 S : ( M , T , Q ( T ) , V ) → { 0 , 1 } S:(\mathcal{M},\mathcal{T},\mathcal{Q}(\mathcal{T}),\mathcal{V})\to\{0,1\} 为一个二元函数,正确答案得分为 1,错误答案为 0。令 s_{ij} 表示模型 m_j 在单元 y_i 上的得分,其中每个单元可以对应于,例如,给定学科的单个问题-提示对,或者聚合多个问题和提示的结果,具体取决于分析上下文。这个单元的定义构成了我们假设检验和构建本文分析的模型间差异向量的基础。总单元数 n 构成了配对 t 检验的总体。所有报告的得分和排名置信区间使用的错误覆盖率为 α = 0.05 \alpha=0.05。请注意,本节中的所有排名置信区间都是边际覆盖;同时排名置信区间的示例见附录 B.2。 ### 3.1 基准层级变异性 比较两个模型的一种朴素方法是将每个单独的观察视为一个独立的单元。具体来说,一个单元 y_i 由所有唯一的三元组 ( t b , q b c , v l ) (t_b, q_bc, v_l) 索引,其中 t_b 是一个学科,q_bc 是学科 t_b 的一个问题,v_l 是一个提示变体。对于一对模型 (m_j, m_k),我们形成: d [ j k , b , b c , l ] = S ( m j , t b , q b c , v l ) − S ( m k , t b , q b c , v l ) , \displaystyle d_{[jk,b,bc,l]}=S(m_j,t_b,q_bc,v_l)-S(m_k,t_b,q_bc,v_l), (5) 并检验这些单元级差值的均值是否为零。对于模型 (m_j, m_k),估计量为: d ̄ = 1 N T N Q ( T ) N V ∑ b ∑ c ∑ l d [ j k , b , b c , l ] = μ ^ j − μ ^ k \displaystyle\bar{d}=\frac{1}{N_{\mathcal{T}}N_{\mathcal{Q}(\mathcal{T})}N_{\mathcal{V}}}\sum_b\sum_c\sum_l d_{[jk,b,bc,l]}=\hat{\mu}_j-\hat{\mu}_k (6) 其中 N_T 是学科数量,N_Q(T) 是每个学科的问题数量,N_V 是提示变体数量。因此样本量是单元数 n = N_T N_Q(T) N_V,标准差衡量 d_[jk,b,bc,l] 的离散程度。

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。