DualEval:面向统一LLM评估的联合模型-项目校准
摘要
介绍了DualEval框架,该框架联合校准模型能力与项目难度/锐度,以统一静态基准和竞技场式评估,从而实现更可靠的排名以及基准压缩和异常检测等下游应用。
arXiv:2606.26429v1 公告类型:新
摘要:当前的LLM评估依赖于两种互补但常常脱节的信号:具有客观正确性标签的静态基准,以及更能反映开放式用户交互的竞技场式偏好数据。我们引入了DualEval,一个潜在模型-项目校准框架,将模型和评估项目表示在共享空间中,联合估计模型能力以及项目难度和锐度。我们在四个领域应用DualEval:编程、数学、杂项领域知识任务和通用日常用户查询。我们的评估使用了18个前沿LLM、静态基准标签以及奖励模型分数,这些分数针对开放式模型响应的保留人类偏好进行了验证。实验表明,我们的框架生成了可靠且平衡的模型排名,其学习的项目级档案支持下游应用,例如用于样本高效评估的基准压缩和用于污染或异常分析的异常检测。总体而言,DualEval通过联合模型-项目校准统一了静态和竞技场式评估,生成了模型排名和项目级诊断,支持更高效、可解释和可审计的评估流程。
查看缓存全文
缓存时间: 2026/06/26 05:19
# DualEval:面向统一 LLM 评估的联合模型-项目校准
来源:https://arxiv.org/html/2606.26429
Aaron J\. Li¹,Hao Huang¹,Youngmin Park¹,Yitong Ma¹,Wei\-Lin Chiang²,Li Chen²,Cho\-Jui Hsieh²,³,Bin Yu¹,Ion Stoica¹,²
¹加州大学伯克利分校
²Arena
³加州大学洛杉矶分校
https://dualeval.github.io/
https://github.com/aaron-jx-li/DualEval
###### 摘要
当前的 LLM 评估依赖于两种互补但常常相互脱节的信号:带有客观正确性标签的静态基准测试,以及更能反映开放式用户交互的竞技场式偏好数据。我们提出 **DualEval**,一种潜在模型-项目校准框架,该框架将模型和评估项目表示在共享空间中,联合估计模型能力以及项目难度和区分度。我们在四个领域应用 DualEval:编程、数学、杂项领域知识任务以及通用的日常用户查询。我们的评估使用了 18 个前沿 LLM、静态基准标签以及奖励模型分数(这些分数针对开放式模型响应的预留人类偏好进行了验证)。实验上,我们的框架产生了可靠且均衡的模型排名,其学习到的项目层面特征支持下游应用,例如用于样本高效评估的基准压缩,以及用于数据污染或异常值分析的异常检测。总体而言,DualEval 通过联合模型-项目校准统一了静态评估和竞技场式评估,生成了模型排名和项目层面的诊断信息,支持更样本高效、可解释且可审计的评估管道。
## DualEval:面向统一 LLM 评估的联合模型-项目校准
Aaron J\. Li¹,Hao Huang¹,Youngmin Park¹,Yitong Ma¹,Wei\-Lin Chiang²,Li Chen²,Cho\-Jui Hsieh²,³,Bin Yu¹,Ion Stoica¹,²
¹加州大学伯克利分校
²Arena
³加州大学洛杉矶分校
https://dualeval.github.io/
https://github.com/aaron-jx-li/DualEval
††通讯作者:aaronjli@berkeley\.edu
## 1 引言
LLM 评估日益依赖两种互补信号:静态基准正确性和开放式竞技场中的人类偏好。静态基准提供了真实标签和标准化评分协议(Hendrycks 等人,2020(https://arxiv.org/html/2606.26429#bib.bib9);Chen 等人,2021(https://arxiv.org/html/2606.26429#bib.bib27);Austin 等人,2021(https://arxiv.org/html/2606.26429#bib.bib28)),但随着模型改进可能变得饱和或受到污染(Ott 等人,2022(https://arxiv.org/html/2606.26429#bib.bib3);Magar 和 Schwartz,2022(https://arxiv.org/html/2606.26429#bib.bib2))。竞技场式评估,例如 Chatbot Arena(Chiang 等人,2024(https://arxiv.org/html/2606.26429#bib.bib1)),通过 Bradley-Terry 式排名(Bradley 和 Terry,1952(https://arxiv.org/html/2606.26429#bib.bib5))更好地反映开放式用户交互,但开放式偏好判断可能涉及标注者分歧、主观性和系统性的评估者偏差,使其在没有额外结构的情况下难以解释(Van Der Lee 等人,2019(https://arxiv.org/html/2606.26429#bib.bib36);Basile 等人,2021(https://arxiv.org/html/2606.26429#bib.bib37);Zheng 等人,2023(https://arxiv.org/html/2606.26429#bib.bib18))。最近的工作开始连接基于基准和基于偏好的评估(Li 等人,2024(https://arxiv.org/html/2606.26429#bib.bib4);Ni 等人,2024(https://arxiv.org/html/2606.26429#bib.bib25)),但这两种设置仍然提供弱整合的模型能力视图。
此外,这两种设置基本上都是以模型为中心的:它们将项目层面的结果聚合为整体模型分数,将所有项目视为同等信息量。这忽略了一个关键见解:排名信号取决于模型-项目交互。几乎总能解决或几乎总是失败的项目在当前模型池中提供的区分度有限;最具信息量的项目是那些所评估模型之间微小能力差异能够转化为正确性或偏好结果中可检测差异的项目。建模这种项目结构可以使评估更稳定、更具可解释性且更具成本效益,同时还能识别哪些项目是饱和的、有区分度的或面向未来的。
为此,我们提出 **DualEval**,一个统一的评估框架,能够从静态基准正确性和竞技场式偏好信号中联合估计模型能力和项目属性。受项目反应理论(Item Response Theory, IRT)启发(Ackerman 等人,2003(https://arxiv.org/html/2606.26429#bib.bib7);Lord 和 Novick,2008(https://arxiv.org/html/2606.26429#bib.bib6)),DualEval 将模型能力和项目难度置于共享的潜在标度上。对于静态基准,我们在二值正确性标签上使用双参数逻辑 IRT 模型。对于竞技场式数据,我们使用奖励模型分数构建软成对偏好目标,并通过相同的潜在能力-难度结构进行拟合。这种新颖的联合公式允许正确性和偏好监督更新共享的模型和项目参数,不仅产生模型排名,还提供项目层面的诊断信息。
这种联合公式有两个关键优势。首先,它弥合了静态评估和竞技场评估之间的鸿沟:正确性标签和偏好信号可以更新相同的潜在模型参数,允许每种来源弥补对方的弱点。静态基准提供干净、受控的监督,而竞技场提示则提供更接近真实用户交互的开放式信号。其次,DualEval 将评估数据本身变成了分析对象。学习到的项目参数表征了每个问题的难度和区分度,识别出饱和或低信号的项目,并支持能够保留完整数据排名的低成本子集。
我们将 DualEval 应用于四个领域:编程、数学、杂项领域知识任务以及通用的日常用户查询。前三个领域结合了静态基准标签和针对开放式竞技场响应的奖励模型分数,而通用领域仅使用竞技场数据。我们的实验涵盖了来自多个提供商的 18 个前沿 LLM。竞技场监督使用我们专有的标量奖励模型(由 LM Arena 内部开发,并针对预留的人类偏好进行了验证);我们还使用公开的 Skywork-Reward-V2-Qwen3-8B 模型验证了鲁棒性。在各个领域中,DualEval 重构了两种评估信号,在三个静态锚定领域中达到了 88-92% 的静态标签准确率,以及在竞技场比较中 68-81% 的决定性配对一致性。与仅静态和仅竞技场的基线相比,联合模型在评估来源间产生了更均衡的排名,并且在替换奖励模型时依然保持鲁棒。其学习到的项目特征进一步支持诊断应用:在所有静态锚定领域中,按 Fisher 信息选择前 10% 的项目即可恢复完整数据排名,Spearman ρ ≥ 0.95;而在干净拟合参考下,基于残差的异常检测对静态标签目标可恢复注入污染(AUROC ≥ 0.995),对竞技场奖励目标可恢复 AUROC 为 0.93–0.98。
总的来说,我们将 LLM 评估重新定义为联合模型-项目校准,我们的贡献可总结如下:
- • 我们提出了 **DualEval**,一种新颖的评估范式,它在共享的潜在模型-项目标度上统一了静态基准正确性和开放式偏好信号,实现了相互信息的前沿模型评估和项目诊断。
- • 我们在编程、数学、杂项领域知识和通用日常用户查询四个领域中对 18 个前沿 LLM 评估了 DualEval,表明它在信号源之间产生了均衡的排名、稳定的 bootstrap 估计,并且在静态锚定领域中对奖励模型选择具有鲁棒性。
- • 我们展示了两种诊断应用:基于 Fisher 信息的基准压缩,可从小型高信号子集中恢复完整数据排名;以及基于残差的异常检测,可标记观测结果偏离拟合模型-项目预期的(模型,项目)对。
## 2 相关工作
#### 静态与开放式 LLM 评估。
静态基准涵盖自然语言推理和推理(Bowman 等人,2015(https://arxiv.org/html/2606.26429#bib.bib15);Williams 等人,2018(https://arxiv.org/html/2606.26429#bib.bib16);Wang 等人,2018(https://arxiv.org/html/2606.26429#bib.bib17))、问答(Rajpurkar 等人,2016(https://arxiv.org/html/2606.26429#bib.bib12);Yang 等人,2018(https://arxiv.org/html/2606.26429#bib.bib13);Kwiatkowski 等人,2019(https://arxiv.org/html/2606.26429#bib.bib11);Liang 等人,2022(https://arxiv.org/html/2606.26429#bib.bib19))和数学(Hendrycks 等人,2020(https://arxiv.org/html/2606.26429#bib.bib9);Cobbe 等人,2021(https://arxiv.org/html/2606.26429#bib.bib14);Hendrycks 等人,2021(https://arxiv.org/html/2606.26429#bib.bib10)),但在难度和区分度上差异很大(Zhou 等人,2026(https://arxiv.org/html/2606.26429#bib.bib29);Castleman 等人,2025(https://arxiv.org/html/2606.26429#bib.bib33);Wang 等人,2026(https://arxiv.org/html/2606.26429#bib.bib31))。诸如 Chatbot Arena(Chiang 等人,2024(https://arxiv.org/html/2606.26429#bib.bib1))和 MT-Bench(Zheng 等人,2023(https://arxiv.org/html/2606.26429#bib.bib18))等开放式偏好评估通过聚合的 Bradley-Terry 排名捕捉面向用户的质量,而没有显式的项目建模。已有若干工作尝试整合这两种设置(Li 等人,2024(https://arxiv.org/html/2606.26429#bib.bib4);Ni 等人,2024(https://arxiv.org/html/2606.26429#bib.bib25))。
#### IRT 与高效评估。
项目反应理论(Embretson 和 Reise,2013(https://arxiv.org/html/2606.26429#bib.bib21))在教育测试中已有长期应用,并早期被用于 NLP 中的实例级分析(Lalor 等人,2019(https://arxiv.org/html/2606.26429#bib.bib22);Martínez-Plumed 等人,2019(https://arxiv.org/html/2606.26429#bib.bib23))。最近的工作使用 IRT 式建模进行基准诊断(Zhou 等人,2026(https://arxiv.org/html/2606.26429#bib.bib29);Castleman 等人,2025(https://arxiv.org/html/2606.26429#bib.bib33))、无标签评估(Robertson,2025(https://arxiv.org/html/2606.26429#bib.bib26))、数据高效评估(Liao 等人,2025(https://arxiv.org/html/2606.26429#bib.bib24);Wang 等人,2025(https://arxiv.org/html/2606.26429#bib.bib32))以及自适应测试(Li 等人,2025(https://arxiv.org/html/2606.26429#bib.bib30))。这些方法通常在单一的评估源内运行,最常见的是客观正确性标签。DualEval 则不同,它将静态正确性与奖励蒸馏得到的开放式偏好耦合在共享的潜在模型-项目空间中。
## 3 方法
在我们的 DualEval 框架中,每个模型 \(i\) 被赋予一个能力参数 \(\theta_i \in \mathbb{R}\),每个任务 \(q\) 被赋予一个难度参数 \(b_q \in \mathbb{R}\) 和一个区分度参数 \(a_q > 0\),参数化为 \(a_q = \exp(k_q)\),其中 \(k_q \in \mathbb{R}\)。直观上,\(\theta_i - b_q\) 衡量模型 \(i\) 相对于任务 \(q\) 的能力水平,而 \(a_q\) 是一个区分度参数,控制当模型能力相对于项目难度变化时,预测成功概率的变化速度。
#### 静态 IRT。
对于带有二值正确性标签的静态基准,我们使用标准的双参数逻辑 IRT 模型:
\[
p_{i,q} = P(y_{i,q}=1) = \sigma(a_q(\theta_i - b_q)),
\]
其中 \(\sigma(\cdot)\) 是 Sigmoid 函数。令 \(\mathcal{S}\) 表示观测到的静态标签集合。我们定义静态损失为:
\[
\mathcal{L}_{\mathrm{static}} = \mathbb{E}_{(i,q) \in \mathcal{S}} \mathrm{BCE}\!\left(p_{i,q}, y_{i,q}\right).
\]
#### 奖励蒸馏的成对 IRT。
对于开放式评估,奖励模型为每个模型响应分配一个标量分数 \(r_{i,q}\)。我们的框架接受任何标量的响应质量评分函数;联合公式在静态正确性标签可用时提供了对奖励模型噪声的鲁棒性(附录 §F(https://arxiv.org/html/2606.26429#A6))。我们首先通过 \(z_{i,q} = \frac{r_{i,q} - \bar{r}}{\sigma_r}\) 对奖励进行全局标准化,其中 \(\bar{r}\) 和 \(\sigma_r\) 是所有奖励观测值的均值和标准差。对于每个问题 \(q\) 和模型对 \((i,j)\),我们定义一个软成对偏好目标:
\[
p^{*}_{ijq} = \sigma(z_{i,q} - z_{j,q}),
\]
它将奖励差距转换为校准后的偏好强度:较小的差距产生接近 0.5 的目标,而较大的差距则产生更确定的偏好。
给定共享的 IRT 参数,我们定义模型 \(i\) 在问题 \(q\) 上的潜在成功概率为:
\[
p_{i,q} = \sigma\!\left(a_q(\theta_i - b_q)\right).
\]
预测的偏好概率则为:
\[
\hat{P}(i \succ j \mid q) = \sigma\!\left(\gamma(p_{i,q} - p_{j,q})\right),
\]
其中 \(\gamma > 0\) 是学习到的竞技场温度参数。
#### 平局与双差过滤。
并非所有奖励导出的成对数据都能提供有用的相对偏好信号。我们使用经验奖励差距分布来识别平局:如果 \(|z_{i,q} - z_{j,q}| < \delta_{\mathrm{tie}}\),则该对标记为平局,其中 \(\delta_{\mathrm{tie}}\) 被选为成对绝对奖励差距的配置百分位数。平局项被排除在竞技场损失之外。
我们还识别“双差”对,即两个模型都获得较低的标准化奖励,且 \(\max(z_{i,q}, z_{j,q}) < \tau_{\mathrm{bb}}\),其中 \(\tau_{\mathrm{bb}}\) 被选为成对最大奖励的配置百分位数。令 \(\mathcal{A}_{\mathrm{dec}}\) 表示决定性的竞技场对(定义为非平局且非双差的对),令 \(\mathcal{A}_{\mathrm{bb}}\) 表示双差且非平局的对。我们定义完整的竞技场损失为:
\[
\mathcal{L}_{\mathrm{arena}} = \lambda_{\mathrm{pref}} \mathbb{E}_{(i,j,q) \in \mathcal{A}_{\mathrm{dec}}} \mathrm{BCE}\!\left(\hat{P}(i \succ j \mid q), p^{*}_{ijq}\right)
- \lambda_{\mathrm{bb}} \mathbb{E}_{(i,j,q) \in \mathcal{A}_{\mathrm{bb}}} \left[ \log(1-p_{i,q}) + \log(1-p_{j,q}) \right].
\]
第一项拟合来自决定性对的相对偏好证据。第二项将双差对视为绝对失败证据,将两个模型在该问题上的成功概率推向较低值,避免了“两个模型都失败”与“其中一个模型稍好”之间的梯度冲突。
#### 联合目标。
静态和竞技场组件共享相同的潜在参数 \((\theta, b, k)\)。完整的优化目标为:
\[
\mathcal{L} = \lambda_{\mathrm{static}} \mathcal{L}_{\mathrm{static}} + \mathcal{L}_{\mathrm{arena}}
+ \lambda_{\mathrm{reg}} \left( \|\theta\|_2^2 + \|b\|_2^2 + \|k\|_2^2 + (\log \tilde{\gamma})^2 \right).
\]
令 \(\gamma_0 = 4\) 表示默认的竞技场温度标度。我们将相对标度 \(\tilde{\gamma} = \gamma / \gamma_0\) 正则化到 1。
为了可识别性,在每个优化步骤之后,我们将模型能力的均值中心化为零,并将相同的偏移量吸收到项目难度中。相似文章
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
当校准排名反转时:面向LLM公平比较的精度控制评估
本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。
基于语义级奖励的LLM校准
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。
衡量开源权重 LLM 中的评估上下文发散:一种配对提示协议及对对齐管线特定异质性的初步证据
本文介绍了一种配对提示协议,用于衡量开源权重大型语言模型(LLM)中的“评估上下文发散”,研究发现模型的行为会根据提示是被框定为评估还是实际部署而有所不同。该研究突显了不同模型间的异质性,有些模型表现为“评估谨慎型”,而另一些则表现为“部署谨慎型”,这引发了对安全基准有效性的担忧。