当校准排名反转时:面向LLM公平比较的精度控制评估

arXiv cs.CL 论文

摘要

本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。

arXiv:2606.30814v1 公告类型:新 摘要:校准评估模型的置信度与其经验精度是否一致。现有研究通常使用全局校准指标(如期望校准误差和Brier分数)来比较不同大语言模型的校准性能。我们首先从理论和实验上证明,此类比较受模型精度差异的混杂影响。为了实现更公平的跨模型比较,我们提出了ACE,一个包含三种互补视角的精度控制评估框架:实例对齐(Instance-Aligned)、分布对齐(Distribution-Aligned)和候选对齐(Candidate-Aligned)校准。在多个基准测试、模型家族和置信度获取方法上,我们使用ACE研究了两个实际重要的比较轴:小模型与大模型、思考模型与非思考模型。我们发现,许多先前在原始全局指标下报告的校准优势在控制精度后大幅减弱。我们还发现排名逆转频繁发生:在原始指标下受青睐的模型在控制精度后往往不再受青睐。我们的结果表明,原始全局校准指标在跨模型比较中并不稳健,公平的校准比较需要精度感知评估。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:31

# 当校准排名反转时:基于精度控制的LLM公平比较评估框架
来源:https://arxiv.org/abs/2606.30814
查看 PDF(https://arxiv.org/pdf/2606.30814)

> **摘要:** 校准评估的是模型置信度与其经验精度的一致性。现有研究通常使用全局校准指标(如期望校准误差和Brier分数)来比较不同大语言模型之间的校准效果。我们首先从理论和实验两方面证明,这类比较会受到模型精度差异的干扰。为了实现更公平的跨模型比较,我们提出了ACE——一个精度控制的评估框架,包含三种互补视角:实例对齐校准、分布对齐校准和候选对齐校准。在多个基准测试、模型家族及置信度获取方法上,我们利用ACE研究了两条实际重要的比较轴线:小模型与大模型、思考模型与非思考模型。我们发现,许多在原始全局指标下报告的校准优势在精度控制后显著减弱。我们还发现排名反转现象频繁:被原始指标偏好的模型在精度控制后往往不再受青睐。我们的结果表明,原始全局校准指标不适用于跨模型比较,公平的校准比较需要精度感知的评估。

## 提交历史

来自:Ruihan Yang [查看邮件(https://arxiv.org/show-email/6c7a7840/2606.30814)] **[v1]** 2026年6月29日星期一 18:37:48 UTC(9,358 KB)

相似文章

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。