ConfidenceBench:评估大型语言模型中的置信度校准
摘要
ConfidenceBench是一个新的基准测试,使用Brier分数评估大型语言模型中的口头置信度估计,揭示了准确性和校准之间的分歧,即使是高精度的模型也可能严重校准不良。
arXiv:2607.20526v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地被部署在那些流畅但不正确的答案可能代价高昂的场景中。在这些场景中,仅靠准确性是不够的:模型还必须知道它们何时可能出错。我们提出了ConfidenceBench,这是一个校准基准测试,使用Brier分数(一种激励真实概率报告的正确评分规则)评估15个前沿LLM的口头置信度估计。置信度通过提示来获取,无需访问模型逻辑,使得该框架适用于闭源和开源系统。该基准测试包含200个私有选择题,涵盖四个类别:空间推理、高精度数学、单词查找和不可知问题。在三次独立运行中,Claude Opus 4.6和Gemini 3.1 Pro Preview取得了最低的Brier分数,均为0.103。两者都大幅优于校准随机基线0.1875,而Gemini 3.1 Flash-Lite得分为0.367,表明严重校准不良。不同模型家族的准确性和校准之间存在显著差异:最准确的模型并不是校准最好的,一些模型尽管具有合理的准确性,但表现却比校准随机Brier基线更差。这些结果表明,口头置信度校准是LLM可靠性的一个独特且实际重要的维度,是对基于标准准确性评估的补充。
查看缓存全文
缓存时间: 2026/07/24 05:05
# 评估大型语言模型中的置信度校准
来源:https://arxiv.org/html/2607.20526
Matthew ffrench\-ConstantDaniel Yang独立研究员苏黎世联邦理工学院matt\.ffrench\-constant@cantab\.ac\.ukdaniel\.yang@inf\.ethz\.chXinmeng HuangSanyam Kapoor宾夕法尼亚大学纽约大学xinmengh@sas\.upenn\.edusanyam@nyu\.edu
###### 摘要
大型语言模型(LLMs)越来越多地被部署在那些流畅但错误的回答可能代价高昂的场景中。在这些场景中,仅靠准确性是不够的:模型还必须知道它们何时可能出错。我们提出了ConfidenceBench,这是一个校准基准,它使用Brier分数(一种激励真实概率报告的适当评分规则)评估15个前沿LLM的口语化置信度估计。置信度通过提示来获取,无需访问模型logits,使得该框架适用于闭源和开源系统。该基准包含200个私有选择题,涵盖四个类别:空间推理、高精度数学、单词查找和不可知问题。在三次独立运行中,Claude Opus 4.6和Gemini 3.1 Pro Preview取得了最低的Brier分数,均为0.1030.103。两者都显著优于校准随机基线0.18750.1875,而Gemini 3.1 Flash-Lite得分为0.3670.367,表明存在严重误校准。不同模型系列之间的准确性和校准存在显著差异:最准确的模型并非校准最佳的模型,并且尽管具有合理的准确性,有几个模型的性能仍低于校准随机Brier基线。这些结果表明,口语化置信度校准是LLM可靠性的一个独特且实际重要的维度,与基于标准准确性的评估相辅相成。
## 1 引言
大型语言模型(LLMs)越来越多地部署在错误答案代价高昂的场景中,从软件工程和科学辅助到教育、医学和决策支持(Zhang等人,2026 (https://arxiv.org/html/2607.20526#bib.bib18))。然而,即使是高性能模型也经常产生流畅但错误的输出,幻觉出无根据的主张(Kadavath等人,2022 (https://arxiv.org/html/2607.20526#bib.bib4)),或回答那些本应被视为不确定的问题。在这种情况下,仅靠准确性是不够的:一个虽然错误但置信度低的模型可能仍有帮助,而一个错误但置信度高的模型则可能造成实际危害。
因此,可靠的不确定性估计是安全有效部署的先决条件。如果一个LLM能够准确报告其何时可能出错,下游系统可以将困难查询路由到更强的模型,避免回答,请求人工审查,或仅在必要时分配额外计算资源。这使得置信度校准不仅对模型评估至关重要,而且对可靠性关键应用中的实际部署决策也至关重要(Zhang等人,2026 (https://arxiv.org/html/2607.20526#bib.bib18))。
不确定性量化(UQ)为这个问题提供了一个原则性的框架。对于LLM,存在两大类UQ方法。*白盒*方法从内部词元级概率分布中提取不确定性,提供理论上有根据的估计,但需要直接访问模型内部结构,这对于通过API提供服务的商业前沿模型通常是不可用的。*黑盒口语化*方法则通过提示让模型明确陈述其置信度,产生一个普遍适用的信号,但代价是依赖模型的自我知识(Kadavath等人,2022 (https://arxiv.org/html/2607.20526#bib.bib4); Lin等人,2022 (https://arxiv.org/html/2607.20526#bib.bib5); Tian等人,2023 (https://arxiv.org/html/2607.20526#bib.bib6))。口语化引发特别有吸引力,因为它可以统一应用于闭源和开源系统,无需logits、模型权重或重复采样。
尽管对LLM校准的兴趣日益增长,但现有的基准在很大程度上仍然以准确性为中心。诸如MMLU(Hendrycks等人,2020 (https://arxiv.org/html/2607.20526#bib.bib1))和BIG-Bench(Srivastava等人,2023 (https://arxiv.org/html/2607.20526#bib.bib2))等标准评估告诉我们模型正确回答了哪些问题,但没有说明其陈述的置信度是否可靠。最近的不确定性基准已开始解决这一差距,但许多基准聚合了广泛的数据集或侧重于弃权(Wang等人,2025 (https://arxiv.org/html/2607.20526#bib.bib16); Ye等人,2024 (https://arxiv.org/html/2607.20526#bib.bib9); Kirichenko等人,2025 (https://arxiv.org/html/2607.20526#bib.bib10)),而非使用适当的评分规则直接评估前沿模型的口语化概率校准。因此,我们仍然缺乏一个紧凑的基准,专门设计用于隔离现代LLM中不同的校准失败模式。
我们引入了ConfidenceBench,这是一个用于评估前沿LLM口语化置信度的校准基准。该基准包含200个私有选择题,涵盖四个类别:空间推理、高精度数学、单词查找和不可知问题。这些类别旨在暴露性质不同的认知失败模式,包括对看似合理但错误的回忆过度自信、多步推理错误以及在真正无法获取的信息面前的不确定性。
我们的贡献有三方面。首先,我们提出了一个受控的私有基准,直接评估陈述的置信度,而不仅仅是准确性。其次,我们使用Brier分数(一种激励真实概率报告的适当评分规则)在三次独立运行中评估了15个前沿LLM。第三,我们提供了人类基线和类别层面的分析,显示不同模型系列之间的准确性和校准可能显著不同。总之,这些结果表明置信度校准是LLM可靠性的一个基本维度,与基于标准准确性的评估相辅相成。
## 2 相关工作
#### 置信度引发。
LLM可靠性研究的一个核心问题是模型是否能准确评估和报告其自身的不确定性。Kadavath等人(2022 (https://arxiv.org/html/2607.20526#bib.bib4))和Lin等人(2022 (https://arxiv.org/html/2607.20526#bib.bib5))的早期工作表明,当适当提示时,模型可以表达校准后的置信度。后续研究表明,即使在黑盒设置中,简单的引发策略(要求模型报告概率)也能产生有意义的置信度估计(Tian等人,2023 (https://arxiv.org/html/2607.20526#bib.bib6); Xiong等人,2023 (https://arxiv.org/html/2607.20526#bib.bib7))(Yang等人,2024 (https://arxiv.org/html/2607.20526#bib.bib26))。
随着在专有API中通常限制对词元级概率的访问,这一点变得越来越重要。虽然基于logit的方法提供了理论上有根据的不确定性估计,但在许多实际部署中不可行。因此,口语化置信度提供了一种模型无关的替代方案,尽管由于其系统性过度自信而需要仔细评估。值得注意的是,来自人类反馈的强化学习(RLHF;Christiano等人,2017 (https://arxiv.org/html/2607.20526#bib.bib24); Ouyang等人,2022 (https://arxiv.org/html/2607.20526#bib.bib25))已被证明会扭曲内部概率估计(Kapoor等人,2024 (https://arxiv.org/html/2607.20526#bib.bib17)),这进一步推动了基于提示而非logits的黑盒引发方法。
#### 不确定性估计方法。
除了口语化置信度之外,广泛的文献探讨了替代性UQ方法,包括基于logit的置信度(Guo等人,2017 (https://arxiv.org/html/2607.20526#bib.bib3))、熵度量(Fadeeva等人,2023 (https://arxiv.org/html/2607.20526#bib.bib22))以及基于采样的方法,如自一致性(Xiong等人,2023 (https://arxiv.org/html/2607.20526#bib.bib7))。最近的调查(Liu等人,2025 (https://arxiv.org/html/2607.20526#bib.bib12))将这些方法分类为内部、基于采样和语言方法,每种方法在可靠性和计算成本方面都有权衡。基于采样的方法可以通过测量输出之间的变异性来改进不确定性估计,但需要多次前向传播。相比之下,口语化置信度提供了适合基于API评估的单次、可扩展信号。ConfidenceBench专注于这种实用且普遍适用的设置。
#### 校准基准。
最近的一些基准明确评估了LLM的不确定性。UBench(Wang等人,2025 (https://arxiv.org/html/2607.20526#bib.bib16))聚合了多个现有数据集以提供广泛覆盖,而Ye等人(2024 (https://arxiv.org/html/2607.20526#bib.bib9))则证明纳入不确定性会显著改变模型排名。Yang等人(2024 (https://arxiv.org/html/2607.20526#bib.bib26))提供了一个专门的口语化置信度分数基准,表明提示设计会显著影响不同模型的校准质量。最近调查(Liu等人,2025 (https://arxiv.org/html/2607.20526#bib.bib12))中涵盖的其他框架提供了广泛的评估工具,但侧重于覆盖范围而非针对性地隔离不确定性状态。
最近的工作也开始系统化地评估LLM不确定性的黑盒和基于基准的方法。Xiong等人(2023 (https://arxiv.org/html/2607.20526#bib.bib7))研究了黑盒LLM中的置信度引发,涵盖了提示策略、采样方法、聚合技术、校准和失败预测。他们发现,口语化置信度往往过于自信,尽管校准倾向于随着模型能力的提高而改善。LM-Polygraph(Fadeeva等人,2023 (https://arxiv.org/html/2607.20526#bib.bib22))提供了一个用于文本生成中不确定性估计的工程框架,实现了多种方法和一个可扩展的基准接口。MAQA(Yang等人,2025 (https://arxiv.org/html/2607.20526#bib.bib23))通过构建具有多个有效答案的问题来研究数据模糊性下的不确定性,强调当答案空间是多元而非单一值时,不确定性估计可能会下降。
一个关键的工作线是评估模型对不可回答问题的意识。Yin等人(2023 (https://arxiv.org/html/2607.20526#bib.bib8))测量了模型是否认识到自己缺乏知识,AbstentionBench(Kirichenko等人,2025 (https://arxiv.org/html/2607.20526#bib.bib10))评估了在多种不可回答场景下的弃权行为,发现推理微调会削弱弃权性能并导致自信的幻觉。特定领域的基准(Testoni and Calixto,2026 (https://arxiv.org/html/2607.20526#bib.bib13))进一步表明校准在不同领域之间存在显著差异,这加强了对针对性评估的需求。ConfidenceBench与先前工作的不同之处在于,它在统一的口语化置信度和Brier分数框架下评估一组紧凑、受控的不确定性状态,包括一个基于经验可验证但不可访问事实的“不可知”类别。
#### 评估指标。
校准通常使用期望校准误差(ECE;Naeini等人,2015 (https://arxiv.org/html/2607.20526#bib.bib20))来测量,但该指标对分箱选择敏感(Kumar等人,2019 (https://arxiv.org/html/2607.20526#bib.bib21))。适当的评分规则提供了一种更原则性的替代方案:Brier分数(Brier,1950 (https://arxiv.org/html/2607.20526#bib.bib15); Gneiting and Raftery,2007 (https://arxiv.org/html/2607.20526#bib.bib14))评估预测概率与结果之间的平方误差,并且在预测反映真实信念时唯一地最小化。最近的工作越来越倾向于使用Brier分数进行校准评估,因为它避免了分箱伪影;综合性的UQ评估框架(Lafage等人,2025 (https://arxiv.org/html/2607.20526#bib.bib11))也将其与互补指标一起使用。本文中使用的所有指标的正式定义见第3.3节 (https://arxiv.org/html/2607.20526#S3.SS3)。
ConfidenceBench通过四个设计选择来补充现有文献。首先,它使用明确的口语化概率引发,从而能够跨前沿模型进行黑盒评估。其次,它使用一个紧凑、私有、手工编写的问题集,旨在隔离不同的不确定性状态,包括一个受控的“不可知”类别。第三,它在重复运行中评估了15个前沿模型,并报告了运行间稳定性。第四,它使用Brier分数作为主要指标,直接奖励校准后的概率报告。与广泛的不确定性工具包或聚合基准不同,ConfidenceBench旨在作为置信度校准的针对性压力测试,而非通用能力的综合度量。
## 3 基准设计与方法
### 3.1 问题集
该基准包含200个选择题(每类50个),保持私有以防止训练数据污染。这四个类别是:
1. 空间推理:动态物理场景,需要对多个相互作用的对象或步骤进行仔细的心智模拟。*示例:*将一个弹珠放入杯底有孔的马克杯中,然后将杯子倒扣在桌子上。弹珠在哪里?
2. 高精度数学:多步计算,其中单个舍入错误或概念失误会产生一个看似合理但错误的答案。*示例:*取√867的第三位小数,乘以√456,四舍五入到最接近的整数。
3. 单词查找:从著名文本中回忆特定单词;错误选项都是合理的备选答案,因此无法通过猜测得到答案。*示例:*《哈利·波特与密室》第七章的第五个单词是什么?
4. 不可知:无法在没有直接预先访问特定现实世界对象或事件的情况下确定正确答案的问题。*示例:*2026年4月1日,马德里圣恩格拉西亚街和里奥斯罗萨斯街拐角处的售货亭是什么颜色?
所有200个问题均由作者手工编写和验证,并非来自任何现有数据集或基准。问题由第一作者在无LLM辅助的情况下编写,消除了基准与模型训练数据之间任何重叠的风险。这四个类别隔离了不同的认知失败模式,而非测试领域知识的广度:对已知未知的过度自信(不可知)、表面级别的过度猜测(单词查找)、多步错误累积(数学)和心智模拟缺口(空间)。正确答案经过独立确认:数学答案通过直接计算;空间、单词查找和不可知答案通过与主要来源交叉核对。错误选项是合理的备选答案,需要真正的知识或计算才能排除,而非通过排除法。
### 3.2 置信度引发
每个问题后附加一个提示,要求以JSON格式回复:`answer`(A–D)和`probability`(0–100,100 = 确定,25 = 四选项问题的校准随机基线)。完整的提示模板见附录C (https://arxiv.org/html/2607.20526#A3)。不可解析的响应和明确拒绝被记为25%的置信度并随机选择答案,而非排除。排除会人为提升那些在最难问题上拒绝最多的模型的表面校准度,系统性抬高它们的分数。
### 3.3 评估指标
令 \( p_i \in [0,1] \) 为模型对第 \( i \) 个问题指定正确答案的预测概率,\( o_i \in \{0,1\} \) 为指示答案正确与否的二元结果。Brier分数定义为:
\[
\text{Brier} = \frac{1}{N} \sum_{i=1}^{N} (p_i - o_i)^2
\]
其中 \( N = 200 \)。对于四选项问题,始终报告25%置信度的校准随机模型预期Brier分数为0.1875。Brier分数越低表示校准越好,在完美预测时为零。我们报告三次独立运行中的平均Brier分数,并评估运行间标准差。相似文章
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
当校准排名反转时:面向LLM公平比较的精度控制评估
本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。
CalBrief:大型语言模型证据校准式科学简报的试点诊断基准
本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。
分类器性能不确定性估计及其在大语言模型与嵌套数据中的应用
本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。