Expectation Consistency Loss: 重新思考协变量偏移下的置信度校准

arXiv cs.LG 论文

摘要

本文介绍了Expectation Consistency Loss (ECL),这是一种基于理论的损失函数,用于在协变量偏移下校准分类器置信度,该函数源自一个称为Expectation Consistency Condition的必要充分条件。

arXiv:2605.21552v1 Announce Type: new 摘要:分类模型的置信度校准在安全关键决策场景中至关重要,并已受到广泛关注。一般的置信度校准方法假设训练和测试数据独立同分布,这限制了它们在协变量偏移下的有效性。先前在协变量偏移下的校准方法在处理类别级或规范校准时存在困难,并且当密度比很大或无界时,往往依赖于不稳定的重要性加权。鉴于上述局限性,本文重新思考了协变量偏移下的置信度校准。首先,我们推导出协变量偏移下置信度校准的一个必要充分条件,称为期望一致性条件(Expectation consistency condition),该条件表明协变量偏移并不必然导致置信度未校准,并且提供了比全局协变量分布对齐更弱的置信度校准条件。然后,利用期望一致性条件,本文提出了一种无监督域适应损失,用于校准目标域的置信度,称为期望一致性损失(Expectation consistency loss, ECL),它与规范校准、类别级校准和顶层标签校准兼容。第三,我们证明了计算ECL损失与期望校准误差(Expected Calibration Error, ECE)具有相同的样本复杂度,并为ECL损失提供了一个基于理论的小批量可训练方案。最后,我们在模拟和真实的协变量偏移数据集上验证了我们方法的有效性。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:48

# 期望一致性损失:重思协变量偏移下的置信度校准
来源:https://arxiv.org/html/2605.21552
###### 摘要

分类模型的置信度校准在安全关键的决策场景中至关重要,并已受到广泛关注。一般的置信度校准方法假设训练数据和测试数据独立同分布(i.i.d.),这限制了它们在协变量偏移下的有效性。现有的协变量偏移下校准方法难以处理类别级或规范校准,且当密度比过大或无界时往往依赖不稳定重要性加权。鉴于上述局限,本文重新思考协变量偏移下的置信度校准。首先,我们推导出协变量偏移下置信度校准的一个充要条件,称为**期望一致性条件**,该条件揭示了协变量偏移并不必然导致置信度失准,并为置信度校准提供了比全局协变量分布对齐更弱的要求。接着,利用期望一致性条件,本文提出一种无监督域适应损失来校准目标域的置信度,称为**期望一致性损失(ECL)**,它与规范校准、类别级校准和顶标签校准兼容。第三,我们证明计算ECL损失与期望校准误差(ECE)具有相同的样本复杂度,并为ECL损失提供了一种理论上有依据的小批量可训练方案。最后,我们在模拟和真实世界的协变量偏移数据集上验证了方法的有效性。

机器学习,ICML

## 1 引言

现代机器学习分类模型,如深度神经网络,日益精确并广泛应用于安全关键领域(LeCun 等,2015(https://arxiv.org/html/2605.21552#bib.bib23);Jiang 等,2023(https://arxiv.org/html/2605.21552#bib.bib22))。然而,这些领域的决策系统不仅需要高精度,还需要能够识别出何时可能出错(Munir 等,2023(https://arxiv.org/html/2605.21552#bib.bib24))。例如,在自动疾病诊断中,如果模型对其预测置信度较低,则应交由医疗专业人员处理(Jiang 等,2011(https://arxiv.org/html/2605.21552#bib.bib25))。因此,分类模型应在其预测的同时提供准确的置信度估计,以反映事件的真实可能性。准确的置信度比单纯的类别标签更具信息量,例如,说“患者有70%的可能性患有癌症”比仅仅标记为“癌症”能给医生提供更多可操作的信息。此外,准确的置信度有助于分类模型更好地与其他概率模型集成,例如,帮助主动学习选择更具代表性的样本(Han 等,2024(https://arxiv.org/html/2605.21552#bib.bib26)),并提高知识蒸馏的泛化性能(Li 和 Caragea,2023(https://arxiv.org/html/2605.21552#bib.bib27))。因此,追求分类模型中更准确的置信度具有重要意义(Gawlikowski 等,2023(https://arxiv.org/html/2605.21552#bib.bib28))。

近年来,置信度校准已成为产生更可靠置信度估计的最有效方法之一,并吸引了广泛关注(Guo 等,2017(https://arxiv.org/html/2605.21552#bib.bib31);Zhang 等,2020(https://arxiv.org/html/2605.21552#bib.bib32);Kull 等,2019(https://arxiv.org/html/2605.21552#bib.bib33);Dong 等,2025b(https://arxiv.org/html/2605.21552#bib.bib29))。然而,一般的置信度校准方法通常假设目标域(或测试集)与源域(或校准集)是独立同分布的(i.i.d.)。当这一假设因分布偏移而被违反时,校准性能往往显著下降(Zhu 等,2024(https://arxiv.org/html/2605.21552#bib.bib34))。协变量偏移是一种常见的数据分布偏移类型,经常出现在真实世界任务中,如不同人群间的医疗诊断或不同光照条件下的图像识别,此时模型的输入数据分布发生变化,而输入与输出之间的潜在关系保持一致(Kimura 和 Hino,2024(https://arxiv.org/html/2605.21552#bib.bib36))。在协变量偏移下,在源域上校准的模型常常无法泛化到目标域,导致置信度估计不可靠(Bickel 等,2009(https://arxiv.org/html/2605.21552#bib.bib35))。这凸显了开发在协变量偏移下仍然稳健的置信度校准方法的重要性(Hu 等,2024(https://arxiv.org/html/2605.21552#bib.bib37))。

目前,协变量偏移下的主流置信度校准方法基于重要性加权(Pampari 和 Ermon,2020(https://arxiv.org/html/2605.21552#bib.bib39);Park 等,2020(https://arxiv.org/html/2605.21552#bib.bib38);Wang 等,2020(https://arxiv.org/html/2605.21552#bib.bib40),2023(https://arxiv.org/html/2605.21552#bib.bib41)),通过根据源域实例的重要性分配权重来调整目标函数,从而引导模型无偏地泛化到目标域(Kimura 和 Hino,2024(https://arxiv.org/html/2605.21552#bib.bib36))。然而,众所周知,重要性加权在密度比过大或无界时因其不稳定性而备受批评(Cortes 等,2010(https://arxiv.org/html/2605.21552#bib.bib42))。Hu 等(2024(https://arxiv.org/html/2605.21552#bib.bib37))使用 mixup 合成伪目标数据,并将校准性能从伪目标数据泛化到目标域。然而,该方法的有效性主要取决于伪目标数据与目标域数据的相似程度。此外,现有方法主要处理最简单的基于预测的校准(即顶标签校准)。据我们所知,针对协变量偏移的类别级和规范校准方法仍然明显缺失。

置信度校准中的重要性加权旨在全局对齐协变量分布,这受协变量偏移下精度提升的启发。然而,置信度校准与精度提升有根本区别:它要求不是学习新知识,而是准确传达不确定性。这引出一个自然但常被忽视的问题:**全局协变量分布对齐是否必要?** 为回答此问题,我们首先推导出协变量偏移下置信度校准的一个充要条件,称为**期望一致性条件**。该条件表明,协变量偏移并不必然导致校准失效,并且比全局分布对齐要求更弱。基于这一条件,我们提出一种无监督域适应损失——**期望一致性损失(ECL)**,包含三个变体分别用于规范校准、类别级校准和顶标签校准。我们证明 ECL 的样本复杂度为 O(B/ε²),与直方图分箱相当,其中 B 表示置信度分箱数量。为了实现小批量数据上无偏的梯度反向传播,我们还为 ECL 提供了一种理论上有据可依的小批量训练方案。最后,我们在模拟和真实世界的协变量偏移数据集上验证了该方法。

表1:ECL与相关校准方法的比较。

| 方法 | 协变量偏移 | 类别级校准 | 规范校准 | 密度比无界 | 小批量可训练 |
|------|------------|------------|----------|--------------|----------------|
| SB-ECE(Karandikar 等,2021(https://arxiv.org/html/2605.21552#bib.bib44)) | ✗ | ✗ | ✗ | ✓ | ✗ |
| DE-ECE(Bohdal 等,2023(https://arxiv.org/html/2605.21552#bib.bib45)) | ✗ | ✗ | ✗ | ✓ | ✗ |
| ECE^KDE(Popordanoska 等,2022(https://arxiv.org/html/2605.21552#bib.bib43)) | ✗ | ✓ | ✓ | ✓ | ✓ |
| Weighted TS(Pampari 和 Ermon,2020(https://arxiv.org/html/2605.21552#bib.bib39)) | ✓ | ✗ | ✗ | ✗ | ✗ |
| FL+IW+Temp(Park 等,2020(https://arxiv.org/html/2605.21552#bib.bib38)) | ✓ | ✗ | ✗ | ✗ | ✗ |
| TransCal(Wang 等,2020(https://arxiv.org/html/2605.21552#bib.bib40)) | ✓ | ✗ | ✗ | ✗ | ✗ |
| DRL(Wang 等,2023(https://arxiv.org/html/2605.21552#bib.bib41)) | ✓ | ✗ | ✗ | ✗ | ✗ |
| PseudoCal(Hu 等,2024(https://arxiv.org/html/2605.21552#bib.bib37)) | ✓ | ✗ | ✗ | ✓ | ✗ |
| **ECL(本文方法)** | ✓ | ✓ | ✓ | ✓ | ✓ |

## 2 背景与相关工作

考虑一个 K 类分类问题,其中 X∈X 表示输入特征,Y=(Y₁,…,Y_K)∈Y 表示 K 类独热编码标签变量,X⊂R^d,Y={e_k}_{k=1}^K,其中 e_k 是第 k 个分量为 1 的单位向量。令 f:X→S⊂Δ_{K-1} 为概率分类器,其中 Δ_{K-1} 表示 (K-1) 维单纯形。预测的置信度得分向量为 S=f(X)=(f₁(X),…,f_K(X))=(S₁,…,S_K)∈S。通常,真实类别标量为 Y* = argmax_k{Y_k}_{1≤k≤K},预测类别为 Ŷ = argmax_k{S_k}_{1≤k≤K},预测类别的置信度得分为 Ŝ = max{S_k}_{1≤k≤K}。

在协变量偏移下,令 P_s(·) 和 P_t(·) 分别表示源域和目标域的概率密度(对于连续变量,如 X、X|S、S|X、X|Y)或概率测度(对于离散变量,如 Y、Y|S、Y|X)。P 在不需要区分源域和目标域时可指代 P_s 或 P_t。令 D_s 和 D_t 分别表示源域和目标域的数据。

### 2.1 置信度校准

置信度校准旨在将预测的置信度向量与事件发生的真实后验概率相匹配。正式表述如下:

###### 定义 2.1.

(完美校准)若以下等式成立,则称分类器完美校准:

P(Y_k=1 | S=s) = s_k, ∀1≤k≤K,   (1)

其中 s=(s₁,…,s_K) 是 S 上观察到的置信度得分向量。

注:定义1(https://arxiv.org/html/2605.21552#S2.E1)考虑的是最严格的校准范式,称为规范校准(Dong 等,2025a(https://arxiv.org/html/2605.21552#bib.bib30))。附录A(https://arxiv.org/html/2605.21552#A1)给出了另外两种常见校准范式:顶标签校准(Guo 等,2017(https://arxiv.org/html/2605.21552#bib.bib31))和类别级校准(Kull 等,2019(https://arxiv.org/html/2605.21552#bib.bib33))。

现有通用工作主要分为两类:训练时校准(Liu 等,2023(https://arxiv.org/html/2605.21552#bib.bib15);Müller 等,2019(https://arxiv.org/html/2605.21552#bib.bib13);Fernando 和 Tsokos,2022(https://arxiv.org/html/2605.21552#bib.bib16);Hebbalaguppe 等,2022(https://arxiv.org/html/2605.21552#bib.bib17);Grathwohl 等,2020(https://arxiv.org/html/2605.21552#bib.bib18);Yang 和 Ji,2021(https://arxiv.org/html/2605.21552#bib.bib19))和后处理校准(Guo 等,2017(https://arxiv.org/html/2605.21552#bib.bib31);Kull 等,2019(https://arxiv.org/html/2605.21552#bib.bib33);Zhang 等,2020(https://arxiv.org/html/2605.21552#bib.bib32);Rahimi 等,2020(https://arxiv.org/html/2605.21552#bib.bib20);Gupta 等,2021(https://arxiv.org/html/2605.21552#bib.bib21);Dong 等,2025b(https://arxiv.org/html/2605.21552#bib.bib29))。训练时校准通常在分类器训练过程中通过调整目标函数来进行校准,而后处理校准则是在校准数据集上以事后方式学习分类器输出的变换(称为校准映射)。然而,这些方法的有效性依赖于目标域与源域之间的 i.i.d. 假设。当发生协变量偏移时,该 i.i.d. 假设被违反,使得上述方法难以有效校准置信度。

### 2.2 协变量偏移下的置信度校准

在协变量偏移中,目标域与源域具有不同的特征分布,但具有相同的条件分布。正式表述如下:

###### 定义 2.2.

(协变量偏移)若满足以下两个条件,则发生协变量偏移:P_s(X) ≠ P_t(X) 且 P_s(Y|X) = P_t(Y|X)。

表1(https://arxiv.org/html/2605.21552#S1.T1)总结了相关校准方法在五个关键维度上的特征,包括是否能够处理协变量偏移、是否支持类别级/规范校准、是否能够处理无界密度比,以及是否理论上可小批量训练。如图所示,现有方法通常仅覆盖部分能力。相比之下,我们的 ECL 同时满足所有维度,展示了该方法的全面性和通用性。

## 3 方法

### 3.1 期望一致性条件

先前研究(Pampari 和 Ermon,2020(https://arxiv.org/html/2605.21552#bib.bib39);Wang 等,2020(https://arxiv.org/html/2605.21552#bib.bib40);Park 等,2020(https://arxiv.org/html/2605.21552#bib.bib38);Wang 等,2023(https://arxiv.org/html/2605.21552#bib.bib41);Hu 等,2024(https://arxiv.org/html/2605.21552#bib.bib37))已通过实验证明,协变量偏移可能导致在源域上校准的置信度在目标域上失效。然而,仅凭实验证据无法涵盖所有可能情况。这些观察结果的理论基础值得探讨以进一步支持该问题并帮助解决它。为此,本文推导了协变量偏移下置信度校准的一个充要条件,如定理3.1(https://arxiv.org/html/2605.21552#S3.Thmtheorem1)所示。

###### 定理 3.1.

(期望一致性条件)∀1≤k≤K,P_s(Y_k=1|S) = P_t(Y_k=1|S) 当且仅当:E_{X~P_s(X|S)}[P(Y_k=1|X)] = E_{X~P_t(X|S)}[P(Y_k=1|X)],其中 P(Y_k=1|X)=P_s(Y_k=1|X)=P_t(Y_k=1|X)。证明见附录B(https://arxiv.org/html/2605.21552#A2)。

关于定理3.1(https://arxiv.org/html/2605.21552#S3.Thmtheorem1)的说明:源域通常可以通过一般校准方法轻松得到良好校准,至少比目标域好得多(见附录C(https://arxiv.org/html/2605.21552#A3))。定理3.1告诉我们,只要满足期望一致性条件,目标域就能被校准到与源域相同的水平。条件 E_{X~P_s(X|S)}[P(Y_k=1|X)] = E_{X~P_t(X|S)}[P(Y_k=1|X)](该条件实际上意味着在给定 S 的条件下,源域和目标域的 X 分布关于函数 P(Y_k=1|X) 的期望值相等)比要求 P_s(X|S) 和 P_t(X|S) 完全相等(即全局分布对齐)要弱得多。因此,该条件指出了在协变量偏移下实现置信度校准的一种更高效的方式。

(注意:由于原文在中途被截断,翻译到此处为止。后续内容(如3.2节及以后)未提供,因此无法继续翻译。但根据要求,应仅翻译给出的原文内容。已完整翻译所提供的部分。)

相似文章

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。