温度缩放并不足够:人类标签分布下的校准差距
摘要
本文研究了当温度缩放——一种依赖独热标签的常见事后校准方法——应用于反映真实人类分歧的软标签分布训练模型时所产生的校准差距。跨视觉和语言领域的实验表明,基于硬标签校准的温度缩放始终逊于直接软标签校准,且在语言任务中差距更大,凸显了在安全关键部署中的风险。
arXiv:2607.13423v1 公告类型:新
摘要:温度缩放是现代深度学习中最主要的事后校准方法。其理论依据基于一个很少明确陈述的假设:真实标签是独热且确定性的。在实践中,标签往往是软标签、众包标签或真正分布式的,反映了人类标注者之间的真实分歧,而非标注噪声。我们研究当这一假设被违反时,温度缩放是否还能保持其校准特性,以及任何性能退化是否取决于模型规模。使用 CIFAR-10H 和 ChaosNLI 这两个带有标注人员软标签分布的公开数据集,我们在硬独热和软分布标签目标下评估了每种模态的三种模型规模。在所有九种配置中,我们发现了正软标签校准差距:基于硬标签校准的温度缩放始终逊于直接基于软标签校准的预知模型,Brier 分数差距在 0.002 到 0.134 之间。在视觉领域和 ChaosNLI 的 SNLI 衍生子集上,差距随模型规模单调增加,并且在语言领域(平均差距 0.079)显著大于视觉领域(平均差距 0.003)。在 MNLI 衍生子集上,在匹配领域训练后出现了规模顺序反转;我们认为这无法对规模假设得出结论,主要归因于该子集上接近随机的准确率。作为第二个事后校准基线,多类保序回归得出了相同的定性结论:在所有九种配置中均存在正软标签差距,且语言领域差距大于视觉领域。这些发现表明,基于多数投票标签的校准协议会在标签歧义具有结构性的地方系统性地误报模型可靠性,对安全关键环境下的部署产生直接影响。
查看缓存全文
缓存时间: 2026/07/16 04:22
# 人类标签分布下的校准差距 来源:https://arxiv.org/html/2607.13423 ## 温度缩放还不够:人类标签分布下的校准差距 Wisdom Dogah 计算与数学科学学院,矿业与技术大学(UMaT),加纳塔夸。 BlackMatrix AI Research,加纳阿克拉。 通讯作者:[email protected] (https://arxiv.org/html/2607.13423v1/mailto:[email protected])。预印本。欢迎评论。 (2026年7月) ###### 摘要 温度缩放是现代深度学习中占主导地位的后验校准方法。其理论依据建立在一个很少被明确陈述的假设之上:真实标签是独热且确定性的。实际上,标签通常是软标签、众包的或真正分布式的,这反映了人类标注者之间的真实分歧,而非标注噪声。我们研究了当这一假设不成立时,温度缩放是否仍能保持其校准特性,以及任何由此产生的退化是否依赖于模型规模。使用CIFAR-10H和ChaosNLI这两个公开可用的、带有标注软标签分布的数据集,我们在硬独热和软分布标签目标下,评估了每种模态的三个模型规模。在所有九种配置中,我们发现了一个正的软标签校准差距:在硬标签上校准的温度缩放始终不如直接在软标签上校准的“神谕”方法,Brier分数差距范围为0.002到0.134。在视觉域和ChaosNLI的SNLI衍生子集上,差距随模型规模单调增长;而在语言域(平均差距0.079)上则显著大于视觉域(平均差距0.003)。在MNLI衍生子集上,出现了规模顺序反转,在匹配域训练后仍然存在;我们将其视为规模假设的非结论性证据,并主要将其归因于该子集上接近随机猜测的准确率。作为第二个后验基线,多类别等渗回归得出了相同的定性结论:在所有九种配置中均存在正的软标签差距,且语言域上的差距大于视觉域。这些发现表明,基于多数投票标签的校准协议会系统地误判模型在标签歧义结构性存在时的可靠性,这对在安全关键场景中的部署有直接影响。 关键词:校准;温度缩放;软标签;标签歧义;期望校准误差;Brier分数;等渗回归;模型规模;不确定性量化。 ## 1 引言 当预测置信度与经验准确率相匹配时,概率分类器被良好地校准:在所有置信度为 \(p\) 的预测中,大约有 \(p\) 的比例应该是正确的[4 (https://arxiv.org/html/2607.13423#bib.bib5)]。在安全关键应用中,一个错误校准且自信错误的模型比一个不确定但能正确标识自身局限性的模型构成更大的风险。自信预测的后果在医学影像、内容审核和司法风险评估中已有充分记录。 温度缩放[7 (https://arxiv.org/html/2607.13423#bib.bib7)]是神经网络中最广泛部署的后验校准方法。通过在一个留出验证集上最小化负对数似然来拟合一个标量 \(T\),并在推理时在softmax之前将logits除以 \(T\)。该方法不增加参数,也不需要重新训练,这解释了其近乎普遍的采用。其局限性——也是本文所衡量的——在于其优化目标隐含地假设真实标签是独热且确定性的。 每当标注任务涉及真正的分歧,以至于正确答案不是单一类别而是一个可能答案的分布时[1 (https://arxiv.org/html/2607.13423#bib.bib1)],这一假设就会失效。两个数据集使这种分歧显式化。CIFAR-10H[14 (https://arxiv.org/html/2607.13423#bib.bib13)]为CIFAR-10测试集的每张图像提供了软标签分布,该分布源自每个图像平均51个人工标注。ChaosNLI[12 (https://arxiv.org/html/2607.13423#bib.bib10)]为自然语言推理中表现出显著语义歧义的实例提供了每个实例100个人为判断。如果人类标注者意见平分,而模型却对单一类别分配高置信度,那么即使其预测类别与多数投票一致,该模型在任何有意义的意义上都没有被校准。 我们进行了一项受控测量研究,以测试针对硬独热标签校准的温度缩放在针对软分布目标进行评估时,是否仍能作为有效的校准策略,以及任何退化是否与模型容量成比例。我们还比较了在相同硬和软拟合协议下的多类别等渗回归[19 (https://arxiv.org/html/2607.13423#bib.bib19)]。 ### 1.1 假设 我们测试三个预先设定的假设。 - • **H1(差距存在性)**。在硬标签上校准的温度缩放,相对于针对软标签分布直接校准的“神谕”方法,会产生严格更差的Brier分数。我们将此差异称为软标签校准差距(第3.4节 (https://arxiv.org/html/2607.13423#S3.SS4))。 - • **H2(规模依赖性)**。在每个数据集内,软标签校准差距随模型规模单调增加,这与更大模型倾向于更高置信度的发现一致[7 (https://arxiv.org/html/2607.13423#bib.bib7)]。 - • **H3(模态依赖性)**。语言域(ChaosNLI)的软标签校准差距大于视觉域(CIFAR-10H),这反映了自然语言推理中相对于目标分类具有更高的真正语义歧义率。 ### 1.2 贡献 - • 我们形式化了软标签校准差距,并提供了一个利用现有软标签数据集估计它的协议(第3节 (https://arxiv.org/html/2607.13423#S3))。 - • 我们报告了跨两种模态和两种软标签资源(第5节 (https://arxiv.org/html/2607.13423#S5))的系统性跨规模测量。 - • 我们分析了在匹配域训练和评估下,ChaosNLI-M上的规模顺序异常(第5.3节 (https://arxiv.org/html/2607.13423#S5.SS3))。 - • 我们展示了在等渗回归(第二种后验校准器)下差距仍然存在(第5.5节 (https://arxiv.org/html/2607.13423#S5.SS5))。 - • 我们讨论了在有歧义和资源受限的标签设置中校准实践的含义(第6节 (https://arxiv.org/html/2607.13423#S6))。 ## 2 相关工作 ### 2.1 神经网络的校准 Guo等人[7 (https://arxiv.org/html/2607.13423#bib.bib7)]发现现代深度网络比以前架构更显著地过度自信,并提出了温度缩放作为有效的后验校正方法。后续工作提出了等渗回归[19 (https://arxiv.org/html/2607.13423#bib.bib19)]、Platt缩放[15 (https://arxiv.org/html/2607.13423#bib.bib11)]和Dirichlet校准[9 (https://arxiv.org/html/2607.13423#bib.bib8)]作为替代方案。Minderer等人[11 (https://arxiv.org/html/2607.13423#bib.bib9)]发现Vision Transformers在分布内往往比卷积架构更好校准。Bai等人[2 (https://arxiv.org/html/2607.13423#bib.bib2)]从分析上表明过度自信不仅仅是过度参数化的结果。Kumar等人[10 (https://arxiv.org/html/2607.13423#bib.bib6)]表明由于分箱伪影,ECE往往低估真实的错误校准,这促使我们使用Brier分数作为补充指标。 ### 2.2 软标签与人类分歧 关于从群体中学习[16 (https://arxiv.org/html/2607.13423#bib.bib15)]和标注分歧[1 (https://arxiv.org/html/2607.13423#bib.bib1)]的工作已经确定,人类标签变异性携带着任务歧义的信息。Peterson等人[14 (https://arxiv.org/html/2607.13423#bib.bib13)]引入了CIFAR-10H。Nie等人[12 (https://arxiv.org/html/2607.13423#bib.bib10)]引入了ChaosNLI,以揭露多数投票标签所掩盖的真正语义歧义。将它们用作分布目标下的校准基准是本文的具体焦点。 ### 2.3 分布偏移下的校准 Ovadia等人[13 (https://arxiv.org/html/2607.13423#bib.bib12)]表明,即使在准确性部分保持的情况下,校准也会因数据集偏移而退化。Guillory等人[6 (https://arxiv.org/html/2607.13423#bib.bib4)]发现基于置信度的准确性估计器在自然分布偏移下会退化。Wiles等人[18 (https://arxiv.org/html/2607.13423#bib.bib3)]表明,更大的模型和更大的预训练语料库倾向于在标准协议下同时提高OOD准确性和校准。这些工作都没有研究偏移发生在标签分布而非输入分布的情况。 ## 3 问题形式化 ### 3.1 符号表示 令 \(\mathcal{X}\) 为输入空间,\(\mathcal{Y}=\{1,\ldots,K\}\) 为标签空间。分类器 \(f:\mathcal{X}\rightarrow \Delta(\mathcal{Y})\) 将输入映射到类别上的概率分布。硬标签数据集 \(\mathcal{D}_{\mathrm{hard}}=\{(x_i,y_i)\}\) 将每个输入与单个类别标签 \(y_i\in\mathcal{Y}\) 配对。软标签数据集 \(\mathcal{D}_{\mathrm{soft}}=\{(x_i,q_i)\}\) 将每个输入与一个分布 \(q_i\in\Delta(\mathcal{Y})\) 配对,该分布表示实例 \(x_i\) 的人工标注的经验分布。 ### 3.2 硬标签下的校准 如果对所有 \(p\in[0,1]\),有 \[\mathbb{P}\!\left(y=\arg\max f(x)\,\middle|\,\max f(x)=p\right)=p,\] 则分类器 \(f\) 在硬标签下是校准的。ECE通过将预测分入 \(M\) 个箱来近似此条件[7 (https://arxiv.org/html/2607.13423#bib.bib7)]: \[\mathrm{ECE}=\sum_{m=1}^{M}\frac{|B_m|}{n}\left|\mathrm{acc}(B_m)-\mathrm{conf}(B_m)\right|.\] 温度缩放找到 \(T^\star\) 以在 \(\mathcal{D}_{\mathrm{val}}\) 上最小化负对数似然,其中 \(p_T(y\mid x)=\mathrm{softmax}(\mathrm{logits}(x)/T)\)[7 (https://arxiv.org/html/2607.13423#bib.bib7)]: \[T^\star=\arg\min_T\;-\frac{1}{|\mathcal{D}_{\mathrm{val}}|}\sum_{(x,y)\in\mathcal{D}_{\mathrm{val}}}\log p_T(y\mid x).\] ### 3.3 软标签下的校准 如果分类器的预测分布在期望上匹配人工标注分布,则该分类器是软校准的。Brier分数[3 (https://arxiv.org/html/2607.13423#bib.bib14)]是软目标上的一个严格适当评分规则: \[\mathrm{BS}=\frac{1}{n}\sum_{i=1}^{n}\sum_{k=1}^{K}\bigl(f_k(x_i)-q_{ik}\bigr)^2.\] ### 3.4 软标签校准差距 ###### 定义1(软标签校准差距)。 对于具有硬标签最优温度 \(T^\star\) 的模型 \(f\),软标签校准差距为 \[\mathrm{Gap}(f,T^\star)=\mathrm{BS}_{\mathrm{soft}}(f_{T^\star})-\mathrm{BS}_{\mathrm{soft}}(f_{T_{\mathrm{oracle}}}),\] 其中 \(T_{\mathrm{oracle}}\) 直接在软标签上最小化方程3(Brier分数)。正的差距表明硬标签校准未能达到在真实分布目标下可达到的质量。 对于等渗回归,通过将温度映射替换为分别在硬验证标签和软“神谕”标签上拟合的校准器,可以定义类似的差距。 ## 4 实验设计 ### 4.1 数据集 我们使用两个公开可用的软标签数据集。CIFAR-10H[14 (https://arxiv.org/html/2607.13423#bib.bib13)]为所有10,000张CIFAR-10测试图像提供了每个图像平均51个人工标注。ChaosNLI[12 (https://arxiv.org/html/2607.13423#bib.bib10)]为来自SNLI (ChaosNLI-S) 和 MNLI匹配 (ChaosNLI-M) 的NLI示例提供了每个实例100个人工判断。 ### 4.2 模型 对于视觉,我们使用ResNet-18 (11M)、ResNet-50 (25M) 和 ResNet-101 (44M) [8 (https://arxiv.org/html/2607.13423#bib.bib16)],在CIFAR-10上从头训练,使用随机裁剪、水平翻转、SGD和余弦退火学习率,训练30个周期(这是我们发布代码中使用的配方)。对于语言,我们使用DistilBERT-base-uncased[17 (https://arxiv.org/html/2607.13423#bib.bib18)]、BERT-base-uncased 和 BERT-large-uncased[5 (https://arxiv.org/html/2607.13423#bib.bib17)]。每次语言运行从域匹配的NLI检查点(SNLI用于ChaosNLI-S;MNLI用于ChaosNLI-M)开始,并在10,000个示例的训练子集上以学习率 \(2\times10^{-5}\) 和AdamW调整一个周期。对于SNLI上的BERT-large,我们使用从基础bert-large-uncased开始的独立微调检查点(而非来自MNLI检查点),因此ChaosNLI-S条件不受MNLI预训练的干扰。 ### 4.3 校准协议 对于每个模型:(1) 在硬标签上训练或调整;(2) 在保留的硬标签验证集上通过最小化方程2(负对数似然)并使用L-BFGS拟合 \(T_{\mathrm{hard}}\);(3) 在软标签测试集的前半部分上通过最小化方程3(Brier分数)拟合 \(T_{\mathrm{oracle}}\);(4) 在保留的后半部分上评估两者;(5) 计算针对硬目标和软目标的ECE(15个等宽箱)和Brier分数。对于等渗回归,我们在softmax分数上拟合每类的一对其余等渗映射[19 (https://arxiv.org/html/2607.13423#bib.bib19)],使用相同的硬验证和软“神谕”划分,并将校准后的分数重新归一化为概率单纯形。每个配置使用种子42、123和456重复三次;我们报告均值和标准差。 ## 5 结果 ### 5.1 视觉:CIFAR-10H 表1:三种ResNet规模在CIFAR-10H上的校准结果。数值为3个种子的均值(标准差)。ECE针对硬argmax标签;BS针对完整软分布。Gap = TS-Hard BS − TS-Soft BS(来自未四舍五入的值)。TS-Soft是需要在拟合时使用软标签的“神谕”条件。 表1 (https://arxiv.org/html/2607.13423#S5.T1) 报告了视觉结果。软标签校准差距在所有三个模型上均为正(支持H1),且随规模从0.002增加到0.003(视觉中支持H2)。绝对幅度不大:对于ResNet-101,最大差距约占TS-Hard Brier分数的3%。\(T_{\mathrm{oracle}}/T_{\mathrm{hard}}\) 比值范围为1.26到1.32,这与CIFAR-10H中标注者分歧相对较低一致。 ### 5.2 语言:ChaosNLI 表2:在ChaosNLI-S和ChaosNLI-M上的校准结果。DS = 子集(S = SNLI衍生,M = MNLI衍生)。ChaosNLI-S上的BERT-large使用独立的SNLI检查点(\(T_{\mathrm{hard}} \approx 0.980\))。数值为3个种子的均值(标准差)。 表2 (https://arxiv.org/html/2607.13423#S5.T2) 报告了语言结果。在ChaosNLI-S上,差距随规模单调增加:0.045、0.050、0.053(支持H2)。\(T_{\mathrm{oracle}}/T_{\mathrm{hard}}\) 比值在语言中约为2.2到3.5,而视觉中为1.2到1.3。对于ChaosNLI-S上的BERT-large,差距为
相似文章
重新思考温度在大语言模型蒸馏中的作用
本文重新审视了温度在大语言模型蒸馏中的作用,揭示出温度不对称地更有利于正向KL散度而非反向KL,使得简单的KL方法在较高温度下能够匹敌当前最先进的蒸馏方法。
概率校准是大语言模型中的一项可训练能力
本文研究了语言模型的概率校准能力是否可以通过微调得到提升,并在12种模型上比较了软目标和硬目标两种方法。结果表明,校准能力是可以训练的,但有时会导致下游算术推理能力的下降。
校准偏好学习:以标签排序为例
本文形式化了概率标签排序的校准定义,引入了校准概念的层次结构,并表明常见模型校准不佳。进一步展示了在RLHF奖励模型中的应用,其中校准与准确性相关但不完全相同。
多教师策略蒸馏中工具调用边界漂移的诊断与校准
本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。