允许置信度变化,而非预测:事后校准的预测保持修复
摘要
本文提出CORD,一种用于事后校准的后拟合适配器,它修复概率向量以保持原始top-1预测,同时维持校准质量,在CIFAR和ImageNet等数据集上实现零TPCR并改进指标。
查看缓存全文
缓存时间: 2026/09/04 07:56
论文页面 - 让置信度改变,而非预测:用于事后校准的预测保持修复
来源: https://huggingface.co/papers/2609.01072
摘要
CORD 是一个事后适配器,它修复校准后的概率向量,以在保持校准质量的同时,精确保持原始的第一预测结果。
事后校准(https://huggingface.co/papers?q=Post-hoc%20calibration)会修正报告的置信度,但一个多元分类校准器(https://huggingface.co/papers?q=multiclass%20calibrator)也可能改变与之关联的第一预测结果。准确率仅捕捉了这些改变对正确性的净影响,而未能反映预测变化的频率;相比之下,第一预测变化率(Top-1 Prediction Change Rate, TPCR)(https://huggingface.co/papers?q=Top-1%20Prediction%20Change%20Rate%20(TPCR))则衡量这一频率。我们提出了用于保持第一决策的校准器输出修复(Calibrator-Output Repair for Top-1 Decision Preservation, CORD)(https://huggingface.co/papers?q=CORD),这是首个通过修复完整的校准概率向量(https://huggingface.co/papers?q=calibrated%20probability%20vector)来强制实施精确预测保持的后装适配器。仅依据原始和校准后的输出,CORD(https://huggingface.co/papers?q=CORD)就能确定分配给原始第一预测的概率质量。校准后的条件分布会将剩余质量分配给其他类别,从而生成一个修复后的向量,其自身的 argmax(https://huggingface.co/papers?q=argmax)可以恢复原始预测。在校准集上,CORD(https://huggingface.co/papers?q=CORD)会协调修复后的概率质量,以便在可行的情况下保留校准输出在原始预测上的平均质量。该适配器既不改变已拟合的校准器或其直接输出,也不拟合任何额外的监督映射,且无需用户或验证集调整的超参数。在 CIFAR-10/100 和 ImageNet-1K 数据集上,CORD(https://huggingface.co/papers?q=CORD)通过构造实现了零 TPCR,并在每个数据集上降低了相对于相应直接输出的平均 ECE(https://huggingface.co/papers?q=ECE)、NLL(https://huggingface.co/papers?q=NLL)和 Brier 分数;在分布偏移(https://huggingface.co/papers?q=distribution%20shift)和不同校准集规模下,这种成对增益依然存在。因此,CORD(https://huggingface.co/papers?q=CORD)将保持约束从校准器拟合中移除,并将原始决策的精确恢复交由后续的输出修复来完成。我们的代码可在 https://github.com/labhai/CORD (https://huggingface.co/papers?q=CORD) 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.01072) 查看 PDF (https://arxiv.org/pdf/2609.01072) GitHub (https://github.com/labhai/CORD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01072)
引用本文的模型0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.01072 以从本页链接它。
引用本文的数据集0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.01072 以从本页链接它。
引用本文的 Space0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.01072 以从本页链接它。
包含本文的收藏0
没有收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
校准保持剪枝:压缩作为可靠性合约
本文介绍了校准保持剪枝(CPP),一种增强剪枝以保持保形预测效率的方法,在如DBpedia-14等基准测试上,使用Qwen2.5-1.5B等模型,显示了预测集大小减小和准确度提高。
FALCON-Discover:发现校准中的集中假置信区域
本文介绍了FALCON-Discover,这是一个事后(post-hoc)框架,用于发现模型预测高置信度但错误的区域,将校准重点从总体指标转向样本级的危险故障。
时间序列的检索校正共形预测
介绍了检索校正共形预测(RCCP),一种用于时间序列预测区间的检索增强校准方法,它选择相似的过去残差并应用标量共形校正,以低开销实现目标覆盖率。
Expectation Consistency Loss: 重新思考协变量偏移下的置信度校准
本文介绍了Expectation Consistency Loss (ECL),这是一种基于理论的损失函数,用于在协变量偏移下校准分类器置信度,该函数源自一个称为Expectation Consistency Condition的必要充分条件。
确定性的幻觉:解耦策略蒸馏中的能力与校准
本文发现语言模型中的策略蒸馏(OPD)因训练与部署信息不匹配导致严重过度自信,提出校准感知框架 CaOPD,在提升性能的同时显著增强置信度可靠性。