离散分类任务中近似$\Gamma$校准的平滑诱导复杂度
摘要
本文刻画了多类分类中离散属性的近似属性校准,利用Lipschitz连续属性作为中介,将复杂度从类别数量降低到诱导复杂度维度。
查看缓存全文
缓存时间: 2026/05/25 08:58
# 离散分类任务近似$\Gamma$校准的平滑启发复杂度 来源:https://arxiv.org/abs/2605.23017 查看PDF(https://arxiv.org/pdf/2605.23017) > 摘要:评估机器学习模型可信度的一种重要方法是校准概念。在二值结果设定中,若结果根据模型分布预测(在该预测条件下)实际发生,则概率预测器是校准的。将二值校准定义直接扩展到概率多分类器会导致指数级复杂度爆炸,因为预测空间随类别数$n$呈指数增长。作为补救措施,Noarov和Roth(2023)提出使用结果分布属性的多分类校准,将复杂度从随类别数$n$增长降低为随属性维度$d$增长,后者称为其启发复杂度。以往关于近似属性校准的工作通常局限于连续标量属性,尽管许多相关属性是离散的,例如众数或排名。本文通过使用Lipschitz连续属性作为中介,刻画了强可排序离散属性的近似属性校准。据我们所知,这是首次为离散属性提供近似校准结果。在此过程中,我们通过构造用于设计这些Lipschitz属性的算法,刻画了强可排序离散属性的Lipschitz启发复杂度,并证明这些属性可经后处理得到原始离散属性。 ## 提交历史 来自:Jessica Finocchiaro [view email (https://arxiv.org/show-email/774eb2b1/2605.23017)] **\[v1\]** 2026年5月21日星期四 20:39:20 UTC (136 KB)
相似文章
Sample Complexity of Multicalibration for Multilevel Properties
This paper studies the sample complexity of multicalibration for a sequence of properties that are sequentially identifiable, establishing matching upper and lower bounds up to logarithmic factors.
Dirichlet Follow-the-Leader 弥合了同步多类 U 校准中的差距
本文介绍了一种简单的基于 Dirichlet 的预测器,它实现了最优的同步多类 U 校准率,弥补了有界真损失遗憾界中已知的维度差距,并消除了光滑损失的额外加性项。
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。
Fast Rates for Swap-Agnostic Learning of Proper Losses
This paper studies swap-agnostic learning of proper losses, showing that prediction-level comparisons can be controlled jointly via second-order multicalibration, achieving tight rates for finite hypothesis classes and families of losses.