离散分类任务中近似$\Gamma$校准的平滑诱导复杂度

arXiv cs.LG 论文

摘要

本文刻画了多类分类中离散属性的近似属性校准,利用Lipschitz连续属性作为中介,将复杂度从类别数量降低到诱导复杂度维度。

arXiv:2605.23017v1 公告类型:新 摘要:评估机器学习模型可信度的一种重要方法是校准的概念。在二元结果设置中,如果根据模型的预测分布,结果实际发生的情况与该预测一致,则称概率预测器是校准的。将二元校准定义直接扩展到概率多类分类器会导致复杂度指数级增长,因为预测空间随类别数$n$呈指数增长。作为补救措施,Noarov和Roth(2023)提出了使用结果分布的属性作为预测的多类校准,将复杂度从随类别数$n$增长降低到属性维度$d$(称为其诱导复杂度)。先前关于近似属性校准的工作通常仅限于连续标量属性,尽管许多相关属性是离散的,例如众数或排名。我们通过使用Lipschitz连续属性作为中介,刻画了强可排序离散属性的近似属性校准。据我们所知,这是首次为离散属性提供近似校准结果。在此过程中,我们通过构建设计这些Lipschitz属性的算法,刻画了强可排序离散属性的Lipschitz诱导复杂度,并证明这些属性可以通过后处理获得原始离散属性。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:58

# 离散分类任务近似$\Gamma$校准的平滑启发复杂度
来源:https://arxiv.org/abs/2605.23017
查看PDF(https://arxiv.org/pdf/2605.23017)

> 摘要:评估机器学习模型可信度的一种重要方法是校准概念。在二值结果设定中,若结果根据模型分布预测(在该预测条件下)实际发生,则概率预测器是校准的。将二值校准定义直接扩展到概率多分类器会导致指数级复杂度爆炸,因为预测空间随类别数$n$呈指数增长。作为补救措施,Noarov和Roth(2023)提出使用结果分布属性的多分类校准,将复杂度从随类别数$n$增长降低为随属性维度$d$增长,后者称为其启发复杂度。以往关于近似属性校准的工作通常局限于连续标量属性,尽管许多相关属性是离散的,例如众数或排名。本文通过使用Lipschitz连续属性作为中介,刻画了强可排序离散属性的近似属性校准。据我们所知,这是首次为离散属性提供近似校准结果。在此过程中,我们通过构造用于设计这些Lipschitz属性的算法,刻画了强可排序离散属性的Lipschitz启发复杂度,并证明这些属性可经后处理得到原始离散属性。

## 提交历史

来自:Jessica Finocchiaro [view email (https://arxiv.org/show-email/774eb2b1/2605.23017)] **\[v1\]** 2026年5月21日星期四 20:39:20 UTC (136 KB)

相似文章

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。

Fast Rates for Swap-Agnostic Learning of Proper Losses

arXiv cs.LG

This paper studies swap-agnostic learning of proper losses, showing that prediction-level comparisons can be controlled jointly via second-order multicalibration, achieving tight rates for finite hypothesis classes and families of losses.