不要压缩你的特征:为什么CenterLoss会损害OOD检测,而多尺度马氏距离胜出

arXiv cs.LG 论文

摘要

本文介绍了GOEN,一种结合多尺度特征、L2归一化和马氏距离的OOD检测流水线,并发现CenterLoss正则化虽然提高了分类准确率,但实际上会降低OOD性能。

arXiv:2605.21493v1 公告类型:新 摘要:检测分布外(OOD)输入的能力是机器学习系统安全部署的基础。然而,当前方法通常依赖于仅针对分类准确率进行优化的特征表示,忽视了认知不确定性的独特需求。 我们引入了GOEN(几何优化认知网络),一种简单的流水线,结合了多尺度特征、L2归一化、马氏距离以及一个用真实困难OOD样本训练过的校准头。 通过系统消融实验,我们揭示了一个反直觉的发现:CenterLoss,一种用于特征紧凑性的流行正则化器,会显著降低OOD检测性能,尽管提高了分类准确率,但平均OOD AUROC从0.9483降至0.9366。 最佳变体GOEN-NoCenterLoss在CIFAR-10基准测试上实现了平均OOD AUROC为0.9483,超越了所有基线,包括深度集成(0.8827)、KNN(0.8967)和ODIN(0.8870),同时保持了具有竞争力的分布内准确率。 我们的结果挑战了普遍假设,即更好的分类几何自动导致更好的认知不确定性。相反,我们表明过于紧密的特征簇会压缩类间间隔并扭曲有效OOD检测所需的协方差结构。 GOEN是高效的,在单个GPU上训练时间不到20分钟,并为构建能够可靠识别自身局限性的AI系统提供了实用蓝图。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:46

# 别让你的特征坍塌:为什么CenterLoss会损害OOD检测,而多尺度马氏距离才是制胜法宝  
来源:https://arxiv.org/html/2605.21493  

**Rahul D Ray**  
电子与电气工程系  
BITS Pilani,海得拉巴校区  
f20242213@hyderabad\.bits\-pilani\.ac\.in  

###### 摘要  

检测分布外(OOD)输入的能力是机器学习系统安全部署的基础。然而,现有方法通常依赖仅针对分类精度优化的特征表示,忽视了认知不确定性独特的需求。我们提出了GOEN(几何优化认知网络),这是一个简洁的流水线,结合了多尺度特征、L2归一化、马氏距离以及一个使用真实硬OOD样本训练的校准头。通过系统的消融实验,我们发现了一个反直觉的结果:CenterLoss——一种用于特征紧凑性的流行正则化器——会显著降低OOD检测性能,将平均OOD AUROC从0.9483降至0.9366,尽管它提高了分类精度。最佳变体GOEN-NoCenterLoss达到了0.9483的平均OOD AUROC,超越了所有基线方法,包括深度集成(0.8827)、KNN(0.8967)和ODIN(0.8870),同时在CIFAR-10基准上保持了具有竞争力的分布内精度。我们的结果挑战了普遍假设,即更好的分类几何结构会自动带来更好的认知不确定性。相反,我们表明过度紧密的特征簇会压缩类间间隔,并扭曲OOD检测所需的有效协方差结构。GOEN效率高,在单块GPU上训练时间不到20分钟,为构建能可靠识别自身局限性的AI系统提供了实用的蓝图。  

## 1 引言  

在开放世界环境中安全部署机器学习系统,要求能够识别输入是否超出训练分布。因此,分布外(OOD)检测是可信AI的关键组成部分,其应用从自动驾驶到医学诊断(Free et al., 2025 (https://arxiv.org/html/2605.21493#bib.bib20))。在本工作中,我们聚焦于CIFAR-10(Krizhevsky et al., 2009 (https://arxiv.org/html/2605.21493#bib.bib1))和SVHN(Netzer et al., 2011 (https://arxiv.org/html/2605.21493#bib.bib10))基准,基于ResNet-18架构(He et al., 2016 (https://arxiv.org/html/2605.21493#bib.bib13))作为标准骨干。  

现有不确定性量化方法探索了多种策略。蒙特卡洛Dropout(Gal and Ghahramani, 2016 (https://arxiv.org/html/2605.21493#bib.bib12))和深度集成(Lakshminarayanan et al., 2017 (https://arxiv.org/html/2605.21493#bib.bib11))提供了模型不确定性的可扩展近似,而事后校准技术如温度缩放(Guo et al., 2017 (https://arxiv.org/html/2605.21493#bib.bib2))改进了预测置信度。证据深度学习(Sensoy et al., 2018 (https://arxiv.org/html/2605.21493#bib.bib3))用Dirichlet分布替代softmax,以同时捕获偶然不确定性和认知不确定性。对于OOD检测,基于距离的方法如k近邻(Sun et al., 2022 (https://arxiv.org/html/2605.21493#bib.bib9))已被证明有效,它们利用了特征几何结构。除此之外,最近在多专家混合(Mu and Lin, 2025 (https://arxiv.org/html/2605.21493#bib.bib14);Li and Duan, 2025 (https://arxiv.org/html/2605.21493#bib.bib16))和自适应架构(Sun et al., 2025 (https://arxiv.org/html/2605.21493#bib.bib15);Zhou et al., 2025 (https://arxiv.org/html/2605.21493#bib.bib17))方面的进展凸显了灵活特征表示的重要性。同时,视觉特征学习(Abdullahi et al., 2025 (https://arxiv.org/html/2605.21493#bib.bib18))的系统综述以及领域特定应用如脑肿瘤分类(Pacal et al., 2025 (https://arxiv.org/html/2605.21493#bib.bib19))强调了对稳健特征空间的需求。然而,许多现有方法主要针对分类精度优化特征几何结构,可能忽略了认知不确定性的独特要求。  

我们提出了几何优化认知网络(GOEN),这是一个简单但高效的OOD检测流水线。GOEN包含三个阶段:(1)训练一个多尺度ResNet-18骨干网络,使用标准交叉熵(不含CenterLoss),(2)在L2归一化特征上拟合类条件马氏密度,(3)在分布内和真实硬OOD示例的混合数据上训练一个轻量级校准头。通过系统的消融实验,我们发现了一个令人惊讶的结果:CenterLoss——一种常见的特征紧凑性正则化器——会显著降低OOD性能,将平均OOD AUROC从0.9483降至0.9366,尽管它提高了分类精度。这挑战了普遍假设,即更好的分类几何结构会自动产生更好的认知不确定性。  

我们的主要贡献是:(i)GOEN流水线在CIFAR-10基准上实现了最先进的OOD检测,超越了所有基线;(ii)发现了CenterLoss损害OOD检测这个反直觉的结果;(iii)对多尺度特征、球面归一化和硬OOD校准的作用进行了有原则的分析。代码已公开发布以促进可重复性。  

## 2 相关工作  

我们的工作借鉴并贡献于几个相互关联的研究领域:分布外(OOD)检测、深度学习中的不确定性量化、特征表示的几何结构(特别是神经坍塌)、多尺度特征学习和模型校准。下面我们按这些主题组织文献,并定位GOEN在其中的位置。  

### 2.1 分布外检测  

检测位于训练分布之外的测试样本的问题已被广泛研究。早期方法依赖于分类器的softmax置信度,但众所周知,神经网络可能在OOD数据上过度自信(Hendrycks et al., 2021 (https://arxiv.org/html/2605.21493#bib.bib23))。为了克服这一问题,事后检测器在预训练网络上操作,而不修改其训练过程。马氏距离方法(Lee et al., 2018 (https://arxiv.org/html/2605.21493#bib.bib8))在倒数第二层特征上拟合类条件高斯分布;ODIN结合了温度缩放和输入扰动;基于能量的检测(Liu et al., 2020 (https://arxiv.org/html/2605.21493#bib.bib6))使用logits的对数和指数作为分数。最近,基于距离的方法重新受到重视:Sun et al. (2022 (https://arxiv.org/html/2605.21493#bib.bib9)) 展示了在特征空间中简单的k近邻距离实现了最先进的OOD检测。Chen et al. (2020 (https://arxiv.org/html/2605.21493#bib.bib24)) 提出了ALOE,它使用对抗性构造的内点和外点进行稳健训练。Mohseni et al. (2020 (https://arxiv.org/html/2605.21493#bib.bib25)) 引入了一种自监督技术,不需要OOD分布的先前知识。Lee et al. (2020 (https://arxiv.org/html/2605.21493#bib.bib26)) 提出了Deep-MCDD,它对每个类别学习一个球形决策边界。Free et al. (2025 (https://arxiv.org/html/2605.21493#bib.bib20)) 研究了错误分类严重程度如何影响用户信任,强调了可靠OOD检测的实际重要性。  

几篇综述对该领域进行了系统化。Cui and Wang (2022 (https://arxiv.org/html/2605.21493#bib.bib21)) 根据训练数据(监督、半监督、无监督)和技术手段对OOD方法进行了分类。Henriksson et al. (2021 (https://arxiv.org/html/2605.21493#bib.bib22)) 研究了OOD检测性能如何随网络训练变化。Hendrycks et al. (2021 (https://arxiv.org/html/2605.21493#bib.bib23)) 引入了新的真实世界分布偏移数据集,并评估了鲁棒性技术。Abdullahi et al. (2025 (https://arxiv.org/html/2605.21493#bib.bib18)) 提供了视觉特征学习的广泛综述,包括OOD方面。  

### 2.2 神经网络中的不确定性量化  

量化预测不确定性对于安全部署至关重要。蒙特卡洛Dropout(Gal and Ghahramani, 2016 (https://arxiv.org/html/2605.21493#bib.bib12))将Dropout视为近似贝叶斯推断,通过多次随机前向传播捕获认知不确定性。深度集成(Lakshminarayanan et al., 2017 (https://arxiv.org/html/2605.21493#bib.bib11))训练几个独立模型并平均它们的预测,提供了简单而有效的不确定性估计。证据深度学习(Sensoy et al., 2018 (https://arxiv.org/html/2605.21493#bib.bib3))用Dirichlet分布替代softmax,输出信念程度。EpiNet(Osband et al., 2023 (https://arxiv.org/html/2605.21493#bib.bib4))通过随机扰动用一个可训练的epinet增强确定性网络来捕获认知不确定性。Huseljic et al. (2021 (https://arxiv.org/html/2605.21493#bib.bib31)) 提出了AE-DNN,在单次前向传播中分离偶然不确定性和认知不确定性,展示了在安全关键应用中的实用性。综述包括Kabir et al. (2018 (https://arxiv.org/html/2605.21493#bib.bib27)) 关于预测区间,He et al. (2026 (https://arxiv.org/html/2605.21493#bib.bib29)) 提供了UQ方法的分类,Mitros and Mac Namee (2019 (https://arxiv.org/html/2605.21493#bib.bib28)) 比较了贝叶斯网络和点估计网络,Yaseen and Wu (2023 (https://arxiv.org/html/2605.21493#bib.bib30)) 在核工程领域对MCD、集成和BNN进行了基准测试,以及Mosser and Zabihi Naeini (2022 (https://arxiv.org/html/2605.21493#bib.bib38)) 对地震数据比较了深度集成、具体Dropout和SWAG。  

### 2.3 特征几何结构与神经坍塌  

神经坍塌现象描述了在训练的终端阶段,每个类的特征坍塌到其均值,分类器权重与这些均值对齐,形成一个单形等角紧框架(ETF)。这种几何结构对OOD检测有深远的影响。Liu and Qin (2025 (https://arxiv.org/html/2605.21493#bib.bib35)) 利用神经坍塌设计了一个OOD检测器,使用特征与权重向量的邻近度和特征范数。Chen et al. (2024 (https://arxiv.org/html/2605.21493#bib.bib34)) 利用坍塌来指导跨环境的特征对齐以实现OOD泛化。Momeni et al. (2026 (https://arxiv.org/html/2605.21493#bib.bib33)) 提出了分析神经坍塌(AnaNC)来创建用于持续OOD检测的结构化特征几何结构。Haas et al. (2022 (https://arxiv.org/html/2605.21493#bib.bib37)) 展示了L2归一化会诱导早期神经坍塌并改善OOD检测。Zhang et al. (2024 (https://arxiv.org/html/2605.21493#bib.bib36)) 明确为了OOD检测而塑造特征分布。我们的工作直接建立在上述见解之上:我们表明通过CenterLoss强制特征紧凑性——一种鼓励类似神经坍塌行为的正则化器——实际上损害了OOD检测,挑战了更紧凑的簇总是对认知不确定性有益的假设。相比之下,GOEN通过使用L2归一化(诱导早期坍塌)和对多尺度特征使用马氏距离(无需显式紧凑性正则化)实现了优越的OOD检测。  

### 2.4 多尺度特征学习与数据增强  

多尺度表示同时捕获低层纹理和高层语义,这对于检测不同类型的分布偏移至关重要。Abdullahi et al. (2025 (https://arxiv.org/html/2605.21493#bib.bib18)) 和Pacal et al. (2025 (https://arxiv.org/html/2605.21493#bib.bib19)) 讨论了视觉任务中的多尺度特征学习。Mohseni et al. (2020 (https://arxiv.org/html/2605.21493#bib.bib25)) 采用自监督进行可泛化的OOD检测。数据增强是另一个重要工具:Thulasidasan et al. (2019 (https://arxiv.org/html/2605.21493#bib.bib32)) 展示了Mixup训练改善校准并减少OOD数据上的过度自信。Hendrycks et al. (2021 (https://arxiv.org/html/2605.21493#bib.bib23)) 引入了DeepAugment,显著改善了OOD泛化。Free et al. (2025 (https://arxiv.org/html/2605.21493#bib.bib20)) 也触及了增强在信任中的作用。我们的GOEN使用了ResNet-18的layer2和layer4特征的拼接,提供互补的纹理和语义信号,并在校准期间作为合成OOD混合的一部分采用了强增强。  

### 2.5 神经网络校准  

校准——预测置信度与实际准确率之间的一致性——对于可信预测至关重要。温度缩放(Guo et al., 2017 (https://arxiv.org/html/2605.21493#bib.bib2))在验证集上学习一个标量温度。更先进的技术包括基于熵的缩放(Balanya et al., 2024 (https://arxiv.org/html/2605.21493#bib.bib40))、可微分的软校准目标,以及解决过度自信和自信不足的方法(Ao et al., 2023 (https://arxiv.org/html/2605.21493#bib.bib39))。Thulasidasan et al. (2019 (https://arxiv.org/html/2605.21493#bib.bib32)) 展示了Mixup训练改善校准。van der Laan and Alaa (2024 (https://arxiv.org/html/2605.21493#bib.bib41)) 将Venn-Abers校准与共形预测结合,提供校准的点预测和预测区间。  

我们的GOEN校准头是一个小型MLP,在ID和合成OOD示例(包括真实SVHN)的混合数据上使用二元交叉熵训练。它将三个特征(对数马氏距离、最大余弦相似度、预测熵)映射为校准的属于ID的概率,有效融合了几何和预测不确定性信号。  

现有OOD检测和不确定性量化方法要么依赖于仅针对分类训练的特征的事后统计量(马氏距离、KNN、能量),要么修改训练目标以纳入不确定性(深度集成、证据学习、EpiNet)。然而,它们通常没有显式考虑特征空间的几何结构及其对OOD分离的影响。我们的工作贡献了一个简单而强大的流水线,结合了多尺度特征、L2归一化、马氏距离和一个使用真实硬OOD示例训练的校准头。此外,我们揭示了通过CenterLoss强制特征紧凑性是有害的——这是一个挑战常识的反直觉结果。因此,GOEN提供了一种有原则、实用且高效的认知不确定性方法。  

## 3 数据集与预处理  

所有实验都在一个公共的分布内(ID)数据集、三个代表不同类型分布偏移的分布外(OOD)数据集以及一个用于鲁棒性评估的损坏基准上进行。预处理步骤在所有数据集上标准化,以确保公平比较。以下部分描述了每个数据集及应用的预处理。  

### 3.1 分布内数据:CIFAR-10  

CIFAR-10(Krizhevsky et al., 2009 (https://arxiv.org/html/2605.21493#bib.bib1))包含60,000张大小为32×32的彩色图像,均匀分布在10个类别中(飞机、汽车、鸟、猫、鹿、狗、青蛙、马、船、卡车)。原始划分包含50,000张训练图像和10,000张测试图像。我们进一步使用固定比例将训练集划分为训练子集(45,000张图像)和验证子集(5,000张图像)。

相似文章

类别编码在神经坍缩中的作用

arXiv cs.LG

本文研究了类别标签编码如何影响神经网络分类器中的神经坍缩,表明在独热编码和平衡数据下,随着偏置正则化增加,未中心化的均值特征从单纯形等角紧框架转变为正交框架。

挖掘深度中间表示的潜在能力

arXiv cs.LG

本文介绍了LOES(逐层最优嵌入选择)和GeoReg(几何正则化损失)方法,这些方法从深度模型中选择并融合与任务相关的中间层,以提升迁移学习性能,并在多种架构和模态上展现出一致的性能提升。