一种用于长尾识别的强有力平衡Softmax分类器再训练基线
摘要
本文提出 BS-cRT,一种两阶段的长尾识别基线,首先使用 Balanced Softmax 训练骨干网络,然后在平衡批次上仅重新训练分类器,在多个基准测试上持续提升少样本准确率。
arXiv:2607.09832v1 公告类型:new
摘要:长尾识别方法通常修改损失函数、边界或表示以减少频繁类别的支配作用。我们提出一个问题:在 Balanced Softmax 训练之后,仅重新训练分类器能否减少剩余的尾部错误?我们评估了 BS-cRT,一个两阶段流程:首先使用 Balanced Softmax 训练骨干网络和余弦分类器,然后冻结骨干网络,仅对平衡的 episodic 批次更新分类器。第二阶段保持经验先验的 Balanced Softmax 目标,并在推理时使用原始余弦 logits。在 CIFAR-100-LT、CIFAR-10-LT、ImageNet-LT 和 Places-LT 上,这一仅分类器步骤相对于匹配的 Balanced Softmax 检查点持续提高了少样本准确率。在失衡因子为 100 的情况下,少样本提升在 CIFAR-100-LT 上为 +5.15 分,在 CIFAR-10-LT 上为 +5.83 分;在 ImageNet-LT 和 Places-LT 上,提升分别为 +6.92 和 +9.78 分,同时在 ImageNet-LT 上存在 Top-1/少样本的权衡。我们还分析了反事实边界风险最小化(CBRM),这是一种基于决策边界附近原型特征的边界探测扩展。CBRM 识别出两种失效模式:缩放 logit 余弦边界使训练不稳定,以及修正后的最困难负样本探测仍然以头部类别为锚点。结果支持 BS-cRT 作为一个实用的分类器侧基线,并表明边界监督必须考虑类别频率。
查看缓存全文
缓存时间: 2026/07/14 04:14
# 一种面向长尾识别的强平衡Softmax分类器重训练基线
来源:https://arxiv.org/html/2607.09832 (2026年7月10日)
###### 摘要
长尾识别方法通常通过修改损失函数、边界或表示来减少频繁类别的主导地位。我们提出问题:经过平衡Softmax训练后,剩余的尾部类别误差能否通过只重训练分类器来降低?我们评估了BS-cRT这一两阶段流程:首先使用平衡Softmax训练骨干网络和余弦分类器,然后冻结骨干网络,仅在类别平衡的小批量数据上更新分类器。第二阶段保留基于经验先验的平衡Softmax目标,并在推理时使用原始余弦logits。在CIFAR-100-LT、CIFAR-10-LT、ImageNet-LT和Places-LT数据集上,这一仅限分类器的步骤相比于相匹配的平衡Softmax检查点,持续提升了小样本准确率。在失衡因子为100时,小样本准确率在CIFAR-100-LT上提升+5.15个百分点,在CIFAR-10-LT上提升+5.83个百分点;在ImageNet-LT和Places-LT上分别提升+6.92和+9.78个百分点,其中ImageNet-LT存在Top-1/小样本的权衡。我们还分析了反事实边界风险最小化(CBRM),这是一种利用决策边界附近基于原型的特征来进行边界探测的扩展方法。CBRM识别出两种失败模式:缩放logit的余弦边界会破坏训练稳定性,且经过修正的最难负样本探测仍然锚定在头部类别上。实验结果支持BS-cRT作为一个实用的分类器侧基线,并表明边界监督必须考虑类别频率。
*关键词* 长尾识别·不平衡分类·分类器重训练·平衡Softmax·小样本识别·决策边界·分类器偏置
## 1 引言
现实世界中的视觉识别很少拥有标准基准所假设的平衡标签分布。相反,类别通常遵循长尾频率分布:少数头部类别主导训练集,而许多尾部类别仅出现少量次数。这种不平衡尤其成问题,因为稀有类别在实践中往往是最重要的,例如不常见的医学发现、稀有物种、安全关键故障或罕见的工业缺陷。天真地在这些数据上训练的模型倾向于为头部类别分配过多的决策空间,产生欺骗性的强整体准确率,却在大量标签空间上表现不佳(Yang et al., 2022 (https://arxiv.org/html/2607.09832#bib.bib36))。
大量工作通过修改训练信号来解决长尾识别问题。重加权方法放大稀有类别样本的损失(Cui et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib5));焦点式目标减少简单样本的贡献(Lin et al., 2017 (https://arxiv.org/html/2607.09832#bib.bib18));边界和logit调整方法根据类别频率重塑分类器几何结构(Cao et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib2); Ren et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib23));解耦训练方案将表示学习与分类器学习分开,通常在更平衡的采样分布下重训练分类器(Kang et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib13))。其中,平衡Softmax已成为特别强大且简单的训练时基线。同时,分类器重训练(cRT)表明,在表示已经学习后,许多尾部类别缺陷可以得到解决。
本文重新审视这两个思路的交汇点。我们提出了一个刻意简单的问题:*当表示使用强平衡Softmax锚点训练后,分类器重训练能走多远?* 我们将这一思路实例化为BS-cRT,一个最小化的两阶段流程。在第一阶段,我们使用平衡Softmax端到端地训练骨干网络和余弦分类器。在第二阶段,我们冻结骨干网络,仅重训练余弦分类器,同样使用平衡Softmax,但现在是在包含P个类别、每类K个样本的类别平衡小批量数据上进行。该方法没有原型、没有合成样本、没有辅助目标,也没有超出常规分类器重训练设置之外的额外机制。
尽管简单,BS-cRT是一个强基线。在CIFAR-100-LT和CIFAR-10-LT上,对于失衡因子{50,100,200},BS-cRT始终优于相同平衡Softmax第一阶段检查点的小样本准确率,同时保持或提升Top-1准确率。在CIFAR-100-LT(IF=100)上,BS-cRT相较于平衡Softmax提升小样本准确率+5.15个百分点;在CIFAR-10-LT(IF=100)上,提升+5.83个百分点。相同的模式扩展到更大规模的基准:BS-cRT在ImageNet-LT上提升小样本准确率+6.92个百分点,在Places-LT上提升+9.78个百分点。总体而言,在我们评估的每个数据集-失衡因子组合中,小样本增益均为正值,这表明精心匹配的分类器重训练基线仍然是一个强大的参考基线。
然后我们提出第二个问题:*能否通过在决策边界附近注入显式的合成监督来进一步改进尾部类别边界?* 这个问题激发了我们最初的方法——反事实边界风险最小化(CBRM)。CBRM维护多原型类别记忆,在样本的正原型和负类原型之间构建特征空间探针,近似平分当前决策边界,局部加厚得到的探针,并使用类别平衡的top-k风险来惩罚余弦边界违反。直觉很自然:尾部类别的真实样本太少,无法密集监督其边界,因此合成边界邻近探针可能提供额外的纠正信号。
实验不支持在最难负样本探针选择下进行这种扩展,但识别出两个有用的失败模式。首先,我们发现当CBRM与余弦分类器结合时会出现边界/缩放不匹配:原始实现将余弦相似度范围内的边界参数与按分类器温度缩放的logit差异进行比较,产生的梯度比平衡Softmax锚点大约30倍。我们记录了这一失败模式并通过直接在余弦边界空间中计算CBRM违反来进行修正。其次,即使在修正后,最难负样本CBRM探针也没有优于BS-cRT。在CIFAR-100-LT(IF=100)上,修正后的最难负样本探针变体相对于BS-cRT降低了约四个百分点的小样本准确率。我们的分析表明这不仅仅是优化伪影:在长尾数据中,尾部样本的最难负样本通常是头部类别,因此生成的探针锚定在头部类别区域附近,可能将尾部分类器质量拉向错误方向。
对于长尾识别,主要的启示是方法论上的。平衡Softmax分类器重训练提供了一种低复杂度的方式来提高尾部准确率,而无需改变表示,并且在将尾部增益归因于更复杂的机制之前,应当将其作为第二阶段控制。CBRM诊断还表明,合成边界监督并非自动有益:当探针从最难负样本构建时,它们可能被头部类别竞争者锚定,并强化分类器重训练旨在减少的偏置。因此,我们使用BS-cRT作为主要的分类器侧基线,并将CBRM列为一种合理的边界监督策略的受控负结果。
本文做出三项贡献。第一,它提供了平衡Softmax之后分类器重训练的匹配检查点评估,将冻结骨干网络分类器更新的影响与表示学习分离开来。第二,它表明这一第二阶段更新在CIFAR-10/100-LT、ImageNet-LT和Places-LT上持续提升小样本准确率,同时存在头部类别收缩与尾部类别恢复之间的预期权衡。第三,它分析了边界探针扩展CBRM,并揭示了为什么即使经过余弦边界修正,最难负样本探针在长尾设置中也会失败。代码、配置和报告脚本已发布以支持复现。
## 2 背景与相关工作
长尾识别处于统计不平衡、表示学习和分类器几何的交叉点。核心困难不仅在于稀有类别提供的样本较少,还在于经验风险最小化是由倾斜的标签分布驱动的:头部类别在小批量中出现更频繁,贡献更多梯度更新,往往导致更大且更稳定的决策区域(Buda et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib1); Liu et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib19); Yang et al., 2022 (https://arxiv.org/html/2607.09832#bib.bib36))。相比之下,尾部类别必须从有限的证据中识别,同时与从更丰富支持中学到的分类器方向竞争。这种不平衡影响学习到的特征、最终分类器、后验校准以及嵌入空间中分隔类别的边界(Cao et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib2); Kang et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib13); Ren et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib23); Zhong et al., 2021 (https://arxiv.org/html/2607.09832#bib.bib39))。
文献从几个互补的角度解决了这个问题。一些方法通过重采样、重加权、焦点目标、元学习权重或有效数量修正来重新平衡观察样本的贡献(Chawla et al., 2002 (https://arxiv.org/html/2607.09832#bib.bib3); Lin et al., 2017 (https://arxiv.org/html/2607.09832#bib.bib18); Ren et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib22); Shu et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib25); Cui et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib5))。其他方法直接通过边界、logit调整、先验感知的softmax归一化器或标签分布校正来修改分类器目标(Cao et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib2); Menon et al., 2021 (https://arxiv.org/html/2607.09832#bib.bib21); Ren et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib23); Hong et al., 2021 (https://arxiv.org/html/2607.09832#bib.bib11))。第三个家族将表示学习与分类器学习解耦,表明有用的特征提取器仍可能与有偏的分类器配对(Kang et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib13); Zhou et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib41); Tang et al., 2020 (https://arxiv.org/html/2607.09832#bib.bib28); Zhong et al., 2021 (https://arxiv.org/html/2607.09832#bib.bib39))。最近的工作进一步探索对比目标、基于原型的表示、多专家模型和合成边界监督(Cui et al., 2021 (https://arxiv.org/html/2607.09832#bib.bib6); Zhu et al., 2022 (https://arxiv.org/html/2607.09832#bib.bib42); Xuan and Zhang, 2024 (https://arxiv.org/html/2607.09832#bib.bib35); Snell et al., 2017 (https://arxiv.org/html/2607.09832#bib.bib26); Jian et al., 2025 (https://arxiv.org/html/2607.09832#bib.bib12); Yang et al., 2026 (https://arxiv.org/html/2607.09832#bib.bib37))。这些方向为我们研究提供了背景,我们重新审视一个刻意简单的问题:使用平衡Softmax训练表示后,通过仅在类别平衡暴露下重训练分类器,可以恢复多少尾部准确率?
### 2.1 长尾识别
视觉识别基准通常围绕平衡评估设计,但在自然环境中收集的视觉数据很少遵循这种模式。大型图像分类体系、场景集合和公民科学物种观察自然地将许多样本分配到少数常见类别,而只将少量样本分配到大量稀有类别(Krizhevsky, 2009 (https://arxiv.org/html/2607.09832#bib.bib15); Deng et al., 2009 (https://arxiv.org/html/2607.09832#bib.bib7); Zhou et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib40); Van Horn et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib29))。这种不平衡不仅仅是数据管理上的不便。在经验风险最小化下,头部类别贡献更多的图像、更多的小批量出现和更多的梯度。结果,学习到的后验、分类器权重以及通常的置信度分数都与经验训练先验相关(Liu et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib19); Yang et al., 2022 (https://arxiv.org/html/2607.09832#bib.bib36))。长尾评估中常用的Many、Medium和Few划分因此不仅仅是一种报告惯例。它询问一个方法是否改善了标签空间中被忽视的部分,或者仅仅是保持了头部类别的主导地位。
本文沿着这个问题走向其最小有用干预。它没有假设尾部失败必须通过新的骨干网络或新的表示目标来解决,而是询问在一个已经使用强大长尾损失训练的表示中,有多少稀有类别准确率仍然是潜在的。这使得这项工作在精神上接近经典的长尾识别文献,但它将焦点放在平衡Softmax训练后的分类器几何上。由此产生的立场是刻意严格的:如果一个方法仅通过在更平衡的暴露下重训练最后一层来提升小样本准确率,那么该增益应归功于分类器重训练,而不是更复杂的机制。
### 2.2 重新平衡观察样本
最直接的方法家族修改观察样本的贡献。重采样改变了优化器看到的示例,而重加权改变了每个观察损失对更新的影响强度。卷积网络中类别不平衡的系统性研究表明,不平衡会严重降低识别性能,并且采样选择具有重要影响(Buda et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib1))。焦点损失降低了简单样本的贡献,并在背景和前景不平衡极端的密集检测中产生了影响(Lin et al., 2017 (https://arxiv.org/html/2607.09832#bib.bib18))。类别平衡损失用基于有效样本数量的权重替代原始逆频率权重,当额外样本变得冗余时软化校正(Cui et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib5))。元学习方法,包括Learning to Reweight Examples和Meta-Weight-Net,更进一步,通过从验证反馈中学习权重规则而不是手动固定它(Ren et al., 2018 (https://arxiv.org/html/2607.09832#bib.bib22); Shu et al., 2019 (https://arxiv.org/html/2607.09832#bib.bib25))。
这些方法很重要,因为它们建立了一个核心主题:长尾学习不能通过平等对待每个观察样本来解决。然而,它们也暴露了一个对本论文至关重要的局限性。重加权和重采样仍然通过有限数量的观察尾部样本起作用,并且当端到端使用时,它们可能同时影响表示和分类器。这种耦合使得更难知道尾部增益是来自更好的特征、更好的决策边界,还是来自改变的置信先验。BS-cRT在第二阶段避免了这种歧义。它冻结了骨干网络,隔离了分类器更新相似文章
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
无需更深网络即可加速学习:基于A*的批量选择方法实现高效CNN训练
本文提出一种轻量级策略——基于A*的批量选择方法(A*-BS),它将小批量调度视为启发式搜索,以提高CNN训练效率。在MedMNIST任务中,采用A*-BS的简单CNN在准确率和训练速度上均超越了更深的ResNet-18/50基线模型。
BaLoRA:大规模模型的贝叶斯低秩适应
BaLoRA 引入了低秩适应(LoRA)的贝叶斯扩展,通过缩小与全量微调之间的差距,提供校准良好的不确定性估计并提高预测准确性。
从扰动校正到几何感知采样:长尾学习中用于平衡平坦极小值的锐度引导均衡采样
介绍了锐度引导均衡采样(SGS),该方法利用锐度估计动态调整采样概率,以在长尾学习中实现平衡的平坦极小值,在CIFAR-100 LT和ImageNet-LT上取得了显著提升。
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。