当Softmax在顶部失败时:InfoNCE的极值校正

arXiv cs.LG 论文

摘要

该论文指出了基于softmax的InfoNCE损失与现代对比学习中的归一化嵌入设置之间的不一致性。它提出了WEINCE,一种简单的修改,利用极值理论将softmax logits与端点短缺校正相结合,在视觉基准测试中取得了持续的改进。

arXiv:2606.00262v1 Announce Type: new Abstract: InfoNCE是标准的对比学习目标,但其softmax形式不仅是一种计算便利:它还编码了关于如何选择得分最高示例的统计假设。利用极值理论,我们表明这一假设通常与现代对比学习中使用的归一化嵌入设置不一致。受这种不匹配的启发,我们提出了\textsc{WEINCE},一种对InfoNCE的简单修改,利用锚点在线批次统计将通常的softmax logits与端点短缺校正相结合,不增加任何可训练参数。在五个视觉基准测试中,\textsc{WEINCE}在冻结特征评估中取得了持续改进。这些结果表明,对困难负样本进行更忠实的统计处理可以改善对比学习目标。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:40

# 当 Softmax 在顶部失效时:InfoNCE 的极值修正  
来源:https://arxiv.org/html/2606.00262  
Suat Evren · Oktay Ozel · Alexander Morgan · Jongha Jon Ryu · Lizhong Zheng  

###### 摘要  
InfoNCE 是标准的对比学习目标,但其 softmax 形式不仅仅是一种计算上的便利:它也对如何选择最高分数样本做出了统计假设。利用极值理论,我们证明这一假设通常与现代对比学习中使用的归一化嵌入设定不一致。受此不匹配问题的启发,我们提出 WEINCE,这是 InfoNCE 的一个简单修改,它利用锚点级别的在线批次统计量,将通常的 softmax logits 与端点短差距校正相混合,且不增加任何可训练参数。在五个视觉基准测试中,WEINCE 在冻结特征评估中带来了一致的改进。这些结果表明,对难负例进行更忠实的统计处理可以改进对比学习目标。¹¹¹ 代码:github.com/hsme98/weince (https://github.com/hsme98/weince)。  
InfoNCE、SimCLR、对比学习、无监督学习、ICML  

## 1 引言  
尾部几何 (EVT)  
定理 2.2 (https://arxiv.org/html/2606.00262#S2.Thmtheorem2)  
几何匹配指标  
章节 2.2.2 (https://arxiv.org/html/2606.00262#S2.SS2.SSS2)  
Fr échet (ξ>0\xi>0) 重尾 重尾,无界  
Gumbel (ξ=0\xi=0) 轻尾 轻尾,无界  
Weibull (ξ<0\xi<0) 有界 有界端点,有界分数  

尺度指标 φ(s)=ρ(s)αφ(s)=ρ(s)^{α}  
移位指标 (softmax) φ(s)=exp(s/τ)φ(s)=\exp(s/τ)  
短差距指标 φ(s)=(xF−s)−βφ(s)=(x_F−s)^{-β}  
余弦:xF=1x_F=1  

+++  
Top-1 概率:幂链接 ρ(si+)α∑jρ(sj)α\frac{ρ(s_{i^+})^{α}}{\sum_{j} ρ(s_j)^{α}}  
Top-1 概率:Logit 链接 exp(si+/τ)∑jexp(sj/τ)\frac{\exp(s_{i^+}/τ)}{\sum_{j} \exp(s_j/τ)}  
Top-1 概率:Weibit 链接 (xF−si+)−β∑j(xF−sj)−β\frac{(x_F−s_{i^+})^{-β}}{\sum_{j} (x_F−s_j)^{-β}}  
===  
重尾 轻尾 有界  
InfoNCE WEINCE  

图 1:极值理论(定理 2.2 (https://arxiv.org/html/2606.00262#S2.Thmtheorem2))产生了三种尾部几何。将每种几何与一个兼容的指标模型配对,得到相应的 top-1 分数。Gumbel 行恢复了 InfoNCE 使用的 softmax 分数。对于有界相似度,Weibull 行激励了基于短差距的 logit。WEINCE 通过插值组合 softmax 和短差距 logit,因此当 λ=0λ=0 时,InfoNCE 作为特例被恢复。  

对比学习已成为自监督表示学习的核心方法,而 InfoNCE 或与其密切相关的基于 softmax 的目标函数位于视觉、语言和多模态学习中许多有影响力方法的核心(Jaiswal et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib92); Le-Khac et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib93); van den Oord et al., 2018 (https://arxiv.org/html/2606.00262#bib.bib61); Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62); He et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib9); Gao et al., 2022 (https://arxiv.org/html/2606.00262#bib.bib91); Radford et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib94))。标准的解释是,模型学会给同一示例的相关视图赋予高相似度,而给不同示例的视图赋予低相似度(van den Oord et al., 2018 (https://arxiv.org/html/2606.00262#bib.bib61); Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62); He et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib9))。这种方法对于从未标记数据学习可迁移表示已被证明非常有效(Jaiswal et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib92); Le-Khac et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib93); Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62); He et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib9); Gao et al., 2022 (https://arxiv.org/html/2606.00262#bib.bib91); Radford et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib94))。在许多此类系统中,相似度是在对学习到的表示进行归一化后计算的,通常通过余弦相似度或单位球面上的等效缩放内积(Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62); Wang and Isola, 2020 (https://arxiv.org/html/2606.00262#bib.bib12); Gao et al., 2022 (https://arxiv.org/html/2606.00262#bib.bib91); Radford et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib94))。这将损失置于一个有界相似度区间内。同时,先前的工作表明对比学习对负例集高度敏感。SimCLR 报告了从更大批次大小和更长训练中获得的显著收益(Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62)),理论分析强调了负例数量对表示质量的作用(Saunshi et al., 2019 (https://arxiv.org/html/2606.00262#bib.bib76)),并且多项工作表明,在对比损失下难负例获得了不成比例的权重(Wang and Liu, 2021 (https://arxiv.org/html/2606.00262#bib.bib24); Kalantidis et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib16); Robinson et al., 2021 (https://arxiv.org/html/2606.00262#bib.bib17))。综合来看,这些观察表明负分布的高相似度尾部值得特别关注。

在该领域的大部分文献中,InfoNCE 中的 softmax 仅仅作为损失定义的一部分出现。对比学习和 InfoNCE 通常通过信息论论证来证明其合理性,例如通过表明最小化损失可以最大化互信息的下界(van den Oord et al., 2018 (https://arxiv.org/html/2606.00262#bib.bib61); Chen et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib62); Lu et al., 2023 (https://arxiv.org/html/2606.00262#bib.bib95); Tian et al., 2020 (https://arxiv.org/html/2606.00262#bib.bib96); Poole et al., 2019 (https://arxiv.org/html/2606.00262#bib.bib97); Alshammari et al., 2025 (https://arxiv.org/html/2606.00262#bib.bib98); Ryu et al., 2026 (https://arxiv.org/html/2606.00262#bib.bib57))。在本文中,我们展示了 softmax 隐含地假设了相似度分布的一个特定假设。特别地,我们借鉴了离散选择理论中的见解,其中 softmax 概率源于 Plackett–Luce 模型用于 top-1 选择(Luce, 1959 (https://arxiv.org/html/2606.00262#bib.bib84); Plackett, 1975 (https://arxiv.org/html/2606.00262#bib.bib83))。这为 InfoNCE 提供了一个新的视角:当正例在一组负例中胜出时,该损失正在隐含地拟合该获胜事件的统计模型。这个视角让我们能够质疑 softmax 背后的隐藏假设是否与现代对比学习中使用的归一化嵌入区间兼容。我们在最重要的区间(即相似度范围的顶部,最难负例所在之处)给出了否定答案。这导致了 WEINCE(*Weibull 增强的 InfoNCE*),这是 InfoNCE 的一个简单修改,它利用在线批次统计量在标准 softmax logits 和端点短差距校正之间进行插值。这种插值是有意为之:当锚点层面支持端点行为的证据较弱时,它恢复为 InfoNCE,并且仅在当前负例集接近分数上限时才转向 Weibull 短差距链接。我们通过理论、诊断和实验支持这一观点,并在五个视觉基准测试和 SimCSE 句子嵌入的冻结特征评估中展示了一致的改进。我们的贡献有三方面。首先,我们明确了标准 InfoNCE softmax 内部隐藏的统计假设。其次,我们展示了为什么这一假设在归一化嵌入空间中变得有问题,以及不匹配如何在似然和梯度分配诊断中显现。第三,我们引入了 WEINCE,一个实用的 InfoNCE 替代方案,它利用锚点级别的尾部证据在 softmax 和 Weibull 短差距 logits 之间进行插值。

## 2 通过极值理论重新审视 InfoNCE  
自监督表示学习旨在从*未标记*数据中学习编码器 ff,使其表示能够很好地迁移到有监督的下游任务,尤其是在标记数据稀缺时。标准流程首先用自监督目标预训练编码器主干,然后使用可用标签对编码器进行微调或训练一个轻量级预测头。对比学习通过构建同一底层数据点的多个视图来实现自监督,将这些视图视为正对,而将来自其他数据点的视图视为负例。在这种设定中,广泛使用的对比学习目标是 InfoNCE 损失。

###### 定义 2.1(InfoNCE 损失)。设 (X,Y0)∼pXY(X,Y_0)\sim p_{XY} 表示两个相关的视图(例如,一个输入及其增广),并且 Y1,...,YK∼i.i.d. pXY_1,\dots,Y_K\stackrel{\scriptstyle\mathrm{i.i.d.}}{\sim} p_X 是与 (X,Y0)(X,Y_0) 独立抽取的负例。记 U=f(X)U=f(X) 和 Vi=f(Yi)V_i=f(Y_i) 对于 i∈{0,1,…,K}i\in\{0,1,\dots,K\}。总体 InfoNCE 损失为  
L(f)≜−E[logexp(s(U,V0)/τ)∑i=0Kexp(s(U,Vi)/τ)],\displaystyle\mathcal{L}(f)\triangleq -\mathbb{E}\!\left[\log\frac{\exp(s(U,V_0)/\tau)}{\sum_{i=0}^K \exp(s(U,V_i)/\tau)}\right], (2.1)  
其经验对应物为  
L^(f)≜−1m∑j=1mlogexp(s(uj,vj0)/τ)∑i=0Kexp(s(uj,vji)/τ).\displaystyle\widehat{\mathcal{L}}(f)\triangleq -\frac{1}{m}\sum_{j=1}^m \log\frac{\exp(s(u_j,v_{j0})/\tau)}{\sum_{i=0}^K \exp(s(u_j,v_{ji})/\tau)}. (2.2)  
其中 s(⋅,⋅)s(\cdot,\cdot) 是余弦相似度 s(u,v)=⟨u,v⟩‖u‖2‖v‖2,s(u,v)=\frac{\langle u,v\rangle}{\|u\|_2\|v\|_2}, 并且 τ>0\tau>0 是温度参数。

### 2.1 InfoNCE 作为偏好模型估计目标
公式 2.2 (https://arxiv.org/html/2606.00262#S2.E2) 中的每一项都可以被视为一个 *top-1 选择* 事件的负对数似然:对于锚点视图 uju_j,正例 vj0v_{j0} 被观察到在候选集 {vji}i=0K\{v_{ji}\}_{i=0}^K(正例加上 KK 个负例)中“胜出”。这使 InfoNCE 与学习排序和离散选择模型联系起来。²²² 在经典参数化情况下,这简化为 Plackett–Luce(多项 logit)模型。

##### 一个通用的随机效用生成模型。
固定一个锚点 j∈{1,…,m}j\in\{1,\dots,m\},并令 {sji}i=0K\{s_{ji}\}_{i=0}^K 表示分配给 K+1K\!+\!1 个候选的(潜在)分数。对 top-1 结果建模的一种通用方法是通过一个 *随机效用模型*,其中每个候选 ii 与一个潜在效用 UjiU_{ji} 相关联,这些效用独立地从条件分布中抽取:
Uji∣sji∼PU∣S=sji,i∈{0,1,…,K},U_{ji}\mid s_{ji}\;\sim\;P_{U\mid S=s_{ji}},\qquad i\in\{0,1,\dots,K\},
并且观测到的结果只揭示了胜者 Ij=argmax0≤i≤K Uji.I_{j}\;=\;\operatorname*{arg\,max}_{0\leq i\leq K} U_{ji}.
在这个视角下,对比数据集提供了结果 I≜{Ij}j=1m{\mathcal{I}}\triangleq\{I_j\}_{j=1}^m,学习问题是通过编码器参数化分数,并最大化观测胜者的似然。由于候选索引在重标记下是任意的,我们可以不失一般性地对每个锚点将正例候选索引为 0。

##### 将 InfoNCE 恢复为特例。
InfoNCE 对应于条件模型 PU∣SP_{U\mid S} 的一个特定 *参数化* 选择,即一个具有 i.i.d. Gumbel 噪声的 *可加性* 随机效用模型:
Uji=sji+εji,εji∼i.i.d.Gumbel(0,τ).U_{ji}=s_{ji}+\epsilon_{ji},\qquad\epsilon_{ji}\stackrel{\scriptstyle\mathrm{i.i.d.}}{\sim}\mathrm{Gumbel}(0,\tau). (2.3)
在公式 2.3 (https://arxiv.org/html/2606.00262#S2.E3) 下,top-1 概率采用 softmax 形式:
P(Ij=k|{sji}i=0K)=exp(sjk/τ)∑i=0Kexp(sji/τ).\mathbb{P}\!\left(I_j=k\,\big|\,\{s_{ji}\}_{i=0}^K\right)=\frac{\exp(s_{jk}/\tau)}{\sum_{i=0}^K \exp(s_{ji}/\tau)}.
我们通过余弦相似度使用编码器 f:V→Rdf:\mathcal{V}\to\mathbb{R}^d 参数化分数,
sji=⟨f(uj),f(vji)⟩‖f(uj)‖2‖f(vji)‖2,s_{ji}=\frac{\langle f(u_j),f(v_{ji})\rangle}{\|f(u_j)\|_2\|f(v_{ji})\|_2},
因此观测到 I{\mathcal{I}} 的似然变为
ℓ(f)≜\displaystyle\ell(f)\triangleq\log\mathbb{P}({\mathcal{I}})=\displaystyle\sum_{j=1}^m \log\mathbb{P}(I_j=0)=\displaystyle\sum_{j=1}^m \log\frac{\exp(s(u_j,v_{j0})/\tau)}{\sum_{i=0}^K \exp(s(u_j,v_{ji})/\tau)}. (2.4)
除了因子 1/m1/m 外,负对数似然 −ℓ(f)-\ell(f) 正是公式 2.2 (https://arxiv.org/html/2606.00262#S2.E2) 中的经验 InfoNCE 目标。

##### softmax 链接背后的隐含假设。
这种似然视角突显了 InfoNCE 隐含地假设了 top-1 结果是如何生成的。softmax 形式不仅与 *Gumbel* 分布选择有关,还与公式 2.3 (https://arxiv.org/html/2606.00262#S2.E3) 中的 *分数可加性* 结构有关。然而,更一般地,决定哪个候选胜出的潜在“效用”不必是分数的可加扰动:我们可以假设一个未知的条件模型 PU∣SP_{U\mid S}(可能非可加、异方差,或者在完全不同的尾部坐标下运作)。这引出了本文的核心问题:
> *公式 2.3 (https://arxiv.org/html/2606.00262#S2.E3) 所隐含的 softmax top-1 似然何时能很好地近似由未知条件效用模型 PU∣SP_{U\mid S} 产生的 top-1 结果?当它不能时,用什么替代?*

在这种一般性下,问题是不确定的:有很多方法可以指定 PU∣SP_{U\mid S},不同的选择会导致不同的 top-1 链接函数。为了获得有原则的指导,我们转向渐近理论。³³³ 统计学中的一个反复出现的主题是,大样本或高维极限揭示了 *通用* 结构。求和的标准推断依赖于中心极限定理(例如,(van der Vaart, 1998 (https://arxiv.org/html/2606.00262#bib.bib54))),而 Tracy–Widom 定律是大型随机矩阵极端特征值波动的经典通用性结果(例如,(Tracy and Widom, 1994 (https://arxiv.org/html/2606.00262#bib.bib85); Anderson et al., 2010 (https://arxiv.org/html/2606.00262#bib.bib86); Johnstone, 2001 (https://arxiv.org/html/2606.00262#bib.bib87)))。
在现代对比学习中,负例数量 KK 可能很大,而 top-1 事件由 maxi Uji\max_i U_{ji} 的极端行为支配,或者等效地由效用族的尾部行为支配。正如 CLT 为和提供了通用极限理论,极值理论 (EVT) (De Haan and Ferreira, 2006 (https://arxiv.org/html/2606.00262#bib.bib44)) 为最大值提供了通用极限理论。这激励了我们下一步:分析渐近区域,其中

相似文章

深度隐含偏差:从神经坍缩到Softmax编码

arXiv cs.LG

本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。

加权对比学习的统一几何框架

arXiv cs.LG

本文提出了一个统一的几何框架,证明加权InfoNCE目标可以解释为距离几何问题,从而精确刻画了有监督和弱监督对比学习方法的最优嵌入,并揭示了这些嵌入何时在几何上可实现、退化或不一致。