损失不足:对比表示学习中的采样条件与归纳偏置

arXiv cs.LG 论文

摘要

本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。

arXiv:2606.04280v1 公告类型:新 摘要:对比学习已成为自监督表示学习的主流范式,但对其恢复有意义潜在几何结构的条件尚未完全理解。我们发展了一个测度论框架,形式化了多样性条件,这是正对采样在等距潜在恢复中所需的支持条件。我们证明,标准全支持von Mises-Fisher设置意味着多样性条件的满足,从而全局对比损失最小化器能够恢复潜在几何结构(正交变换下),而受限的条件分布可能使非正交映射达到更低的渐近对比损失。我们引入了一个支持修正的信息噪声对比估计(InfoNCE)变体作为理论修正:该修正使得正交潜在空间恢复成为可能,但并非唯一选择。合成基准实验验证了可辨识性预测,CIFAR-10实验与定性预测一致,即当采样多样性受限时,架构归纳偏置变得更加重要。综上,我们的结果阐明了对比表示学习中采样机制与编码器归纳偏置的交互作用。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:24

# 损失还不够:对比表示学习中的采样条件与归纳偏置  
来源:https://arxiv.org/html/2606.04280  

###### 摘要  

对比学习已成为自监督表示学习的领先范式,但其恢复有意义的潜在几何结构的条件尚未被完全理解。我们构建了一个测度论框架,形式化了多样性条件——这是正样本对采样所需的一个支撑集要求,对于等距潜在恢复必不可少。我们证明了标准全支撑 von Mises-Fisher 设定意味着多样性条件得到满足,因此全局对比损失最小化器能够恢复至正交变换下的潜在几何结构;而受限的条件分布则可能使得非正交映射达到严格更低的渐近对比损失。我们引入了一种支撑校正的 InfoNCE 变体作为理论修正:这种校正使正交潜在空间恢复成为可能,但并不能唯一地选择它。在合成基准上的实验验证了可辨识性预测,CIFAR-10 实验与定性预测一致,即当采样多样性受限时,架构归纳偏置变得更加重要。总之,我们的结果阐明了对比表示学习中采样机制与编码器归纳偏置如何相互作用。  

机器学习,ICML  

## 1 引言  

机器学习社区长期以来一直设想将大量无标注数据转化为密集、鲁棒且可重用的表示,这些表示可用于许多不同的下游任务,如分类、回归和搜索。对比学习(CL)已成为实现这一目标的成功技术,近年来在语言(Jaiswal et al., 2021)、视觉(Chen et al., 2020)、视频(Zhao et al., 2024)和多模态(Radford et al., 2021)领域取得了进展。其在生物学(Richter et al., 2025; Bahrami et al., 2025)、物理学(Cy et al., 2023; Wilkinson et al., 2025)和气候科学(Ballard, 2022; Liu et al., 2026)等科学领域的广泛应用程序使 CL 成为最广泛采用的无监督学习方法之一(Uelwer et al., 2023)。然而,尽管其在经验上取得了成功,但驱动对比学习的精确机制仍未被完全理解。这种理论理解的空白导致了启发式驱动的发展、计算资源的低效利用,以及可能无法充分发挥该方法潜力的设计选择。在这项工作中,我们试图超越对比学习的直觉理解,提供一个严格的框架来推理其成功与失败的机制。  

一种解释学习机制的方法认为,CL 诱导的数据表示对干扰因素具有不变性(Dangovski et al., 2022; Liu et al., 2025; Poudel et al., 2022)。然而,该框架并未讨论数据中的哪些因素是干扰因素,也未说明数据增强的选择如何隐式地决定这一划分。此外,干扰因素的选择(通常被称为风格-内容分解(von Kügelgen et al., 2022))可能对下游任务有害:根据学习表示的预期用途,被对比目标视为“干扰”的因素可能携带特定下游任务所需的判别信息。我们将这种方法称为不变性解释。  

参见图注  

图 1:对比学习概述及采样多样性和归纳偏置的作用。生成过程 \(g\) 将潜在变量映射到观测数据,编码器 \(f\) 学习恢复潜在结构。这里 \(f_1\) 表示低归纳偏置的编码器(如 MLP),\(f_2\) 表示高归纳偏置的编码器(如逆过程的模型)。橙色点表示锚点;绿色点是共现(正)样本。图像上的边框颜色与其潜在位置匹配。(a) 多样性满足:\(f_1\) 恢复几何结构。(b) 多样性违反(蓝色带):\(f_1\) 失败。(c) 多样性违反:尽管采样多样性受限,\(f_2\) 仍恢复潜在结构。  

另一种方向认为,CL 恢复了数据的“真实”生成因子(Ji et al., 2023; Kirchhof et al., 2023; Sandilya et al., 2025)。这种方法假设数据位于高维流形上,但具有低维潜在结构,并且生成过程将这个低维表示映射到观测到的高维数据。在这个方向上,CL 恢复了潜在结构。图 1 说明了这一设置。我们将这种方法称为恢复解释。  

在这项工作中,我们认为恢复解释提供了一个更完整的认识论解释,用于理解对比学习的潜在机制。我们引入了一个关于潜在空间条件分布 \(P_{\tilde{Z}|z}\) 的约束,称之为多样性条件,并证明它对于恢复潜在空间直至等距(保距)变换是必要的。基于 Zimmermann 等人(2021)引入的潜在空间恢复概念,我们将经典的全支撑 vMF 设置与采样受限的实际相关设置区分开来。我们对全支撑情形的证明使用了概率性的 Mazur-Ulam 论证(Zaliaduonis and Gatidis, 2026),并且不要求恢复映射的可微性。我们的主要结果表明,违反多样性条件可能会使扭曲几何结构的解变得可取,并且校正支撑集不匹配可以恢复(但不能唯一选择)保距最小化器。现实世界的采样机制通常违反多样性条件,且潜在结构通常是先验未知的。我们提出了一种广义的 InfoNCE 目标来解决这一差距,并证明这种调整允许保距潜在空间成为目标的最优解之一。我们通过 CIFAR-10(Krizhevsky, 2009)上的实验研究了该理论的定性含义。在这里,我们研究了不同增强机制下架构归纳偏置如何影响表示质量。  

总之,我们的贡献如下:  

- 形式化了一个关于潜在空间采样的测度论多样性条件,将其与先前可辨识性结果中使用的全支撑 vMF 假设区分开来,并分析了该条件被违反时出现的失败情况。  
- 证明违反多样性条件可能使得非正交恢复映射达到严格低于任何正交映射的渐近对比损失,并展示了支撑校正的 InfoNCE 目标使等距嵌入成为可能。  
- 在合成数据集上经验性地验证了理论预测,并在 CIFAR-10 上考察了其定性含义,展示了采样策略和编码器归纳偏置如何共同决定表示质量。  
- 从理论与实验的一致性中提炼出选择增强流程和编码器架构的设计指南。  

## 2 相关工作  

#### 对比学习中的可辨识性。  
无监督学习中的可辨识性问题历史悠久,始于独立成分分析(ICA)的经典结果。早期工作确定了非高斯独立源的线性混合可以在排列和缩放意义上被辨识,为盲源分离奠定了理论基础(Comon, 1994)。随后的发展提供了实用算法并刻画了线性 ICA 的基本限制(Hyvärinen and Oja, 2000)。后来阐述了学习捕捉有意义变化因素的解耦表示的更广泛目标(Bengio et al., 2013),尽管随后证明,没有对模型和数据的归纳偏置,无监督解耦是不可能的(Locatello et al., 2019)。在对比学习的背景下,引入了潜在空间可辨识性的正式定义,并证明了 InfoNCE 可以在正交变换下恢复真实因子(Zimmermann et al., 2021)。该分析采用了 von Mises-Fisher 条件分布和球面流形上的交叉熵渐近分析。对比目标与非线性 ICA 之间的联系也已建立,通过时间结构证明了可辨识性(Hyvärinen and Morioka, 2016)。  

#### 增强与不变性。  
另一条互补的工作线考察了数据增强如何通过定义哪些因素应被保留或丢弃来塑造学习到的表示。一个内容-风格框架形式化了这一直觉,证明基于增强的对比学习能够在潜在变量模型下实现不变内容分区的块可辨识性,该模型具有非平凡的统计和因果依赖关系(von Kügelgen et al., 2022)。InfoMin 原则提出,对比学习的最优视图应在保留任务相关信息的同时共享最小互信息,从而丢弃干扰因素(Tian et al., 2020)。一种因果解释表明,数据增强可以视为对风格变量的干预,这促使引入一种显式的不变性正则化器,强制代理目标在增强下进行不变预测(Mitrovic et al., 2021)。  

Wen and Li (2021) 研究了一个互补的特征学习机制:他们分析了有限 ReLU 网络中的基于梯度的学习,并展示了合适的增强如何将期望的稀疏特征与干扰的密集特征分离。我们的分析提出了一个不同的问题,即渐近对比目标是否能够在等距意义下恢复潜在几何结构,以及当采样多样性不足时,架构归纳偏置如何补偿。  

#### 架构偏置与扩展。  
编码器架构在对比学习中的作用受到了越来越多的关注。近期工作分析了架构约束如何影响学习表示的几何结构(HaoChen and Ma, 2023),而理论框架已扩展到多模态设置(Tschannen et al., 2023)。其他贡献则解决了理论假设与实现之间的差距(Rusak et al., 2025)。  

#### 经验方法。  
我们的理论分析建立在经验上成功的方法之上,包括 SimCLR(Chen et al., 2020)、对比预测编码(CPC)(van den Oord et al., 2019)和 VICReg(Bardes et al., 2022)。这些框架展示了对比目标在视觉、语言和多模态领域的实际效果。  

## 3 预备知识  

### 3.1 对比学习框架  

遵循 Zimmermann 等人(2021)的工作,我们使用非线性独立成分分析(ICA)(Hyvärinen et al., 2019)的工具来分析对比学习。我们考虑一个编码器 \(f: \mathcal{X} \to \mathcal{Z}\),将观测从数据空间 \(\mathcal{X} \subset \mathbb{R}^n\) 映射到潜在表示空间 \(\mathcal{Z} \subset \mathbb{R}^k\),其中 \(k < n\)。该框架假设存在一个生成过程 \(g: \mathcal{Z} \to \mathcal{X}\) 将潜在变量映射到数据。对比学习的目标是学习一个编码器 \(f\),使得对于某一变换类 \(T\),有 \(f \circ g \approx T\)。  

### 3.2 采样机制  

在对比学习中,采样机制定义了来自数据分布 \(\mathcal{D}\) 的锚点 \(x \in \mathcal{X}\) 与正样本 \(\tilde{x} \in \mathcal{X}\) 的共同出现关系。形式上,条件概率 \(P_{\tilde{X}|x}\) 指定了给定锚点 \(x\) 时正样本的分布。这个条件分布定义了“正对”的概念,这是对比目标的基础。在实践中,这种采样通常通过数据增强操作实现,生成原始数据的语义相似变体。  

这种关系隐式地由潜在空间中对应的条件分布决定:  

\[
P_{\tilde{Z}|z} = P_{\tilde{X}|x} \circ g^{-1}
\]

潜在空间中的条件概率 \(P_{\tilde{Z}|z}\) 编码了我们对哪些潜在因素应被视为“可变”而非“干扰”的假设。  

### 3.3 对比学习目标  

InfoNCE 目标(van den Oord et al., 2019)是广泛使用的对比目标。给定编码器 \(h\) 和采样机制,损失函数为:  

\[
\mathcal{L}_{\text{CL}}(h; \tau, M) = -\mathbb{E}_{\substack{z, \tilde{z} \sim P_{Z, \tilde{Z}} \\ z_1', \dots, z_M' \sim P_Z}} \left[ \log \frac{e^{h(\tilde{z})^\top h(z)/\tau}}{e^{h(\tilde{z})^\top h(z)/\tau} + \sum_{i=1}^M e^{h(z_i')^\top h(z)/\tau}} \right]
\]

其中 \(\tau > 0\) 是温度参数,\(M\) 是负样本数量。遵循 Zimmermann 等人(2021),我们将潜在空间取为超球面 \(\mathbb{S}^{k-1}\),这源于 \(L^2\) 归一化对比表示的实际惯例(Chen et al., 2020; Haas et al., 2024)。我们假设条件分布服从 von Mises-Fisher (vMF) 分布,具有浓度参数 \(\kappa > 0\),其中采样频率与潜在距离成反比。  

###### 定理 3.3 ( \(\mathcal{L}_{\text{CL}}\) 的渐近性质,Zimmermann et al., 2021)。  
给定球形潜在空间 \(\mathcal{Z} = \mathbb{S}^{k-1}\),均匀边际律 \(P_Z = U(\mathcal{Z})\),von Mises-Fisher 条件测度 \(P_{\tilde{Z}|z}\) 具有密度  

\[
p(\tilde{z}|z) = \frac{e^{\kappa \tilde{z}^\top z}}{\int_{\mathcal{Z}} e^{\kappa z'^\top z} \, d\sigma(z')} \quad (3)
\]

其中 \(\sigma\) 表示 \(\mathcal{Z}\) 上的球面表面积测度,\(\kappa > 0\) 是浓度参数,以及模型条件测度 \(Q_{h,z}\) 具有密度  

\[
q_h(\tilde{z}|z) = \frac{e^{h(\tilde{z})^\top h(z)/\tau}}{\int_{\mathcal{Z}} e^{h(z')^\top h(z)/\tau} \, d\sigma(z')} \quad (4)
\]

对于固定的 \(\tau > 0\),当负样本数 \(M \to \infty\) 时,(归一化的)对比损失收敛到  

\[
\lim_{M \to \infty} \mathcal{L}_{\text{CL}}(h; \tau, M) - \log M + \log |\mathcal{Z}| = \mathbb{E}_{z \sim P_Z} [H(P_{\tilde{Z}|z}, Q_{h,z})] \quad (5)
\]

其中 \(H(P_{\tilde{Z}|z}, Q_{h,z})\) 表示交叉熵,在 vMF 设定中使用相对于 \(\sigma\) 的密度。这种解释使我们能够通过采样机制 \(P_{\tilde{Z}|z}\) 与模型测度 \(Q_{h,z}\) 之间的分布匹配视角来分析对比学习。  

### 3.5 归纳偏置  

归纳偏置指的是限制学习算法假设空间的结构性假设,使得泛化成为可能(Vapnik, 1999)。在对比学习中,这些假设来源于模型架构(例如,CNN 中的平移等变性(LeCun et al., 1998)、Transformer 中的注意力机制(Dosovitskiy et al., 2021))以及几何约束。

相似文章

加权对比学习的统一几何框架

arXiv cs.LG

本文提出了一个统一的几何框架,证明加权InfoNCE目标可以解释为距离几何问题,从而精确刻画了有监督和弱监督对比学习方法的最优嵌入,并揭示了这些嵌入何时在几何上可实现、退化或不一致。

自然图像对比学习理论

Hugging Face Daily Papers

本文通过分析计算,针对基本数据增强和具有平稳统计特性的自然图像,在对比损失下得到了最优表示。结果表明,最优CNN的第一层滤波器是正弦波,且权重可通过注水算法计算。

草图线性对比学习:近似、优化与统计缩放

arXiv cs.LG

本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。

KODA:面向视觉-语言基础模型的对比表示比较与对齐

arXiv cs.LG

本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。