草图线性对比学习:近似、优化与统计缩放
摘要
本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。
arXiv:2606.26617v1 公告类型:新
摘要:缩放定律描述了学习性能如何随模型规模、数据规模和计算量变化。虽然近期的理论工作已为草图线性回归建立了缩放定律,但对于对比表示学习的理解则要少得多。本文研究了在配对高斯潜变量设置下的对比学习的草图线性模型。学习器仅观测两个相关变量的草图视图,并通过全批量经验梯度下降训练双线性对比得分。我们在对齐的幂律谱和对比源条件下分析了高斯负二次对比替代,推导出包含不可约风险、近似误差、GD偏差、GD方差和交叉项的风险分解。交叉项由偏差和方差控制,因此不影响上界缩放。我们的主要定理给出了关于草图维度 $M$、样本量 $N$ 和有效优化视界 $L_{\mathrm{eff}}\gamma$ 的显式缩放定律。与标准线性回归缩放定律相比,对比设置必须学习两个视图之间的交互,这改变了优化和有限样本噪声随模型规模、数据和训练时间缩放的方式。这为理解对比学习中的缩放行为提供了第一步理论指导,并为平衡模型规模、数据和优化计算提供了指导。
查看缓存全文
缓存时间: 2026/06/26 05:21
# 近似、优化与统计缩放 来源:https://arxiv.org/html/2606.26617 ## 草图线性对比学习:近似、优化与统计缩放 ###### 摘要 缩放定律描述了学习性能如何随模型大小、数据规模和计算量变化。虽然近期理论工作已建立了草图线性回归的缩放定律,但对对比表示学习的理解仍显不足。本文研究了一种在配对高斯潜变量设置下的草图线性对比学习模型。学习者仅观测两个相关变量的草图视图,并通过全批次经验梯度下降训练双线性对比分数。我们在对齐幂律谱和对比源条件下分析了高斯负二次对比代理函数,由此将风险分解为不可约风险、近似误差、GD偏差、GD方差以及一个交叉项。交叉项受偏差和方差控制,因此不影响上界缩放。我们的主要定理给出了关于草图维度 \( M \)、样本量 \( N \) 和有效优化视界 \( L_{\mathrm{eff}}\gamma \) 的显式缩放定律。与标准线性回归缩放定律相比,对比设置必须学习两个视图之间的交互作用,这改变了优化和有限样本噪声随模型大小、数据量和训练时间的缩放方式。这为理解对比学习中的缩放行为提供了初步理论步骤,并为平衡模型规模、数据和优化计算提供了指导。 ## 引言 缩放定律提供了一种简洁的方式描述预测误差如何随模型大小、数据量和计算量变化。代表性形式是 Kaplan 等人 (2020) 的神经语言模型缩放定律(见 \cite{bib.bib2}),其中损失被建模为关于非嵌入参数数量 \( N \) 和数据集大小 \( D \) 的幂律之和:\( L(N,D) = L_{\infty} + \left(\frac{N_c}{N}\right)^{\alpha_N} + \left(\frac{D_c}{D}\right)^{\alpha_D} \)。类似的经验定律已在语言、视觉、翻译、语音和多模态建模中被观察到(Hestness 等人 2017 \cite{bib.bib1}; Henighan 等人 2020 \cite{bib.bib3}; Hoffmann 等人 2022 \cite{bib.bib4}; Zhai 等人 2022a \cite{bib.bib5}; Muennighoff 等人 2023 \cite{bib.bib6})。这些经验定律很有用,因为它们在执行昂贵的训练运行之前就能预测额外计算、数据或参数带来的好处。然而,经验幂律本身并不能解释指数从何而来、它们描述风险的哪一部分、或者算法选择如何影响它们。这促使在简化但统计透明的模型中研究缩放定律的理论文献日益增长(Hutter 2021 \cite{bib.bib7}; Sharma and Kaplan 2020 \cite{bib.bib8}; Maloney 等人 2022 \cite{bib.bib9}; Bahri 等人 2024 \cite{bib.bib10}; Bordelon 等人 2024 \cite{bib.bib11}; Atanasov 等人 2026 \cite{bib.bib12}; Paquette 等人 2024 \cite{bib.bib13}; Dohmatob 等人 2024 \cite{bib.bib14})。特别是,关于草图线性回归的最新工作在幂律协方差谱和源条件下推导了可证明的缩放定律,将近似、优化、数据和计算联系起来(Lin 等人 2024 \cite{bib.bib15}, 2025 \cite{bib.bib16}; Chen and Zhou 2026 \cite{bib.bib17})。受此草图线性框架的启发,我们提出一个问题:是否可以为对比学习建立类似的缩放定律理论。
对比学习是现代表示学习中的核心范式。其基本原则是学习表示,使得相关对彼此接近,而不相关对彼此分离。这一思想出现在早期的度量学习目标(Hadsell 等人 2006 \cite{bib.bib23})、互信息和噪声对比形式(如 CPC 和 InfoNCE)(Oord 等人 2018 \cite{bib.bib24})以及自监督视觉表示学习方法(如 SimCLR、MoCo 和监督对比学习)(Chen 等人 2020 \cite{bib.bib25}; He 等人 2020 \cite{bib.bib26}; Khosla 等人 2020 \cite{bib.bib27})中。同样的原则也支撑着大规模语言-图像预训练:CLIP 通过对比匹配的图像-文本对与不匹配对来学习对齐的视觉和文本表示(Radford 等人 2021 \cite{bib.bib28}),相关系统如 ALIGN 和 LiT 表明对比预训练能在规模上产生强大的零样本迁移、检索和鲁棒视觉分类性能(Jia 等人 2021 \cite{bib.bib29}; Zhai 等人 2022b \cite{bib.bib30})。因此,对比学习的广泛目标不仅仅是拟合监督标签,而是恢复一种表示几何结构,以支持下游分类、检索、迁移和多模态对齐。
尽管取得了这些经验成功,对比学习的理论理解仍不完整。现有的理论工作解释了对比学习的若干重要方面,包括对比目标为何能恢复潜在因子、增广和正对结构如何影响学习到的表示,以及对比学习如何区别于生成式或基于重建的无监督学习(Arora 等人 2019 \cite{bib.bib31}; Wang and Isola 2020 \cite{bib.bib32}; Tosh 等人 2021 \cite{bib.bib33}; Zimmermann 等人 2021 \cite{bib.bib34}; HaoChen 等人 2021 \cite{bib.bib35}; Ji 等人 2021 \cite{bib.bib36})。近期工作还通过函数逼近和有限样本分析研究了对比表示学习的统计一致性和泛化性(Li 等人 2026 \cite{bib.bib37})。然而,这些工作并未直接解释在幂律谱模型下对比学习风险应如何随模型大小、样本量和优化时间缩放。
与此同时,对对比语言-图像预训练的经验研究发现,类似 CLIP 的模型表现出可预测的缩放行为。例如,Cherti 等人 (2023) 报告了在公开图像-文本数据上训练的 OpenCLIP 模型在零样本分类、检索、线性探测和微调方面的幂律缩放(\cite{bib.bib38}),而 Li 等人 (2023) 发现 CLIP 训练存在逆缩放定律,即随着编码器增长而减少图像/文本令牌长度(\cite{bib.bib39})。更近期的工作使用缩放定律拟合来比较开放的视觉-语言预训练程序和数据集(Nezhurina 等人 2025 \cite{bib.bib40})。这些经验发现表明对比学习具有稳定的缩放结构,但并未将其分解为近似、优化和采样效应。
本文在草图线性设置中为对比学习开发了一个理论缩放定律模型。我们研究了一个高斯配对视图模型和一个基于草图输入训练的双线性对比分数。我们并未分析完整的非线性 InfoNCE 损失,而是考虑一个高斯负二次对比代理函数,它保留了核心对比结构:正协方差项对应匹配对的对齐,而二次边际协方差项对应高斯负项。由此产生的问题在分析上是可处理的,但表现出一个新特征:普通线性回归学习的是单个输入方向如何对响应做出贡献;而对比学习必须学习两个视图之间的关系。在我们的双线性模型中,这些关系由成对谱方向之间的相互作用表示,这改变了优化和有限样本噪声的缩放方式。我们的结果在定性上与经验对比缩放定律一致,因为风险分解为稳定的幂律项,受模型大小、数据量和计算量控制。然而,我们的定理不应被解读为对深度 CLIP 训练的定量预测。我们分析的是一个受控的高斯、草图、双线性代理函数,通过经验梯度下降训练。目的是隔离能产生对比学习缩放行为的机制。主要信息是近似、优化和采样误差仍然是可分离的,但优化项和方差项是由视图间交互而非单个输入方向单独塑造的。
我们的主要贡献如下。
- • **一个草图线性对比学习设置。** 我们为对比学习提出了一个草图高斯二次代理函数。该模型是理想化的,以允许精确的风险分解,同时保留对比表示学习的双线性对齐结构。
- • **经验 GD 的缩放定律。** 我们分析了经验梯度下降,并将期望草图风险分解为不可约风险、近似误差、GD 偏差和 GD 方差,以及一个交叉项,该交叉项可被吸收到偏差和方差之和中。在对齐幂律假设下,我们获得了关于草图维度、样本量和 GD 步数(通过有效视界 \( L_{\mathrm{eff}}\gamma \))的显式缩放定律。一个关键的新量是乘积有效维度,它计数的是活跃的谱方向对,而非线性回归中的单个活跃方向。
- • **计算资源分配的指导。** 我们的最终缩放定律分离了模型大小、数据量和优化步数的影响,为在风格化对比设置中平衡它们与计算量提供了透明规则,从而指导计算分配。
据我们所知,这是首次对草图双线性模型中的对比学习目标进行可证明的缩放定律分析。一个核心新意是乘积有效维度,它在普通线性回归中没有对应物,反映了对比学习激活了两个视图间谱方向对的事实。该分析是风格化的,但它为理解对比目标为何能展现缩放行为以及其缩放如何不同于普通线性预测提供了理论起点。
#### 符号。 对于两个正量 \( f \) 和 \( g \),我们记 \( f \lesssim g \)(等价地,\( f = O(g) \))和 \( f \gtrsim g \)(等价地,\( f = \Omega(g) \))如果不等式在绝对常数意义下成立。当两个界都成立时,记 \( f \asymp g \) 或 \( f = \Theta(g) \)。对于维数兼容的矩阵 \( A \) 和 \( B \),\( \langle A, B\rangle := \operatorname{tr}(A^\top B) \) 表示 Frobenius 内积。\( \|\cdot\| \) 表示矩阵的算子范数和向量的欧几里得范数,\( \|\cdot\|_F \) 表示 Frobenius 范数。对于半正定矩阵 \( A \) 和 \( B \),\( A \preceq B \) 表示 \( B - A \) 是半正定的。如果 \( \Sigma \succeq 0 \),我们记 \( \|u\|_{\Sigma}^2 := u^\top \Sigma u \) 和 \( \|A\|_{\Sigma,\Sigma}^2 := \operatorname{tr}(A^\top \Sigma A \Sigma) \)。最后,\( \mu_i(\Sigma) \) 表示对称矩阵 \( \Sigma \) 的第 \( i \) 大特征值,\( \mathbb{E}_{\mathcal{D}} \) 表示在训练样本上的期望,当草图固定时条件于草图。
## 预备知识
#### 对比学习背景。 对比学习从一个配对视图 \( a_i, b_i \) 开始,其中 \( a_i \) 是与 \( b_i \) 匹配的正视图,而 \( b_j \)(\( j \neq i \))作为负视图。一种常见的公式是训练编码器 \( f_\theta \) 和 \( g_\theta \),通过相似度得分如 \( s_\theta(u,v) := \frac{\langle f_\theta(u), g_\theta(v) \rangle}{\tau} \)。目标是学习表示为匹配对分配高分、为不匹配对分配低分的表示,从而恢复一种对下游预测有用的几何结构(Oord 等人 2018 \cite{bib.bib24}; Radford 等人 2021 \cite{bib.bib28})。我们的草图双线性模型可被视为用固定的线性草图替换非线性编码器 \( f_\theta, g_\theta \),仅学习双线性交互矩阵。
### 问题设置
#### 潜变量对比设置。 令 \( D \in \mathbb{N} \cup \{\infty\} \) 为环境维度,\( M \leq D \) 为草图/模型维度。我们考虑配对高斯模型:
\[ z \sim \mathcal{N}(0, \Lambda_z), \quad \epsilon_x, \epsilon_y \overset{\mathrm{i.i.d.}}{\sim} \mathcal{N}(0, \Lambda_\epsilon), \]
其中 \( z, \epsilon_x, \epsilon_y \) 相互独立,且
\[ x = z + \epsilon_x, \quad y = z + \epsilon_y. \]
定义边际协方差和互协方差为:
\[ H := \mathbb{E}[x x^\top] = \mathbb{E}[y y^\top] = \Lambda_z + \Lambda_\epsilon, \]
\[ C := \mathbb{E}[x y^\top] = \Lambda_z. \]
令 \( S \in \mathbb{R}^{M \times D} \) 为高斯草图矩阵,其条目从高斯分布采样并从一开始固定,满足 \( S_{ij} \overset{\mathrm{i.i.d.}}{\sim} \mathcal{N}(0, 1/M) \)。对于真实输入对 \( (x, y) \),学习者仅观测草图对:
\[ \widetilde{x} = S x, \quad \widetilde{y} = S y. \]
#### 双线性对比分数。 对于非草图设置,我们在配对观测之间学习双线性分数矩阵 \( W \):
\[ s_W(x, y) := x^\top W y, \quad W \in \mathbb{R}^{D \times D}. \]
令 \( p_+ \) 为正对 \( (x, y) \) 的联合分布,\( p_x \) 和 \( p_y \) 为其边缘分布。一个大型负样本的总体对比目标可写为基于分数的形式(Wang and Isola 2020 \cite{bib.bib32}):
\[ \mathcal{L}_{\mathrm{pop}}(s; \tau) := \mathbb{E}_{(x,y) \sim p_+} [\ell_s(x, y)], \]
其中
\[ \ell_s(x, y) := \log \mathbb{E}_{y' \sim p_y} \exp\left( \frac{s(x, y') - s(x, y)}{\tau} \right) = -\frac{1}{\tau} \mathbb{E}_{(x,y) \sim p_+} s(x, y) + \mathbb{E}_{x \sim p_x} \left[ \log \mathbb{E}_{y' \sim p_y} \exp\left( \frac{s(x, y')}{\tau} \right) \right]. \]相似文章
从单次SGD到数据复用:素描线性回归中的小批量缩放定律
本文推导了在幂律谱下素描线性回归的批量缩放定律,分析了单次和多次遍历的小批量SGD。它提供了明确的风险分解,展示了批量大小如何影响偏差、方差和波动项,并证明了无放回采样比有放回采样产生更低的噪声。
扩展定律,谨慎解读(25分钟阅读)
全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。
数据受限训练的规定性缩放定律
一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。
@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
损失不足:对比表示学习中的采样条件与归纳偏置
本文发展了一个测度论框架,分析对比学习何时恢复有意义的潜在几何结构,引入了正对采样的'多样性条件'和一个支持修正的InfoNCE变体。实验表明,采样多样性与架构归纳偏置在对比表示学习中存在关键交互。