从单次SGD到数据复用:素描线性回归中的小批量缩放定律

arXiv cs.LG 论文

摘要

本文推导了在幂律谱下素描线性回归的批量缩放定律,分析了单次和多次遍历的小批量SGD。它提供了明确的风险分解,展示了批量大小如何影响偏差、方差和波动项,并证明了无放回采样比有放回采样产生更低的噪声。

arXiv:2605.24316v1 Announce Type: new Abstract: 缩放定律提供了预测误差如何随计算量、模型大小和数据变化的简洁描述,但现有理论主要处理单样本SGD或完全数据复用,使得小批量的作用尚不明确。我们研究了在幂律协方差谱和目标参数源条件下的素描线性回归的批量缩放定律。我们分析了单次遍历批量SGD、有放回多次遍历批量SGD和无放回多次遍历批量SGD。我们的第一个结果是风险分解:所有三种过程共享相同的不可约项和近似项,而它们的随机项取决于采样协议。单次遍历批量SGD分解为偏差和方差,而两种多次遍历方法则分解为GD偏差、GD方差以及围绕共同GD参考轨迹的波动项。然后我们证明了单次遍历和多次遍历小批量方法在源条件下的缩放定律。对于单次遍历批量SGD,小批量保持了近似和优化偏差指数,而方差缩放为$O(\min(M,(T_{\mathrm{eff}}\gamma)^{1/a})/(B T_{\mathrm{eff}}))$。因此,在固定更新次数$T$下,通常的$1/B$协方差缩减成立,但在单次遍历机制$T=N/B$中,它部分被较短的优化时域所抵消。对于多次遍历批量SGD,有放回和无放回采样具有相同的近似和GD偏差/方差项;它们仅在波动协方差前因子上有差异,有放回时为$1/B$,无放回时为$\rho_{N,B}=(N-B)/(B(N-1))$。因此,当$B>1$时,无放回采样的噪声更小,并且当$B=N$时,波动消失,恢复为确定性梯度下降。这些结果将批量大小与计算量、数据和模型维度在素描线性回归中置于相同的理论基础上。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:04

# 从单次遍历SGD到数据重用:素描线性回归中的小批量规模定律  
来源:https://arxiv.org/html/2605.24316  

Ziyan Chen  
悉尼大学  
ziyan\.chen@sydney\.edu\.au  

& Dingxuan Zhou  
悉尼大学  
dingxuan\.zhou@sydney\.edu\.au  

###### 摘要  

规模定律以紧凑的形式描述了预测误差如何随计算量、模型大小和数据量变化,但现有的理论结果主要关注单样本SGD或完整数据重用,而小批量处理的作用尚不明确。本文研究幂律协方差谱和目标参数源条件下的素描线性回归中的批量规模定律。我们分析了三种优化过程:单次遍历小批量SGD、有放回多次遍历小批量SGD和无放回多次遍历小批量SGD。我们首先推导出一个显式的风险分解,表明三种过程共享相同的不可约项和近似项,而随机贡献则取决于优化协议:单次遍历小批量SGD分解为偏差和方差,而两种多次遍历过程分解为梯度下降偏差、梯度下降方差以及围绕一条公共梯度下降参考轨迹的波动项。基于此分解,我们证明单次遍历和多次遍历小批量方法在源条件下的规模定律。对于单次遍历小批量SGD,小批量处理保留了近似和优化偏差的指数,而方差项缩放为 \(O(\min\{M, (T_{\mathrm{eff}}\gamma)^{1/a}\}/(B T_{\mathrm{eff}}))\);因此,在固定更新次数 \(T\) 下,通常的协方差缩减因子 \(1/B\) 成立,而在单次遍历模式 \(T=N/B\) 下,这种增益部分地被较短的优化视界所抵消。对于多次遍历小批量SGD,有放回和无放回采样的近似项以及梯度下降偏差/方差贡献相同;唯一的区别在于波动项,其协方差前因子在有放回时为 \(1/B\),在无放回时为 \(\rho_{N,B}=(N-B)/(B(N-1))\)。因此,当 \(B>1\) 时,无放回采样的噪声更小,且当 \(B=N\) 时波动项恰好消失,恢复为确定性梯度下降。这些结果将批量大小置于素描线性回归框架中与计算量、数据量和模型维度相同的理论基础上。

## 1 引言  

规模定律已成为描述现代机器学习进展的标准语言:在许多领域,预测误差随模型大小、数据量和计算量呈现规则的幂律关系。这一模式从早期的跨翻译、语言、视觉和语音的大规模研究(Hestness 等,2017 (https://arxiv.org/html/2605.24316#bib.bib6))到现代语言模型规模分析(Kaplan 等,2020 (https://arxiv.org/html/2605.24316#bib.bib3);Hoffmann 等,2022 (https://arxiv.org/html/2605.24316#bib.bib2))以及多模态自回归建模(Henighan 等,2020 (https://arxiv.org/html/2605.24316#bib.bib5))中均有记载。因此,规模定律不仅用于总结实验,还用于指导预测、资源分配和训练设计(Rosenfeld 等,2020 (https://arxiv.org/html/2605.24316#bib.bib21);Zhai 等,2022 (https://arxiv.org/html/2605.24316#bib.bib22);Alabdulmohsin 等,2022 (https://arxiv.org/html/2605.24316#bib.bib23);Besiroglu 等,2024 (https://arxiv.org/html/2605.24316#bib.bib18);Muennighoff 等,2023 (https://arxiv.org/html/2605.24316#bib.bib19);Paquette 等,2024 (https://arxiv.org/html/2605.24316#bib.bib20))。经验规模定律本身并不能解释指数从何而来、它们描述风险的哪些部分、或者算法选择如何改变它们。因此,严格的结果更为罕见。然而,在统计上透明的模型中,近似、优化和采样效应可以分离。沿着这一路线,Lin 等(2024 (https://arxiv.org/html/2605.24316#bib.bib4))证明了素描线性回归中单次遍历SGD在源条件下的规模定律,而 Lin 等(2025 (https://arxiv.org/html/2605.24316#bib.bib1))表明多次遍历会导致分解为近似、梯度下降偏差、梯度下降方差和波动项,从而得到更尖锐的计算-风险权衡。这些论文将经验规模定律置于严格的基础上,并补充了基于流形论证、构造性学习曲线、可解和动力学模型、重整化高维渐近分析、量化和特征学习的幂律行为理论文献(Sharma 和 Kaplan,2020 (https://arxiv.org/html/2605.24316#bib.bib24);Bahri 等,2024 (https://arxiv.org/html/2605.24316#bib.bib17);Hutter,2021 (https://arxiv.org/html/2605.24316#bib.bib25);Maloney 等,2022 (https://arxiv.org/html/2605.24316#bib.bib26);Michaud 等,2023 (https://arxiv.org/html/2605.24316#bib.bib27);Bordelon 等,2024 (https://arxiv.org/html/2605.24316#bib.bib28),2025 (https://arxiv.org/html/2605.24316#bib.bib29);Atanasov 等,2024 (https://arxiv.org/html/2605.24316#bib.bib30);Dohmatob 等,2024 (https://arxiv.org/html/2605.24316#bib.bib31);Paquette 等,2024 (https://arxiv.org/html/2605.24316#bib.bib20);Ren 等,2025 (https://arxiv.org/html/2605.24316#bib.bib32))。

批量大小是最重要的大规模训练参数之一,因为它影响硬件利用率、挂钟效率和梯度噪声。在经验方面,大批量规则使 ImageNet 训练能够支持高达 8192 的批量大小(Goyal 等,2017 (https://arxiv.org/html/2605.24316#bib.bib8)),LARS 将卷积训练推向 8K 和 32K(You 等,2017 (https://arxiv.org/html/2605.24316#bib.bib9)),后续研究表明增益高度依赖于工作负载并且最终会饱和(Shallue 等,2019 (https://arxiv.org/html/2605.24316#bib.bib10);Golmant 等,2019 (https://arxiv.org/html/2605.24316#bib.bib11))。一个特别有影响力的综合是 McCandlish 等(2018 (https://arxiv.org/html/2605.24316#bib.bib12))的梯度噪声尺度观点,并且最近直接研究了语言模型中与批量相关的经验规模定律(Shuai 等,2024 (https://arxiv.org/html/2605.24316#bib.bib16))。通过 SGD 噪声对批量大小 \(B\) 的理论理解也在增长。Smith 和 Le(2018 (https://arxiv.org/html/2605.24316#bib.bib13))用噪声尺度正比于 \(\epsilon N/B\) 的 SDE 对 SGD 进行建模,表明最优批量大小应随学习率和数据集大小 \(N\) 的增长而增长。Smith 等(2018 (https://arxiv.org/html/2605.24316#bib.bib14))研究了增加批量大小而不是衰减学习率的密切相关策略。在最小二乘及类似设置中,小批量、多次遍历、尾部平均和隐式正则化的统计效应也得到了广泛分析(Lin 和 Rosasco,2017 (https://arxiv.org/html/2605.24316#bib.bib33);Jain 等,2017 (https://arxiv.org/html/2605.24316#bib.bib34);Mücke 等,2019 (https://arxiv.org/html/2605.24316#bib.bib35);Ge 等,2019 (https://arxiv.org/html/2605.24316#bib.bib36);Zou 等,2021 (https://arxiv.org/html/2605.24316#bib.bib37);Wu 等,2022 (https://arxiv.org/html/2605.24316#bib.bib7);Pillaud-Vivien 等,2018 (https://arxiv.org/html/2605.24316#bib.bib15))。在这个素描线性回归框架中仍缺少的是:一个显示批量大小如何进入近似、优化偏差、方差和数据重用的规模定律分析。本文针对使用小批量方法训练的素描线性回归发展了这样一套理论。我们研究三种随机过程:单次遍历小批量SGD、有放回多次遍历小批量SGD和无放回多次遍历小批量SGD。虽然小批量处理在固定更新次数下经典地将每次更新的噪声协方差降低因子 \(1/B\),但我们的贡献在于展示批量大小如何通过 Lin 等(2024 (https://arxiv.org/html/2605.24316#bib.bib4),2025 (https://arxiv.org/html/2605.24316#bib.bib1))的规模定律分解进行传播。特别地,无放回方案引入了有限总体因子 \(\rho_{N,B}\),并在 \(B=N\) 时精确恢复为梯度下降。我们的主要贡献如下。

- •**单次遍历批量规模定律与视界-噪声权衡。** 定理 3.1 (https://arxiv.org/html/2605.24316#S3.Thmmytheorem1) 结合命题 3.1 (https://arxiv.org/html/2605.24316#S3.Thmproposition1) 中的统一风险分解表明,小批量处理保留了单次遍历的近似和偏差指数,而随机贡献满足定理 3.1 (https://arxiv.org/html/2605.24316#S3.Thmmytheorem1) 中的方差界。等价地,在固定 \(T\) 下,每次更新的协方差获得通常的因子 \(1/B\),但在实际的单次遍历模式 \(T=N/B\) 中,这种改进部分地被抵消,因为更大的批量缩短了优化视界。
- •**多次遍历波动定律。** 定理 3.2 (https://arxiv.org/html/2605.24316#S3.Thmmytheorem2) 表明,小批量处理不改变 Lin 等(2025 (https://arxiv.org/html/2605.24316#bib.bib1))中的确定性近似和梯度下降偏差-方差项;它仅改变围绕梯度下降参考路径的波动。重要的是,这一结果并非简单地将 2025 年的波动界乘以 \(1/B\):批量更新改变了波动递归和驱动噪声的协方差计算,因此推导必须在批量设置中重新进行。由此产生的前因子在有放回时为 \(1/B\),在无放回时为 \(\rho_{N,B}=(N-B)/(B(N-1))\),因此无放回采样的噪声更小,并在 \(B=N\) 时恢复为确定性梯度下降,补充了多次遍历在困难问题上统计上有用的更广泛图景(Pillaud-Vivien 等,2018 (https://arxiv.org/html/2605.24316#bib.bib15))。

#### 符号。  
对于两个正值函数 \(f(x)\) 和 \(g(x)\),如果存在绝对常数 \(c>0\) 使得 \(f(x) \leq c g(x)\) 和 \(f(x) \geq c g(x)\),我们分别记 \(f(x) \lesssim g(x)\)(等价地,\(f(x)=O(g(x))\))和 \(f(x) \gtrsim g(x)\)(等价地,\(f(x)=\Omega(g(x))\));当两个方向都成立时记 \(f(x) \asymp g(x)\)(等价地,\(f(x)=\Theta(g(x))\))。对于希尔伯特空间中的向量 \(u\) 和 \(v\),我们将其内积记为 \(\langle u, v \rangle\) 或 \(u^\top v\)。对于维数兼容的矩阵 \(A\) 和 \(B\),我们定义其内积为 \(\langle A, B \rangle := \operatorname{tr}(A^\top B)\)。我们使用 \(\|\cdot\|\) 表示矩阵的算子范数和向量的 \(\ell_2\) 范数。对于半正定矩阵 \(A\) 和兼容向量 \(v\),我们记 \(\|v\|_A^2 := v^\top A v\),并且当 \(B-A\) 半正定时记 \(A \preceq B\)。对于对称矩阵 \(A\),\(\mu_j(A)\) 表示其第 \(j\) 个特征值,\(r(A)\) 表示其秩。最后,\(\log(\cdot)\) 表示以 2 为底的对数。

## 2 预备知识  

我们采用与 Lin 等(2024 (https://arxiv.org/html/2605.24316#bib.bib4),2025 (https://arxiv.org/html/2605.24316#bib.bib1))相同的素描线性回归框架。除了常规的梯度下降迭代 \(\theta_t\) 外,我们研究单次遍历小批量SGD迭代、有放回多次遍历小批量SGD迭代和无放回多次遍历小批量SGD迭代;每次随机更新平均一个大小为 \(B\) 的小批量。特别地,当 \(B=1\) 时,单次遍历小批量SGD设置退化为 Lin 等(2024 (https://arxiv.org/html/2605.24316#bib.bib4))的单次遍历SGD设置。对于多次遍历方法,我们的有放回和无放回规则在 \(B=1\) 时一致,因为后者仅在小批量内部是无放回,而不是在整个 epoch 中。因此,我们的无放回过程不应与随机重排混淆。

#### 问题设置。  
设 \(\mathcal{H}\) 为有限维或可数无穷维希尔伯特空间。对于参数 \(w \in \mathcal{H}\),定义总体风险  
\[
R(w) := \mathbb{E}\bigl[(\langle x, w \rangle - y)^2\bigr], \qquad (x,y) \sim P,
\]  
其中 \(P\) 是 \(\mathcal{H} \times \mathbb{R}\) 上的 Borel 概率测度。定义总体协方差和总体风险最小化器:  
\[
H := \mathbb{E}[x x^\top], \quad w^* \in \arg\min_{w \in \mathcal{H}} R(w).
\]  
我们仅观测素描后的协变量 \((Sx, y)\),其中 \(S: \mathcal{H} \to \mathbb{R}^M\) 是素描算子。对于 \(u \in \mathbb{R}^M\),定义素描的风险  
\[
R_M(u) := R(S^\top u) = \mathbb{E}\bigl[(\langle Sx, u \rangle - y)^2\bigr].
\]  
给定根据 \(P\) 独立同分布抽取的 \(N\) 个样本 \(D = \{(x_i, y_i)\}_{i=1}^N\),观测值为 \(O = \{(Sx_i, y_i)\}_{i=1}^N\)。记  
\[
X := (x_1, \dots, x_N)^\top, \qquad y := (y_1, \dots, y_N)^\top,
\]  
并定义总体和经验量  
\[
\Sigma := S H S^\top, \quad \widehat{\Sigma} := \frac{1}{N} S X^\top X S^\top, \quad \widehat{b} := \frac{1}{N} S X^\top y.
\]  
在给定 \(S\) 的条件下,\(R_M\) 的最小化器为(与 Lin 等(2024 (https://arxiv.org/html/2605.24316#bib.bib4))相同)  
\[
u^* = (S H S^\top)^{-1} S H w^* = \Sigma^{-1} S H w^*.
\]

#### 优化过程。  
我们在这一共同设置下比较四种方法。对于每种运行 \(L_{\mathrm{run}}\) 次更新的优化过程,我们使用相同的分块几何学习率调度:将更新划分为连续的块,索引为 \(l = 0, 1, 2, \dots\),每个块包含 \(L_{\mathrm{run,eff}} := L_{\mathrm{run}} / \log L_{\mathrm{run}}\) 次连续更新(舍入到端点),并对块 \(l\) 中的每次更新 \(t\) 设置 \(\gamma_t = \gamma / 2^l\)。特别地,对于单次遍历小批量SGD,\(L_{\mathrm{run}} = T = N/B\);而对于常规梯度下降和两种多次遍历小批量方法,\(L_{\mathrm{run}} = L\)。

#### 1. 常规梯度下降。  
设 \((\gamma_t)\) 为指定的步长调度。常规梯度下降迭代为  
\[
\theta_t = \theta_{t-1} - \gamma_t \widehat{\Sigma} \theta_{t-1} + \gamma_t \widehat{b}, \quad \theta_0 = 0. \tag{1}
\]

#### 2. 单次遍历小批量SGD。  
为简单起见,假设 \(B \mid N\),并将 \([N]\) 划分为不相交的批次 \(I_1, \dots, I_{N/B}\),其中 \(|I_t| = B\)。对于每个批次,定义  
\[
\widehat{\Sigma}_{I_t}^{(B)} := \frac{1}{B} \sum_{i \in I_t} S x_i x_i^\top S^\top, \qquad \widehat{b}_{I_t}^{(B)} := \frac{1}{B} \sum_{i \in I_t} S x_i y_i.
\]  
单次遍历小批量SGD迭代为  
\[
u_t^{\mathrm{op}} = u_{t-1}^{\mathrm{op}} - \gamma_t \widehat{\Sigma}_{I_t}^{(B)} u_{t-1}^{\mathrm{op}} + \gamma_t \widehat{b}_{I_t}^{(B)}, \quad t = 1, \dots, \frac{N}{B}, \quad u_0^{\mathrm{op}} = 0. \tag{2}
\]  
因此,每次更新使用 \(B\) 个样本,总共进行 \(N/B\) 次更新。

#### 3. 多次遍历小批量SGD

相似文章

草图线性对比学习:近似、优化与统计缩放

arXiv cs.LG

本文推导了在高斯潜变量模型下的草图线性对比学习的缩放定律,分析了风险如何分解为近似项、优化项和统计项,并为对比学习中平衡模型规模、数据和计算提供了理论指导。

面向OLS回归的数据分区分布式草图方法

arXiv cs.LG

本文研究了OLS回归中的分布式草图化方法,该方法不是对整个数据集构建草图,而是基于分区子集构建,从而降低计算成本。作者刻画了平均估计量的精确超额损失,并表明当子集协方差散度较小时,该损失与全数据草图化的损失相当。

平坦最小值下固定步长SGD的缩放极限

arXiv cs.LG

本文分析了平坦最小值附近固定步长SGD的缩放极限,表明对于平坦度指数m≥2的目标函数,不变分布集中在尺度α^(1/m)上,且当m>2时收敛到非高斯平稳分布。