如何分配你的Token?训练步数与批次大小的缩放定律

arXiv cs.LG 论文

摘要

提出了一种三项缩放定律,将模型大小、训练步数和批次大小解耦,使得用更少的运行次数即可进行稳健拟合,并推导出次优批次大小的缩放定律。

arXiv:2607.01487v1 公告类型:新 摘要:我们提出了一种缩放定律,该定律考虑了模型大小和训练数据,同时将训练数据明确分解为训练步数和批次大小(称为三项定律)。在大量训练运行上拟合所提出的定律,我们发现它正确地恢复了最优批次大小的缩放。此外,由于它利用了次优批次大小的训练运行,我们的定律可以用显著更少的训练运行次数进行稳健拟合。我们进一步表明,三项定律可用于推导次优批次大小的缩放定律,并且它与先前关于临界批次大小的实证结果一致。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:41

如何分配你的Token?基于训练步数和批次大小的缩放定律
来源:https://arxiv.org/html/2607.01487
Fabian Schaipp<sup>1</sup> 通讯邮箱:[email protected] (https://arxiv.org/html/2607.01487v1/[email protected])<sup>2</sup> Inria, 巴黎高等师范学院, PSL研究大学, 巴黎

###### 摘要

我们提出一种缩放定律,该定律同时考虑模型规模和训练数据,并明确将后者拆分为训练步数和批次大小(称为*三项定律*)。通过在一组大规模训练运行上拟合所提出的定律,我们发现它能正确恢复最优批次大小的缩放关系。此外,由于该定律利用了具有次优批次大小的训练运行,我们的定律可以用显著更少的训练运行来稳健拟合。我们进一步表明,三项定律可用于推导次优批次大小的缩放定律,并且它与之前关于临界批次大小的实证结果一致。

## 1 引言

深度学习领域,特别是大型语言模型(LLMs)领域,在过去几年中取得了巨大进展。这一进展在很大程度上归功于“简单”地扩大规模,无论是在模型规模还是训练数据方面。模型性能的提升通常遵循可预见的趋势,称为*缩放定律*,这些定律已在LLM预训练背景下被发现(Kaplan et al., 2020 (https://arxiv.org/html/2607.01487#bib.bib12); Hoffmann et al., 2022 (https://arxiv.org/html/2607.01487#bib.bib10)),也在深度学习的许多其他领域如视觉(Zhai et al., 2022 (https://arxiv.org/html/2607.01487#bib.bib25))、天气预报(Bodnar et al., 2024 (https://arxiv.org/html/2607.01487#bib.bib5))或蛋白质建模(Lin et al., 2023 (https://arxiv.org/html/2607.01487#bib.bib16))中有所发现。

##### 模型规模和数据的缩放定律。

在训练大型语言模型的背景下,缩放定律通常指那些能够推断计算资源在模型规模 \( N \) 和训练样本 \( D \) 之间最优分配的函数形式。Kaplan 等人(2020 (https://arxiv.org/html/2607.01487#bib.bib12))和 Hoffmann 等人(2022 (https://arxiv.org/html/2607.01487#bib.bib10))的开创性工作表明,当增加 \( N \) 或 \( D \) 时,测试损失会可预见地降低。一种广泛使用的获得缩放定律的技术,称为 Chinchilla 方法3,是将(最终测试)损失建模为 \( N \) 和 \( D \) 的幂律之和,即

\[
\mathcal{L}(N,D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}. \tag{1}
\]

参数 \( (E, A, B, \alpha, \beta) \) 通过一组训练运行进行拟合。然后,在给定计算约束下,从 (1) 推导出最优模型规模,并可能外推到实验测试范围之外的 \( (N, D) \) 值。另一方面,多项工作表明拟合过程本身很微妙,训练过程以及拟合技术中的设计选择都会影响结果(Besiroglu et al., 2024 (https://arxiv.org/html/2607.01487#bib.bib3); Li et al., 2025b (https://arxiv.org/html/2607.01487#bib.bib15))。此外,不能保证该定律具有良好的泛化性,而这对于推导大规模训练运行的最优配置至关重要。

##### 超参数缩放定律。

虽然 Chinchilla 形式的缩放定律可以告知 \( N \) 和 \( D \) 的计算最优分配,但它们没有明确考虑训练超参数。为了解决这个问题,最近一些工作推导了最优学习率和/或批次大小作为 \( (N, D) \) 函数的缩放定律(DeepSeek-AI et al., 2024 (https://arxiv.org/html/2607.01487#bib.bib7); Li et al., 2025a (https://arxiv.org/html/2607.01487#bib.bib14); von Rütte et al., 2026 (https://arxiv.org/html/2607.01487#bib.bib19))。通常,这些工作只是假设感兴趣的超参数(例如作为 \( D \) 函数的最优批次大小)具有幂律关系,并将系数拟合到训练运行的数据上。然而,这些方法并不直接与形式 (1) 兼容,因为它们不建模损失值。

另一条不同的工作路线基于*临界批次大小*的概念(McCandlish et al., 2018 (https://arxiv.org/html/2607.01487#bib.bib17); Shallue et al., 2018 (https://arxiv.org/html/2607.01487#bib.bib29)):它描述了如下现象:达到目标损失所需的步数 \( K \) 作为批次大小的函数,在某一点之后其下降速度会远慢于反线性关系。McCandlish 等人(2018 (https://arxiv.org/html/2607.01487#bib.bib17))用以下方程对此建模

\[
(K / K_{\min} - 1)(D / D_{\min} - 1) = 1. \tag{2}
\]

这里,\( K_{\min} \)(分别为 \( D_{\min} \))是达到目标损失所需的最小步数(分别为最小 token 数),可以通过经验拟合得到。临界批次大小随后定义为 \( D_{\min} / K_{\min} \)。Bergsma 等人(2025 (https://arxiv.org/html/2607.01487#bib.bib2))建立了该关系与权重衰减的联系。在早期工作中,Kaplan 等人(2020 (https://arxiv.org/html/2607.01487#bib.bib12))使用了相同的临界批次大小模型来关联损失与训练步数。

(2) 的一个核心问题是它暗示了一个*最优批次大小为1*(Bergsma et al., 2025 (https://arxiv.org/html/2607.01487#bib.bib2));然而,这与使用 AdamW 时的经验情况相冲突,其中最优批次大小被发现随可用 token 预算 \( D \) 缩放(Porian et al., 2024 (https://arxiv.org/html/2607.01487#bib.bib18); Li et al., 2025a (https://arxiv.org/html/2607.01487#bib.bib14))。

##### 缩放定律与优化理论。

从理论角度来看,损失、批次大小和训练步数之间的关系本质上与优化理论相关。最近的工作由 Shulgin 等人(2026 (https://arxiv.org/html/2607.01487#bib.bib23))和 Islamov 等人(2026 (https://arxiv.org/html/2607.01487#bib.bib11))直接通过随机条件梯度方法的收敛界推导出了超参数缩放定律。此外,先前已经证明,优化理论可以为 LLM 训练的超参数调优/迁移提供信息,例如在学习率调度(Schaipp et al., 2025 (https://arxiv.org/html/2607.01487#bib.bib21))或权重衰减(Wang and Aitchison, 2025 (https://arxiv.org/html/2607.01487#bib.bib24))的背景下。

## 2 概述

##### 我们提出的定律。

在此,我们建议将损失建模为 \( (N, M, K) \) 的幂律函数,其中 \( M \) 是以 token 为单位的批次大小,\( K \) 是训练步数,即

\[
\mathcal{L}(N, M, K) = E + \frac{A}{N^{\alpha}} + \frac{B}{M^{\beta}} + \frac{C}{K^{\gamma}}.
\]

这有几个自然的优势:

1.  (i) 我们的定律将 Chinchilla 形式 (1) 与最优批次大小的缩放定律结合在一起。在受限数据预算 \( D = MK \) 下,我们的定律暗示了最优批次大小随 \( D \) 的缩放规则,同时在使用最优批次大小时坍缩为 Chinchilla 形式。
2.  (ii) 所提出的形式也与随机优化的理论结果密切相关并受其启发,参见 Shulgin 等人 (2026 (https://arxiv.org/html/2607.01487#bib.bib23));Kovalev (2025 (https://arxiv.org/html/2607.01487#bib.bib13))。这使得桥接从经验缩放分析到更理论化的理解成为可能。
3.  (iii) 所提出的定律可以用来自次优批次大小的运行进行拟合,这(正如我们将展示的)大大减少了拟合所需的训练运行数量。
4.  (iv) 虽然之前的缩放定律仅建模具有*最优*超参数的性能,但我们的公式也描述了次优批次大小下的性能。这在实践中面临硬件约束时可能很重要。

##### 我们的发现总结。

我们在两个(密集)LLM 训练运行数据集上拟合了我们提出的定律,以下分别称为 Li(Li et al., 2025a (https://arxiv.org/html/2607.01487#bib.bib14))和 OpenEuroLLM(OpenEuroLLM Consortium, (https://arxiv.org/html/2607.01487#bib.bib30))。两个数据集都涵盖了多种模型规模、token 预算和批次大小。<sup>3</sup> 注:OpenEuroLLM 数据集在撰写本文时尚未公开。我们将在 OpenEuroLLM 数据集发布后公开用于复现所有实验的代码库。

1.  (i) 我们的定律产生的最优批次大小缩放关系与先前不建模损失值的超参数缩放定律一致(见第 4.1 节 (https://arxiv.org/html/2607.01487#S4.SS1))。特别地,我们发现使用我们的公式,每个 \( (N, D) \) 只需两个批次大小即可稳健地找到该定律(而无需进行全面扫描);这将所需的训练运行数量减少到 28%(见第 4.2 节 (https://arxiv.org/html/2607.01487#S4.SS2))。
2.  (ii) 通过构建,我们提出的定律产生了非平凡的最优批次大小(与上述早期公式相反),并且该最优批次大小与模型规模无关,这与 Li 等人(2025a (https://arxiv.org/html/2607.01487#bib.bib14))的经验结果一致。同时,它描述了临界批次大小如何随 \( N \) 和/或 \( D \) 缩放,与 Zhang 等人(2025 (https://arxiv.org/html/2607.01487#bib.bib26))的发现一致(见第 4.4 节 (https://arxiv.org/html/2607.01487#S4.SS4))。
3.  (iii) 对于最优批次大小因实际约束而不可行的情况,我们推导了 \( \varepsilon \)-次优批次大小的缩放定律,这些定律能良好地泛化到样本外的 token 预算(见第 4.3 节 (https://arxiv.org/html/2607.01487#S4.SS3))。

##### 符号说明。

下表总结了整篇文章中使用的最重要的符号。注意,有 \( D = MK \)。

## 3 带训练步数和批次大小的缩放定律

回顾由 Hoffmann 等人(2022 (https://arxiv.org/html/2607.01487#bib.bib10))提出的 Chinchilla 定律:对于 \( A, B, E > 0 \) 和 \( \alpha, \beta > 0 \),将损失参数化为

\[
\mathcal{L}(N, D) = E + \frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}.
\]

此处,\( \mathcal{L} \) 通常指训练结束时的测试损失(或其平滑版本)。使用 Hoffmann 等人(2022 (https://arxiv.org/html/2607.01487#bib.bib10))的训练运行,但采用更精确的拟合过程,Besiroglu 等人(2024 (https://arxiv.org/html/2607.01487#bib.bib3))报告了以下定律

\[
\mathcal{L}(N, D) = 1.8172 + \frac{482.01}{N^{0.3478}} + \frac{2085.43}{D^{0.3658}}. \tag{EpochAI}
\]

上述缩放定律没有考虑批次大小,然而批次大小对训练性能至关重要(Bergsma et al., 2025 (https://arxiv.org/html/2607.01487#bib.bib2); Zhang et al., 2025 (https://arxiv.org/html/2607.01487#bib.bib26))。特别地,Hoffmann 等人(2022 (https://arxiv.org/html/2607.01487#bib.bib10))仅报告他们使用了“经过充分测试的启发式方法”来选择批次大小,但并未研究其对缩放分析的影响。

在此,我们提出考虑 token 预算 \( D \) 如何分配给训练步数 \( K \) 和批次大小 \( b \)。我们首先描述两种类似的方法。

##### 方法一:三项定律。

遵循幂律方法,我们提出函数形式

\[
\mathcal{L}(N, M, K) = E + \frac{A}{N^{\alpha}} + \frac{B}{M^{\beta}} + \frac{C}{K^{\gamma}}, \tag{3}
\]

其中 \( (E, A, B, C, \alpha, \beta, \gamma) \) 是可拟合的参数。这有一个优势:当选择最优批次大小时,它自动简化为原始的 Chinchilla 形式 (1)。为了看到这一点,在约束 \( D = MK \) 下对 \( M \) 最小化 (3)。最优批次大小为

\[
M^{\star} = \left[ \frac{\beta B}{\gamma C} \right]^{\frac{1}{\beta+\gamma}} D^{\frac{\gamma}{\beta+\gamma}} =: G D^{\frac{\gamma}{\beta+\gamma}}. \tag{4}
\]

特别地,最优批次大小与模型规模 \( N \) 无关。将 \( M^{\star} \) 和 \( K^{\star} = D / M^{\star} \) 代回 (3) 得到

\[
\mathcal{L}(N, D) = E + \frac{A}{N^{\alpha}} + \frac{\hat{B}}{D^{\tau}}, \quad \tau := \frac{\beta\gamma}{\beta+\gamma}, \quad \hat{B} := BG^{-\beta} + CG^{\gamma}. \tag{5}
\]

因此,在 (3) 下,将固定 token 预算 \( D \) 最优地拆分为 \( (K, b) \) 通过重新参数化 \( (B, \beta) \to (\hat{B}, \tau) \) 恢复了形式 (1)。

方程 (3) 在结构上与随机优化的收敛界非常相似。设 \( (x_k)_{k \in \mathbb{N}} \) 是随机条件梯度方法相对于一般范数的迭代。假设损失函数满足 \( \mu \)-KL 条件(见 Islamov 等人 (2026 (https://arxiv.org/html/2607.01487#bib.bib11))),对于固定批次大小 \( M \)(或 \( b \))和训练步数 \( K \),在最优学习率 \( \eta^{\star} \) 下,Shulgin 等人(2026 (https://arxiv.org/html/2607.01487#bib.bib23),定理 1)(从 Kovalev (2025 (https://arxiv.org/html/2607.01487#bib.bib13)) 推导得出)指出

\[
\min_{1 \leq k \leq K} \mathbb{E}[\mathcal{L}(x_k)] \lesssim \mathcal{L}_{\star} + \frac{1}{\sqrt{M}} + \frac{1}{\sqrt{K}},
\]

其中 \( \lesssim \) 表示该界对右边每一项都成立,直到某个乘法常数。与 (3) 相比,最优损失由 \( E + A / N^{\alpha} \) 参数化,而其他项的幂次从 \( 1/2 \) 放松为 \( (\beta, \gamma) \)。

##### 方法二:特定模型的两项定律。

函数形式 (3) 隐含地假设模型规模不影响系数 \( (B, C) \) 和 \( (\beta, \gamma) \),因此结构上 \( M^{\star} \) 与 \( N \) 无关。虽然这一隐含假设得到了先前对 LLMs 的实验结果支持(Li et al., 2025a (https://arxiv.org/html/2607.01487#bib.bib14); Zhang et al., 2025 (https://arxiv.org/html/2607.01487#bib.bib26)),作为一种替代方案,我们可以*固定模型规模*并拟合以下函数形式

\[
\mathcal{L}(M, K) = E + \frac{B}{M^{\beta}} + \frac{C}{K^{\gamma}}, \tag{6}
\]

其中 \( (E, B, C, \beta, \gamma) \) 同样是可拟合的参数。我们可以(独立地)针对多个 \( N \) 拟合该形式,先验地允许在不同模型规模下 \( (B, C, \beta, \gamma) \) 取不同值。

##### 术语。

从现在起,我们将形式 (6) 的定律称为*两项定律*,将形式 (3) 的定律称为*三项定律*。方便时,我们将分别使用缩写 2TL 和 3TL。

## 4 实验

我们在两个数据集上拟合 2TL 和 3TL 形式的缩放定律,这些数据集包含多种组合 \( (N, M, K) \) 的训练日志。

相似文章

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。

统一神经缩放定律

Hugging Face Daily Papers

提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。