统一神经缩放定律
摘要
本文提出了统一神经缩放定律(UNSL),这是一种函数形式,能够准确建模和推断深度神经网络在多个维度(如参数、数据和步骤)同时变化时的缩放行为,相较于之前的缩放定律有所改进。
arXiv:2605.26248v1 Announce Type: new
摘要:我们提出了一种函数形式(称之为统一神经缩放定律(UNSL)),该形式能够准确建模和推断深度神经网络在多个维度同时变化时的缩放行为(即,当模型参数数量、训练数据集大小、训练步数、推理步数、计算量以及各种超参数同时变化时,目标评估指标如何变化),适用于多种架构以及一系列上游和下游任务中的各个任务。这些任务包括大规模视觉、语言、数学和强化学习。与其他神经缩放的函数形式相比,该函数形式在此任务集上得出的缩放行为外推结果显著更为准确。
查看缓存全文
缓存时间: 2026/05/27 09:06
# 统一神经缩放定律 来源:https://arxiv.org/html/2605.26248 Ethan Caballero Mila, 蒙特利尔大学 [email protected] [email protected] & Priyank Jaini Google DeepMind & David Krueger Mila, 蒙特利尔大学 & Irina Rish Mila, 蒙特利尔大学 ###### 摘要 我们提出了一种函数形式(称为统一神经缩放定律,UNSL),能够准确建模和推断深度神经网络在多个维度同时变化时的缩放行为(即,当同时变化模型参数数量、训练数据集大小、训练步数、推理步数以及各种超参数时,感兴趣的评价指标如何变化),适用于多种架构以及一系列上游和下游任务中的各类任务。与其他神经缩放函数形式相比,这种函数形式对该集合中的缩放行为推断结果更为准确。 ## 1 引言 训练当今最先进的神经网络需要大量的计算资源和训练数据。鉴于可用的方法和架构种类繁多,准确预测其性能对于选择那些在更大规模下可能表现最佳的方法至关重要,尤其是因为小规模下表现最佳的方法往往在更大规模下无法保持其性能(Sutton, 2019; Tolstikhin 等, 2021)。此外,准确预测神经网络在大规模下的行为不仅对识别最优方法至关重要,而且对确保人工智能安全也至关重要,因为预测大规模下新能力的涌现对于负责任地开发和部署先进AI系统是必不可少的。这一认识推动了神经缩放定律的研究(Cortes 等, 1994; Hestness 等, 2017; Rosenfeld 等, 2019; Kaplan 等, 2020; Zhai 等, 2021; Abnar 等, 2021; Brown 等, 2020; Bahri 等, 2021; Alabdulmohsin 等, 2022; Caballero 等, 2023),这些定律旨在预测大规模模型在计算量、数据和模型参数增加时的行为。显然,根据标准条件熵不等式 H(Y|X) ≤ H(Y),其中 X 是预测变量向量,Y 是性能评价指标,神经缩放定律预测的准确性和置信度会随着更多相关预测变量的加入而增加(或保持不变)。也就是说,随着预测变量 Xi(i=1,...,m)数量的增加,条件熵 H(Y|(X1,...,Xm)) 只会减少(或保持不变)。最终,为了最大程度地降低 Y 的熵,需要识别所有可能与 Y 存在因果关系的 Xi 集合,并开发一个完整的模型 P(Y|X),作为大规模神经网络行为的“统一函数形式”。 为了满足对(更)统一函数形式的需求,我们提出了**统一神经缩放定律(UNSL)**,这是一种函数形式,能够准确建模和推断深度神经网络在多个维度同时变化时的缩放行为。与其他神经缩放函数形式相比,这种函数形式在该集合上的缩放行为推断结果更为准确。此外,这种函数形式还能准确建模和推断其他函数形式无法表达的多变量缩放行为,例如过拟合以及超参数(如学习率和初始化权重标准差)与性能评价指标之间存在的非单调关系中的非单调转变。 ## 2 统一神经缩放定律的函数形式 图 1:具有两个输入维度 x₁ 和 x₂ 的统一神经缩放定律(UNSL)(深色实线)示意图;中间图和右图分别展示了在每个输入维度上的投影。在此示例中,UNSL 包含 3 个超转折点,由较亮的虚线表示——橙色、黄色和绿色。绿色超转折点由非瓶颈组件生成。橙色超转折点由 x₁ 瓶颈组件生成。黄色超转折点由 x₂ 瓶颈组件生成。详细解释请参见第 2 节关于超转折点的说明。 令 y 表示感兴趣的性能评价指标,例如预测误差或交叉熵,“上游”(即在预训练数据分布的验证集上测量)或“下游”(即模型在预训练中未遇到的新数据和/或任务上测量)。令 (xᵢ)ᵢ₌₁ᵐ ∈ ℝ̄₊ₘ 表示 m 个量的元组,这些量可视为 y 的预测因子,例如模型参数数量、训练数据集大小、训练步数、推理步数以及各种超参数的值。我们提出统一神经缩放定律(UNSL)的以下通用函数形式: y = a₀ + ( ( Q(3) + ( Q(S+4) + a₁⁻¹ )⁻¹ ⏟ 过拟合的反力 )⁻¹ + a₂⁻¹ )⁻¹ (1) 其中 Q 定义如下: Q(q) = ( (R(q))⁻¹ + a_q⁻¹ )⁻¹ + ∑_{s=1}^{S} ( R(q+s) + a_{q+s}^{-1} )⁻¹ ⏟ 超参数的反力 (2) 其中 R 定义如下: R(r) = K( U_r, n_{r₀}, r·(m+1) ) ⏟ 非瓶颈组件 + ∑_{t∈T_r} K( {t}, n_{r_t}, r·(m+1)+t ) ⏟ 瓶颈组件, 其中 U_r, T_r ⊆ {1, ..., m} (3) 其中 K 是多变量破碎神经缩放定律(MBNSL),定义如下: K(M, n, k) = b_k · ( ∏_{i∈M} x_i^{-c_{i0_k}} ) · ∏_{j=1}^{n} ( 1 + ( ∏_{i∈M} x_i^{c_{ijk}} / d_jk )^{|1/f_jk|} )^{-f_jk} (4) 其值为未知常数且需通过将上述函数形式拟合到 (x₁...xₘ, y) 数据点来估计的参数,是所有底数为 a, b, c, d, f 的参数。变量 i, j, k, q, r, s, t 用于索引。n 是乘积算符的界限;因此,n_{r₀} 和 n_{r_t} 隐式地是乘积算符的界限。S 是求和算符的界限。M ⊆ {1, ..., m}。M 是乘积索引集;因此,U_r 隐式地是乘积索引集。T_r 是求和索引集。K, Q, R 是函数,K(·), Q(·), R(·) 括号中的内容是这些函数的参数。当 K, Q 或 R 的参数通过加法和/或乘法获得时,这些加法和乘法发生的唯一原因是使每个 K 的实例化具有唯一的 k 值。 方程 (1)、(2)、(3) 和 (4) 解释如下。我们使用术语“多对数空间”指代通过对每个维度(x₁...xₘ, y)应用对数变换获得的 (m+1) 维空间。方程 (4) 是 Caballero 等人(2023)提出的单变量破碎神经缩放定律(BNSL)在多变量设置下的扩展。当 |M| = 1 时,其表达能力与 Caballero 等人(2023)中的单变量破碎神经缩放定律函数形式(减去性能极限项)相同。当 |M| > 1 时,方程 (4) 定义了一系列 (n+1) 个在多对数空间中平滑连接的超平面。常数 n 对应于多对数空间中 (n+1) 个连续超平面之间的(平滑)“超转折点”(即转变)的数量;每个超平面的维度为 |M|,每个超转折点的维度为 |M|−1。当 n = 0 时,方程 (4) 变为 b_k ∏_{i∈M} x_i^{-c_{i0_k}}。在多对数空间中,每个输入维度的初始指数 (c_{i0_k})_{i∈M} 对应于第一个超平面相对于输入维度 (xᵢ)ᵢ∈M 的梯度。在多对数空间中,b_k 对应于方程 (4) 输出的偏移量。第 j 个超平面平滑地过渡到第 (j+1) 个超平面,当 (xᵢ)ᵢ∈M 的值满足以下等式时:d_jk = ∏_{i∈M} x_i^{c_{ijk}}。每个输入维度的第 j 个指数 (c_{ijk})_{i∈M} 乘以 sign(f_jk) 对应于第 j 个超平面与第 (j+1) 个超平面之间在多对数空间中梯度的变化。常数 f_jk 表示第 j 个和第 (j+1) 个超平面之间超转折点的锐度;|f_jk| 的值越小,超转折点越尖锐,且超转折点前后区域在多对数空间中曲率越小;|f_jk| 的值越大,超转折点越平滑(更宽),且超转折点前后区域在多对数空间中曲率越大。 方程 (3) 由两种组件组成。组件 K( U_r, n_{r₀}, r·(m+1) ) 称为“非瓶颈”组件,对应于前述在多对数空间中平滑连接的超平面。求和 ∑_{t∈T_r} K( {t}, n_{r_t}, r·(m+1)+t ) 中的每个组件称为“瓶颈”组件,对应于当被每个维度 (x_t)_{t∈T_r} 瓶颈时的性能极限。 方程 (2) 如下:R(q) 代表第 2 节中迄今为止讨论的所有内容;a_q 代表一个误性能极限(例如,随机猜测的交叉熵或测试错误率)。方程 (2) 的其余内容代表与性能评价指标具有对立关系的超参数(例如学习率和初始化权重标准差)的“反力”;例如,当学习率和/或初始化权重标准差过大时,它们会对 Q(q) 的值施加“反力”。S 代表超参数“反力”的误性能极限数量;S 不代表任何其他数量(例如,S 不代表超参数的数量)。在实践中,S ≤ 1,除非在相对人为设计的场景中(例如,训练步数非常小(例如小于 5 步)且学习率大于 1 的场景),如附录 17.5 图 9 所示的缩放行为。 方程 (1) 如下:Q(3) 代表第 2 节中迄今为止讨论的所有内容。常数 a₀ 对应于 y 值在某种程度上可以降低(或最大化)的极限,即使所有 x₁...xₘ 都达到能产生 y 全局最优的 (xᵢ)ᵢ₌₁ᵐ ∈ ℝ̄₊ₘ 值。常数 a₂ 对应于由所使用特定性能评价指标引起的误性能极限。例如,当使用上界无穷的性能评价指标(如交叉熵)时,a₂ = ∞(即 a₂⁻¹ = 0);当使用上界有限的性能评价指标(如错误率)时,a₂ < ∞。方程 (1) 的其余内容,即内部倒数部分 ( Q(S+4) + a₁⁻¹ )⁻¹,对应于过拟合所施加的“反力”。当模型训练超过一个 epoch 时,这个内部倒数会变成一个非可忽略且远大于零的数。 ### 2.1 加法对称性 图 2:方程 (5) 的一个示例配置示意图,具有两个输入维度 x₁ 和 x₂。所有三个图展示的是相同的缩放行为。详见第 2.1 节。 以下表达式¹¹在方程 (1)、(2) 中出现多次(当发生加法时): ¹¹在方程 (5) 中,b、cᵢ₀、g 和 hᵢ 是通过将方程 (5) 拟合到 (x₁...xₘ, y) 数据点估计的常数。 [注:原文此处未完整给出方程 (5),但继续翻译后续内容。我们按原文保留。实际翻译中,方程 (5) 未在原文中列出,但根据上下文,它可能涉及加法对称性。此处我们直接翻译下文的说明文字。] (原文后续内容未提供,但根据格式,应继续翻译剩余部分。)
相似文章
统一神经缩放定律
提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。
扩展定律,谨慎解读(25分钟阅读)
全面概述深度学习中的扩展定律,追溯其理论基础和实证发现,并解释损失如何随模型大小、数据和计算量可预测地降低。
@lilianweng: 一篇超级迟到的(3年以上?)关于扩展定律的帖子。计算很昂贵。扩展定律是一种帮助我们推理…
Lilian Weng的博客文章全面概述了深度学习中的扩展定律,涵盖了它们的推导、计算最优分配以及Kaplan等人与Chinchilla之间的争论。
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
如何分配你的Token?训练步数与批次大小的缩放定律
提出了一种三项缩放定律,将模型大小、训练步数和批次大小解耦,使得用更少的运行次数即可进行稳健拟合,并推导出次优批次大小的缩放定律。