无声冻结:预测低精度训练何时停止学习
摘要
本文识别出低精度训练中的一种确定性、可预测的冻结现象:当梯度下降权重更新低于权重最后一位单位的一半时,该更新被舍入消失,对应坐标冻结,而梯度仍为非零。该冻结由每坐标半ULP条件决定,且仅需高精度轨迹和目标尾数长度即可预测,无需低精度数据。在一个使用标准AdamW加余弦退火方案、权重以bf16等价精度存储的小型GPT模型中,训练正常进行,然后在中期之后永久冻结——与先验预测相差不超过四个步骤。在一个1.24亿参数的GPT-2变压器中,每次优化器步骤后权重被约束到8位浮点网格,无主权重,密集权重在两个fp8格式下均在初始化时冻结——从fp32参考先验预测——验证损失停滞,而全精度持续提升。随机舍入消除了持久冻结,同一参考也预测了这一点。该条件可迁移至冻结特征回归、跨128倍精度的尾数截断仿真器、小网络以及MNIST上的CNN:这是一个可计算的低精度训练轴,而非扩散噪声。
查看缓存全文
缓存时间: 2026/07/14 04:14
# 预测低精度训练何时停止学习
来源: https://arxiv.org/html/2607.09800
###### 摘要
在降低浮点精度下进行训练可能会悄无声息地停止学习:当梯度下降的权重更新值小于该权重最后一位单位(ULP)的一半时,该更新会被舍去,该坐标冻结,而其梯度仍然非零。这种冻结是确定性的,由每个坐标的半ULP条件决定,并且仅根据高精度轨迹和目标尾数长度即可预测,无需低精度数据。在一个使用标准AdamW+余弦学习率方案、权重存储为bf16等效格式的小型GPT中,训练正常进行,然后在运行中期过后、先验预测的四个步长内永久冻结。在一个1.24亿参数的GPT-2 Transformer中,其权重在每个优化器步骤后都被约束为8位浮点网格(无主权重),密集权重在两种fp8格式下都在初始化时冻结——这是根据fp32参考先验预测的——而验证损失进入平台期,全精度训练则继续改进。随机舍入消除了持续冻结,且同一参考也预测了这一点。该条件可跨冻结特征回归、跨越128倍精度的尾数截断模拟器、小型网络以及MNIST上的CNN迁移:这是一个可计算的低精度训练轴线,而非弥散的噪声。
低精度算术现已广泛应用于训练,且位宽持续下降:bfloat16已成为常规,8位浮点已应用于前沿Transformer训练。随着位宽下降,科学机器学习、低精度优化器设计和分布式后训练等不同领域的独立研究小组都遇到了同一种未命名的失败:训练继续进行,损失有限,梯度非零——但权重悄无声息地停止移动(表1 (https://arxiv.org/html/2607.09800#S0.T1))。每个小组都设计了变通方案,但都无法事先说明故障何时会发生。低精度故障模式通常被视为弥散的“噪声”。而这一种完全不是噪声,而是一个确定性的、每个坐标的、可预测的事件:梯度下溢冻结。具体来说,这正是fp32主权重旨在防止、而纯低尾数权重更新会暴露的故障模式。在梯度下降中,权重更新为 \( w \leftarrow w - \eta \nabla l \);在有限精度下,结果会被舍入回浮点网格。当更新量 \( \eta \|\nabla l\| \) 小于 \( w \) 最后一位单位(ULP)的一半时,舍入结果就是 \( w \) 本身——该坐标停止移动,而其真实梯度仍然非零。一旦足够多的坐标超过此阈值,即使损失梯度并未消失,权重向量也停止更新。由于训练中 \( \|w\| \) 增长,其ULP也随之增长,因此最初远低于分辨率限制的学习过程可能在中途进入冻结区域并停止。
**表1:** 六份独立报告涉及同一算术风险:权重更新过小,无法在目标网格中幸存。每一种都是半ULP更新淹没的表现形式——无论是存储权重训练、混合精度流水线,还是强制转换并同步的后训练——尽管周围机制不同(相关工作)。没有一份报告能预测每个坐标条件 \( \|\Delta w_i\| < \tfrac{1}{2} \mathrm{ULP}_m(w_i) \) 何时触发,且仅有一份文献\[9 (https://arxiv.org/html/2607.09800#bib.bib9)\]陈述了该条件,但仅作为修复方案的门槛,而非预测。
我们的核心主张是:这种冻结是*受控且可预测的*。控制事件是每个坐标的:当 \( \|\Delta w_i\| < \tfrac{1}{2} \mathrm{ULP}_m(w_i) \) 时,坐标 \( i \) 冻结,而被标记的坐标比例即为冻结分数。当权重在尺度上均匀时,这个逐坐标规则可聚合为一个无量纲数,
\[
\rho \equiv \frac{\eta \|g\|}{\varepsilon \|w\|},
\tag{1}
\]
即梯度下降步长与尾数分辨率 \( \varepsilon \|w\| \)(\( \varepsilon = 2^{-(m+1)} \),其中 \( m \) 为尾数位数)之比,其起始阈值为 \( \rho^{\star} = \mathcal{O}(1) \);当权重跨越多个尺度时,逐坐标条件保持精确,而此聚合标量失去意义。更有力的是,冻结*时间* \( \tau^{\star} \) 仅根据单个高精度轨迹和目标尾数长度即可先验得出——无需进行低精度运行即可预测低精度何时失败。我们在受控的冻结特征设定中建立该机制,然后展示它能直接迁移至跨越128倍精度的尾数截断模拟器以及纯全批量GD下的可训练特征网络,证明它会在标准AdamW+余弦学习率方案的小型GPT训练中途、在提前已知的步长处发生作用,最后证明它支配着一个1.24亿参数的GPT-2 Transformer——该模型在每个步骤下均使用标准nanoGPT风格优化器和调度,其权重被约束在8位浮点网格上——其中密集权重在初始化时冻结,这是根据廉价的fp32参考先验预测的,而验证损失进入平台期,全精度训练则持续改进。因此,冻结是算术的性质,而非任何特定模型或规模的产物。
由于这是浮点更新本身的属性,只要梯度下降在低精度下运行,冻结就具有重要意义;已有六份独立报告以某种形式遇到了潜藏的半ULP淹没现象(表1 (https://arxiv.org/html/2607.09800#S0.T1)及相关工作)。更广泛的目标是将精度选择从经验法则转向预测。近期一篇关于bf16 FlashAttention损失爆炸机制的论文\[10 (https://arxiv.org/html/2607.09800#bib.bib10)\]结尾呼吁对其他精度故障通道进行类似处理;本文正是针对权重更新通道的回应——提供控制参数、推导阈值,以及在投入任何低精度硬件之前,对给定格式在给定调度下何时停止学习的先验预测。我们的第一个测试系统——冻结特征线性回归——借鉴了一项关于可预测性推断的研究\[1 (https://arxiv.org/html/2607.09800#bib.bib1),2 (https://arxiv.org/html/2607.09800#bib.bib2)\]。
---
## 相关工作
**记录到的更新通道冻结遭遇。** 权重更新下溢已被多个社区独立遇到——除了一个案例\[9 (https://arxiv.org/html/2607.09800#bib.bib9)\]外,均未被命名,且无一作出预测(表1 (https://arxiv.org/html/2607.09800#S0.T1))。在科学机器学习中,基于物理信息的网络的L-BFGS优化在fp32更新数值上不可见时提前停止\[4 (https://arxiv.org/html/2607.09800#bib.bib4)\];fp16权重更新在混合精度训练中下溢为零\[6 (https://arxiv.org/html/2607.09800#bib.bib6)\]。在低精度优化器设计中,纯bf16 Adam在没有fp32主副本的情况下发散或停滞\[5 (https://arxiv.org/html/2607.09800#bib.bib5)\];一个生产环境中的PyTorch算子额外携带16个尾数位,正是为了让小更新能在bf16网格中幸存\[7 (https://arxiv.org/html/2607.09800#bib.bib7)\]。在分布式强化学习的后训练中,在典型学习率下,约99%的每步bf16权重更新在强制转换后不可见——那里高精度学习器继续训练,而转换后更新的不可见性被用于通信压缩\[12 (https://arxiv.org/html/2607.09800#bib.bib12)\]。在文献\[9 (https://arxiv.org/html/2607.09800#bib.bib9)\]的受控对比中,朴素bf16微调T5 Transformer直接崩溃。每份报告都用变通方案应对症状,其中一份——Yu\[9 (https://arxiv.org/html/2607.09800#bib.bib9)\],下文将详述——明确陈述了逐坐标半ULP条件作为其修复的门槛。没有一份报告(包括该份)提供关于起始的总体阈值或该条件何时会触发的先验预测。
**最接近的现有工作。** Yu\[9 (https://arxiv.org/html/2607.09800#bib.bib9)\]独立识别出相同的算术死区——“淹没”,借用浮点数求和的经典术语\[18 (https://arxiv.org/html/2607.09800#bib.bib18)\]——陈述了半ULP条件 \( \|\delta\| < \tfrac{1}{2} u(\theta) \) 并以逐坐标比值 \( \|\delta\| / u(\theta) \) 来门控更新,该比值在我们符号中即为 \( \|\Delta w_i\| / \mathrm{ULP}_m(w_i) \)。这个原始ULP比值——记作 \( \rho_{\mathrm{Yu}} \equiv \|\Delta w_i\| / \mathrm{ULP}_m(w_i) \)——*不是*我们的聚合 \( \rho \):它与我们的逐坐标 \( \rho_i \equiv \|\Delta w_i\| / (\varepsilon |w_i|) \) 的关系为 \( \rho_{\mathrm{Yu}} = 2^{\phi_i - 1} \rho_i \),其中 \( \phi_i = \mathrm{frac}(\log_2 |w_i|) \) 将 \( w_i \) 定位在其binade中,因此Yu的死区门控 \( \rho_{\mathrm{Yu}} < \tfrac{1}{2} \) 正是我们的逐坐标条件 \( \rho_i < 2^{-\phi_i} \)。聚合标量 \( \rho = \eta \|g\| / (\varepsilon \|w\|) \) 及其推导阈值 \( \rho^{\star} = 1 / \sqrt{2} \) 是独立的均匀总体对象(方法部分),并非对他比值的重新标记。该工作的贡献是一个*修复*:将有条件地将淹没的更新放大到 \( \pm 1 \) ULP,使得完全低精度训练无需主权重即可进行。我们的工作与之正交且互补:我们从算术中推导出总体阈值 \( \rho^{\star} = 1 / \sqrt{2} \),展示冻结*时间*仅根据单次高精度轨迹加上目标尾数长度即可先验得出(在启动任何低精度运行之前),并通过从受控回归到1.24亿参数fp8 Transformer的验证来证实这一预测。预测与修复自然结合:对哪些张量何时冻结的预测,将允许任何此类缓解措施被选择性地而非全覆盖地部署。
**同类故障通道(非本案例)。** 两个邻近的低精度故障模式具有有限尾数的根本原因,但机制不同,我们不将其归为权重冻结的实例。Qiu和Yao\[10 (https://arxiv.org/html/2607.09800#bib.bib10)\]将长期存在的bf16 FlashAttention损失爆炸追溯到前向注意力乘积中的有偏舍入,该舍入沿共享的低秩方向累积(另见\[26 (https://arxiv.org/html/2607.09800#bib.bib26)\]);这是一种前向累积偏差,具有相反的特征(突然爆炸),而本文研究的冻结是权重更新本身的舍入事件,其特征是无声停滞。Topollai和Choromanska\[11 (https://arxiv.org/html/2607.09800#bib.bib11)\]对量化*优化器状态*的陈旧性进行建模,这是第三个通道,其中EMA内存(而非权重)停止更新。Qiu和Yao在结尾呼吁对其他精度故障通道、格式和规模进行同样的机制化处理;本文正是为权重更新通道提供了这一点,涵盖Transformer规模的fp8。
**缓解措施与缺失的预测。** 标准防御手段包围了冻结,但无法预测它。权重的fp32主副本\[13 (https://arxiv.org/html/2607.09800#bib.bib13)\]——这一默认设置使得bf16训练成为常规\[14 (https://arxiv.org/html/2607.09800#bib.bib14)\],并且八位训练从首次演示\[15 (https://arxiv.org/html/2607.09800#bib.bib15)\]到前沿实践\[16 (https://arxiv.org/html/2607.09800#bib.bib16)\]一直保留——将累积更新保持在ULP足够精细以被记录的位置。随机舍入完全消除了确定性死区,具有成熟的收敛理论\[8 (https://arxiv.org/html/2607.09800#bib.bib8),19 (https://arxiv.org/html/2607.09800#bib.bib19),20 (https://arxiv.org/html/2607.09800#bib.bib20),21 (https://arxiv.org/html/2607.09800#bib.bib21)\]并在边缘计算中实践日益增多\[22 (https://arxiv.org/html/2607.09800#bib.bib22)\];针对四位格式的无偏量化方案进一步推进了同一思路\[23 (https://arxiv.org/html/2607.09800#bib.bib23),24 (https://arxiv.org/html/2607.09800#bib.bib24)\],而单位缩放将张量重新归一化到可表示的最佳区域\[25 (https://arxiv.org/html/2607.09800#bib.bib25)\]。缩放研究量化了精度的总体成本\[17 (https://arxiv.org/html/2607.09800#bib.bib17)\]。所有这些都没有提供特定运行的预测——*哪些*张量的*哪些*坐标会在给定格式和调度下、在*哪个*步骤冻结——该预测可在任何低精度硬件投入之前获得。这正是本文的贡献。
---
## 结果
### 半ULP冻结条件
冻结是算术的性质,而非任何特定模型的产物。在具有 \( m \) 个尾数位的格式中,在 \( w_i \) 处的可表示间距为 \( \mathrm{ULP}_m(w_i) = 2^{\lfloor \log_2 |w_i| \rfloor - m} \),且四舍五入在 \( \|\Delta w_i\| < \tfrac{1}{2} \mathrm{ULP}_m(w_i) \) 时返回未改变的 \( w_i \);被标记的坐标比例即为冻结分数。以 \( \rho \)(方程 (1) (https://arxiv.org/html/2607.09800#S0.E1) ,其中 \( \varepsilon = 2^{-(m+1)} \))为单位,该条件变为 \( \rho_i < 2^{-\phi_i} \),其中 \( \phi_i = \mathrm{frac}(\log_2 |w_i|) \in [0,1) \) 将 \( w_i \) 定位在其binade内,因此半ULP边界是一个恰好一个位宽的区间 \( [\tfrac{1}{2}, 1] \)。当 \( \phi_i \) 均匀分布时(在我们的运行中高度精确),该区间的中位数为 \( 2^{-1/2} \),固定了 \( \rho^{\star} = 1 / \sqrt{2} \),无拟合参数(完整推导见方法部分);实测阈值(模拟器0.71,网络0.72–0.74)落在此值上。由于该区间宽度恒为一个位,与坐标数量无关,因此冻结起始具有内在的、与规模无关的宽度——是一个交叉而非锐化转变,我们将在下文直接验证。
随着训练进行,\( \|w\| \) 增长而 \( \|g\| \) 衰减,因此在这些运行中 \( \rho \) 下降并经过一个 \( \mathcal{O}(1) \) 阈值,此时迭代冻结。我们直接测量冻结分数,即一步后位不变权重坐标的比例 \( f = \langle \mathbb{1}[\, \mathrm{fl}(w - \eta g) = w\,] \rangle \),并将冻结时间 \( \tau^{\star} \) 定义为 \( f \) 首次达到 \( \tfrac{1}{2} \) 时的步骤。在真实bfloat16硬件上的冻结特征GD中,冻结通过稀疏检查点记录:在第100步时 \( f = 0 \),到第300步时 \( f = 1.0 \),之后迭代在训练的最后90%保持冻结(图1 (https://arxiv.org/html/2607.09800#Sx2.F1)a)。硬件检查点只能包围而不能精确定位交叉点;读取第一个完全冻结点的 \( \rho \) 值得到 \( \rho^{\star} \approx 0.72 \),与密集记录的模拟器一致(\( \rho^{\star} = 0.71 \),见下文)。
### 冻结时间可先验预测
决定性的测试是,我们能否在不运行低精度模型的情况下预测 \( \tau^{\star} \)。我们计算一条高精度(fp64)轨迹?此处原文似乎不完整,但根据上下文,我们继续翻译。相似文章
冻结深层,训练浅层:持续预训练中可解释的层分配方法
本文提出了 LayerTracer,这是一个用于持续预训练中参数层分配的可解释框架。研究表明,在冻结深层网络的同时仅训练浅层,其效果优于全参数微调。这为资源受限团队优化大语言模型提供了一种低成本且可操作的策略。
在顺序训练的早退出神经网络中平衡稳定性与可塑性
本文针对顺序训练的早退出神经网络中的灾难性遗忘问题,提出了两种分别基于弹性权重巩固(Elastic Weight Consolidation)和无遗忘学习(Learning without Forgetting)的方法,旨在在添加新退出点的同时保留早期退出点的性能。
学习何时停止有用?推理模型早期退出的成本感知研究
本文介绍了LearnStop,一种用于推理模型的轻量级检查点停止器,它从在线特征中预测前缀正确性,并发现学习式停止仅在多个问题早期正确且没有单一可靠的标量信号时,才比标量规则更有价值。
逐层渐进二值化:面向深度可伸缩二值网络的训练框架
提出StoMPP,一种针对二值神经网络的逐层渐进冻结训练框架,从输入到输出逐步对层进行二值化,在不依赖直通估计器的情况下,相比普通STE实现了显著的精度提升,并在多种架构和任务中表现出一致的增益。
面向模拟硬件的噪声感知训练:准确率在阈值处崩溃而非平滑下降 [D]
一项关于模拟硬件噪声的实验表明,准确率在阈值处崩溃而非平滑下降,而噪声感知训练显著移动了该阈值。