floating-point-precision

标签

Cards List
#floating-point-precision

无声冻结:预测低精度训练何时停止学习

arXiv cs.LG ↗ · 2026-07-14 缓存

本文识别出低精度训练中的一种确定性、可预测的冻结现象:当梯度下降权重更新低于权重最后一位单位的一半时,该更新被舍入消失,对应坐标冻结,而梯度仍为非零。该冻结由每坐标半ULP条件决定,且仅需高精度轨迹和目标尾数长度即可预测,无需低精度数据。在一个使用标准AdamW加余弦退火方案、权重以bf16等价精度存储的小型GPT模型中,训练正常进行,然后在中期之后永久冻结——与先验预测相差不超过四个步骤。在一个1.24亿参数的GPT-2变压器中,每次优化器步骤后权重被约束到8位浮点网格,无主权重,密集权重在两个fp8格式下均在初始化时冻结——从fp32参考先验预测——验证损失停滞,而全精度持续提升。随机舍入消除了持久冻结,同一参考也预测了这一点。该条件可迁移至冻结特征回归、跨128倍精度的尾数截断仿真器、小网络以及MNIST上的CNN:这是一个可计算的低精度训练轴,而非扩散噪声。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈