深度双下降
摘要
OpenAI研究揭示了“双下降”现象,即测试误差随着模型规模和训练步数的增加呈现出非单调的模式,挑战了传统上对深度学习偏差-方差权衡的理解。
我们展示了CNNs、ResNets和transformers中发生的双下降现象:性能首先提升,然后变差,接着随着模型规模、数据规模或训练时间的增加再次提升。这种效应通常通过仔细的正则化来避免。虽然这种行为似乎相当普遍,但我们尚未完全理解其发生的原因,并认为进一步研究这一现象是一个重要的研究方向。
查看缓存全文
缓存时间: 2026/04/20 14:43
# 深度双重下降
来源:https://openai.com/index/deep-double-descent/
上方的图表展示了测试误差和训练误差随模型规模与优化步数的变化。对于给定的优化步数(固定 y 坐标),测试误差和训练误差呈现出模型规模的双重下降。对于给定的模型规模(固定 x 坐标),随着训练的进行,测试误差和训练误差先下降、再上升、之后再次下降;我们将这种现象称为 epoch 级别的双重下降。
*通常,测试误差的峰值系统性地出现在模型刚刚能够拟合训练集的时候。*
我们的直觉是,对于处于插值阈值的模型,实际上只有一个模型能够拟合训练数据,而强迫它拟合即使带有轻微噪声或错误标注的标签,也会破坏其整体结构。也就是说,既能够插值训练集又在测试集上表现良好的“好模型”并不存在。然而,在过参数化区域,存在许多能够拟合训练集的模型,并且其中不乏这样的好模型。此外,随机梯度下降(SGD)的隐式偏差会引导它找到这些好模型,其原因我们尚不完全理解。
我们将全面理解深度神经网络中双重下降背后的机制视为一个重要的开放问题。
相似文章
深度隐含偏差:从神经坍缩到Softmax编码
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。
含污染数据最小二乘插值的双重下降现象:一项模拟研究
这项模拟研究考察了线性回归中含污染数据的最小二乘插值的双重下降现象,比较了最小二乘插值器与稳健替代方法的性能。
深度促进局部熵:深层变分范数ReLU回归中的二次深度依赖
本文证明了深层变分范数ReLU回归的极小极大风险对深度具有二次依赖关系,使用了局部打包论证和逼近定理。
大步长梯度下降恢复多路径深度线性网络中的对称性
本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。
Decoupled Descent:通过AMP Onsager修正强制实现精确的训练-测试误差追踪 [R]
一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。