Decoupled Descent:通过AMP Onsager修正强制实现精确的训练-测试误差追踪 [R]
摘要
一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。
链接:https://arxiv.org/pdf/2604.27883 大家好,我们大多数人都熟悉使用梯度下降训练神经网络时的头疼问题:训练误差可能降至零,但测试误差可能与初始化时相同甚至增加。我的论文将这一现象视为数据重用偏差的结果,并且可以通过在一组风格化的高斯混合模型上研究全批量梯度下降来将其分离出来。事实证明,这个基本问题可以利用高维统计理论中的一些巧妙技巧来避免,特别是近似消息传递(这超出了本贴的范围,但我很乐意详细解释)。通过这样做,我创建了一种名为Decoupled Descent (DD)的训练方法,它生成一个证书,保证网络在每个参数迭代处的训练误差将渐近等于测试误差。我认为这种方法为如何训练网络提供了一种很酷的方式,希望大家能给我反馈。它为最优停止或超参数调整提供了一些好的想法,并为未来推进到诸如SGD或更一般模型的方向打开了思路。我附上了一个简单模型拟合问题上的训练-测试曲线,用来比较GD和DD(我的算法)的性能,以便让你从高层次了解该方法能保证什么。我强调这是一篇理论论文,所以要想应用到非常大的模型还有很长的路要走,但我认为这是一个好的第一步。对于一个定制的两层网络,一个简单的高维XOR模型进行了100次模拟。左边是用GD训练,右边是用我的方法训练。彩色带是25%到75%的分位数。我很乐意回答大家的问题,我计划有一天为这种训练方法编写一个兼容PyTorch的软件包,所以也欢迎任何功能建议。
相似文章
深度双下降
OpenAI研究揭示了“双下降”现象,即测试误差随着模型规模和训练步数的增加呈现出非单调的模式,挑战了传统上对深度学习偏差-方差权衡的理解。
从下降方向学习:单侧赫尔德正则性下的自适应梯度下降
本文提出了一种自适应梯度下降方法,利用单侧赫尔德正则性根据方向曲率而非全梯度变化来控制步长,为非凸目标函数提供了收敛保证,并展示了实证优势。
函数梯度下降与自适应表示 [R]
该论文介绍了函数梯度下降的自适应表示,可证明确保收敛到全局最小值点,并在多种设置中以数量级优于神经网络。
耦合梯度下降中瞬态放大的伪谱界
本文针对耦合梯度下降中的块三角Jacobian矩阵建立了精确的伪谱理论,证明了Kreiss常数界并给出了迭代复杂度结果。研究揭示了与双层优化、双时间尺度随机逼近以及GAN训练相关的非渐近、实例相关的瞬态放大现象。
差分隐私自然梯度下降
本文介绍了DP-NGD,一个实用框架,通过将曲率估计与私有数据解耦,并协调各向同性DP约束与各向异性二阶优化,将自然梯度下降与差分隐私相结合,在相同隐私预算下实现了最先进的准确率和高达10倍的收敛速度提升。