神经网络的Hessian谱如何依赖于数据
摘要
本文推导了任意宽度和深度的线性神经网络的Hessian矩阵的特征值,表明在分类任务中使用MSE损失时,尖锐度与最大类别比例相关,并通过实验验证了预测结果。
arXiv:2607.13631v1 公告类型:新
摘要:Hessian矩阵是研究深度学习中的损失景观和优化动力学,以及设计泛化度量、二阶学习算法等时的一个重要关注量。先前的工作主要关注实证结果,或在过于简化的设置下进行理论处理。在这项工作中,我们推导了任意宽度和深度的线性网络以及具有任意数量的样本、特征和标签的数据集的Hessian矩阵的特征值。重要的是,对于使用MSE损失的分类任务,我们发现解的尖锐度直接与属于任何类别的样本的最大比例相关。我们通过实验验证了我们的预测,并系统地分析了逐一去除不切实际的假设以及引入非线性带来的影响。我们观察到,在大多数情况下,我们的预测相当稳健,这使得我们能够将结论推广到更实际的学习设置中。
查看缓存全文
缓存时间: 2026/07/16 04:23
# 神经网络的海森谱如何依赖于数据 来源:https://arxiv.org/abs/2607.13631 查看PDF (https://arxiv.org/pdf/2607.13631) > 摘要:海森矩阵是研究深度学习中的损失景观和优化动态,以及设计泛化度量、二阶学习算法等时的一个重要关注量。先前的工作主要集中在经验结果上,或者在过于简化的设定下进行理论处理。在这项工作中,我们推导了具有任意宽度和深度的线性网络,以及具有任意样本数、特征数和标签数的数据集的海森矩阵的特征值。重要的是,对于使用均方误差损失的分类任务,我们发现解的尖锐度与样本中属于任何类别的最大比例直接相关。我们通过实验验证了我们的预测,并系统地分析了逐一去掉不切实际的假设以及引入非线性的影响。我们观察到,在大多数情况下,我们的预测相当稳健,这使得我们可以将结论扩展到更实际的学习设置中。 ## 提交历史 来自:Jasraj Singh [查看邮件 (https://arxiv.org/show-email/5d893aae/2607.13631)] **\[v1\]** Wed, 15 Jul 2026 09:25:49 UTC (919 KB)
相似文章
面向平坦极小值的闭式最速下降方向:降低神经网络损失Hessian特征谱的上界
推导了损失Hessian特征谱的Wolkowicz-Styan上界的闭式梯度,以引导神经网络训练朝向平坦极小值,并提出了Hessian谱范围(HSR)正则化。数值实验表明,HSR收窄了Hessian特征值范围,避免了尖锐极小值和鞍点,并实现了与Sharpness-Aware Minimization(SAM)相当的解。
通过神经网络中的近似对称性解释接近零的海森特征值
本文认为,神经网络中大量接近零的海森特征值来源于网络参数化中弱破缺的对称性。研究表明,高曲率方向与对称性子空间正交,而大量小特征值则位于该子空间内。
神经网络损失景观的谱渐近:曲率指数的精确分解
本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。
稳定边缘选择性塑造数据分布上的学习
MIT研究人员表明,神经网络训练中的稳定边缘(EoS)不仅仅是一个全局优化现象,而是选择性地在训练分布的子集上重新分配学习,放大某些数据组的进展同时抑制其他组。他们识别出控制这种分配的两个关键条件:梯度与Hessian矩阵最大特征向量的对齐,以及持续非消失的梯度幅度。
深度隐含偏差:从神经坍缩到Softmax编码
本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。