标签
本文推导了任意宽度和深度的线性神经网络的Hessian矩阵的特征值,表明在分类任务中使用MSE损失时,尖锐度与最大类别比例相关,并通过实验验证了预测结果。
本文认为,神经网络中大量接近零的海森特征值来源于网络参数化中弱破缺的对称性。研究表明,高曲率方向与对称性子空间正交,而大量小特征值则位于该子空间内。
本文诊断了基于梯度反演的Gray-Scott反应扩散系统的损失景观,表明直接反向传播由于平坦平台和陡峭悬崖而失败,而PINN组件(如残差损失)则平滑了景观。这些发现为PINN类方法提供了设计启示。
MIT研究人员表明,神经网络训练中的稳定边缘(EoS)不仅仅是一个全局优化现象,而是选择性地在训练分布的子集上重新分配学习,放大某些数据组的进展同时抑制其他组。他们识别出控制这种分配的两个关键条件:梯度与Hessian矩阵最大特征向量的对齐,以及持续非消失的梯度幅度。
本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。
本文识别了科学机器学习模型中一致的三模态结构,表明优化效果是模态特定的,并可能挑战传统的损失景观解释。它提出了一个模态感知的诊断框架,并在PINN、神经算子以及神经ODE上得到验证。