gradient-descent

标签

Cards List
#gradient-descent

Flatland:大步长梯度下降的冒险

arXiv cs.LG · 2026-06-08 缓存

本文探讨了在非L-光滑目标上梯度下降收敛的最大步长这一开放问题,引入了在稳定性边缘运行且能够全局最小化尖锐度的自适应方法。

0 人收藏 0 人点赞
#gradient-descent

大步长梯度下降恢复多路径深度线性网络中的对称性

arXiv cs.LG · 2026-06-05 缓存

本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。

0 人收藏 0 人点赞
#gradient-descent

稳定边缘选择性塑造数据分布上的学习

arXiv cs.LG · 2026-06-04 缓存

MIT研究人员表明,神经网络训练中的稳定边缘(EoS)不仅仅是一个全局优化现象,而是选择性地在训练分布的子集上重新分配学习,放大某些数据组的进展同时抑制其他组。他们识别出控制这种分配的两个关键条件:梯度与Hessian矩阵最大特征向量的对齐,以及持续非消失的梯度幅度。

0 人收藏 0 人点赞
#gradient-descent

耦合梯度下降中瞬态放大的伪谱界

arXiv cs.LG · 2026-06-04 缓存

本文针对耦合梯度下降中的块三角Jacobian矩阵建立了精确的伪谱理论,证明了Kreiss常数界并给出了迭代复杂度结果。研究揭示了与双层优化、双时间尺度随机逼近以及GAN训练相关的非渐近、实例相关的瞬态放大现象。

0 人收藏 0 人点赞
#gradient-descent

跨层学习率平衡:线性神经网络中的精确两步动力学与最优缩放

arXiv cs.LG · 2026-06-02 缓存

本文推导了两层和三层线性神经网络在一步和两步梯度下降后梯度和测试损失的精确闭式表达式,刻画了最优学习率选择,并揭示了一个独特的早期训练阶段:在该阶段中,初始时不等层学习率是最优的。

0 人收藏 0 人点赞
#gradient-descent

通过监督投影流形学习的李群嵌入神经动力学规划

arXiv cs.LG · 2026-05-27 缓存

本文提出了一种李群嵌入动态神经网络(LieEDNN)及其基于梯度下降和光滑流形度量投影的学习算法,能够在SO(3)和SE(3)等李群上实现稳定动力学,用于机器人学和控制应用。

0 人收藏 0 人点赞
#gradient-descent

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL · 2026-05-27 缓存

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

0 人收藏 0 人点赞
#gradient-descent

@pallavishekhar_: 梯度下降背后的数学原理 在此阅读:https://outcomeschool.com/blog/math-behind-gradient-descent…

X AI KOLs Timeline · 2026-05-26 缓存

这篇博客文章通过逐步的数值示例和直观理解,解释了梯度下降(训练机器学习模型所使用的基本优化算法)背后的数学原理。

0 人收藏 0 人点赞
#gradient-descent

深度隐含偏差:从神经坍缩到Softmax编码

arXiv cs.LG · 2026-05-25 缓存

本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。

0 人收藏 0 人点赞
#gradient-descent

二次型三明治

Hacker News Top · 2026-05-20 缓存

一篇解释优化中强凸性和L-平滑性(即二次型三明治)概念及其在梯度下降性能中作用的文章。

0 人收藏 0 人点赞
#gradient-descent

Bug or Feature^2:权重漂移、激活稀疏性与尖峰

Hugging Face Daily Papers · 2026-05-17 缓存

本文正式证明了使用非对称激活函数(如ReLU、GELU或SiLU)训练神经网络会导致权重向负方向漂移,进而使激活稀疏性高达90%。同时,研究表明平方激活函数(如ReLU²)能提升性能,但会导致激活尖峰,这一问题可通过裁剪解决,其中GELU²达到了最低验证损失。

0 人收藏 0 人点赞
#gradient-descent

分叉附近的状态空间NTK坍缩

arXiv cs.LG · 2026-05-14 缓存

本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈