gradient-descent

标签

Cards List
#gradient-descent

正则感知的随机MGDA及自适应避冲突更新方向控制

arXiv cs.LG · 2天前 缓存

本文提出了一种正则感知的随机多梯度下降方法(MoRe),该方法在冲突避免更新与标量化更新之间自适应切换。在非凸场景下,该方法将收敛率从 O~T^{-1/4} 提升至 O~T^{-1/2},同时保持每轮迭代的冲突避免特性。

0 人收藏 0 人点赞
#gradient-descent

在弯曲权重空间中学习:用于改进优化的指数-线性权重重参数化

arXiv cs.LG · 2026-07-14 缓存

介绍了SymExpLin (SEL),一种结合对称指数路径和线性路径的权重重参数化方法,用于改进神经网络的优化,在Transformer上将训练步数减少最多1.49倍。

0 人收藏 0 人点赞
#gradient-descent

理解非凸优化中的无调度方法:速率保证与逃离鞍点

arXiv cs.LG · 2026-07-13 缓存

本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。

0 人收藏 0 人点赞
#gradient-descent

@TensorTonic: 7个机器学习工程师每天使用但几乎没人真正推导的数学概念:1. 为什么梯度下降沿着……移动

X AI KOLs Timeline · 2026-07-11 缓存

这条推文列出了机器学习工程师每天使用的7个基础数学概念,并简要强调了这些概念背后的推导过程,例如为什么梯度下降沿着最陡方向移动,以及为什么softmax加交叉熵会产生一个干净的梯度。

0 人收藏 0 人点赞
#gradient-descent

深度标量线性网络中最优学习率缩放依赖于数据

arXiv cs.LG · 2026-07-10 缓存

本文证明,深度标量线性网络中的最优学习率缩放本质上依赖于数据,这与先前数据无关的缩放规则相矛盾。它表明,在依赖数据的缩放下,收敛变得与深度无关,包括在无限深度下。

0 人收藏 0 人点赞
#gradient-descent

面向MIONet的混合最小二乘/梯度下降方法

arXiv cs.LG · 2026-07-09 缓存

提出了一种用于MIONet的混合最小二乘/梯度下降方法,通过利用交替最小二乘法优化多个分支网络的最后一层参数,并借助Kronecker和Khatri-Rao乘积,从而加速训练。

0 人收藏 0 人点赞
#gradient-descent

@0x0SojalSec:想要在AI/ML领域真正脱颖而出,不仅仅是使用工具,而是理解并改进它们?理解为什么梯度下降…

X AI KOLs Timeline · 2026-06-30 缓存

一条推文,推广了一份精心整理的数学与深度学习资源合集,旨在帮助理解像Claude这样的模型背后的基础,包括线性代数、实分析、优化和表示论。

0 人收藏 0 人点赞
#gradient-descent

反思优化

Hacker News Top · 2026-06-26 缓存

一篇博客文章,讨论针对受约束的分类概率分布的优化技术,使用softmax重参数化和log barrier方法,应用于蛋白质结合剂设计。

0 人收藏 0 人点赞
#gradient-descent

我为不同的优化器制作了一个梯度下降可视化。[P]

Reddit r/ArtificialInteligence · 2026-06-17

一个项目,可视化了不同优化算法的梯度下降,有助于理解机器学习中优化器的工作原理。

0 人收藏 0 人点赞
#gradient-descent

FastMix:通过梯度下降的快速数据混合优化

arXiv cs.LG · 2026-06-16 缓存

FastMix 是一个新颖的框架,通过使用单个代理模型和双层优化自动发现训练大型模型的数据混合方式,实现了最先进的性能,并大幅提升效率。

0 人收藏 0 人点赞
#gradient-descent

关于固定点参数下GD和SGD的一致稳定性与泛化误差

arXiv cs.LG · 2026-06-08 缓存

本文分析了离散参数空间中采用确定性或随机舍入的梯度下降(GD)和随机梯度下降(SGD)的泛化误差、一致稳定性和一致参数稳定性,表明舍入会降低GD的泛化性能,并为随机舍入引入了维度相关的误差。

0 人收藏 0 人点赞
#gradient-descent

Flatland:大步长梯度下降的冒险

arXiv cs.LG · 2026-06-08 缓存

本文探讨了在非L-光滑目标上梯度下降收敛的最大步长这一开放问题,引入了在稳定性边缘运行且能够全局最小化尖锐度的自适应方法。

0 人收藏 0 人点赞
#gradient-descent

大步长梯度下降恢复多路径深度线性网络中的对称性

arXiv cs.LG · 2026-06-05 缓存

本文证明,使用大步长的离散梯度下降能够恢复多路径深度线性网络中的对称性,这与梯度流所预测的对称性破缺相反,并导致跨路径的信号重新平衡。作者从理论上证明,平衡解比稀疏解更平坦(锐度更低),且大的学习率驱动网络朝着稳定、平衡的配置发展。

0 人收藏 0 人点赞
#gradient-descent

稳定边缘选择性塑造数据分布上的学习

arXiv cs.LG · 2026-06-04 缓存

MIT研究人员表明,神经网络训练中的稳定边缘(EoS)不仅仅是一个全局优化现象,而是选择性地在训练分布的子集上重新分配学习,放大某些数据组的进展同时抑制其他组。他们识别出控制这种分配的两个关键条件:梯度与Hessian矩阵最大特征向量的对齐,以及持续非消失的梯度幅度。

0 人收藏 0 人点赞
#gradient-descent

耦合梯度下降中瞬态放大的伪谱界

arXiv cs.LG · 2026-06-04 缓存

本文针对耦合梯度下降中的块三角Jacobian矩阵建立了精确的伪谱理论,证明了Kreiss常数界并给出了迭代复杂度结果。研究揭示了与双层优化、双时间尺度随机逼近以及GAN训练相关的非渐近、实例相关的瞬态放大现象。

0 人收藏 0 人点赞
#gradient-descent

跨层学习率平衡:线性神经网络中的精确两步动力学与最优缩放

arXiv cs.LG · 2026-06-02 缓存

本文推导了两层和三层线性神经网络在一步和两步梯度下降后梯度和测试损失的精确闭式表达式,刻画了最优学习率选择,并揭示了一个独特的早期训练阶段:在该阶段中,初始时不等层学习率是最优的。

0 人收藏 0 人点赞
#gradient-descent

通过监督投影流形学习的李群嵌入神经动力学规划

arXiv cs.LG · 2026-05-27 缓存

本文提出了一种李群嵌入动态神经网络(LieEDNN)及其基于梯度下降和光滑流形度量投影的学习算法,能够在SO(3)和SE(3)等李群上实现稳定动力学,用于机器人学和控制应用。

0 人收藏 0 人点赞
#gradient-descent

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL · 2026-05-27 缓存

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

0 人收藏 0 人点赞
#gradient-descent

@pallavishekhar_: 梯度下降背后的数学原理 在此阅读:https://outcomeschool.com/blog/math-behind-gradient-descent…

X AI KOLs Timeline · 2026-05-26 缓存

这篇博客文章通过逐步的数值示例和直观理解,解释了梯度下降(训练机器学习模型所使用的基本优化算法)背后的数学原理。

0 人收藏 0 人点赞
#gradient-descent

深度隐含偏差:从神经坍缩到Softmax编码

arXiv cs.LG · 2026-05-25 缓存

本文研究深度本身如何在没有正则化训练的情况下,在深度无约束特征模型中引致隐式低秩偏差,将最优解从神经坍缩转向Softmax编码,并首次给出了在交叉熵损失下梯度下降中这一偏差的渐近和动态表征。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈