gradient-descent

标签

Cards List
#gradient-descent

REAL-Q:通过动态梯度下降实现端到端大语言模型量化

arXiv cs.LG · 6天前 缓存

本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。

0 人收藏 0 人点赞
#gradient-descent

所择之路:优化器在稳定性边缘的角色

arXiv cs.LG · 2026-08-20 缓存

本文重新审视了深度学习优化中的稳定性边缘现象,提出了一种基于方向海森矩阵和梯度对齐分数的新表述,以实现更准确的预测和诊断工具。

0 人收藏 0 人点赞
#gradient-descent

梯度下降神经网络训练的通用性

Hacker News Top · 2026-08-20 缓存

论文探讨了是否任何神经网络都可以被重新设计以通过梯度下降有效训练,并证明了一个通用性结果:对于任何网络,都存在一个扩展,可以通过梯度下降重现给定的权重和输出。

0 人收藏 0 人点赞
#gradient-descent

基于广义Lipschitz光滑性的神经网络梯度下降收敛保证

arXiv cs.LG · 2026-08-13 缓存

本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。

0 人收藏 0 人点赞
#gradient-descent

结合梯度下降的自适应混合粒子群优化

arXiv cs.AI · 2026-08-13 缓存

本文提出自适应混合粒子群优化(AHPSO),利用群体多样性的sigmoid函数在搜索过程中自动调节梯度影响。结果表明,在特定问题类别上,它优于标准粒子群优化,并能与CMA-ES相媲美,但优势并非普遍适用。

0 人收藏 0 人点赞
#gradient-descent

Decoupled Descent:通过AMP Onsager修正强制实现精确的训练-测试误差追踪 [R]

Reddit r/MachineLearning · 2026-08-11

一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。

0 人收藏 0 人点赞
#gradient-descent

Hidden Gauge Controls Feature Specialization in ReLU Networks

arXiv cs.LG · 2026-08-10 缓存

A theoretical study shows that in overparameterized ReLU networks, a positive-homogeneous scaling gauge hidden in the initial parameters can deterministically control which duplicate neuron learns a teacher feature, affecting specialization time and pruning trajectories.

0 人收藏 0 人点赞
#gradient-descent

梯度下降早期动力学中逻辑回归的非渐近隐式偏差

arXiv cs.LG · 2026-08-06 缓存

这篇理论论文研究了梯度下降下逻辑回归的非渐近隐式偏差,证明了参数向量能在与对齐误差相关的双指数次迭代内快速弱对齐最大间隔方向。

0 人收藏 0 人点赞
#gradient-descent

损失函数看不到基,但 Adam 能看到

Hugging Face Daily Papers · 2026-08-05 缓存

本文研究了在因子化模型中,为什么 Adam 不表现出梯度下降所具有的隐式低秩偏差,并表明逐坐标预处理打破了相关对称性,而共享标量方法(如 Muon 和 Shampoo)则保持了这种对称性。

0 人收藏 0 人点赞
#gradient-descent

正则感知的随机MGDA及自适应避冲突更新方向控制

arXiv cs.LG · 2026-07-20 缓存

本文提出了一种正则感知的随机多梯度下降方法(MoRe),该方法在冲突避免更新与标量化更新之间自适应切换。在非凸场景下,该方法将收敛率从 O~T^{-1/4} 提升至 O~T^{-1/2},同时保持每轮迭代的冲突避免特性。

0 人收藏 0 人点赞
#gradient-descent

在弯曲权重空间中学习:用于改进优化的指数-线性权重重参数化

arXiv cs.LG · 2026-07-14 缓存

介绍了SymExpLin (SEL),一种结合对称指数路径和线性路径的权重重参数化方法,用于改进神经网络的优化,在Transformer上将训练步数减少最多1.49倍。

0 人收藏 0 人点赞
#gradient-descent

理解非凸优化中的无调度方法:速率保证与逃离鞍点

arXiv cs.LG · 2026-07-13 缓存

本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。

0 人收藏 0 人点赞
#gradient-descent

@TensorTonic: 7个机器学习工程师每天使用但几乎没人真正推导的数学概念:1. 为什么梯度下降沿着……移动

X AI KOLs Timeline · 2026-07-11 缓存

这条推文列出了机器学习工程师每天使用的7个基础数学概念,并简要强调了这些概念背后的推导过程,例如为什么梯度下降沿着最陡方向移动,以及为什么softmax加交叉熵会产生一个干净的梯度。

0 人收藏 0 人点赞
#gradient-descent

深度标量线性网络中最优学习率缩放依赖于数据

arXiv cs.LG · 2026-07-10 缓存

本文证明,深度标量线性网络中的最优学习率缩放本质上依赖于数据,这与先前数据无关的缩放规则相矛盾。它表明,在依赖数据的缩放下,收敛变得与深度无关,包括在无限深度下。

0 人收藏 0 人点赞
#gradient-descent

面向MIONet的混合最小二乘/梯度下降方法

arXiv cs.LG · 2026-07-09 缓存

提出了一种用于MIONet的混合最小二乘/梯度下降方法,通过利用交替最小二乘法优化多个分支网络的最后一层参数,并借助Kronecker和Khatri-Rao乘积,从而加速训练。

0 人收藏 0 人点赞
#gradient-descent

@0x0SojalSec:想要在AI/ML领域真正脱颖而出,不仅仅是使用工具,而是理解并改进它们?理解为什么梯度下降…

X AI KOLs Timeline · 2026-06-30 缓存

一条推文,推广了一份精心整理的数学与深度学习资源合集,旨在帮助理解像Claude这样的模型背后的基础,包括线性代数、实分析、优化和表示论。

0 人收藏 0 人点赞
#gradient-descent

反思优化

Hacker News Top · 2026-06-26 缓存

一篇博客文章,讨论针对受约束的分类概率分布的优化技术,使用softmax重参数化和log barrier方法,应用于蛋白质结合剂设计。

0 人收藏 0 人点赞
#gradient-descent

我为不同的优化器制作了一个梯度下降可视化。[P]

Reddit r/ArtificialInteligence · 2026-06-17

一个项目,可视化了不同优化算法的梯度下降,有助于理解机器学习中优化器的工作原理。

0 人收藏 0 人点赞
#gradient-descent

FastMix:通过梯度下降的快速数据混合优化

arXiv cs.LG · 2026-06-16 缓存

FastMix 是一个新颖的框架,通过使用单个代理模型和双层优化自动发现训练大型模型的数据混合方式,实现了最先进的性能,并大幅提升效率。

0 人收藏 0 人点赞
#gradient-descent

关于固定点参数下GD和SGD的一致稳定性与泛化误差

arXiv cs.LG · 2026-06-08 缓存

本文分析了离散参数空间中采用确定性或随机舍入的梯度下降(GD)和随机梯度下降(SGD)的泛化误差、一致稳定性和一致参数稳定性,表明舍入会降低GD的泛化性能,并为随机舍入引入了维度相关的误差。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈