标签
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。
本文重新审视了深度学习优化中的稳定性边缘现象,提出了一种基于方向海森矩阵和梯度对齐分数的新表述,以实现更准确的预测和诊断工具。
论文探讨了是否任何神经网络都可以被重新设计以通过梯度下降有效训练,并证明了一个通用性结果:对于任何网络,都存在一个扩展,可以通过梯度下降重现给定的权重和输出。
本文针对任意宽度或深度的通用前馈神经网络,建立了梯度下降的收敛保证。文中使用了一种新颖的广义Lipschitz光滑性条件,该条件适用于常见激活函数和均方误差,且不需要特殊的初始化或数据集要求。
本文提出自适应混合粒子群优化(AHPSO),利用群体多样性的sigmoid函数在搜索过程中自动调节梯度影响。结果表明,在特定问题类别上,它优于标准粒子群优化,并能与CMA-ES相媲美,但优势并非普遍适用。
一篇理论论文,介绍了Decoupled Descent (DD),一种训练方法,它利用近似消息传递(AMP)的Onsager修正来在梯度下降过程中强制训练误差与测试误差之间的渐近相等,从而可能实现更好的停止和超参数调整。
A theoretical study shows that in overparameterized ReLU networks, a positive-homogeneous scaling gauge hidden in the initial parameters can deterministically control which duplicate neuron learns a teacher feature, affecting specialization time and pruning trajectories.
这篇理论论文研究了梯度下降下逻辑回归的非渐近隐式偏差,证明了参数向量能在与对齐误差相关的双指数次迭代内快速弱对齐最大间隔方向。
本文研究了在因子化模型中,为什么 Adam 不表现出梯度下降所具有的隐式低秩偏差,并表明逐坐标预处理打破了相关对称性,而共享标量方法(如 Muon 和 Shampoo)则保持了这种对称性。
本文提出了一种正则感知的随机多梯度下降方法(MoRe),该方法在冲突避免更新与标量化更新之间自适应切换。在非凸场景下,该方法将收敛率从 O~T^{-1/4} 提升至 O~T^{-1/2},同时保持每轮迭代的冲突避免特性。
介绍了SymExpLin (SEL),一种结合对称指数路径和线性路径的权重重参数化方法,用于改进神经网络的优化,在Transformer上将训练步数减少最多1.49倍。
本文为无调度梯度下降和无调度随机梯度下降在非凸优化中提供了最坏情况收敛性分析,建立了最优速率和严格鞍点规避,从而从理论上证明了其实验成功。
这条推文列出了机器学习工程师每天使用的7个基础数学概念,并简要强调了这些概念背后的推导过程,例如为什么梯度下降沿着最陡方向移动,以及为什么softmax加交叉熵会产生一个干净的梯度。
本文证明,深度标量线性网络中的最优学习率缩放本质上依赖于数据,这与先前数据无关的缩放规则相矛盾。它表明,在依赖数据的缩放下,收敛变得与深度无关,包括在无限深度下。
提出了一种用于MIONet的混合最小二乘/梯度下降方法,通过利用交替最小二乘法优化多个分支网络的最后一层参数,并借助Kronecker和Khatri-Rao乘积,从而加速训练。
一条推文,推广了一份精心整理的数学与深度学习资源合集,旨在帮助理解像Claude这样的模型背后的基础,包括线性代数、实分析、优化和表示论。
一篇博客文章,讨论针对受约束的分类概率分布的优化技术,使用softmax重参数化和log barrier方法,应用于蛋白质结合剂设计。
FastMix 是一个新颖的框架,通过使用单个代理模型和双层优化自动发现训练大型模型的数据混合方式,实现了最先进的性能,并大幅提升效率。
本文分析了离散参数空间中采用确定性或随机舍入的梯度下降(GD)和随机梯度下降(SGD)的泛化误差、一致稳定性和一致参数稳定性,表明舍入会降低GD的泛化性能,并为随机舍入引入了维度相关的误差。