标签
本文介绍了一个用于理解自适应矩估计方法(如 Adam)的信任域框架,推导出一族基于 p 阶矩约束(2≤p≤4)的学习率机制,包括基于峰度的变体(Gmake)。在 GPT2-124M 上的实验表明,当信任域控制更强时,二阶矩版本变得更具竞争力。
本文提出了一种并行架构,将静态梯度方法组合起来以实现随机梯度下降的自适应性,在简化收敛性分析的同时保留参数自适应性。
本文强化了LoRA的收敛性分析,将确定性预言机复杂度从指数级提升至O(epsilon^{-4}),并提出了随机变体LoRA-NSGDM和LoRA-STORM,其预言机复杂度分别改进为O(epsilon^{-8})和O(epsilon^{-6})。
本文提出了针对带动量和不带动量的随机梯度Langevin动力学(SGLD)的新离散时间近似方法,能够准确预测平稳协方差、迭代平均协方差和积分自相关时间。该方法为大样本不确定性量化提供了改进的调参指导,尤其在模型错误指定情况下。
本文提出了 LMO-IGT,这是一类新的随机优化方法,它利用隐式梯度传输来加速收敛,同时保持每次迭代仅计算一次梯度的结构。文中引入了一个统一的理论框架,并展示了相较于 Muon 等现有基于 LMO 的优化器,该方法具有更优的性能。