标签
本文介绍了一个用于理解自适应矩估计方法(如 Adam)的信任域框架,推导出一族基于 p 阶矩约束(2≤p≤4)的学习率机制,包括基于峰度的变体(Gmake)。在 GPT2-124M 上的实验表明,当信任域控制更强时,二阶矩版本变得更具竞争力。