矩估计的信任域框架
摘要
本文介绍了一个用于理解自适应矩估计方法(如 Adam)的信任域框架,推导出一族基于 p 阶矩约束(2≤p≤4)的学习率机制,包括基于峰度的变体(Gmake)。在 GPT2-124M 上的实验表明,当信任域控制更强时,二阶矩版本变得更具竞争力。
查看缓存全文
缓存时间: 2026/08/06 07:44
# 矩估计的信任域框架
Source: https://arxiv.org/html/2608.04026
###### 摘要
在本文中,我们开发了一个信任域框架,用于理解随机梯度优化中自适应矩估计机制(如Adam)的行为。具体而言,在该框架中,每个单独权重的更新步幅度被限制在一个由\(p \in [2,4]\)阶矩约束所控制的信任域内。由此推导得到一系列基于二阶矩估计和归一化\(p\)阶矩估计的学习率机制。当\(p=4\)时,这涉及类似峰度的估计。该通用机制称为Gmake,它在统一的信任域框架内为矩估计归一化、学习率调度、作为动量的谱低通滤波以及算子级谱归一化提供了一种统一解释。在FineWeb-Edu和TinyStories上训练的GPT2-124M实验表明,当信任域约束较弱时,四阶矩实现能带来最大收益。随着逐步引入更强的信任域控制,二阶矩实现变得越来越有竞争力,其验证损失通常略低于相应的四阶矩实现。
## 1 引言
从随机梯度优化中流行的自适应矩估计(Adam,Kingma和Ba,2015 (https://arxiv.org/html/2608.04026#bib.bib324))机制中自然产生的一个问题是:其矩归一化更新分量能否从严格的信任域原理来理解。在本文中,我们通过为随机梯度优化开发一个矩约束的信任域控制框架来回答这个问题。由此推导得到一系列学习率机制,这些机制由更新步上的\(p\)阶矩信任域约束控制,其中\(2 \leq p \leq 4\)。在特殊情况\(p=4\)下,该机制同时涉及矩估计和梯度过程的归一化峰度估计。因此,我们粗略地将该信任域框架的实现称为Gmake。除了推导出一系列学习率机制外,该框架还揭示了传统上被分开研究的若干机制可以在关于更新步的统一信任域视角下理解。特别是,常见的学习率调度自然地作为信任域变分问题的解出现,而动量和谱归一化则作为逐步加强底层信任域约束执行的互补机制出现。从这个角度看,这些机制可以被理解为更新过程中互补形式的信任域控制。
### 1.1 信任域问题
设随机梯度算法在迭代\(t\)时应用于单个权重\(w(t)\in\mathbb{R}\)的更新步为:
\[
\Delta(t+1) = w(t+1) - w(t),
\tag{1}
\]
并令\(g(t)\in\mathbb{R}\)表示通过在一段迭代窗口\(t\in\{0,1,\ldots,\tau\}\)(其中\(\tau \gg 0\))内关于\(w(t)\)最小化标量损失函数\(f(t)\)而得到的关联梯度分量。在整个过程中,我们用\(\mathbb{E}\{\cdot\}\)表示关于生成梯度的底层随机过程的期望。我们不假设任何特定的目标函数、概率结构或梯度分布。我们仅对所有\(t\in\{0,1,\ldots,\tau\}\)作如下假设:
**假设1(Lipschitz正则性)**:函数\(f(t)\)至少二次连续可微,且\(f(t)\)和\(g(t)\)关于\(w(t)\)都是Lipschitz连续的(Bottou等,2018 (https://arxiv.org/html/2608.04026#bib.bib75))。
**假设2(有界\(p\)阶矩)**:随机信号\(g(t)\)满足\(\|g(t)\|_\infty < \infty\)。因此,对每个\(p \in [2,4]\),有\(\mathbb{E}\{|g(t)|^p\} \leq \|g(t)\|_\infty^p < \infty\)。学习算法(1)的每次迭代至少构造为确保\(\mathbb{E}\{|\Delta(t+1)|\} \leq \mu\)。换句话说,更新步的期望幅度被限制在最大信任域半径\(\mu \in (0,1)\)内。更新步的信任域半径在每次迭代中由其\(p\)阶矩刻画:
\[
\delta_p^p(t) \equiv \mathbb{E}\{|\Delta(t+1)|^p\} \leq \mu^p,
\tag{2}
\]
其中\(\mu\)(最大允许更新步长)为实常数,而\(\delta_p(t) \leq \mu\),且当\(t \to \tau\)时\(\delta_p(t) \to 0\),是控制更新步变化的一个信任域半径整形函数。
### 1.2 算法概览
学习算法的基本形式中,\(\varsigma(t相似文章
AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction
This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.
信任区域Q伴随匹配
信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。
TeamTR:多智能体LLM协调的信任域微调
本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。
面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断
本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。
用于学习测度值轨迹的主动时间点选择
本文提出了一种主动时间点选择框架,用于从稀疏快照推断概率路径。通过线性化最优传输将分布映射到切空间,以进行高斯过程建模,从而实现具有不确定性感知的采集策略。