机制驱动的LLM训练不稳定性预判监测器
摘要
提出了一种基于机制驱动的监测器,用于预判检测LLM训练不稳定性,通过从低精度闪光注意力(flash attention)和MoE路由器中提取内部信号,使得能在损失发散前数千步进行检测。
arXiv:2606.28116v1 公告类型:新
摘要:前沿大语言模型训练需要庞大的加速器集群和较长的实际运行时间,这使得稳定性失败发生时代价高昂。当数值或超参数故障已经破坏训练动态后,训练可能持续数千步,而损失和梯度范数看起来仍然正常。我们通过从每个关键模块的功能角色以及预期故障产生可测量信号的最早计算点出发,构建内部监测器,研究基于机制的训练不稳定性检测方法。对于低精度闪光注意力(flash attention),我们监控QK双线性分解的谱熵,其一阶项在损失完全崩溃前变得异常。对于MoE路由器,我们从其在专家选择中的角色推导出指标。我们在低精度注意力、大学习率和组合故障上的故障注入实验表明,这些信号为不同的故障提供了独特的特征,能在损失发散前数千步触发检测。
查看缓存全文
缓存时间: 2026/06/29 05:25
# 基于机制的监控器:用于抢先检测大语言模型训练的不稳定性
来源:https://arxiv.org/html/2606.28116
Ruixuan Huang¹, Yipei Wang², Wenyi Fang², Hantao Huang³, Yifan Huang³, Ansheng You³, Zhenxing Zhang³, Shuai Wang¹, Fan Wu², Yang Zheng²
¹HKUST ²华为 ³独立研究者
###### 摘要
前沿大语言模型的训练消耗大量的加速器集群和较长的时钟时间,这使得稳定性故障一旦发生便代价高昂。当数值或超参数故障已经破坏了训练动态后,训练可能还会持续数千步,而损失和梯度范数仍然看似正常。我们研究基于机制的训练不稳定性检测方法,从每个关键模块的功能角色以及最早期可能出现可测量故障特征的计算位置出发,推导内部监控器。对于低精度闪存注意力,我们监控QK双线性分解的谱熵,其第一项在损失完全崩溃之前变得异常。对于MoE路由器,我们从其在专家选择中的作用推导出指示器。我们在低精度注意力、大学习率和组合故障上的故障注入实验表明,这些信号为不同的故障提供了独特的特征,在损失发散前的数千步即可触发。
## 1 引言
前沿大语言模型(LLM)的训练通常占用数千个加速器,持续数周至数月(Chowdhery et al., 2022 (https://arxiv.org/html/2606.28116#bib.bib19); Smith et al., 2022 (https://arxiv.org/html/2606.28116#bib.bib20))。参数数量现已达到数千亿至超过一万亿(Yang et al., 2025 (https://arxiv.org/html/2606.28116#bib.bib23); Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17); DeepSeek-AI, 2026 (https://arxiv.org/html/2606.28116#bib.bib26));预训练语料库跨越数十万亿个token(GLM-4.5 Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib24); Meituan LongCat Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib41); Qwen Team, 2026 (https://arxiv.org/html/2606.28116#bib.bib25))。DeepSeek-V3给出了明确的成本核算,其中14.8T的预训练token需要2.788M H800 GPU小时,报告的直接租赁成本为5.576M美元,不包括先前的研究和消融实验(DeepSeek-AI, 2024 (https://arxiv.org/html/2606.28116#bib.bib21))。在这种规模下,训练稳定性已成为训练系统的一个工程问题。GLM-130B描述了意想不到的100B规模训练挑战,特别是损失尖峰和发散(Zeng et al., 2023 (https://arxiv.org/html/2606.28116#bib.bib27));DeepSeek-V3强调了FP8混合精度训练,并明确报告没有不可恢复的损失尖峰或回滚(DeepSeek-AI, 2024 (https://arxiv.org/html/2606.28116#bib.bib21));Kimi K2引入了带QK裁剪的MuonClip来解决训练不稳定问题,并报告了15.5T token的预训练实现零损失尖峰(Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17))。
训练不稳定的风险通常来自两个来源。第一个是数值精度误差。例如,Flash Attention(FA)在单独的前向传递中表现出明显大于基线注意力的BF16数值偏差(Golden et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib16)),并且低精度FA可能通过有偏的舍入误差破坏权重更新,逐渐使训练动态偏离轨道(Qiu and Yao, 2026 (https://arxiv.org/html/2606.28116#bib.bib1))。第二个是超参数交互,例如全局批量大小(GBS)、学习率调度和MoE辅助损失之间的耦合。然而,在全局症状出现之前,训练运行可能已经进入了其权重或优化器的不稳定状态,而训练会在症状显现之前悄悄地持续数千步。详尽的消融只会增加这些沉没成本。因此,一个有用的监控器应该在损失发散之前识别出哪个子系统已经被破坏。
当前的训练稳定性监控主要依赖于全局训练曲线和症状级指标。损失、梯度范数和权重范数是最滞后的指标。一旦出现损失尖峰或发散,故障可能已经写入权重或优化器状态。注意力熵、最大注意力logits和谱指标进一步刻画了注意力侧的不稳定性症状(Zhai et al., 2023 (https://arxiv.org/html/2606.28116#bib.bib14); Takase et al., 2025 (https://arxiv.org/html/2606.28116#bib.bib15); Golden et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib16); Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17))。边缘稳定性分析解释了高级损失动态,但并未识别出哪个模块首先失败(Cohen et al., 2021 (https://arxiv.org/html/2606.28116#bib.bib32))。最大logits信号在生产FA中难以暴露,因为它们需要内核修改和重新计算(Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17))。Hessian或曲率诊断可以提供更精细的几何信息,但作为前沿规模下常规的在线检查来说成本过高(Yao et al., 2020 (https://arxiv.org/html/2606.28116#bib.bib49); Kalra et al., 2026 (https://arxiv.org/html/2606.28116#bib.bib50))。
![参照说明(a)LM损失] ![参照说明(b)|W_{QKV}|_F] ![参照说明(c)梯度范数] ![参照说明(d)ΔW_{QKV}谱]
图1:训练运行前25,000步的监控信号。(a)–(c)是标准的症状级指标:LM损失、QKV权重范数和梯度范数。(d)显示了本文使用的一个内部更新监控器。在(b)和(d)中,实线是逐层平均值,阴影带跨越所有层的第10至第90百分位数。
我们的核心思想是基于机制的监控。对于每个关键模块,我们问:这个模块应该计算什么?故障首先会在哪里留下可归因的痕迹?我们将这一原则应用于两个模块。对于低精度FA,我们监控权重更新,低精度反向误差首先在其中进入模型状态(第3节 (https://arxiv.org/html/2606.28116#S3))。我们分解QK算子的两快照增量,并监控ΔW的谱熵。图1 (https://arxiv.org/html/2606.28116#S1.F1) 展示了低精度FA训练下的一个例子,其中ΔW谱的崩溃比损失、梯度范数和权重范数早数千步。对于MoE路由器,预期的计算是判别性和非崩溃的专家选择(第4节 (https://arxiv.org/html/2606.28116#S4))。因此,我们监控路由器权重相似性和居中条件数作为权重指标,表征有效专家选择轴是否变得冗余。对于行为,我们监控每个token的路由熵。它读取完整的softmax分布,因此可以在下游离散量(如top-k计数、容量溢出或负载平衡统计)变化之前捕获路由行为的崩溃。我们进一步分析了学习率和GBS如何通过稳定胜者强化相互作用。较大的学习率放大了一致性边际增长,而较小的批量大小增加了边际噪声;两者都可以降低路由器熵并加速专家使用崩溃。我们的故障监控实验展示了这两类监控器的不同作用,组合故障继承了两种特征而不会混淆其归因。
## 2 相关工作
#### 训练稳定性监控器。
现有工作提出了用于检测或缓解训练不稳定性的监控器。在注意力方面,为ViT-22B引入的最大logits裁剪(Dehghani et al., 2023 (https://arxiv.org/html/2606.28116#bib.bib12)),并通过小规模Transformer代理进行研究(Wortsman et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib13)),能直接捕获softmax爆炸。Kimi K2添加了QK裁剪和逐头MuonClip(Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17))。其他方法针对注意力熵崩溃,通过σReparam(Zhai et al., 2023 (https://arxiv.org/html/2606.28116#bib.bib14))、损失尖峰通过谱范数控制(Takase et al., 2025 (https://arxiv.org/html/2606.28116#bib.bib15)),或Flash Attention输出分布(Golden et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib16))。在MoE路由器方面,LongCat-Flash监控专家路由器权重的平均余弦相似度以及负载平衡目标与语言建模目标在平均专家概率上的梯度范数比(Meituan LongCat Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib41))。
#### 注意力电路分析。
注意力QK电路主要被作为静态对象分析。Bao等人(2024 (https://arxiv.org/html/2606.28116#bib.bib3))通过Wq⊤Wk的特征谱方差刻画注意力局部化,Pan等人(2024 (https://arxiv.org/html/2606.28116#bib.bib4))研究了视觉Transformer中QK核的奇异向量对应关系。研究表明注意力图和QK核可能表现出强烈的低秩结构。Bhojanapalli等人(2020 (https://arxiv.org/html/2606.28116#bib.bib5))研究了在小的dk下WqWk⊤的秩亏瓶颈,而Dong等人(2021 (https://arxiv.org/html/2606.28116#bib.bib11))证明了纯自注意力随深度增加存在双重指数秩坍塌。最近的工作还表明权重更新包含信息丰富的低秩结构。LoRA(Hu et al., 2022 (https://arxiv.org/html/2606.28116#bib.bib28))、GaLore(Zhao et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib29))和Muon优化器家族(Liu et al., 2025 (https://arxiv.org/html/2606.28116#bib.bib30))利用更新中的低秩或谱结构进行参数高效适应或优化,Yunis等人(2024 (https://arxiv.org/html/2606.28116#bib.bib31))调查了权重的谱演化作为观察训练动态的窗口。从机制上讲,Qiu和Yao(2026 (https://arxiv.org/html/2606.28116#bib.bib1))将低精度FA失败识别为有偏舍入积累成类似的低秩更新方向。这些工作激发了使用ΔW本身作为分析对象。
## 3 注意力更新监控
Flash Attention(Golden et al., 2024 (https://arxiv.org/html/2606.28116#bib.bib16))将softmax缩放的QK⊤计算融合在片上存储器中,并且不会实例化完整的N×N logits矩阵。这带来了巨大的内存和吞吐量增益,现代LLM训练和推理现在依赖它作为流行的注意力实现。然而,FA被报道为训练不稳定的一个来源,其反向传递中的低精度算术可能将持久有偏的误差沉积到权重更新中(Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17); Qiu and Yao, 2026 (https://arxiv.org/html/2606.28116#bib.bib1))。此外,融合实现阻止了规模上最自然的症状级监控器,即跟踪最大注意力logits(max-logits)以捕获softmax爆炸(Kimi Team, 2025 (https://arxiv.org/html/2606.28116#bib.bib17))。从生产FA内核中读取max-logits需要侵入性的内核修改或重新计算传递,这两者在大型训练运行中都是不可接受的。运行时的训练监控器只适用于不需要内核修改或激活重新计算的量。例如,直接使用梯度或权重W(Fang et al., 2023 (https://arxiv.org/html/2606.28116#bib.bib51))。然而,在实践中,基于梯度的指标被连续步之间的小批量噪声主导,而基于W的指标被初始化能量稀释。自然剩下的目标是参数更新ΔW本身,这正是低精度FA故障已被证明会沉积其持久损伤的级别(Qiu and Yao, 2026 (https://arxiv.org/html/2606.28116#bib.bib1))。事实上,现代LLM严重过参数化,其内在维度远低于参数数量(Jacot et al., 2018 (https://arxiv.org/html/2606.28116#bib.bib34); Chizat et al., 2019 (https://arxiv.org/html/2606.28116#bib.bib35); Lee et al., 2019 (https://arxiv.org/html/2606.28116#bib.bib36)),因此沿着当前低影响方向扰动的故障会被静默吸收——损失滞后不是因为损坏发生需要多长时间,而是因为损坏的方向需要多长时间才能变得任务负载。在参数侧的量中,更新ΔW比原始权重W在信噪比方面更优:Wt的奇异值统计被初始化能量稀释(附录A (https://arxiv.org/html/2606.28116#A1)),而增量ΔW_{t,δ} = W_t - W_{t-δ}移除了这一背景,并直接暴露了更新几何。
### 3.1 Flash Attention的内在低精度问题
随着低精度算术在LLM训练中成为标准,Qiu和Yao(Qiu and Yao, 2026 (https://arxiv.org/html/2606.28116#bib.bib1))表明低精度FA在δ = rowsum(dO ⊙ O)中引入了有偏标量误差,并且这些有偏标量乘以结构一致的秩一更新原子。我们采用他们的逐步源模型作为更新侧监控的基础。按照并简化他们的记号,令X ∈ R^{N×d}为进入查询投影的隐藏状态矩阵,K = XW_k,P = softmax(QK^⊤ / √(d_k))为注意力概率矩阵。对于一个token步样本j,令X_j和(PK)_j表示相应的行。按照他们的机制,用j索引token步样本,并将更新侧源写为e_j R_j,其中e_j是通过δ引入的有偏标量误差,R_j = X_j^⊤ (PK)_j是相关的秩一更新原子,忽略注意力尺度和符号。这里e_j对应于Qiu和Yao的有偏系数(δ_lp - δ_hp)[T],R_j对应于他们的公共低秩误差方向R ≈ (PK)[T]^⊤ X[T](他们的主张2,公式3)。监控的前提是有偏标量系数和一致的原子在累积的更新窗口中产生低秩均值分量:
> 观察1(Qiu–Yao的累积结果)。用j索引token步样本,并写R_j = X_j^⊤ (PK)_j ∈ R^{d×d_k}。如果M = E[e_j R_j]具有有效秩r ≪ d_k(这是实质前提;由于M = E[e_j R_j] ∈ R^{d×d_k},自动有rank(M) ≤ d_k,这在Qiu and Yao (2026) (https://arxiv.org/html/2606.28116#bib.bib1)的实证发现中得到支持,即原子R_j跨token和训练步共享公共列结构;见他们的图4),且中心化波动e_j R_j - M是独立的(或鞅差)且有界二阶矩,那么在n个样本上,
> ∑_{j=1}^n e_j R_j = nM + O_p(√n)。
> (1)
> 一致的低秩分量随n线性增长,而零均值残差亚线性增长。一旦n||M||_2 n\...相似文章
构建独立LLM漂移检测 - 分享方法论,寻求对方法的反馈
作者分享了一种构建外部LLM漂移检测系统的方法论,该系统持续探测模型行为(模式遵循、指令遵循、拒绝率等),以捕捉API性能的静默退化,并邀请对方法、定价和用例的反馈。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。
少量神经元揭示LLM何时误用工具:面向可靠工具使用的稀疏检测与选择性引导
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
TRACER:基于追踪的自适应成本高效路由用于LLM分类
TRACER是一个开源系统,它在LLM分类端点的生产追踪数据上训练轻量级机器学习代理,并通过一个一致性门控路由请求,仅当代理与原始模型的一致性超过指定阈值时才激活代理。该方法在意图分类基准上实现了83-100%的代理覆盖率,同时保持了对处理边界和故障模式的可解释性。
从检测到拒绝:通过电路引导权重缩放实现更安全的LLMs
本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。