混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台期
摘要
本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。
查看缓存全文
缓存时间: 2026/08/14 03:26
论文页面 - 混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台
Source: https://huggingface.co/papers/2608.12149
摘要
混合线性注意力大语言模型中的大规模激活表现出由取消时序所控制的注意力前尖峰和尖峰间平台,其形态在全注意力极限下得以恢复。
我们首次系统研究了大规模激活 (https://huggingface.co/papers?q=Massive%20activations)(MAs)在层间交错 HLA 大语言模型 (https://huggingface.co/papers?q=layer-interleaved%20HLA%20LLMs) 中的表现,并发现了两种与架构对齐的形态:MAs 持续在全注意力层 (https://huggingface.co/papers?q=full%20attention) 之前立即尖峰,形成注意力前尖峰 (https://huggingface.co/papers?q=pre-attention%20spikes)(PAS),并可贯穿中间的线性注意力层 (https://huggingface.co/papers?q=linear%20attention) 持续存在,产生尖峰间平台 (https://huggingface.co/papers?q=inter-spike%20plateaus)(ISP)。随着全注意力 (https://huggingface.co/papers?q=full%20attention) 变得密集,连续的 PAS 通过 ISP 越来越相连,最终恢复全注意力 (https://huggingface.co/papers?q=full%20attention) 大语言模型的稳定 MA 形态。我们证实了这种组织在五种线性注意力 (https://huggingface.co/papers?q=linear%20attention) 架构、六种混合配置、五个数据域以及参数总量从 1.2B 到 397B 的代表性开源混合模型中的反复出现。基于 GDN (https://huggingface.co/papers?q=GDN) 的混合模型在最高 1.3B 规模的受控预训练表明,这两种形态都较早出现,并且对输出门控 (https://huggingface.co/papers?q=output%20gating) 的响应不对称:全注意力 (https://huggingface.co/papers?q=full%20attention) 输出门控 (https://huggingface.co/papers?q=output%20gating) 强烈衰减其绝对幅度,但不会消除其逐层组织,而移除 GDN (https://huggingface.co/papers?q=GDN) 门则会带来相对适度的放大。从机制上讲,我们的系统性离群值分析 (https://huggingface.co/papers?q=systematic-outlier%20analysis) 支持一个由 MA 取消时机控制的共享生命周期解释。PAS 遵循局部的写入-汇合-取消(write-sink-cancel)过程,而 ISP 的延长持续与延迟取消一致。在全注意力 (https://huggingface.co/papers?q=full%20attention) 极限下,这一解释恢复了全注意力 (https://huggingface.co/papers?q=full%20attention) 大语言模型所特有的稳定 MA 形态。我们的代码可在 https://github.com/StartluxLabs/Massive-Activations-HLA 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.12149)查看 PDF (https://arxiv.org/pdf/
相似文章
一层解释所有:理解大型语言模型中的大规模激活现象
本文识别出大型语言模型(LLM)中极端激活现象产生并传播的“大规模涌现层(Massive Emergence Layer)”,并提出一种缓解其僵化性、提升模型在数学推理和指令遵循等任务上性能的方法。
注意力衰减、功能标记锚定与大型语言模型中基于注意力的干预的局限性
本文研究了大型语言模型中的短期注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,并且功能标记锚定依赖于架构。因果测试表明,增加功能标记上的注意力权重并不会改善检索性能,这表明注意力衰减是描述性的而非规范性的。
Retrofitting Linear Attention into Diffusion Language Models
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
测量开放大语言模型中的最大激活值
本文测量了来自8个开放LLM家族的27个检查点的最大激活幅度,发现不同家族、架构和训练阶段之间存在显著差异,这对低位量化和部署具有影响。
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。