混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台期

Hugging Face Daily Papers 论文

摘要

本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。

我们首次对层交错式HLA大语言模型中的大规模激活(MAs)进行了系统性研究,并发现了两种与架构对齐的形态:MAs总是在完全注意力层之前立即出现尖峰,形成注意力前尖峰(PAS),并且可以持续通过中间的线性注意力层,从而产生尖峰间平台期(ISP)。随着完全注意力变得更加密集,连续的PAS通过ISP逐渐连接起来,最终恢复完全注意力大语言模型的稳定MA形态。我们验证了这种组织在五种线性注意力架构、六种混合配置、五个数据域以及总参数从1.2B到397B的代表性开源混合模型中的重现性。基于GDN的混合模型在高达1.3B规模下的受控预训练表明,这两种形态都在早期出现,并且对输出门控表现出不对称响应:完全注意力输出门控会强烈衰减其绝对幅度,但不会消除其逐层组织,而移除GDN门控则产生相对适度的放大。在机制上,我们的系统性离群值分析支持一个由MA抵消时机控制的共享生命周期解释。PAS遵循局部化的写入-汇聚-抵消过程,而ISP的持续存在与其延迟取消一致。在完全注意力极限下,这一解释恢复了完全注意力大语言模型特有的稳定MA形态。我们的代码可在 https://github.com/StartluxLabs/Massive-Activations-HLA 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:26

论文页面 - 混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台

Source: https://huggingface.co/papers/2608.12149

摘要

混合线性注意力大语言模型中的大规模激活表现出由取消时序所控制的注意力前尖峰和尖峰间平台,其形态在全注意力极限下得以恢复。

我们首次系统研究了大规模激活 (https://huggingface.co/papers?q=Massive%20activations)(MAs)在层间交错 HLA 大语言模型 (https://huggingface.co/papers?q=layer-interleaved%20HLA%20LLMs) 中的表现,并发现了两种与架构对齐的形态:MAs 持续在全注意力层 (https://huggingface.co/papers?q=full%20attention) 之前立即尖峰,形成注意力前尖峰 (https://huggingface.co/papers?q=pre-attention%20spikes)(PAS),并可贯穿中间的线性注意力层 (https://huggingface.co/papers?q=linear%20attention) 持续存在,产生尖峰间平台 (https://huggingface.co/papers?q=inter-spike%20plateaus)(ISP)。随着全注意力 (https://huggingface.co/papers?q=full%20attention) 变得密集,连续的 PAS 通过 ISP 越来越相连,最终恢复全注意力 (https://huggingface.co/papers?q=full%20attention) 大语言模型的稳定 MA 形态。我们证实了这种组织在五种线性注意力 (https://huggingface.co/papers?q=linear%20attention) 架构、六种混合配置、五个数据域以及参数总量从 1.2B 到 397B 的代表性开源混合模型中的反复出现。基于 GDN (https://huggingface.co/papers?q=GDN) 的混合模型在最高 1.3B 规模的受控预训练表明,这两种形态都较早出现,并且对输出门控 (https://huggingface.co/papers?q=output%20gating) 的响应不对称:全注意力 (https://huggingface.co/papers?q=full%20attention) 输出门控 (https://huggingface.co/papers?q=output%20gating) 强烈衰减其绝对幅度,但不会消除其逐层组织,而移除 GDN (https://huggingface.co/papers?q=GDN) 门则会带来相对适度的放大。从机制上讲,我们的系统性离群值分析 (https://huggingface.co/papers?q=systematic-outlier%20analysis) 支持一个由 MA 取消时机控制的共享生命周期解释。PAS 遵循局部的写入-汇合-取消(write-sink-cancel)过程,而 ISP 的延长持续与延迟取消一致。在全注意力 (https://huggingface.co/papers?q=full%20attention) 极限下,这一解释恢复了全注意力 (https://huggingface.co/papers?q=full%20attention) 大语言模型所特有的稳定 MA 形态。我们的代码可在 https://github.com/StartluxLabs/Massive-Activations-HLA 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.12149)查看 PDF (https://arxiv.org/pdf/

相似文章

Retrofitting Linear Attention into Diffusion Language Models

arXiv cs.LG

This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.

测量开放大语言模型中的最大激活值

arXiv cs.CL

本文测量了来自8个开放LLM家族的27个检查点的最大激活幅度,发现不同家族、架构和训练阶段之间存在显著差异,这对低位量化和部署具有影响。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。