谱异常值揭示Transformer注意力中主导的学习结构
摘要
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。
查看缓存全文
缓存时间: 2026/08/11 08:08
# 谱异常揭示Transformer注意力中主导的学习结构 来源:https://arxiv.org/abs/2608.07921 查看 PDF (https://arxiv.org/pdf/2608.07921) HTML(实验性)(https://arxiv.org/html/2608.07921v1) > 摘要:我们将Marchenko-Pastur(MP)随机矩阵理论应用于预训练的注意力权重,以将每个投影矩阵分离为类似随机的bulk和一组谱异常值。我们通过因果性实验验证了这一分解:在Mistral-7B中将MP识别的异常值(信号)置零,使HellaSwag、MMLU和PIQA的性能接近随机水平,而将数量匹配的bulk奇异值子集置零则导致较小但不可忽略的性能下降。在11个预训练的transformer中,我们识别出五种重复出现的模式:谱异常值编码了学习结构的主要组成部分;Q投影携带最多的异常值;分组查询注意力下的V投影缺乏清晰的信号/噪声分离;条目级异常值在Q中形成结构化的行带,在O中形成列带;特定的残差流维度在K和O的各层中持续以带状异常值存在。最后,我们概述了这些观察结果如何为参数高效微调和结构化剪枝提供参考。 ## 提交历史 来自:Kasun Dewage Dewage [查看邮件 (https://arxiv.org/show-email/963cdfa0/2608.07921)] **[v1]** 2026年8月8日星期六 04:56:11 UTC(9,211 KB)
相似文章
我发现Transformer中一个预测几何稳定性的隐藏比率 [R]
本文通过Lyapunov谱分析发现,MLP和注意力谱范数之间的比率能够预测Transformer模型的几何稳定性,最优范围在0.5–2之间,可防止秩坍缩。
相关与无关:Transformer注意力机制的重整化群分析
本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。
光谱探针电路:识别预训练Transformer中注意力头电路的三步法
介绍了一种三步法,用于识别预训练Transformer中的注意力头电路,该方法使用频谱信号和任务模式筛选,无需标签,并在51M到1B参数模型及多种架构上验证。
@antoniolupetti: 《理解Transformer与注意力机制》是一篇非常有趣的论文,它从应用数学的角度介绍了Transformer架构…
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。
Transformer的熵界:为何静态秩失效而注意力原生秩恢复
本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。