谱异常值揭示Transformer注意力中主导的学习结构

arXiv cs.LG 论文

摘要

本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。

arXiv:2608.07921v1 公告类型:新 摘要:我们应用Marchenko-Pastur(MP)随机矩阵理论于预训练注意力权重,以将每个投影矩阵分解为类随机体(bulk)和一组谱异常值。我们通过因果方式验证了这种分解:在Mistral-7B中将MP识别的异常值(信号)置零,会使HellaSwag、MMLU和PIQA的性能接近随机水平,而将数量匹配的体奇异值子集置零则会导致较小但不可忽略的退化。在11个预训练Transformer中,我们识别出五种反复出现的模式:谱异常值编码了学习结构的主要成分;Q投影携带的异常值最多;分组查询注意力下的V投影缺乏清晰的信号/噪声分离;条目级异常值在Q中形成结构化行带,在O中形成结构化列带;特定的残差流维度在K和O中跨层持续作为带状异常值存在。最后,我们概述了这些观察如何为参数高效微调和结构化剪枝提供参考。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# 谱异常揭示Transformer注意力中主导的学习结构
来源:https://arxiv.org/abs/2608.07921
查看 PDF (https://arxiv.org/pdf/2608.07921) HTML(实验性)(https://arxiv.org/html/2608.07921v1)

> 摘要:我们将Marchenko-Pastur(MP)随机矩阵理论应用于预训练的注意力权重,以将每个投影矩阵分离为类似随机的bulk和一组谱异常值。我们通过因果性实验验证了这一分解:在Mistral-7B中将MP识别的异常值(信号)置零,使HellaSwag、MMLU和PIQA的性能接近随机水平,而将数量匹配的bulk奇异值子集置零则导致较小但不可忽略的性能下降。在11个预训练的transformer中,我们识别出五种重复出现的模式:谱异常值编码了学习结构的主要组成部分;Q投影携带最多的异常值;分组查询注意力下的V投影缺乏清晰的信号/噪声分离;条目级异常值在Q中形成结构化的行带,在O中形成列带;特定的残差流维度在K和O的各层中持续以带状异常值存在。最后,我们概述了这些观察结果如何为参数高效微调和结构化剪枝提供参考。

## 提交历史

来自:Kasun Dewage Dewage [查看邮件 (https://arxiv.org/show-email/963cdfa0/2608.07921)] **[v1]** 2026年8月8日星期六 04:56:11 UTC(9,211 KB)

相似文章

相关与无关:Transformer注意力机制的重整化群分析

arXiv cs.LG

本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。

Transformer的熵界:为何静态秩失效而注意力原生秩恢复

arXiv cs.LG

本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。