Transformer的熵界:为何静态秩失效而注意力原生秩恢复
摘要
本文介绍了熵界(Entropic Bound),这是一种针对Transformer的任务内在容量的谱度量,证明了令牌混合算子的内在秩为所需模型容量提供了一个紧的下界。本文表明,虽然从线性注意力到真实注意力的简单迁移会失败,但注意力原生的内在秩能恢复完整的理论结构。
arXiv:2607.23050v1 公告类型:新
摘要:神经规模定律描述了随着模型、数据和计算量的增长,损失如何下降,但它们并未回答一个前置问题:对于固定任务,解决该任务所需的最小模型容量是多少?我们通过熵界来研究这一问题,熵界是一种针对Transformer的任务内在容量的谱概念。我们首先证明,在线性注意力替代中,令牌混合算子的内在秩 $r^*$ 是一个紧下界:任何秩不足的模型都会产生不可避免的额外风险,并且该下界在 $r^*$ 处可以达到。我们进一步证明,在标准的低秩隐式偏差假设下,梯度下降能够恢复该秩,通过实验验证了所有三个性质,并表明 $r^*$ 可以在训练前从数据中恢复。然后我们追问这一结论是否能迁移到真实注意力上。简单的迁移失败了,而一个受控的插值阶梯精确地定位了原因:不是softmax,也不是秩约束,而是注意力混合算子的输入条件性本质,这是静态权重核无法概括的。受此启发,我们引入了注意力原生的内在秩——在注意力类别内实现任务所需的最小查询-键核秩——并表明在该定义下,对于线性和softmax注意力,完整的熵界结构(不足性、可实现性、可恢复性)得以恢复,其中能量有效秩作为对softmax失真鲁棒的估计器。最后,我们描绘了纯数据可预测性的边界:$r^*$ 对于线性QK注意力是精确可恢复的,即使在大规模下没有值映射,而softmax注意力由于非线性反演和核-值可识别性效应,仅允许部分预训练恢复。我们的结果将熵界从一种事后描述符重新构建为一种注意力原生的容量度量,并精确刻画了其可预测性边界。
查看缓存全文
缓存时间: 2026/07/28 06:24
# 变换器的熵界:为何静态秩失效而注意力原生秩恢复
来源:https://arxiv.org/html/2607.23050
###### 摘要
神经缩放定律描述了损失随模型、数据和计算量增长而下降的规律,但它们并未回答一个更根本的问题:对于固定任务,解决该任务所需的*最小*模型容量是多少?我们通过熵界——一种针对变换器任务固有容量的谱概念——来研究这一问题。首先我们证明,在线性注意力代理中,令牌混合算子的固有秩 \(r^*\) 是一个*tight*(紧致)下界:任何秩不足的模型都会产生不可避免的过剩风险,并且该界可在 \(r^*\) 处达到。我们进一步分析了在标准低秩隐式偏差假设下梯度下降恢复过程,表明学习到的有效秩集中于 \(r^*\)。我们通过实验验证了所有三个性质,并展示了 \(r^*\) 可以在*训练之前*从数据中恢复。
然后我们问:这一结论能否转移到真实的注意力机制中?直接的转移*失败*了,通过一个受控的插值阶梯,我们精确定位了原因:既不是 softmax,也不是秩约束,而是注意力混合算子的*输入条件性*性质——这是静态权重核无法概括的。受此启发,我们引入一种*注意力原生的固有秩*——即在注意力类内实现该任务所需的最小查询-键核秩——并证明在这一新定义下,完整的熵界结构(不足性、可达性、恢复性)对于线性和 softmax 注意力都能恢复,同时采用*能量*有效秩作为对 softmax 扭曲鲁棒的估计器。最后,我们描绘了仅从数据可预测性的边界:对于线性 QK 注意力,\(r^*\) 可精确恢复,即使在大规模设置下不含值映射也成立;而 softmax 注意力由于非线性反演和核-值可识别性效应,仅允许部分训练前恢复。我们的结果将熵界从一种事后描述重新定义为一种注意力原生容量度量,并给出了精确刻画的可预测性前沿。
## 1 引言
大模型训练的经验规律已被充分记录:损失随参数、数据和计算量呈幂律下降。然而缩放定律描述的是*轨迹*,而非*下限*。它告诉我们性能如何随容量增加而提升,却没有告诉我们给定任务根本需要多小的容量。这个量——任务达到目标误差时可解的最小模型规模——在概念上先于缩放,也是我们研究的目标。
一个有用的类比来自编码理论。一旦字母表和允许的码长固定,只有有限数量的消息可被表示。同样,一旦模型族固定,有限参数向量只能实现有限的输入-输出映射集合。如果一个任务要求许多可区分的预测模式,任何解决该任务的模型必须携带足够的*有效*容量。困难在于原始参数计数并非架构不变的,因此正确的对象是任务固有的有效维度,它可导出架构相关的参数下界。
对于线性注意力代理,这个方案可以精确实现。我们将固有秩 \(r^*\) 定义为达到噪声基底所需令牌混合算子的最小秩,并证明它是紧致的:秩不足强制产生过剩风险(必要性),噪声基底可在 \(r^*\) 处达到(充分性),并且从小的初始化开始的梯度下降收敛到它(隐式偏差)。这些结果在代理设置下给出了一个清晰完整的图像。
本文的核心问题是这一图像能否在真实的注意力机制中存续。我们发现*直接*转移失败,但失败具有信息量。通过构建一个插值阶梯,从线性代理开始,一次改变一个架构组件,我们将故障定位到单一原因——并且与直觉相反,这个原因*不是* softmax。而是注意力计算分数时使用的输入条件性双线性形式 \(X K X^\top\):因为该算子依赖于输入,权重核 \(K\) 的任何静态性质(无论其秩还是有效秩)都不能决定模型的任务容量。一个具有无约束满秩核的控制实验同样失败,从而排除了秩约束的解释。
这促使我们重新定义。我们不测量静态核,而是定义一个*注意力原生的固有秩*——在注意力类*本身*内实现任务所需的最小查询-键核秩。从同一类中生成教师任务,通过构造消除了算子不匹配,在新定义下整个熵界结构恢复:秩不足的学生产生过剩风险,在 \(r^*\) 处的学生达到噪声基底,过参数化的学生恢复 \(r^*\)。这不仅对线性注意力成立,对 softmax 注意力也成立,只要容量由*能量有效秩*度量——我们证明它对于 softmax 引入的小奇异值噪声是鲁棒的。
最后,我们刻画了*可预测性*:在不训练的情况下从数据估计 \(r^*\)。我们展示了线性 QK 注意力的精确恢复,包括大规模下未知 V 的设置,并识别了 softmax 注意力中的剩余前沿,其中非线性反演破坏了数值秩,仅留下部分能量秩可预测性。
#### 贡献。
1. 1. 我们重新陈述并在线性注意力代理中经验验证了熵界的紧致性(不足性、可达性、恢复性),并展示了仅从数据恢复 \(r^*\) 的方法(第4节 (https://arxiv.org/html/2607.23050#S4)、第6节 (https://arxiv.org/html/2607.23050#S6))。
2. 2. 我们展示了直接转移到真实注意力的失败,并通过受控插值阶梯将原因定位到输入条件性——而非 softmax 或秩约束(第5节 (https://arxiv.org/html/2607.23050#S5))。
3. 3. 我们引入了注意力原生的固有秩,并证明它恢复了线性和 softmax 注意力的完整界结构,其中能量有效秩作为 softmax 鲁棒估计器(第6节 (https://arxiv.org/html/2607.23050#S6))。
4. 4. 我们描绘了可预测性前沿:线性 QK 注意力(包括大规模下未知 V 的设置)的精确数据仅恢复,以及 softmax 下的部分恢复,其中非线性反演破坏数值秩,能量秩估计器仍不完美(第6节 (https://arxiv.org/html/2607.23050#S6.SS0.SSS0.Px3))。
| 固定算子代理 \(Y = A^* X V^*\) | B0 成功;\(r^*\) 紧致(定理1–4,表1 (https://arxiv.org/html/2607.23050#S4.T1)) |
|-----------------------------------|-------------------------------------------------------------------------------------------|
| 静态秩转移(固定目标,学生 \(X K X^\top\)) | B1/B1c/B2 失败 — *输入条件性*(表2 (https://arxiv.org/html/2607.23050#S5.T2)) |
| 注意力原生教师 \(Y = \mathrm{Attn}_{K^*,V^*}(X)\),\(\mathrm{rank}(K^*) = r^*\) | 不足性/可达性/恢复性恢复(表3 (https://arxiv.org/html/2607.23050#S6.T3)) |
| 直接转移 | 在注意力类中重新定义 |
|----------|-----------------------|
图1:本文逻辑概览。固定算子线性代理具有紧致的熵界(左)。直接转移到注意力失败,即使使用满秩核(中),将故障定位到输入条件性混合而非 softmax 或秩不足。在注意力类内部定义固有秩恢复了不足性、可达性和恢复性(右)。
## 2 相关工作
#### 神经缩放定律。
经验缩放定律将损失描述为模型规模、数据和计算量的光滑幂律函数 (Kaplan et al., 2020 (https://arxiv.org/html/2607.23050#bib.bib11); Hoffmann et al., 2022 (https://arxiv.org/html/2607.23050#bib.bib9))。我们的框架是互补的:我们不研究改进轨迹,而是研究任务所施加的*临界容量阈值*。
#### 信息论下界。
率失真和预测信息论证从下界限制表示大小 (Cover and Thomas, 2006 (https://arxiv.org/html/2607.23050#bib.bib5); Berger, 1971 (https://arxiv.org/html/2607.23050#bib.bib4))。我们的谱剪枝视角是其矩阵值类比:率是保留的秩 \(r\),失真是尾部能量 \(\sum_{j>r} \sigma_j^2\);有效秩标志着额外的谱模式不再值得付出代价。
#### 统计学习理论。
经典复杂度度量(VC维、Rademacher复杂度、覆盖数)是最大情况和分布无关的,这里过于粗糙 (Vapnik, 1998 (https://arxiv.org/html/2607.23050#bib.bib15); Bartlett and Mendelson, 2002 (https://arxiv.org/html/2607.23050#bib.bib3))。我们的分析是分布相关的:度量熵控制泛化,而我们的界控制*表示容量*。
#### 低秩结构与压缩。
大量文献表明微调更新和训练权重是低秩的,并且低秩参数化可以廉价地匹配稠密模型 (Hu et al., 2022 (https://arxiv.org/html/2607.23050#bib.bib10); Aghajanyan et al., 2021 (https://arxiv.org/html/2607.23050#bib.bib1))。这些工作涉及更新秩或训练模型的可压缩性;我们则追问实现任务的最小秩这一更根本的问题,并表明*静态核秩*对于注意力而言是错误的度量。
#### 隐式正则化与谱偏差。
过参数化模型上的梯度下降偏向于低秩解 (Srebro et al., 2004 (https://arxiv.org/html/2607.23050#bib.bib14); Gunasekar et al., 2017 (https://arxiv.org/html/2607.23050#bib.bib8); Arora et al., 2019 (https://arxiv.org/html/2607.23050#bib.bib2))。这构成了训练核的有效秩可以收敛到任务固有秩的基础,也支持了我们的恢复实验。
#### 有效秩与注意力秩坍缩。
有效秩 (Roy and Vetterli, 2007 (https://arxiv.org/html/2607.23050#bib.bib13)) 以及注意力秩坍缩现象 (Dong et al., 2021 (https://arxiv.org/html/2607.23050#bib.bib6); Kobayashi et al., 2020 (https://arxiv.org/html/2607.23050#bib.bib12)) 已被作为动力学和信号传播效应研究。我们的贡献是正交的:我们将谱容量度量与*任务固有*下界联系起来,识别出静态核度量为何失败,并提出了实现算子替代方案。
## 3 预备知识
#### 总体风险。
对于分布 \(D\) 上的 \((x,y)\) 和损失 \(\ell\),总体风险为 \(L_D(f) = \mathbb{E}[\ell(f(x), y)]\),在容忍误差 \(\varepsilon\) 下的最小所需参数计数为 \(P^*(\varepsilon; D) = \min\{P: \exists f \text{ with } P \text{ params}, L_D(f) \leq \varepsilon\}\)。
#### 谱复杂度度量。
对于矩阵 \(M\) 奇异值 \(\sigma_1 \geq \cdots \geq \sigma_q\):
\[
\begin{aligned}
R_{\mathrm{eff}}(M) &= \exp\!\Big(-\textstyle\sum_i p_i \log p_i\Big), \quad p_i = \sigma_i / \textstyle\sum_j \sigma_j, \tag{1} \\
\tilde{R}_{\mathrm{eff}}(M) &= \exp\!\Big(-\textstyle\sum_i \tilde{p}_i \log \tilde{p}_i\Big), \quad \tilde{p}_i = \sigma_i^2 / \textstyle\sum_j \sigma_j^2, \tag{2} \\
R_{\mathrm{stable}}(M) &= \|M\|_F^2 / \|M\|_2^2. \tag{3}
\end{aligned}
\]
这些满足 \(1 \leq R_{\mathrm{stable}} \leq \tilde{R}_{\mathrm{eff}} \leq R_{\mathrm{eff}} \leq \mathrm{rank}(M)\)。对于注意力核,能量变体 \(\tilde{R}_{\mathrm{eff}}\) (Roy and Vetterli, 2007 (https://arxiv.org/html/2607.23050#bib.bib13)) 是适当的度量,我们在第6节 (https://arxiv.org/html/2607.23050#S6) 中经验验证了这一选择。
#### 任务固有有效维度。
给定一个参考类 \(G\) 及其复杂度泛函,
\[
r^*(\varepsilon; D) = \inf\{ \dim_{\mathrm{eff}}(g): g \in G, L_D(g) \leq \varepsilon\}, \tag{4}
\]
而熵界为 \(B(\varepsilon; D) = r^*(\varepsilon; D)\),按层求和。
## 4 线性注意力代理中的熵界
#### 设置。
设 \(X \in \mathbb{R}^{T \times d}\),考虑 \(\hat{Y}_{A,V} = A X V\),目标为 \(Y = A^* X V^* + E\),\(\mathrm{rank}(A^*) = r^*\),\(E \sim \mathcal{N}(0, \sigma^2 I)\)。固有秩为
\[
B_{\mathrm{lin}}(\varepsilon; D) = \min\{ \mathrm{rank}(A): \exists V, \mathbb{E} \|Y - A X V\|_F^2 \leq \varepsilon\}, \tag{5}
\]
在噪声基底 \(\varepsilon = \sigma^2 T d\) 处有 \(B_{\mathrm{lin}} = r^*\)。
#### 紧致性(重述)。
在满秩输入协方差、误差独立于输入以及在 \(r^*\) 处存在谱间隙的条件下:
###### 定理1(不足性 \(\Rightarrow\) 过剩风险)。
若 \(r < r^*\),则任何秩 \(\leq r\) 的模型的风险至少比噪声基底大一个正项,该正项由 \(\sum_{j > r} \lambda_j(A^*)^2\) 乘以输入协方差常数给出;特别地,风险严格超过噪声基底。
###### 定理2(可达性)。
若 \(r \geq r^*\),则秩为 \(r^*\) 的模型恰好达到噪声基底。
###### 定理3(紧致性)。
因此,\(r^*\) 正好是贝叶斯最优性能所需的最小有效维度。
###### 定理4(GD收敛性)。
从小的初始化开始,梯度下降收敛到一个解,其有效秩等于 \(r^*\) 加上一个 \(O(\sigma^2 / n)\) 项,并包含有限样本估计的 Marchenko–Pastur 修正。完整陈述和证明见附录A (https://arxiv.org/html/2607.23050#A1);不足性界由 Eckart–Young–Mirsky 定理 (Eckart and Young, 1936 (https://arxiv.org/html/2607.23050#bib.bib7)) 导出。
#### 经验验证。
我们实例化代理:\(T=16\),\(d=12\),秩为 \(r^*=3\) 的目标具有尖锐谱间隙,并验证每个性质(表1 (https://arxiv.org/html/2607.23050#S4.T1))。秩扫描显示了清晰的相变:对于 \(r < r^*\) 存在大的过剩风险,对于 \(r > r^*\) 则风险饱和。从小的初始化开始的过参数化训练恢复了固有秩:Marchenko–Pastur 修正后的有效秩为 \(2.97\),匹配 \(r^*=3\)。仅从数据恢复 \(r^*\)(第6节 (https://arxiv.org/html/2607.23050#S6.SS0.SSS0.Px3))给出数值秩恰好为 \(3\)。
表 1:线性代理验证(\(r^*=3\),噪声基底 \(0.48\))。在 \(r=r^*\) 处有尖锐的不足性-可达性相变;过参数化 MP 修正 \(R_{\mathrm{eff}}=2.97 \to r^*\)。
该导引实验清晰地再现了全部四个性质,为后续将理论转移到注意力提供了依据。
## 5 为何直接转移失败:定位故障
#### 插值阶梯。
在具有已知 \(r^*\) 的*相同*合成任务上,我们构建四个类,每类相差一个组件:
- B0:线性 \(A X V\),其中 \(A = P Q^\top\);
- B1:线性 QK \((X W_Q)(X W_K)^\top X V\) 不含 softmax;
- B2:softmax\(((X W_Q)(X W_K)^\top)\) \(X V\);
- B3:完整块(带残差、LayerNorm 和 FFN 的 softmax 注意力)。
对于每个类,我们测量可达性(在 \(r=r^*\) 处的过剩风险)和恢复性(实现算子的有效秩)。
#### 故障发生在 B1;原因是输入条件性。
表2 (https://arxiv.org/html/2607.23050#S5.T2)相似文章
我发现Transformer中一个预测几何稳定性的隐藏比率 [R]
本文通过Lyapunov谱分析发现,MLP和注意力谱范数之间的比率能够预测Transformer模型的几何稳定性,最优范围在0.5–2之间,可防止秩坍缩。
穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置
本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。
谱异常值揭示Transformer注意力中主导的学习结构
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。
相关与无关:Transformer注意力机制的重整化群分析
本文应用威尔逊重整化群理论,将Transformer注意力机制视为对已训练MLP残差栈固定点的扰动,并根据数据相关长度判断注意力是相关还是无关。在合成马尔可夫链上的实验证实,注意力的相关性取决于数据生成过程的谱结构,其中第一层头主导了转变。
秩不等于容量:潜在图模型的光谱占用分析
本文提出了一种名为 Spectra 的方法,利用光谱占用率来分析和控制潜在图模型的实际容量,并论证了模型的秩并不等同于其容量。