Transformer残差流中的几何与行为分层
摘要
本文研究了训练后Transformer的残差流几何结构,表明预测方向作为一个特权锚点,将残差流的变化分为狭窄的、与读出相关的区域和宽广的计算区域,这一现象在18个模型中均成立。这些发现对可解释性和评估具有启示意义。
arXiv:2608.12447v1 公告类型:新
摘要:经过训练的Transformer模型会形成特权基(privileged bases):一组坐标轴,其统计特性与残差流的其余部分不同。但这种基会选择什么样的方向呢?我们研究了预测方向,即模型当前预测token的去嵌入方向,发现它起到了内容定义的特权锚点作用。以该锚点为参照测量时,残差流的变化会根据与预测的接近程度在几何和行为上呈现分层。
这种分层在测试的所有十八个模型中均成立(包括密集模型和混合专家模型,7B-120B,基础版和指令微调版)。一个狭窄的、尺度不变的预测接口集中了与读出相关的结构,而广阔的预测远端补集则随模型规模扩大。由于预测方向几乎与主方差轴正交,基于方差的分析只能部分恢复这种组织,而且这种不足会随着提示的异质性增加而加剧。
锚定揭示了一个陡峭的几何梯度:预测近端区域高度结构化,并会将相关的提示聚类在一起;而补集则更平坦,并且在提示组之间具有反区分性。该接口是一个狭窄的切片,但在功能上具有决定性。破坏最接近预测的方差方向会立即导致发散和频繁的任务框架转移;破坏下一层级则会延迟发散并保持框架。补集在每个方向上与读出的对齐较弱,但在因果和时间上承担着重要负载,行为由方向而非幅度驱动。
这些结果确立了预测方向是一个区别于先前描述的坐标轴的特权锚点,并从几何角度解释了高维计算如何与线性读出共存。
查看缓存全文
缓存时间: 2026/08/14 09:29
# Transformer残差流中的几何与行为分层
来源:https://arxiv.org/html/2608.12447 \[Path=, Extension=\]
###### 摘要
近期研究表明,经过训练的Transformer模型会发展出特权基:特定的坐标轴,其统计行为与残差流的其余部分不同。但这种特权基选择的究竟是什么样的方向?我们研究了预测方向,即模型当前预测token的去嵌入方向,并发现它充当了一个内容定义的特权锚点。以该锚点为参照进行测量时,残差流的变化在几何上和行为上都按与预测的接近程度分层。这一分层出现在我们测试的所有十八个模型中(稠密和MoE,7B–120B,基座和指令微调)。一个狭窄、尺度不变的预测接口集中了与读出相关的结构,而其余广大部分——预测远端补集——则随模型规模扩展。我们证明,基于方差的分析只能部分恢复这种组织,因为预测方向几乎与主方差轴正交。在比较语言异质性更强的提示时,沿预测轴的组织变得更加明显。因此,随着提示变得更加多样化,提示间的模型分离对主方差轴越来越不可见,而相对预测轴则越来越可见。锚定预测方向揭示了一个陡峭的几何梯度。预测近端区域高度结构化,并对语义相关的提示进行聚类,而补集则更平坦,且系统性地对提示分组产生反判别。这些预测近端子空间只占残差流的狭窄切片,但被证明在功能上具有相关性。扰动最接近预测方向的高方差方向会立即导致发散和频繁的任务框架转移。扰动方差次一级的方向则产生较晚的发散,并保持输出的框架。残差流几何的其余部分方差较低,且与下一token的读出弱对齐,但干预表明它在因果和时间上都是承重的。在整个几何中,我们发现行为由方向结构而非幅度驱动,这表明我们识别出的几何分层帮助模型将读出结构与计算隔离开。这些结果确立了预测方向作为一个特权锚点,它既不同于先前描述的基于坐标的轴,又与模型训练方式在功能上对齐。我们的数据还提供了一种几何解释,说明高维计算如何与线性读出共存。我们认为这项工作对可解释性和评估具有意义。参见图1的说明:图1:线性读出仅使用残差流的狭窄区域来决定下一token,且该区域的大小不随模型规模变化——这是本文所依赖的架构不对称性。(A) 残差流中的变化如何与读出对齐或正交的概念性可视化。绿色变化代表*预测接口*,即残差流中其成分直接决定线性读出接下来选择哪个token的狭窄区域。残差流的其余部分——红色散点,在几何上与预测接口正交——代表*补集*,即承载模型计算状态但不直接贡献读出的绝大多数方向。(B) 预测接口的狭窄维度在所有模型中普遍存在,无论其规模如何。测试平台中的十个指令微调模型,隐藏维度跨度达2.8倍(完整的十八个模型测试平台见§4),都表现出相同的模式。绿色的预测接口占据相同的低有效维度,与模型规模无关(旁边的数字给出了1\+DPR\+SPR1\+D\_\{PR\}\+S\_\{PR\}来自表1的有效维度)。补集(白色轮廓)随残差流宽度(dmodeld\_\{\text\{model\}\},右)增长。柱状图以压缩方式绘制(断点标记)。如果按真实比例渲染,补集相对于接口将大得多。总之,更宽的模型通过更大的补集进行计算,但通过相同的窄带读出。(C) 线性读出产生一个覆盖候选token的分布,从(A)中的预测接口读出,其中最高的柱(argmax)被选为预测。
## 1\. 引言
Transformer语言模型在高维残差流中进行计算,该残差流在训练前没有旋转偏好。近期研究表明,训练打破了天然的旋转对称性,并诱导出*特权基*:特定坐标轴,其统计行为与其余部分系统性不同(van Nierop, 2024; Elhage et al., 2023)。到目前为止,该基仅被描述为一组异常坐标轴,而没有明确其功能角色。在本文中,我们提出证据表明*预测方向*,即模型每一步预测token的秩1去嵌入方向,是一个内容定义的特权锚点。在我们测试的每个模型中,残差流几何都相对它进行组织。预测方向是此类结构自然集中的位置,因为它是架构使计算变得可读的地方。Transformer在高维残差流中计算,残差流是跨序列累积更新的逐层运行状态,但通过*线性读出*产生每个下一token预测,即残差流状态到词汇表logits的单一线性投影(Vaswani et al., 2017; Elhage et al., 2021)。这产生了一个基本不对称性:计算占据数千维,但预测只有通过与去嵌入对齐才变得可读。由于自回归训练完全通过每一步线性读出所解析的内容来塑造残差流,模型自身的预测方向是一个按功能定义的轴,可以据此度量残差流几何。先前研究已将此方向用作logit透镜方法中的诊断读出轴(nostalgebraist, 2020; Belrose et al., 2023)。我们利用这些工作表明,预测方向同时也是一个几何锚点。我们通过检查结构化提示集上残差流几何的方差,考察了预测方向对残差流几何结构的影响。通过将分析锚定到预测方向,我们识别出一个狭窄的*预测接口*,即一个低维、读出近端的区域,它在我们的18个模型测试平台中是普遍的。这个狭窄接口,残差流计算通过它变得对去嵌入可读,是几何中极薄的切片:在受约束的提示上,在跨越残差流的数千维中,有效维度不足20。几何的其余部分,我们称为预测*远端补集*,在每个方向上与读出弱对齐,但对于生成在因果和时间上仍然至关重要。为解释这一发现,我们提出一种几何解释,说明高维计算如何与跨定义输出的线性读出共存。通过证明Transformer模型残差流中的变化主要是方向性的而非幅度性的,我们提出与预测相关的结构必须与残差流变化的大得多的背景保持距离,以便在读出时隔离去嵌入信号。我们的发现表明,模型通过将大多数变化定向为远离读出,同时保留一个狭窄区域来表达与预测相关的结构,从而实现这一点。由于读出通过一个固定、狭窄的接口解析下一token,更大的模型应保持该接口狭窄并扩展补集。图1A展示了不同轴上的变化如何定向为朝向或远离去嵌入读出的概念性渲染。为评估这一问题,我们使用了来自六个架构家族(Llama、Gemma、Mistral、Mixtral、Qwen和GPT\-OSS)的十八个Transformer模型测试平台,涵盖稠密和混合专家设计、基座和指令微调变体,以及17倍的参数范围(7B–120B)。对于每个模型,我们在三个结构化提示集上测量了残差流几何中的预测近端和预测远端结构,这些提示集旨在评估模型如何响应提示变化来构建残差流几何。我们通过一种预测锚定的分解*PDSF*导出了主要测量单位,该分解将每个残差状态划分为四个正交分量,按与预测方向的方差接近程度排序。PDSF分解首先提取P,即当前argmax token在去嵌入方向上的秩1投影,然后对剩余部分进行连续的方差排序切割:D,P残差的top\-k PCA基;S,\(P\+D\)残差的top\-k PCA基;以及F,三者共同的正交补(详见§3)。我们将组合的预测近端区域P \+ D \+ S称为预测接口。几何的其余部分最大,且提示间的每维方差小得多。我们称这个预测远端区域为"F",在整篇论文中也称之为补集。使用这种分解方法,我们发现预测近端区域的有效维度很小,并且近似不受模型宽度影响。在受约束的提示(期望简单单token答案的提示)上,预测近端D子空间在指令微调模型和基座模型中都具有个位数有效秩。当我们测量分解子空间上的流形复杂度时,发现沿D中高度折叠结构到F中更平坦且更少折叠结构的强梯度。比较指令模型和基座模型表明,微调锐化了接口的内部组织,但没有加宽它。在我们测试的每个模型中,我们都发现了相同的分层。使用提示间的几何方差作为分解方法,先验地预期会出现判别梯度。一个令人惊讶的发现是,低方差、预测远端补集并不具有较少的判别性,反而跨结构化提示集产生反判别。在发现沿预测轴存在几何分层后,我们通过评估模型输出对目标子空间干预的行为响应来测试其功能意义。当我们干预残差流的预测远端分量时,发现尽管这一大部分几何中的维度与下一token弱对齐,但该几何在因果上仍然对计算至关重要,并且在每一步都是必要的。当我们干预狭窄的预测近端子空间D和S时,发现与下一预测token方向的方差接近程度与干预扰动输出的未来时间对齐。换句话说,在最高方差维度上进行干预会立即影响输出,而在下一个最高方差维度组上进行干预只在几个token之后才影响输出。这一结果似乎令人惊讶,并表明模型会划分影响即时与未来输出的方向。这些发现——尺度不变、流形复杂度梯度、F在组判别中的符号反转、或行为层级——都不是PDSF构造方式所必然导致的。PDSF分解是一种用于测量残差流几何的分析坐标系,唯一的先验预期(判别梯度)也揭示了意外结果。我们相信我们的结果与线性表示和探针研究有关,这些研究从激活空间中的低维方向恢复语义上有意义的信息(Marks & Tegmark, 2023; Park et al., 2024),也与从稀疏方向恢复信息的稀疏自编码器有关(Bricken et al., 2023)。所有这些研究表明,可读结构是低维或稀疏的。Saurez et al. (2026) 将此强化为一种架构主张:通过线性接口读出的特征必须占据上下文不变的线性子空间,这仅由读出几何决定。这些结果还与通过方差结构、内在维度或逐深度几何阶段来刻画残差流几何的工作相关(Ansuini et al., 2019; Valeriani et al., 2023; Cheng et al., 2025; Kirsanov et al., 2025)。我们的工作表明,残差流中的几何结构是相对于下一token训练最直接塑造的轴——模型自身的当前预测方向——来组织的。我们认为这项工作对缩放、可解释性和评估具有意义。如果模型宽度主要扩展的是围绕一个大致固定大小的读出接口的基底,那么更大的模型很可能通过计算到该接口的更精确投影来改进,而不是通过加宽它。我们发现的不同预测方向接近程度的子空间之间的行为差异表明,这可能是一种有价值的特征级可解释性工具,因为这两个区域以不同的读出强度携带不同类型的信息。这些结果也贡献于越来越多的研究,表明输出级评估低估了计算。我们的工作进一步证明,残差流方差的大部分对读出是弱可见的。大纲。§2 发展线性读出在范数集中条件下施加的架构约束。§3 定义PDSF分解及全文使用的几何测量。§4 报告尺度不变的预测接口、读出/方差分离、流形复杂度梯度、组判别反转以及基座/指令比较。§5 测试补集的因果作用是否由方向而非幅度承载。§6 使用持续性旋转干预来刻画沿预测接近度轴的行为分层。§7 识别自回归生成期间补集的静态/动态划分。§8 讨论对缩放、可解释性和评估盲区的影响,并总结。
## 2\. 线性读出的架构约束
线性读出仅通过向词汇表方向的投影来观察残差流。在每一步,投影都会创建一个潜在token分布(logits),计算为 li=uiTh,\\ell\_\{i\}=\\mathbf\{u\}\_\{i\}^\{T\}\\mathbf\{h\},其中h∈Rd\\mathbf\{h\}\\in\\mathbb\{R\}^\{d\}是残差流,ui\\mathbf\{u\}\_\{i\}是token ii的去嵌入向量。预测的下一token是这些点积上的argmax,因此正确预测要求残差状态与正确token的去嵌入向量的对齐程度必须强于与竞争token的对齐程度。我们用预测方向所使用的方向是模型当前预测token(其argmax)的去嵌入向量,记作u^\\hat\{\\mathbf\{u\}\}。我们识别出的架构不对称性提出了一个问题:残差流携带的总信息中有多少实际上是为生成logit分布所必需的?相似文章
跨Transformer深度的残差流几何分析
本文提出了一种跨深度的Transformer残差流几何分析方法,利用相对位移和正交普鲁克分析,揭示了六个指令调优模型在代码生成和翻译任务中的结构化规律。
Transformer 残差流的动力学:谱几何与网络拓扑的耦合
本文对生产规模的大型语言模型进行了完整的 Jacobian 特征分解,揭示了从旋转主导的早期层到对称后期层的习得谱梯度,以及一个压缩扰动的低秩瓶颈。结果将扰动传播与压缩与网络功能拓扑联系起来。
我发现Transformer中一个预测几何稳定性的隐藏比率 [R]
本文通过Lyapunov谱分析发现,MLP和注意力谱范数之间的比率能够预测Transformer模型的几何稳定性,最优范围在0.5–2之间,可防止秩坍缩。
谱异常值揭示Transformer注意力中主导的学习结构
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。
最后一层模型窃取的几何结构
本文利用外微分系统对Transformer最后一层模型窃取攻击进行了几何解释,表明投影矩阵的恢复受二次曲面的极空间控制。它还刻画了最后一层之下的可识别性壁垒,揭示了哪些信息可以被提取,哪些不能。