跨Transformer深度的残差流几何分析

arXiv cs.LG 论文

摘要

本文提出了一种跨深度的Transformer残差流几何分析方法,利用相对位移和正交普鲁克分析,揭示了六个指令调优模型在代码生成和翻译任务中的结构化规律。

arXiv:2607.18348v1 公告类型:新 摘要:我们提出了一种以过渡为中心的Transformer残差流几何分析。相对位移衡量表示在连续层之间的移动距离,正交普鲁克分析将每个过渡分解为刚性旋转和非刚性残差。在六个指令调优模型上,针对代码生成和跨语言翻译,这些测量揭示了可重复的深度规律。相对位移强烈依赖于层,通常早期和晚期较大,中间三分之一较为平稳;并且在每个模型内部几乎不随条件变化。旋转幅度在深度上几乎恒定,而普鲁克残差和角度集中度保持深度调制,残差在最终过渡处达到峰值。在生成过程中,非英语目标比英语目标显示出更大的最终层位移和残差。我们将其描述为描述性几何规律,而非计算努力或因果解释的度量。贡献在于提出了一个残差流过渡的测量框架,并提供了证据表明,在所研究的设置中,深度曲线是模型依赖的,并且在很大程度上条件稳定。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# 跨Transformer深度的残差流几何分析
来源:https://arxiv.org/html/2607.18348

###### 摘要

我们提出了一种以过渡为中心的Transformer残差流几何分析方法。相对位移衡量了表示在连续层之间移动的*距离*,而正交Procrustes分析则将每次过渡分解为一个刚性旋转和一个非刚性残差。在六个指令微调模型上,针对代码生成和跨语言翻译任务,这些测量揭示出可复现的深度规律性。相对位移高度依赖于层:通常在早期和后期较大,中间三分之一较为平静;并且在每个模型内部,不同条件下几乎不变。旋转幅度在深度上几乎恒定,而Procrustes残差和角度集中度仍受深度调制,其中残差在最后一次过渡时达到峰值。在生成过程中,非英语目标显示出比英语目标更大的最终层位移和残差。我们将这些呈现为描述性的几何规律性,而非计算工作量或因果解释的度量。贡献在于提供了一个残差流过渡的测量框架,并证明了在所研究的设置中,深度曲线依赖于模型且主要保持条件稳定。

跨Transformer深度的残差流几何分析

Sunit Bhattacharya, Ravi Kolli  
ProRata AI  
联系方式:[email protected] (https://arxiv.org/html/2607.18348v1/mailto:[email protected])

## 1 引言

Transformer (Vaswani et al., 2017 (https://arxiv.org/html/2607.18348#bib.bib1)) 通过反复更新残差流 (Elhage et al., 2021 (https://arxiv.org/html/2607.18348#bib.bib9); Olah et al., 2020 (https://arxiv.org/html/2607.18348#bib.bib8)) 来处理信息。大多数对该流的分析关注某一层表示或预测的内容:表示相似性 (Kornblith et al., 2019 (https://arxiv.org/html/2607.18348#bib.bib15))、Logit Lens和Tuned Lens等词汇投影 (nostalgebraist, 2020 (https://arxiv.org/html/2607.18348#bib.bib14); Belrose et al., 2023 (https://arxiv.org/html/2607.18348#bib.bib13)),或特定计算的电路级解释 (Olah et al., 2020 (https://arxiv.org/html/2607.18348#bib.bib8); Elhage et al., 2021 (https://arxiv.org/html/2607.18348#bib.bib9); Bushnaq et al., 2024 (https://arxiv.org/html/2607.18348#bib.bib7))。我们提出一个互补视角:将每一层过渡视为残差空间中标记云的一个几何变换。在此视角下,研究对象不是静态的层激活,而是从深度 ℓ 的云到深度 ℓ+1 的云的映射。相对位移问的是标记移动了多少。正交Procrustes分析 (Schönemann, 1966 (https://arxiv.org/html/2607.18348#bib.bib16)) 则将这种移动分解为最优刚性旋转和非刚性残差。最近关于Transformer的几何工作研究了运动学加速度 (Fernando and Guitchounts, 2025 (https://arxiv.org/html/2607.18348#bib.bib30))、沿标记路径的曲率 (Damirchi et al., 2026 (https://arxiv.org/html/2607.18348#bib.bib31)),以及每层云的本征维度 (Viswanathan et al., 2025 (https://arxiv.org/html/2607.18348#bib.bib27))。这些方法要么快照某一层,要么跟踪单个标记。我们的贡献是测量完整残差流云的集体层间变换。

我们将此框架应用于六个指令微调模型:Qwen3 0.6B−8B、Gemma-2-2B-IT和StableLM-2-1.6B-Chat,针对代码生成以及英语与四种印欧语言之间的翻译。在这些设置中,出现了四种规律:

1. 1. 相对位移由深度强烈结构化:更新通常在早期和后期较大,中间三分之一较为平静。在每个模型内部,代码和翻译条件基本共享相同的深度曲线。
2. 2. 全局Procrustes旋转的幅度在深度上几乎恒定(变化低于预设的3%界限),而Procrustes残差和角度集中度仍受深度调制,其中残差在最后一次过渡时达到峰值。
3. 3. 条件主要重新缩放后期层的振幅,而不是重写深度曲线。在生成过程中,非英语目标显示出比英语目标更大的最终层位移和残差。
4. 4. 这些模式在分层bootstrap和层置换检验(经Holm校正)下具有统计稳健性。

我们的贡献是测量优先的。我们引入了一个以过渡为中心的残差流几何视角,并记录了在所研究的模型和条件下稳定的规律性。我们既不声称这些度量衡量了计算工作量,也不提供这些模式为何出现的因果解释。特别是,近乎恒定的旋转幅度可能部分反映了高维Procrustes几何;更具信息量的观察是,即使旋转尺度平坦,位移和残差仍保持深度结构化。中间层放缓恰好与之前与更语言中性处理相关的深度重合 (Wendler et al., 2024 (https://arxiv.org/html/2607.18348#bib.bib17); Chang et al., 2022 (https://arxiv.org/html/2607.18348#bib.bib18); Bhattacharya and Bojar, 2023 (https://arxiv.org/html/2607.18348#bib.bib19)),而非英语残差的升高与英语枢纽账户一致 (Wendler et al., 2024 (https://arxiv.org/html/2607.18348#bib.bib17))。我们将这些报告为关联。综合来看,结果支持一个紧凑的描述性主张:在代码和翻译中,残差流深度曲线依赖于模型且主要保持条件稳定,而内容主要重新缩放后期层的振幅。

## 2 相关工作

### 2.1 多语言表示

多语言模型在深度上展现出结构化的几何特征:早期和后期层通常保留语言特定结构,而中间层形成一个更共享、与语言无关的子空间 (Chang et al., 2022 (https://arxiv.org/html/2607.18348#bib.bib18); Bhattacharya and Bojar, 2023 (https://arxiv.org/html/2607.18348#bib.bib19))。大型语言模型也经常通过路由至以英语为中心的潜在空间来处理非英语输入 (Wendler et al., 2024 (https://arxiv.org/html/2607.18348#bib.bib17))。在该共享空间中,某些计算特征似乎在很大程度上独立于输入语言和最终输出语言 (Schut et al., 2025 (https://arxiv.org/html/2607.18348#bib.bib20); Kyriakou et al., 2026 (https://arxiv.org/html/2607.18348#bib.bib21))。这些发现定位了语言特定结构出现的*位置*;它们并未测量残差流几何在层与层之间如何变化。

### 2.2 残差流、读出与深度

机制可解释性将残差流视为Transformer的主要通信通道,由注意力层和MLP块进行加性更新 (Elhage et al., 2021 (https://arxiv.org/html/2607.18348#bib.bib9); Olah et al., 2020 (https://arxiv.org/html/2607.18348#bib.bib8))。Logit Lens和Tuned Lens等逐层读出方法询问每个深度对下一个标记的预测 (nostalgebraist, 2020 (https://arxiv.org/html/2607.18348#bib.bib14); Belrose et al., 2023 (https://arxiv.org/html/2607.18348#bib.bib13))。一条互补的研究线路争论深度本身的功能角色:有人主张后期层主要精炼输出概率 (Csordás et al., 2026 (https://arxiv.org/html/2607.18348#bib.bib44)),而其他结果则强调需要额外的计算步骤而非额外参数 (Saunshi et al., 2025 (https://arxiv.org/html/2607.18348#bib.bib45))。相关提议通过循环或更长的生成分配额外计算 (Dehghani et al., 2018 (https://arxiv.org/html/2607.18348#bib.bib43); Wei et al., 2022 (https://arxiv.org/html/2607.18348#bib.bib48))。我们的度量解决了一个不同的问题:不是某层预测什么,而是表示如何在连续的残差状态之间移动。

### 2.3 机制可解释性与推理动态

机制研究逆向工程了Transformer中特定的算法操作,例如grokking期间的傅里叶乘法电路 (Nanda et al., 2023 (https://arxiv.org/html/2607.18348#bib.bib22)),以及操作数信息从早期注意力流向后期MLP计算的过程 (Stolfo et al., 2023 (https://arxiv.org/html/2607.18348#bib.bib23))。更近期的研究采用了推理的几何和运动学视角。逻辑推理已被建模为平滑的几何流,其结构塑造了轨迹速度和曲率 (Zhou et al., 2025 (https://arxiv.org/html/2607.18348#bib.bib24))。Fernando和Guitchounts (2025 (https://arxiv.org/html/2607.18348#bib.bib30)) 将残差流视为一个具有不同运动学加速度阶段的动力系统,而Damirchi等人 (2026 (https://arxiv.org/html/2607.18348#bib.bib31)) 使用离散曲率研究模型真实性,认为标量标记运动学本身可能被词汇效应混淆。这些方法激励了以过渡为中心的分析,但它们主要跟踪单个标记路径,而非跨深度的全局云几何。

### 2.4 Transformer表示的几何分析

其他工作更直接地研究标记表示的几何。Viswanathan等人 (2025 (https://arxiv.org/html/2607.18348#bib.bib27)) 使用本征维度和余弦相似度表征逐层标记云,将空间结构与预测损失联系起来;相关工作使用动力系统建模跨层传播 (Shang et al., 2026 (https://arxiv.org/html/2607.18348#bib.bib26))。方向一致性也已沿序列轴测量:Hosseini等人 (2026 (https://arxiv.org/html/2607.18348#bib.bib32)) 使用速度向量的余弦相似度量化上下文学习中的轨迹拉直。然而,该领域的许多文献将每一层视为静态快照。运动学方法跟踪过渡,但通常针对孤立标记而非完整标记云。我们转而使用正交Procrustes分析 (Schönemann, 1966 (https://arxiv.org/html/2607.18348#bib.bib16)) 将每个层过渡分解为最优刚性旋转和非刚性残差。这种全局的、以过渡为中心的视角是我们框架的独特之处。

### 2.5 综合

多语言文献映射了语言特定结构出现的位置;机制和读出方法表征了层计算或预测的内容;几何和运动学研究描述了表示形状或标记轨迹。很少有工作询问残差流几何在层过渡之间是如何组织的。我们的贡献是直接测量这种组织:相对位移和Procrustes残差高度受深度结构化,而旋转幅度在深度上几乎恒定。简而言之,先前的工作解释了语言结构存在于何处以及层做了什么;我们量化了几何变化如何通过堆叠分配。

## 3 方法

### 3.1 设置

对于每个示例,我们记录输入提示(*prefill*)和自回归生成标记(*generation*)的残差流激活。如果模型有L层和隐藏维度d,则标记t在深度ℓ处由 h<sub>t</sub><sup>ℓ</sup> ∈ ℝ<sup>d</sup> 表示。Prefill在一次前向传递后产生所有提示标记的一个云;生成产生每个解码步骤中新产生标记的隐藏状态。我们的分析以过渡为中心:我们不将每一层视为静态快照,而是测量标记云如何从深度ℓ变换到ℓ+1。

### 3.2 几何度量

我们将每个层过渡视为残差流的一个几何变换。以下度量分离了标记移动了多少、其轨迹弯曲得有多尖锐、云的多少变化由全局旋转解释,以及该旋转如何在平面上分布。

#### 相对位移.

我们测量每个标记相对于其源表示范数的层间移动:

δ<sub>ℓ</sub>(t) = ‖h<sub>t</sub><sup>ℓ+1</sup> - h<sub>t</sub><sup>ℓ</sup>‖<sub>2</sub> / ‖h<sub>t</sub><sup>ℓ</sup>‖<sub>2</sub>. (1)

这控制了深度上残差流范数的增长(这在Pre-LN模型中常见):一个大的绝对步长相对于增长的残差向量可能仍然很小。较大的δ<sub>ℓ</sub>意味着该过渡处有更大的相对更新。除非另有说明,我们报告提示内标记的δ<sub>ℓ</sub>(t)均值,然后跨提示和条件取平均。

#### 曲率.

将深度视为轨迹,令 v<sub>ℓ</sub>(t) = h<sub>t</sub><sup>ℓ+1</sup> - h<sub>t</sub><sup>ℓ</sup> 为过渡ℓ处的更新。曲率比较连续更新:

κ<sub>ℓ</sub>(t) = ‖ (h<sub>t</sub><sup>ℓ+2</sup> - h<sub>t</sub><sup>ℓ+1</sup>) - (h<sub>t</sub><sup>ℓ+1</sup> - h<sub>t</sub><sup>ℓ</sup>) ‖<sub>2</sub> / ‖h<sub>t</sub><sup>ℓ+1</sup> - h<sub>t</sub><sup>ℓ</sup>‖<sub>2</sub><sup>2</sup>. (2)

较大的值表示更新相对于其幅度变化强烈,无论是通过改变方向还是改变步长。我们仅将曲率用作位移的描述性补充。

#### 全局旋转.

在每个过渡处,深度ℓ和ℓ+1处的标记形成ℝ<sup>d</sup>中的两个点云。我们将两个云居中,并使用正交Procrustes对齐 (Schönemann, 1966 (https://arxiv.org/html/2607.18348#bib.bib16)) 找到最佳将源云映射到目标云的旋转 R<sub>ℓ</sub><sup>*</sup>。我们通过

ℛ<sub>ℓ</sub> = ‖R<sub>ℓ</sub><sup>*</sup> - I‖<sub>F</sub>. (3)

总结此刚性分量的大小。更大的值意味着标记云更大的全局重定向。由于 R<sub>ℓ</sub><sup>*</sup> 是正交的,ℛ<sub>ℓ</sub> 仅取决于拟合旋转偏离恒等矩阵的程度,而不取决于残差流的尺度。

#### Procrustes残差.

单个全局旋转不能解释每个标记的移动。在应用 R<sub>ℓ</sub><sup>*</sup> 后,我们计算每个对齐的源标记与其居中目标之间的欧氏距离,然后在每个提示和过渡内跨标记取平均。残差是云变化中无法被一个共享旋转吸收的部分:各向异性拉伸、局部重排以及其他非刚性效应。我们将其视为非刚性不匹配的度量,而非计算工作量的直接度量。

#### 旋转-角度集中度.

一个高维旋转可能分布在许多平面上,也可能由少数平面主导。令 D<sub>ℓ</sub> = R<sub>ℓ</sub><sup>*</sup> - I 且 q = ⌊d/2⌋。我们定义

C<sub>ℓ</sub> = ‖D<sub>ℓ</sub>‖<sub>F</sub><sup>2</sup> / (q ‖D<sub>ℓ</sub>‖<sub>2</sub><sup>2</sup>). (4)

这是一个从 R<sub>ℓ</sub><sup>*</sup> - I 推导出的有效代理,而非旋转的完整特征分解。较大的 C<sub>ℓ</sub> 表示旋转变化分布在更多平面上;较小的值表示少数平面主导。与 ℛ<sub>ℓ</sub> 和 Procrustes 残差一起,它让我们可以询问恒定的旋转*大小*是否与结构化的旋转*几何*共存。

### 3.3 统计验证

我们分别分析模型和阶段,使用之前商议好的方法...

相似文章

Transformer 残差流的动力学:谱几何与网络拓扑的耦合

arXiv cs.LG

本文对生产规模的大型语言模型进行了完整的 Jacobian 特征分解,揭示了从旋转主导的早期层到对称后期层的习得谱梯度,以及一个压缩扰动的低秩瓶颈。结果将扰动传播与压缩与网络功能拓扑联系起来。

DeepLoop:循环Transformer的深度缩放

arXiv cs.LG

DeepLoop为循环Transformer引入了一种残差缩放方法,该方法根据参数访问进行调整,从而在物理块跨多轮重用时提高稳定性和性能。

关于循环变换器中残差缩放:稳定性与可迁移性

arXiv cs.LG

本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。