层重要性揭示了Transformer与状态空间模型中的什么?
摘要
本文将层重要性分解为必要性与可塑性,以此比较Transformer与状态空间模型,揭示二者内部动态的根本差异,并探讨其对微调与适应性调整的启示。
arXiv:2609.16537v1 公告类型:新
摘要:Transformer与状态空间模型(SSMs)是序列建模的两大主流框架,一个核心开放问题是:为Transformer建立的分析知识能在多大程度上迁移至SSMs。我们通过层重要性这一视角切入——该指标支撑着两类模型的压缩、选择性微调与可解释性研究。我们将层重要性分解为两个独立概念:\emph{必要性}衡量预训练模型对特定层既有贡献的依赖程度,通过绕过该层导致的损失增加来量化;\emph{可塑性}则刻画微调过程中模型吸收新信息的位置,通过任务特定权重更新的幅度来度量。分析表明两类模型存在根本性差异:在所有评测的参数量达$14$B的残差Transformer中,必要性与可塑性在深度维度上呈反向对齐关系,而在评测的Mamba架构SSMs中,二者指向重叠区域。这种对齐关系的符号特征还能预测下游适应行为:在评测的Transformer中,将更新集中在可塑性最高的层会加剧灾难性遗忘,而这种层级依赖效应在评测的Mamba架构SSMs中完全消失。
查看缓存全文
缓存时间: 2026/09/16 08:54
# 层重要性揭示了Transformer与状态空间模型的哪些特性? 来源:https://arxiv.org/html/2609.16537 Istabrak Abbes 机构:Chandar Research Lab 机构:Mila - Quebec AI Institute 机构:蒙特利尔大学 邮箱:[[email protected]](mailto:) Irina Rish 机构:Mila - Quebec AI Institute 机构:蒙特利尔大学 机构:Canada CIFAR AI Chair Sarath Chandar 机构:Chandar Research Lab 机构:Mila - Quebec AI Institute 机构:蒙特利尔工学院 机构:Canada CIFAR AI Chair ###### 摘要 Transformer与状态空间模型(SSMs)是两大主流序列模型家族,一个核心开放问题是:为Transformer建立的分析知识能在多大程度上迁移至SSMs?我们通过层重要性视角探讨此问题——该视角支撑着两个家族的模型压缩、选择性微调与可解释性研究。我们将层重要性分解为两个不同概念: **必要性**衡量预训练模型对某层现有贡献的依赖程度,通过绕过该层导致的损失增加来量化。 **可塑性**衡量模型在微调过程中吸收新信息的位置,通过任务特定权重更新的幅度来量化。 分析揭示两大模型家族存在本质差异:在所有评估的最高达14B参数的残差Transformer中,必要性与可塑性沿深度呈现反向对齐;而在评估的Mamba式SSMs中,二者指向重叠区域。这种对齐的符号还能预测下游适应行为:在评估的Transformer中,将更新集中于最可塑的层级会加剧灾难性遗忘,而这种层级依赖效应在评估的Mamba式SSMs中消失。 ## 1 引言 现代语言建模仍由残差Transformer主导(Vaswani等,2023),但选择性状态空间模型已成为重要的替代架构(Gu与Dao,2024;Dao与Gu,2024)。关于Transformer的大量研究已产出成熟的剪枝(Gromov等,2025;Men等,2025)、参数高效微调(Hu等,2021)与可解释性(Meng等,2023;Song等,2026)工具,其中许多依赖于**层重要性**估计(Zhang等,2024;Naim等,2026;Xu等,2026;Yao等,2024)。 另一方面,SSMs继承相同术语表,但显然未继承相同内部结构。自然的问题是:针对Transformer校准的分析工具能否迁移至SSMs?或者当选择性循环状态动态取代基于注意力的令牌混合时,这些工具是否在无声中测量其他内容? 我们通过将层重要性分解为两个不同概念来研究此问题。**必要性**衡量预训练模型对某层现有贡献的依赖程度,通过绕过该层造成的损失增加量化。**可塑性**衡量模型在适应过程中吸收新信息的位置,通过微调期间任务特定权重更新的幅度量化。尽管这些概念常被混为单一的“重要性”,但它们捕捉根本不同的属性:剪枝与可解释性主要依赖必要性(Men等,2025;Zhang等,2024),而选择性微调依赖可塑性(Pan等,2024;Zhang等,2023;Qing等,2024;Hayou等,2026)。关键问题是这两个量是否标识网络的相同区域,以及这种关系是否跨架构可迁移。 **图1:层重要性具有方法相关性与架构条件性** 左图:估计器投影至必要性-可塑性平面(纵轴:与消融法的平均斯皮尔曼相关性;横轴:与LoRA增量相关性)。在Transformer中,梯度法和残差归一化法与必要性对齐;激活范数法和TELL-TALE法与可塑性对齐。在Mamba中,估计器聚集于混合正相关区域。 右图:检查点间的NPA(\(\mathcal{NPA}\))(柱状图:95%置信区间)。所有评估的最高达14B参数Transformer均为负值;所有评估的Mamba式SSMs均为正值;两个最大Transformer向零值收敛。虚线标记家族平均值。 为明确区分,我们引入**必要性-可塑性对齐**(NPA \(\mathcal{NPA}\)):模型层基于消融的必要性排序与基于LoRA更新幅度的可塑性排序之间的平均斯皮尔曼相关性(跨任务)。正NPA意味着相同层同时具备必要性与可塑性;负NPA意味着预训练依赖与适应集中在网络的两端;接近零的值表明未指定估计器时不存在稳定深度排序。 在评估的Transformer和Mamba检查点中,NPA清晰区分两个家族。所有评估的最高达14B参数残差Transformer均呈现负对齐:早期层最必要,晚期层最可塑。相反,所有评估的Mamba式SSMs均呈现正对齐,必要性与可塑性集中于重叠区域。这种对比在不同重要性估计器中持续存在,在移除首层后依然成立,且扩展至Mamba之外的RWKV和混合架构。这也非低秩适应的产物:通过全参数微调重新计算可塑性的无适配器控制实验,在每个重新训练的检查点上保留了NPA的符号(附录E.3)。更大的Transformer(包括Qwen3-32B和Llama-3.1-70B)未进入SSM范畴,其对齐反而向零收敛。 同样的区分预测下游适应行为:当连续任务适应高度可塑的层级时,Transformer呈现层级依赖的遗忘,而这种效应在Mamba式SSMs中消失。 代码、逐层重要性分数与分析脚本:https://github.com/chandar-lab/layer-importance-ssm-vs-transformers。 ##### 贡献 1) 我们引入**必要性-可塑性对齐**(NPA \(\mathcal{NPA}\)),一种衡量预训练层依赖与任务特定适应跨深度一致性的诊断工具。 2) 我们发现稳健的架构依赖性区分:所有评估的最高达14B参数残差Transformer呈现负NPA,早期层最必要而晚期层最可塑;而评估的Mamba式SSMs呈现正NPA,必要性与可塑性集中于重叠区域。该区分在无适配器的全量微调控制实验中成立,且在*单一混合检查点内*重现。 3) 我们证明NPA在受控的双任务持续学习探针中预测选择性微调行为:评估的Transformer在两个任务适应相同高度可塑层级时呈现强烈遗忘,而评估的Mamba式SSMs中该层级依赖性干扰消失。 ## 2 相关工作 ##### 重要性引导的PEFT与秩/位置分配 参数高效微调(PEFT)领域的发展趋势认为适应不应沿深度均匀分布。AdaLoRA(Zhang等,2023)通过奇异值重要性重分配秩;AlphaLoRA(Qing等,2024)使用重尾自正则化统计分配LoRA专家;Layer Card(Xu等,2026)引入*残差归一化*作为可重用的层诊断工具以选择性分配位置;ShapLoRA(Zhao等,2026)使用Shapley式敏感度分数;PLoP(Hayou等,2026)提出由神经特征范数驱动的精确位置信号。这些方法均提出单一重要性估计器并独立研究。 近期研究也开始探讨为Transformer开发的压缩、PEFT与可解释性工具能否迁移至选择性状态空间模型。LoRA式适应已扩展至Mamba式架构(Galim等,2025),而层剪枝与相关性传播方法已适配至选择性SSMs(Munoz等,2025;Jafari等,2025)。这些工作推动了跨架构比较,但未探究不同任务敏感重要性估计器在相同检查点上是否一致。 ##### 层角色、冗余性与深度依赖的任务使用 平行文献研究预训练模型中哪些层有用、冗余或具有任务特异性。ShortGPT(Men等,2025)表明许多Transformer层可在有限性能损失下移除;TELL-TALE(Naim等,2026)执行任务感知层消除;Song等(2026)论证深度对检索、知识和推理贡献不同;Yao等(2024)研究层重要性以实现内存高效PEFT。 Zhang等(2024)通过Shapley式消融识别“基石层”,发现早期层主导现象——我们在消融中复现此现象,但表明其在同一检查点的LoRA增量下消散。Nepal等(2025)报告消融识别为数学推理重要的层在预训练与训练后稳定存在。Shi等(2025)在对齐期间学习层重要性的二元掩码,观察到跨对齐数据集的高重叠,但所有研究基于单一估计器。 这些结果记录了*单一*估计器内的稳定性;我们记录正交事实:*跨*估计器时,“重要”层的身份本身会改变,且其是否改变是架构依赖的。 ##### 归因与重要性中的方法分歧 归因方法间的分歧是可解释性文献的已知发现。Adebayo等(2020)表明梯度显著性图在破坏网络行为的参数随机化中存活,证明梯度归因测量的内容与因果干预不同。Ancona等(2018)将基于梯度的方法统一为真实消融的不同保真度线性化;Sundararajan等(2017)证明无归因方法同时满足敏感性、实现不变性与完备性。Krishna等(2024)测量特征级归因分歧的幅度,并描述从业者解释如何随所选方法变化。 我们的贡献将分歧从特征归因转移至层排序,从单一架构转向Transformer/SSM对比,并将“高分辨率下的预期”转化为残差流梯度流的结构化可预测函数。 ## 3 层重要性诊断协议 我们的目标是确定常用层重要性估计器是否跨架构测量相同底层属性,还是其行为依赖于预训练依赖与适应动态的区别。因此,我们通过两个互补量研究层重要性:**必要性**与**可塑性**。 ##### 必要性 必要性衡量预训练模型在推理时对某层现有贡献的依赖程度。若绕过某层显著降低性能,则该层被视为必要的。对于具有层\(\{\ell_i\}_{i=1}^L\)的模型\(M\),定义层\(\ell_i\)在任务\(t\)上的必要性分数为: \[ \mathcal{N}(\ell_i; M,t) = \mathcal{L}\!\left(M_{\setminus\ell_i},t\right) - \mathcal{L}(M,t), \] 其中\(\mathcal{L}\)表示任务损失,\(M_{\setminus\ell_i}\)是绕过层\(\ell_i\)的模型。数值越大表明预训练计算越依赖该层。 ##### 可塑性 可塑性衡量模型在适应过程中吸收新信息的位置。它不量化对预训练计算的依赖,而是量化每层在任务特定微调中的变化强度。使用LoRA适应,定义层\(\ell_i\)的可塑性分数为: \[ \mathcal{P}(\ell_i; M,t) = \left\|\Delta W_i^{(t)}\right\|_F, \] 其中\(\Delta W_i^{(t)}\)是层\(\ell_i\)在任务\(t\)上学得的LoRA更新,\(\|\cdot\|_F\)表示弗罗贝尼乌斯范数。数值越大表明适应越集中于该层。 尽管这两个量常被混为单一的“重要性”,但它们捕捉根本不同的属性:必要性衡量预训练模型对现有计算的依赖,而可塑性衡量适应过程中对新信息的接纳度。因此,二者关系是实证与架构性问题。 为研究此关系,我们引入**必要性-可塑性对齐**(NPA \(\mathcal{NPA}\)),定义为必要性与可塑性诱导的层排序间的斯皮尔曼相关性: \[ \mathcal{NPA}(M,t) = \rho_{\mathrm{Spearman}}\bigl(R_{\mathrm{Nec}}(M,t), R_{\mathrm{Plast}}(M,t)\bigr), \] 其中\(R_{\mathrm{Nec}}\)与\(R_{\mathrm{Plast}}\)分别表示模型\(M\)在任务\(t\)上的对应层排序。 正NPA表明相同层同时具备必要性与可塑性;负NPA表明预训练依赖与适应集中于网络两端;接近零的值表明两种重要性概念间无稳定一致性。 此协议使我们能够独立于单一估计器跨架构比较层重要性结构。我们不问某一重要性度量是否普适正确,而是探究不同估计器是否持续与必要性或可塑性对齐,以及这些量之间的关系是否跨模型家族变化。 ## 4 Transformer与SSMs在层重要性上存在分歧 现在我们应用诊断
相似文章
@che_shr_cat: 1/ 标准Transformer有一个根本的拓扑缺陷:它们无法在不耗尽层数的情况下随时间跟踪动态状态…
这个帖子认为,标准Transformer存在一个拓扑缺陷:一旦状态表示到达顶层,它们就无法随时间更新信念,随着层数增加导致崩溃。
Transformer 中的世界建模
本文证明了 Transformer 可以具备可靠的内部世界模型,通过机制性分析表明其故障源于特征干扰而非不连贯的映射,并提出了“可供性打包”方法以提升性能。
句法 vs. 语义:Transformers如何学习深层依赖
本文介绍了一个机制框架,用于分析Transformer学习动态,识别出梯度饥饿是深层语义依赖的障碍,并验证了思维链策略对有效学习的作用。
重新审视Padded Transformer的表达能力:哪些架构选择重要,哪些不重要
这篇理论论文分析了填充Transformer的表达能力,表明与数值精度和模型深度相比,注意力类型、宽度和均匀性的影响很小。它建立了Transformer变体与电路复杂性类(如AC0和TC0)之间的等价关系,提供了稳健的特征描述。
语法的演变几何:Transformer层间的维度与邻域重组
本文研究了词元的语法角色如何影响Transformer表示的几何结构在各层中的变化,发现编码器和解码器模型中存在不同的演化模式。