XMerge:跨轴选择与重构层合并用于LLM深度压缩

arXiv cs.LG 论文

摘要

XMerge介绍了一种后训练方法,通过跨轴选择和重构重建来压缩基于Transformer的LLM,在激进的深度缩减下超越现有方法并保持性能。

arXiv:2609.02083v1 公告类型:新 摘要:移除完整的Transformer层保留了标准服务架构,但现有的深度压缩方法可能导致质量大幅下降,且损失在不同模型间不可预测。我们引入XMerge,这是一种后训练方法,包含两个组件。跨轴选择识别具有低相对幅度和角度隐藏状态变化的块,局部边界重构重新拟合相邻存活块以匹配原始两个块输出。XMerge不使用任务标签或端到端微调,也不引入架构更改或额外的推理时间参数。在七个Llama和Qwen骨干网络(0.5B-8B)、五个已发布的基线和三个层缩减级别上,它在最激进的移除下优势最大:在k=4时,在CORE(一个22任务聚合)上在七个骨干网络中排名六个第一,在MMLU上排名六个第一(同时在五个上第一),同时避免了几个竞争操作符的大幅困惑度增加。在任务级自举中,三个最大CORE差异的95%置信区间排除了零;其余差异与平局一致。在14个(模型,方案)单元中,它也是唯一一个从未崩溃的评估操作符,在零样本和上下文方案中都排名前二;在一个首次校准探测(一个骨干网络)中,它是最佳校准的操作符。消融研究表明,局部重构提供了大部分增益,而跨轴融合在两个选择轴不一致时有所帮助。额外的构建成本通过每个令牌解码节省在大约数万次请求后收回。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:14

# XMerge:基于跨轴选择与重构层合并的大语言模型深度压缩
来源:https://arxiv.org/html/2609.02083  
Jundong Hu††致谢:通讯作者 \(jundongh@alumni\.upenn\.edu\)\. Jundong Hu 领导并全程执行了该研究\.Shekar Ramachandran所属单位:PayPal AI邮箱:[sheramachandran@paypal\.com](mailto:)

###### 摘要
移除完整的Transformer层能保留标准的服务架构,但现有的深度压缩方法可能导致质量显著下降,且这种损失在不同模型上难以预测。我们提出XMerge,一种包含两个组件的后训练方法。跨轴选择识别在相对幅度变化和角度隐状态变化上均较低的块,局部边界重构则微调相邻的存活块以匹配原始两个块的输出。XMerge不使用任务标签或端到端微调,也不引入架构变更或额外的推理时参数。在七个Llama和Qwen骨干模型(0.5B–8B)、五种已发布基线方法以及三种层级缩减水平的测试中,其相对于基线的优势在最激进的移除时最大:当k=4时,在七分之六个骨干模型的CORE(一个包含22个任务的聚合指标)上排名第一,并且在七分之六个模型的MMLU上也排名第一(同时在七分之五个模型上两项均第一),同时避免了其他几种竞争算子导致的大幅困惑度增加。在任务级自举分析中,三个最大CORE优势的95%置信区间不包含零;其余优势与持平一致。在所有14个(模型,模式)单元中,它也是唯一一个从未崩溃的*已评估*算子,在零样本和上下文学习模式中均排名前二;在首次校准探针(一个骨干模型)上,它是校准最好的算子。消融实验表明,局部重构提供了大部分增益,而跨轴融合在两个选择轴不一致时提供帮助。额外的构建成本通过大约数万次请求后的每token解码节省得以回收。

## 1 引言
#### 动机。Transformer的深度决定了推理延迟和内存流量:解码在层上是顺序执行的,因此移除整个块可以减少墙钟时间和键值(KV)缓存流量。与需要稀疏感知内核的非结构化稀疏性或改变张量维度的宽度剪枝不同(Frantar and Alistarh (2023) (https://arxiv.org/html/2609.02083#bib.bib17));Sun et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib18));Ma et al. (2023) (https://arxiv.org/html/2609.02083#bib.bib19)),*深度*压缩移除整个层,同时保持隐藏大小、注意力、词汇表和服务接口不变,因此一个更浅的标准Transformer可以在标准基础设施上运行。但丢弃层可能导致不成比例的性能下降,先前的方法在压缩哪些层以及如何吸收被移除的层上存在分歧:是通过丢弃、平均、合并还是重构。
#### 深度压缩是先选择后合并。任何深度压缩方法都可以分解为一个*选择器*S(选择移除哪个块)和一个结构性的*算子*M(相邻块如何吸收它),C=M∘S。这种分解将两种失败模式分离开来:选择了一个重要的块,或者未能保留一个安全块及其邻居的组合映射。我们分别评估这两个错误来源。
#### 提出的解决方案。XMerge显式地实现了这两个决策。*跨轴选择*仅当一个块在相对幅度轴和角度轴上都“安静”时,才标记其为可安全移除。然后*重构合并*将该块与相邻邻居合并,用一个现有的标准Transformer块替换这对块,优化该块的现有参数以复现这对块的原始输出边界状态。这两个组件解决不同的退化来源:重构保留了所选对的局部映射,而跨轴选择减少了选择有害位置的可能性。
#### 贡献。  
- • 一种保留服务接口的重构合并算子。我们通过微调*一个现有的标准块*(其所有参数)来折叠相邻的块对,以复现该对块的原始输出映射,因此压缩后的模型仍然是一个普通的L−k层Transformer,没有新模块或额外的推理时参数。在此比较的所有算子中,它是唯一一个通过微调*一个完整的现有标准(非线性)块*进行重构的算子:最接近的无模块邻居ReplaceMe(Shopkhoev et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib10))将一个*线性*映射折叠到存活的权重中,学习替代剪枝(LLM‑Streamline(Chen et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib9)))添加一个新模块,而解析折叠(LaCo/MKA/SWM/CoMe)根本不使用激活拟合(表1 (https://arxiv.org/html/2609.02083#S2.T1),§3\.3 (https://arxiv.org/html/2609.02083#S3.SS3))。
- • 一种无参数的跨轴选择器和评估。我们将相对幅度轴和角度轴与最大值组合(C=M∘S,§3\.1 (https://arxiv.org/html/2609.02083#S3.SS1)),并在七个Llama和Qwen骨干模型、五种基线方法和三种压缩水平上进行评估,包含组件、模式、恢复、成本和延迟分析。XMerge在移除更多层时,相对于强基线越来越稳健,在匹配的推理成本下,并且是唯一一个在所有14个(模型,模式)单元中零模式崩溃的已评估算子(§5 (https://arxiv.org/html/2609.02083#S5)–§8 (https://arxiv.org/html/2609.02083#S8))。

## 2 相关工作
#### 深度压缩。层级丢弃方法如ShortGPT(Men et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib1))和块剪枝方法(Kim et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib2));Song et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib8));Zhong et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib7))通过激活或重要性标准移除Transformer块;基于幅度的分析如Prune&Comp(Chen et al. (2026) (https://arxiv.org/html/2609.02083#bib.bib13))研究了层移除引起的隐状态幅度差距,因此相对幅度选择信号在这类工作中有先例。LaCo(Yang et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib3))、MKA(Liu et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib4))和SWM(Ding et al. (2026) (https://arxiv.org/html/2609.02083#bib.bib5))解析合并或组合相邻参数,而CoMe(Wang et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib6))及相关方法添加特征对齐、蒸馏或训练替代模块。最相关的算子ReplaceMe(Shopkhoev et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib10))基于校准且无模块,但*线性化*被移除的块(一个线性映射折叠到存活的权重中);XMerge则微调一个完整的非线性存活块以匹配两个块的边界映射(下文将逐个算子对比)。我们使用“层合并”指代相邻层的深度压缩,而不是跨独立训练网络的模型合并(Wortsman et al. (2022) (https://arxiv.org/html/2609.02083#bib.bib20));Ilharco et al. (2023) (https://arxiv.org/html/2609.02083#bib.bib21))。
#### 定位。XMerge使用一个短暂的、层局部的后训练*校准*(自监督的MSE损失,拟合模型自身的合并前激活),而不是瞬时的结构性剪枝或端到端恢复。校准产生了一个其他方面都标准的更浅Transformer,类似于后训练量化(Frantar et al. (2023) (https://arxiv.org/html/2609.02083#bib.bib15));Lin et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib16));因此我们将其描述为后训练重构而非无训练压缩。针对稠密模型自身激活的局部重构是一种成熟的后剪枝范式(Wagner et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib11));van der Ouderaa et al. (2024) (https://arxiv.org/html/2609.02083#bib.bib12));§3\.3 (https://arxiv.org/html/2609.02083#S3.SS3))详述了我们保留服务接口的实现方式。
#### XMerge与先前算子的区别。表1 (https://arxiv.org/html/2609.02083#S2.T1)将XMerge与五种已评估基线方法以及两种我们未作为基线运行的相关方法进行了比较:最接近的无模块邻居ReplaceMe(Shopkhoev et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib10))和最接近的学习重构邻居LLM‑Streamline(Chen et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib9))。XMerge是唯一一个通过微调*一个完整的现有标准(非线性)块*以匹配相邻对输出的算子,同时保持被服务的模型为一个无模块的L−k层Transformer;解析折叠以闭式形式组合层,ReplaceMe将一个*线性*映射折叠到存活的权重中,而LLM‑Streamline拟合一个*新*模块。“梯度拟合”指的是算子本身;CoMe的蒸馏和SWM的低秩适配(LoRA)是单独的恢复阶段(设定B,§4 (https://arxiv.org/html/2609.02083#S4)),不属于算子的一部分。

表1:算子设计属性(非准确性)。规则线上方:五种已评估基线方法和XMerge;下方:ReplaceMe和LLM‑Streamline,仅作引用(未运行)。除LLM‑Streamline外,所有方法都产生一个普通的L−k层Transformer,零新增推理参数,因此它们在*如何*吸收被移除块上有所不同。“梯度拟合”是算子属性;CoMe的蒸馏和SWM的LoRA是单独的设定B阶段(§7 (https://arxiv.org/html/2609.02083#S7))。

## 3 方法:XMerge
图1:XMerge三个阶段。(1)根据在WikiText‑2激活上的相对幅度(RM)和块影响(BI)隐状态变化对每个块进行评分,并选择在*两个*轴上值都低的块;一个幅度变化低但角度变化高的块不会被选择。(2)通过无标签的300步局部激活匹配拟合,将对(fl, fl+1) (f_{ℓ}, f_{ℓ+1})重构为一个存活块f~l(\tilde{f}_{ℓ})。(3)部署一个标准的L−1层Transformer,零新增推理时参数。定义见§3\.2 (https://arxiv.org/html/2609.02083#S3.SS2)–§3\.3 (https://arxiv.org/html/2609.02083#S3.SS3)。

### 3\.1 深度压缩作为先选择后合并
图1 (https://arxiv.org/html/2609.02083#S3.F1)提供了XMerge的概述。一个Transformer应用块f1,...,fL (f_{1},\dots,f_{L}),其中块fl (f_{l})映射hl→hl+1 (h_{l}\\\!\\\to\\\!h_{l+1})。选择器S对每个单块转换进行评分,并标记一个块fl (f_{ℓ})进行移除;算子M随后用一个标准块f~l(\tilde{f}_{ℓ})替换相邻对(fl, fl+1) (f_{ℓ}, f_{ℓ+1})(原始映射hl+2 = fl+1(fl(hl)) (h_{ℓ+2}=f_{ℓ+1}(f_{ℓ}(h_{ℓ})))),使得h~l+2 = f~l(hl) (\tilde{h}_{ℓ+2}=\tilde{f}_{ℓ}(h_{ℓ})),因此C=M∘S。我们分别研究两种失败模式(§1 (https://arxiv.org/html/2609.02083#S1)):选择器见§6\.2 (https://arxiv.org/html/2609.02083#S6.SS2),算子见§6\.1 (https://arxiv.org/html/2609.02083#S6.SS1)。在k次合并后,模型有L−k个块,这是所有方法在相同k下的共同形状。

### 3\.2 选择器:跨轴融合(无参数)
#### 相对幅度轴。低RM:小残差位移;高RM:层强烈改变激活幅度。
RMl = Ex,t[∥hl+1(x,t)−hl(x,t)∥2 / (∥hl(x,t)∥2+ε)]。
\mathrm{RM}_{l}=\mathbb{E}_{x,t}\\\!\left[\;\\dfrac{\\lVert h^{\\(x,t\\)}_{l+1}\\-h^{\\(x,t\\)}_{l}\\rVert_{2}}{\\lVert h^{\\(x,t\\)}_{l}\\rVert_{2}+\\epsilon}\;\\right]。

#### 角度轴。低BI:方向变化小;高BI:层显著旋转表示。
BIl = Ex,t[1−⟨hl(x,t),hl+1(x,t)⟩ / (∥hl(x,t)∥2 ∥hl+1(x,t)∥2+ε)]。
\mathrm{BI}_{l}=\mathbb{E}_{x,t}\\\!\left[\;1\\-\\dfrac{\\langle h^{\\(x,t\\)}_{l},h^{\\(x,t\\)}_{l+1}\\rangle}{\\lVert h^{\\(x,t\\)}_{l}\\rVert_{2}\\,\\lVert h^{\\(x,t\\)}_{l+1}\\rVert_{2}+\\epsilon}\;\\right]。
这是ShortGPT(Men et al. (2025) (https://arxiv.org/html/2609.02083#bib.bib1))的块影响标准。我们将其复用为角度轴,并与相对幅度结合。重构算子是主要的方法论贡献;跨轴组合用作两个轴不一致时的保障。

#### 跨轴评分。两个轴都根据单个块fl (f_{l})的输入→输出转换进行评分。对每个合格层进行标准化,zlRM = (RMl−μRM)/(σRM+ε) (z^{\\mathrm{RM}}_{l}=(\\mathrm{RM}_{l}\\-\\mu_{\\mathrm{RM}})/(\\sigma_{\\mathrm{RM}}+\\epsilon)) 和 zlBI = (BIl−μBI)/(σBI+ε) (z^{\\mathrm{BI}}_{l}=(\\mathrm{BI}_{l}\\-\\mu_{\\mathrm{BI}})/(\\sigma_{\\mathrm{BI}}+\\epsilon)),并标记合格块中sl = max(zlRM, zlBI) (s_{l}=\\max\\\!\\left(z^{\\mathrm{RM}}_{l},\\;z^{\\mathrm{BI}}_{l}\\right))最小的块进行移除。一个块仅当幅度和角度变化都*不*大时才算“安静”。我们使用max(最大值)而不是平均值,因为平均值可能用一个轴上的小分数掩盖另一个轴上的大分数。此选择没有可调的权重系数。在报告的所有运行中未使用边界掩码:一个可选的保障措施禁止将首/尾块作为合并*目标*(源于层手术的边界敏感性(Hu and Ramachandran (2026) (https://arxiv.org/html/2609.02083#bib.bib14)))在每个报告的单元中都是*关闭*的,因为跨轴融合已经避免了会触发它的边界选择(§6\.2 (https://arxiv.org/html/2609.02083#S6.SS2));我们仅提及以说明不需要它。

### 3\.3 算子:重构深度折叠
剪枝后的局部激活匹配重构本身是一种成熟的范式(§2 (https://arxiv.org/html/2609.02083#S2));我们的新颖之处不在于局部重构*本身*,而在于其保留服务接口的实现方式。我们将*相邻两个块的映射蒸馏到一个现有的存活标准块中*,而不是一个学习的替代模块,因此压缩后的模型仍然是一个普通的、更浅的Transformer,没有插入模块。对于校准输入x,我们缓存该对的输入hl(x) (h_{l}(x)) 和原始输出hl+2(x) (h_{l+2}(x)),并保留该对中的一个成员作为存活块f~l(\tilde{f}_{l}):当两侧都可用时,选择具有更高相邻激活修补冗余分数Spatch (S_{\\mathrm{patch}}})一侧的邻居,以其自身的预训练权重初始化。此固定规则仅设定合并方向;我们不将其视为贡献或进行消融(§H (https://arxiv.org/html/2609.02083#A8),§8 (https://arxiv.org/html/2609.02083#S8))。然后我们优化其所有参数(注意力、MLP和归一化):minθ~l Ex[∥f~l(hl(x);θ~l)−fl+1(fl(hl(x)))∥22]。 \min_{\\tilde{\\theta}_{l}}\\;\\mathbb{E}_{x}\\\!\\left[\\;\\bigl\\lVert\\tilde{f}_{l}\\!\\left(h_{l}(x);\\tilde{\\theta}_{l}\\right)\\-f_{l+1}\\!\\left(f_{l}(h_{l}(x))\\right)\\bigr\\rVert_{2}^{2}\\;\\right]。优化使用Adam,300步,学习率…

相似文章

基于输出空间投影的模型合并

arXiv cs.LG

本文提出了一种新的模型合并框架,将问题转化为关于残差更新的凸二次规划,以最小化平方输出的校准目标。该框架涵盖现有的启发式方法,并提供了一种闭式诊断指标来预测合并质量,在语言和视觉基准测试中持续取得改进。

面向大型语言模型的卷积

arXiv cs.CL

本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。