训练即部署:弥合低秩克隆蒸馏中的MLP可达性鸿沟
摘要
本文提出一种通过训练完整部署矩阵来弥合低秩克隆蒸馏中MLP可达性鸿沟的方法,显著提升了token效率和模型性能,且不增加推理成本。
arXiv:2609.02006v1 公告类型:新研究
摘要:压缩后的学生模型存在两种形态,它们可能并不一致:其推理时部署的权重,与训练过程所能达到的权重族。我们表明,一种最先进的权重继承蒸馏器——低秩克隆——部署了全宽度的学生MLP,但将训练约束在由教师诱导的切片上,导致每个部署矩阵中62.5%-81.4%的独立线性自由度无法触及——推理时付出了算力,却从未被训练过。我们的核心原则只有一行:训练即部署。在完全相同的低秩克隆初始化之上,我们将训练目标设为整个部署的矩阵,部署的模型形状、参数数量和推理浮点运算次数均无变化,通过两种可合并的实现方式(Dense-LRC和CORE-LRC)达成,两者最终都合并为单一的部署权重。这恢复了搁置的容量:根据每个教师网络选择更强的实现方式,在三个教师网络上,相比参数预算相当的普通低秩克隆基线,平均9项任务得分分别提升了+2.36/+2.71/+10.45,其中在最宽的教师网络上收益最大,它仅用10B token(2倍token效率)即达到了原始方案约20B token时的精度;在该教师网络上,严格同源的分支仍能获得+6.39的提升,这是完全受控的对比结果。对照实验有力地表明,性能的提升应归因于扩大的可达权重集合,而非额外增加的参数或方案本身。通过约10B蒸馏token和简短的指令微调,一个半参数量的1.5B学生模型匹配了其约9T token教师模型在9项任务上的宏平均表现,处于评估噪声范围内,仅MMLU存在残余差距;而一个2.7B学生模型则以约900倍更少的蒸馏token,超过了Meta官方发布的Llama3.1-8B压缩模型(此处token数对比基于不同方案,非算力声明)。所有结果均基于低秩克隆主干上的单次种子运行。
查看缓存全文
缓存时间: 2026/09/03 06:14
# 在低秩克隆蒸馏中弥合MLP可达性差距
来源: https://arxiv.org/html/2609.02006
## 所训即所部署:在低秩克隆蒸馏中弥合MLP可达性差距
Zhifeng Li, Jie Zhou, Navan Preet Singh, Madalina Ciobanu, Chenghua Wang, Qingqing Mao\\corresponding, Ritankar Das
###### 摘要
压缩学生模型存在两种可能不一致的形态:其在推理时部署的权重,以及其训练过程所能达到的权重族。我们表明,一种最先进的权重继承蒸馏器——低秩克隆——部署了全宽的学生MLP,但将训练绑定到一个由教师诱导的子空间,导致部署矩阵中每个独立的线性自由度有62.5–81.4%无法被训练所触及——这些维度承担了推理成本,却从未被训练。我们的原则只有一条:所训即所部署。从相同的LRC热启动出发,我们将训练目标设为整个部署矩阵,在部署形态、部署参数数量或推理FLOPs均无改变的情况下,通过两种可合并的实现方式,两者都合并为单一的部署权重。这恢复了被搁置的容量:根据教师模型选择更强的实现,相比预算匹配的普通LRC基线,在三个教师模型上平均提升+2.36/+2.71/+10.45 Avg9(Llama3.2-3B, Llama3.1-8B, Qwen2.5-3B)。其中,在最宽的教师模型上增益最大,达到原始方案约20B tokens的精度仅需10B tokens(2倍token效率);在该情况下,严格同源分支仍能恢复+6.39,这是完全受控的数字。对照实验有力地支持将增益归因于扩大后的可达集,而非添加的参数或特定方案。从约10B蒸馏tokens加上简短SFT后,一个半参数量的1.5B学生模型在9任务宏平均上匹配其约9T tokens的教师模型,处于评估噪声范围内且存在残余的MMLU差距;一个2.7B学生模型在约900倍更少的压缩tokens下超越Meta官方的Llama3.1-8B压缩模型(该token计数是在不同方案下的压缩阶段数据,并非计算声明)。所有结果均基于LRC主干上的单次种子运行。
1Incept Labs, Houston, TX
2Titan Holdings, San Francisco, CA
通讯作者:Qingqing Mao
## 1 引言
系统领域有一个著名的原则:*训练/服务一致性*:你用于训练的流水线应与你用于服务的流水线相匹配。本文指出,一种最先进的权重继承蒸馏器违反了同一原则的权重层面版本——而修复它能带来大幅且免费的增益。
压缩学生模型存在两种可能不一致的形态:其在推理时*部署*的权重矩阵,以及其训练过程实际*可达*的矩阵族。低秩克隆部署了一个全宽的学生MLP,但将其训练绑定到一个由教师诱导的子空间,因此部署矩阵的大部分独立自由度被提供使用,却无法被优化器触及。我们的修复方案遵循相应原则——*所训即所部署*:将训练目标设为整个部署矩阵。从相同的LRC热启动出发,在部署形态不变的情况下,这使得一个半参数量的1.5B学生模型能够在9任务宏平均上匹配其约9T tokens的教师模型;一个2.7B学生模型在约900倍更少的压缩tokens下超越Meta官方的同源压缩模型;并且——在最宽的教师模型上,约束导致最多容量被搁置的情况下——一个1.7B学生模型相比匹配的10B tokens基线在Avg9上获得+10.45的增益,以一半的tokens达到原始方案约20B tokens的精度;所有这些都*零*额外推理成本(图1)。
图1:训练LRC完整部署MLP矩阵的token效率。Avg9(0-shot)与训练tokens(对数尺度)。从约10B*蒸馏*tokens(加简短SFT)开始,我们的学生模型(星号;每种设置下选择更强的实现:1.5B时为教师-谱66.21,2.7B时为典型稠密68.93)达到其约9T tokens的教师模型(Llama3.2-3B)和Meta官方的同源压缩模型;2.7B学生模型在约900倍更少的*压缩*tokens下超过官方Llama3.2-3B(该token计数是在不同方案下的数据;两者均支付教师模型自身的预训练成本)。从头训练的SLM模型(Qwen3-1.7B, SmolLM2)仅作为规模参考;外部点是在相同评估框架下发布的数值(§7)。
#### 任何压缩器都可能失败的审计。对于部署的权重,定义其*训练利用率*u为训练可达维度与其部署维度之比。差距(u<1)只有在能换来某种好处时才是合理的:LoRA式的适配器接受u<1以*保护*预训练内容;真正的结构化剪枝接受它是因为被删除的维度也从部署中移除了。LRC的MLP差距两者都不满足。它只压缩隐藏维度,并*继承*教师的MLP中间宽度d_ff:它部署一个d_ff × d_model(S)矩阵,但只写入一个d_model(T)维的教师列切片,因此u = d_model(T) / d_ff = 1/ρ。由于现代MLP很宽——我们的三个教师模型ρ值从2.67到5.375——这导致部署矩阵中每个独立的线性自由度有1-1/ρ = 62.5–81.4%无法被训练触及,却承担完整的部署成本(被搁置的是独立的*方向*,而非固定条目;形式化定义见§2)。最近的谱分析工作认为这种名义上的宽度大部分从未被有效使用;但“在初始化时很少使用”和“训练后变得无用”是不同的主张,只有干预实验才能将它们区分开。
#### 所训即所部署。贯彻这一原则是最简单的干预:从LRC热启动开始,训练完整的部署d_ff × d_model(S)矩阵,初始化使得学生模型*精确*起始于LRC模型,并能合并回完全相同的部署形态(图2)。我们通过两种*可合并*的方式实现它:一种是从合并的LRC热启动开始全量训练的普通稠密权重(Dense-LRC),另一种是同一完整矩阵的教师-谱重参数化(CORE-LRC, §4)——两者在零额外推理成本下合并为相同的部署权重。对照实验(§6)将原因归结于可达集本身:在狭窄的Llama教师模型上,一个典型稠密分支、一个随机环境补全以及教师基底重参数化都能恢复增益;合并后的权重保持了标准的部署形态和部署参数数量;一个完全等参数分支,其添加的坐标被限制在教师切片内——在未扩大可达集的同时添加了*相同*的可训练坐标和优化器状态——则*没有*恢复任何增益(在普通LRC的噪声范围内);并且切片→全量的增益在精简的*通用*方案(仅logit-KL,随机初始化)下持续存在,因此它是方案无关的,而非LRC目标函数的产物。在最宽、条件最差的教师模型上,两种实现方式出现分化:教师-谱基底在固定预算下实现了更大幅度的*相同*扩展(+10.45 vs. +6.39 Avg9;§5),使得CORE-LRC成为压缩最困难场景下的首选实现(基底条件分析见补充材料)。
#### 贡献。
- • LRC中部署与训练可达集之间的差距,并使其可审计。我们通过训练利用率u来刻画压缩权重,并展示LRC的MLP处于u=1/ρ:部署族{TZᵀ}是ℝ^(d_ff × r)的严格子集,将每个部署矩阵中62.5–81.4%的独立自由度在完整推理成本且无部署节省的情况下搁置——这种差距与LoRA或真正剪枝的不同,它换不来任何好处(§2)。
- • 所训即所部署,并受控归因。从相同的热启动开始训练完整的部署矩阵,在零额外推理成本下恢复搁置容量:相比预算匹配的普通LRC基线,在三个教师模型上平均提升+2.36/+2.71/+10.45 Avg9(根据教师选择更强的实现,表1);严格同源稠密分支单独给出+2.23/+2.71/+6.39),在最宽的教师模型上达到2倍token效率,且一个半规模1.5B学生模型匹配其教师的宏平均。对照实验将原因归结于扩大的集合:全矩阵参数化恢复了它;*部署*形态和参数数量不变(训练时可训练参数从rH增至d_ff r——恰好被等参数对照匹配);长预算扫描排除了仅是更快收敛的可能性;一个等参数、切片限制分支*没有*恢复任何增益;增益在精简的通用方案下持续存在;占用/敲除显示打开的方向被使用(§6)。
表1:训练部署矩阵 vs. 匹配的普通LRC基线(10B PT, Avg9, 0-shot; Avg9是9个任务(包括MMLU,排除MathQA)的平均值)。全MLP LRC有两种可合并的实现——典型Dense-LRC和教师-谱CORE-LRC——在零额外推理成本下合并为相同的部署权重,且在Llama上表现*相当*(基底无关性);每行报告每个教师下更强的实现(Llama3.2-3B和Qwen上为教师-谱,Llama3.1-8B上为稠密)。在最宽的教师(Qwen)上,教师-谱实现达到63.44,以一半的tokens匹配原始约20B tokens基线;它与匹配对属于不同的训练序列,其同源稠密分支恢复+6.39(59.38)——这是完全受控的归因证据(§5)。
## 2 继承的宽度及其搁置的补集
LRC仅压缩隐藏维度d_model,并*继承*教师的完整中间宽度d_ff,但仅训练每个MLP投影的d_model(T)维教师切片。我们的三个教师模型的ρ = d_ff / d_model分别为2.67、3.50和5.375,因此继承但未训练的部分很大且依赖于教师。对于一个满列秩的门/上投影W ∈ ℝ^(d_ff × d_model),训练不可达的正交补空间维度为d_⊥ = d_ff - d_model,占中间空间的比例为f_⊥ = d_⊥ / d_ff = 1 - 1/ρ (1),在ρ=2.67时为62.5%,ρ=3.50时为71.4%,ρ=5.375时为81.4%。这限定了一个非方阵投影中被排除的*矩阵自由度*,而非未使用的神经元(SwiGLU乘积混合了门和上的输出)。这些方向是无用的还是未使用但可用的,只有在将其打开并测量恢复了多少才能确定——这正是本文所做的干预。
###### 命题1(可达性差距)
设ℋ_deploy = ℝ^(d_ff × r)为学生投影的一个部署假设空间(r = d_model(S)),ℛ_LRC = {TZᵀ} ⊊ ℋ_deploy为LRC参数化(T冻结)的可达集。*可达性差距*𝒢 = ℋ_deploy \ ℛ_LRC 是确定性的:由参数化固定,对于任何初始化、目标函数或优化器均成立。可达性关注*优化可及性*,而非表征能力:部署形态可以携带任何W ∈ ℋ_deploy,且推理成本相同,但训练只会产生ℛ中的一个成员。ℛ中的成员资格与优化器无关;一个*有限预算*优化器达到ℛ的多少也取决于其坐标(AdamW不是旋转不变的;Zhang et al. 2025)——第一层承载结构性主张(§6),第二层仅在最宽的教师模型上显现(§5.2)。
## 3 相关工作
#### 压缩蒸馏与剪枝。知识蒸馏是DistilBERT、TinyBERT、MiniLM以及生成式LLM的序列级目标的基础。低秩克隆是我们构建的基础,它通过低秩投影联合软剪枝教师权重并克隆教师激活,用约20B tokens匹配万亿token训练的模型。另一条互补路线*移除*容量:基于蒸馏的重训练进行结构化剪枝以削减深度和宽度,包括MLP中间维度,如Minitron和Sheared LLaMA。这种对比是我们的出发点:宽度剪枝*删除*中间维度,而LRC*继承*教师的d_ff以对抗较小的d_model;我们将由此产生的结构补集视为待填充的储备,而非浪费。
#### 并发诊断,以及增长的二元性。RED诊断了同一投影蒸馏家族中的另一种失败:隐藏表示的有效秩崩溃,通过激活感知的通道选择*初始化*来修复,之后训练仍在投影族{TZᵀ}*内*进行。我们则识别了一个*确定性参数化差距*(即§2中的𝒢)并移除了族约束本身。这两个轴在我们的数据中经验上是可分离的:那种风格的激活感知通道直通初始化在Qwen目标上价值+0.68 Avg9,而在相同预算下打开可达集则恢复+6.39到+10.45(§5.2);表示秩统计量与增益分离(§6.4)。谱缩放分析报告FFN宽度利用不足,且可用容量取决于优化器。相似文章
让知识蒸馏的成本低到足以大规模运行
Multiverse Computing 发布了一篇论文,介绍如何通过离线 top-K logits 和融合的分块 KL 损失来降低 LLM 知识蒸馏的成本,从而减少大规模蒸馏时的显存占用。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。
TallyTrain: 通信高效的联邦蒸馏
本文介绍了TallyTrain,一种通信高效的联邦蒸馏方法,该方法仅传输每个探针的argmax类索引(硬标签共识),而非完整的softmax向量,从而将带宽减少多达三个数量级,同时匹配或超越软标签蒸馏的性能,并帕累托优于FedAvg、FedProx和FedDF等标准联邦学习基线。
用于大语言模型后训练的蒸馏强化学习
介绍了蒸馏强化学习,一种使用教师模型为大模型后训练提供细粒度的词元级梯度信号的方法,结合了强化学习和知识蒸馏。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。