连接胜过混合:不同Transformer规模之间迁移了什么——以及什么没有迁移
摘要
本文研究了同一系列(Pythia)中不同规模Transformer模型之间迁移的内容,表明表示对齐而权重不对齐,并且通过初始化而非直接权重投影进行转换效果最佳。
arXiv:2608.02829v1 公告类型:新
摘要:模型家族从头训练每种规模。能否将预训练的大模型转换为较小的同类模型?我们端到端地刻画了Pythia家族中1.4B->410M的转换:(i)跨规模的表示强烈对齐(岭回归R^2=0.84),而参数对齐较弱;(ii)稠密权重投影在功能上具有破坏性——可证明不是组装伪影——因为基混合破坏了旋转位置编码、每头、GELU和LayerNorm结构;(iii)在最佳拟合线性算子之后,权重残差在洗牌控制下与噪声在统计上无法区分;(iv)因此,转换价值存在于初始化中。在匹配预算的持续预训练中,我们将转换分解为两个独立的杠杆——最小二乘补偿(功能:最佳零样本表现)和保持方差的重新缩放(动态:最佳终点)。补偿是token高效、低预算的胜利,而非普遍胜利:在30M token下,它在宽度缩减对(84.0 +/- 1.8 vs. 89.7 +/- 3.7,3/3种子)和保留的深度缩减对(109.3 vs. 117.9,3/3种子)上都击败了最强子克隆变体,用更少的token达到给定质量;在33倍更大的预算下,两者趋同于持平(40.0 vs. 40.0),都远超从头训练,而迁移初始化始终击败从头训练——在低预算下最多达18倍,差距在收敛时和最大规模处缩小。我们进一步描绘了该方法的边界:在约5倍供体规模(6.9B->1.4B)时,叠加两个杠杆会过度校正,我们将其追溯到大规模宽度下补偿求解的病态条件,指出维度感知正则化是修复方法。代码、检查点和冻结评估语料库已发布。
查看缓存全文
缓存时间: 2026/08/05 07:42
# 不同 Transformer 尺寸之间有什么能迁移——以及什么不能
来源:https://arxiv.org/html/2608.02829
## 配线胜过混合:不同 Transformer 尺寸之间有什么能迁移——以及什么不能
###### 摘要
模型家族会从零开始训练每一个尺寸。能否将一个预训练大模型转换成更小的同族模型?我们端到端地表征了 Pythia 家族中的 1.4B→\to410M 转换:(i) 表示在不同尺寸间强对齐(岭回归 R2=0.84R^{2}=0.84),而参数对齐较弱;(ii) 稠密权重投影在功能上具有破坏性——可证明不是组装伪影——因为基混合破坏了 rotary、逐头、GELU 和 LayerNorm 结构;(iii) 在最佳拟合线性算子之后,权重残差在洗牌对照下与噪声在统计上不可区分;(iv) 因此转换的价值在于*初始化*。在匹配预算的持续预训练中,我们将转换分解为两个独立杠杆——最小二乘*补偿*(功能:最佳零样本)和方差保持*重缩放*(动力学:最佳终点)。补偿是一个*令牌高效、低预算*的胜利,而非普适胜利:在 30M 令牌时,它在宽度缩减配对(84.0±1.884.0\pm 1.8 对 89.7±3.789.7\pm 3.7,3/3 种子)和留出深度缩减配对(109.3109.3 对 117.9117.9,3/3 种子)上都击败最强的子克隆变体,以更少令牌达到给定质量;在 33×33\times 更大的预算下,两者*收敛到持平*(40.040.0 对 40.040.0),同时都远超从零开始——后者在低预算下总是被迁移初始化击败,最多达 18×18\times,差距在收敛时和最大规模处收窄。我们进一步*绘制该方法的边界*:在约∼\sim5×\times 供体规模处(6.9B→\to1.4B),叠加两个杠杆会过度校正,我们将其追溯到补偿求解在大宽度下的病态性,并指出维度感知正则化是修复方案。代码、检查点和冻结评估语料库已发布。
## 1 引言
Transformer 家族以离散尺寸的阶梯形式发布——仅 Pythia 就从 70M 跨越到 12B 参数(Biderman et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib3))——因为不同的部署预算需要不同的模型。在当前的实践中,每一级都是单独购买的:每个尺寸都是一次完整的预训练运行,有自己的 GPU 和能源账单,尽管家族成员在相同数据上使用共享分词器和架构训练,仅宽度和深度不同。从构造上看,这些同族模型是同一问题在不同容量下的解;从零开始训练每一个,相当于把它们当作互不相关。本文提出的问题,其成本让阶梯变得实际,其构造让阶梯变得可解:*同一预训练模型家族的两个尺寸之间,到底有什么能迁移——又通过什么操作能将其带入更小的形状?*
我们在 Pythia 套件上端到端地回答,其中相同的数据和分词器将尺寸隔离为唯一变量(§3 (https://arxiv.org/html/2608.02829#S3)),分四步进行。首先,我们定位跨尺寸关系(§4 (https://arxiv.org/html/2608.02829#S4)):较小模型的激活在很大程度上是较大模型的线性像(留出岭回归 R2=0.84R^{2}=0.84),而其权重则不是。其次,我们诊断为什么将大权重稠密投影到小形状在功能上具有破坏性(§5 (https://arxiv.org/html/2608.02829#S5)):一个比特精确的对照排除了组装问题,剩下的就是投影数学本身,其基混合破坏了 rotary、逐头、GELU 和 LayerNorm 结构。第三,最佳拟合线性算子所遗漏的东西,在洗牌对照下与噪声不可区分(§6 (https://arxiv.org/html/2608.02829#S6)),因此不存在零样本修复。转换价值因此必然存在于*初始化*中,第四步是一场匹配预算的恢复竞赛(§7 (https://arxiv.org/html/2608.02829#S7)),将转换分解为两个独立杠杆,作用于尊重结构的选取之上——闭式最小二乘*补偿*(修复网络计算的内容)和方差保持*重缩放*(修复优化器看到的尺度)——二者作用于不相交的权重路径,可以叠加。
我们的贡献是:
- •对跨尺寸迁移内容的受控表征。在同一家族、相同数据训练下,表示在线性映射下强对齐(留出岭回归 R2=0.84R^{2}=0.84),而参数对齐较弱(在最干净的嵌入情形下 R2=0.25R^{2}=0.25–0.390.39)——本文其余部分围绕这一差距展开(§4 (https://arxiv.org/html/2608.02829#S4))。
- •对稠密投影为何失败的机械验证诊断。从自身提取的权重重建供体模型,能够比特精确地复现其 logits,因此投影模型的崩溃可完全归因于基混合:稠密映射破坏了 rotary 配对、逐头注意力、逐元素 GELU 和逐特征 LayerNorm——其中 LayerNorm 是最大的单一因素(§5 (https://arxiv.org/html/2608.02829#S5))。
- •在对照下的零结果。在最佳拟合线性算子之后,权重残差不携带跨层方向、无可补丁可学习的信号、也无跨配对迁移(谱、一致性、可学习性、迁移检验对照洗牌,带 bootstrap CI,p≥0.99p\geq 0.99):在该粒度上不存在学到的零样本修正(§6 (https://arxiv.org/html/2608.02829#S6))。
- •转换的双杠杆分解,以及叠加它们的方法。在匹配预算下,最小二乘补偿是*功能*杠杆(最佳零样本),方差保持重缩放是*训练动力学*杠杆(最佳终点);二者的组合——补偿式选取——在两条轴线和每个种子上都优于权重子克隆的最强变体(Samragh et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib12))(最终困惑度 84.0±1.884.0\pm 1.8 对 89.7±3.789.7\pm 3.7,3/3 配对胜;零样本 18.518.5k 对 61.961.9k),并在 30M 令牌时比从零开始好 18×\times;该排序在域外和 2×2\times 训练上下文处依然成立,且相对从零开始的优势(∼\sim13×\times)以三个种子推广到一个留出的深度主导配对(§7 (https://arxiv.org/html/2608.02829#S7))。
## 2 相关工作
##### 预训练模型降规模。
最接近的先前工作是 Weight Subcloning(Samragh et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib12)),它通过对较大预训练模型的单元进行排序、复制所选行和列并重缩放,来初始化一个较小的 transformer——确立了基于选取的初始化能加速目标尺寸的训练。Sheared LLaMA(Xia et al.,2024 (https://arxiv.org/html/2608.02829#bib.bib16))在持续预训练中联合学习结构化剪枝掩码,仅用从零开始计算量的一小部分;它优化整个流水线,而我们则在不同臂之间固定训练配方,并单独隔离*初始化*本身所贡献的部分。我们的闭式补偿属于“剪枝加重建”谱系——调整幸存的权重以吸收被移除权重的功能,从 Optimal Brain Surgeon(Hassibi & Stork,1993 (https://arxiv.org/html/2608.02829#bib.bib6))到结构化 LLM 剪枝如 LLM-Pruner(Ma et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib10))——在转换时以闭式一次性应用。知识蒸馏(Hinton et al.,2015 (https://arxiv.org/html/2608.02829#bib.bib7))通过教师输出传递功能,需要一次完整的训练运行;我们研究的是互补问题:以可忽略的成本通过*权重*传递什么,且二者可以组合。
##### 增长预训练模型。
镜像方向——从较小模型初始化一个*较大*模型——有更长的历史:Net2Net(Chen et al.,2016 (https://arxiv.org/html/2608.02829#bib.bib5))引入了保函数加宽和加深,bert2BERT(Chen et al.,2022 (https://arxiv.org/html/2608.02829#bib.bib4))将其适配到 transformer,分阶段训练(Shen et al.,2022 (https://arxiv.org/html/2608.02829#bib.bib13))形式化了保持损失和动力学的增长算子,LiGO(Wang et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib15))则学习从小权重到大初始化的结构化线性映射。线性算子向上传递有用信号,这与我们的发现一致:向下时,即使是拟合的稠密投影也远比随机初始化好;我们记录的对称性破缺是,稠密基混合破坏了选取所保留的 rotary、逐头和归一化结构(§5 (https://arxiv.org/html/2608.02829#S5))。
##### 表示相似性与参数对称性。
我们的分析使用标准相似性工具:CKA(Kornblith et al.,2019 (https://arxiv.org/html/2608.02829#bib.bib8))和 SVCCA(Raghu et al.,2017 (https://arxiv.org/html/2608.02829#bib.bib11))度量表示对齐,模型拼接(Lenc & Vedaldi,2015 (https://arxiv.org/html/2608.02829#bib.bib9); Bansal et al.,2021 (https://arxiv.org/html/2608.02829#bib.bib2))通过训练好的适配器测试功能互换性。关于置换对称性和模型合并的工作(Ainsworth et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib1))表明,网络通常是在架构不变的变换*模*下进行比较。我们的“选取对混合”结果就是同一原理的一个实例:结构化选取组合了一个置换——架构对称群的一个元素,并限制为尊重头边界和 rotary 频率对(Su et al.,2024 (https://arxiv.org/html/2608.02829#bib.bib14))——以及坐标删除,因此每个幸存单元保持架构赋予它的精确非线性与位置语义;稠密投影混合坐标,离开该群,并因此受到惩罚。
##### 定位。
上述每个要素都单独存在过:基于选取的初始化、最小二乘重建、线性增长算子、表示相似性。新的在于*情境*——在同一家族、相同数据训练下的尺寸间转换,消除了数据和分词器混淆——加上 rotary 频率匹配选取,以及从表示对齐到投影诊断、残差零检验再到匹配预算竞赛的受控端到端表征。由于我们的子克隆基线重新实现了 Samragh et al. (2023 (https://arxiv.org/html/2608.02829#bib.bib12)) 的配方,我们披露三个保真度差异,并将其标记为*子克隆风格*:(a) 我们按权重范数给注意力头和 MLP 单元打分、按激活方差给残差通道打分,而他们按激活幅度打分;(b) 当深度必须缩减时,我们以均匀步长移除块,而不是从中间移除;(c) 我们直接评估他们的d/d′\sqrt{d/d^{\prime}} 权重重缩放,而不是全盘采用(§7 (https://arxiv.org/html/2608.02829#S7))——将其应用于每个矩阵会摧毁零样本质量,因为 LayerNorm 已经重新归一化了大多数读取路径,而其方差保持动机恰好适用于没有范数保护的投影,也正是我们补偿所重新拟合的两个家族。
## 3 实验设置
##### 模型家族与转换配对。
我们研究 Pythia 套件(Biderman et al.,2023 (https://arxiv.org/html/2608.02829#bib.bib3)):在相同数据(Pile)上训练、共享同一分词器的 GPT-NeoX 模型,从而将*尺寸*隔离为家族成员之间的唯一变量。我们的主要配对转换 1.4B→\,\to\,410M(两者都是 24 层、16 头;只有宽度缩小:残差 2048→10242048\!\to\!1024,头维度 128→64128\!\to\!64,MLP 8192→40968192\!\to\!4096),因此层对应是一对一的,分析隔离了宽度。一个留出配对 410M→\,\to\,160M 则覆盖其他轴:深度减半(24→1224\!\to\!12 块),头*数量*下降(16→1216\!\to\!12;头维度不变),宽度削减温和(约∼\sim25%)。第三个配对 6.9B→\,\to\,1.4B 测试规模(三个轴都缩减;§7 (https://arxiv.org/html/2608.02829#S7))。
##### 冻结评估语料库。
所有表示分析都用*相同*输入探测每个模型:来自 Pile(pile-uncopyrighted)的 10,000 条 128 令牌序列,分词一次并为本项目冻结。前 500 条序列(所有令牌位置)构成相似性子集(§4 (https://arxiv.org/html/2608.02829#S4));其余部分贡献均值池化和最后令牌激活。持续预训练流式使用同一语料库,但跳过冻结集区域(污染防护),每个种子使用不相交的流偏移训练。
##### 行为评估。
语言建模质量是 WikiText-103 验证集上的跨步滑窗困惑度(每个令牌计一次)。加固评估增加 C4 困惑度(域外)、2×2\times 训练上下文(2048)处的困惑度,以及通过 lm-eval 在 LAMBADA、ARC-Easy、HellaSwag 和 PIQA 上的零样本准确率。参考模型锚定每个表格;锚点分数与已发布 Pythia 数值一致。所有前向传播都是贪心且带种子的,重复时比特一致;权重提取通过精确重建验证(头感知 QKV 拆分/重新融合达到比特级一致;用自身提取权重重建的模型以零差异复现原始 logits,§5 (https://arxiv.org/html/2608.02829#S5)),因此下游质量变化可归因于转换数学,而非组装。
##### 训练协议。
实验内的每个转换臂共享*相同*的数据顺序、优化器、余弦调度和令牌预算,因此实验内各臂的唯一差异是起始权重;初始化构造相对于任何训练预算都可忽略。完整超参数、预算和硬件见附录 C (https://arxiv.org/html/2608.02829#A3)。
## 4 表示对齐,参数不对齐
尺寸转换预设了两个家族成员彼此相关;问题在于关系*存在于哪里*。在主要纯宽度配对(1.4B→\,\to\,410M,深度和头数相同;§3 (https://arxiv.org/html/2608.02829#S3))上,我们测量了两个模型计算的表示以及它们存储的参数中的关系,结果只在一处发现它。
##### 层对应在 CKA 下饱和。
所有 24×2424\times 24 层对之间的线性 CKA(相似性子集,所有令牌位置;§3 (https://arxiv.org/html/2608.02829#S3))给出对角均值 0.8830.883,但只有 12.5%12.5\% 的层将它们的单个最佳匹配放在对角线上。热图是一个大的饱和块(App. Fig.2 (https://arxiv.org/html/2608.02829#A1.F2),左)——第 0–2 层是独特的,中间带(层∼\sim4–22)彼此≈1.0\approx 1.0,第 23 层独特——因此线性 CKA 只确认了*粗略*的早/中/晚对应(中间带饱和是该度量已知的局限)。这激发了一个有方向性的映射:小模型表示中有多少是来自大模型的线性像?
##### 激活在宽度上大体是线性像。
在每一层,我们在池化激活上拟合一个大→\,\to\,小映射(8k 训练 / 2k 留出),并在两个算子下评分留出 R2R^2:*Procrustes*(旋转加一个全局尺度)和*岭回归*(一个完整线性映射 2048→10242048\!\to\!1024)。岭回归达到平均留出 R2=0.844R^{2}=0.844(App. Table3 (https://arxiv.org/html/2608.02829#A1.T3)):410M 的池化表示在很大程度上是 1.4B 的线性投影,捕获了留出方差的 84%84\%。Procrustes 已经达相似文章
关于循环变换器中残差缩放:稳定性与可迁移性
本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。
重新审视Padded Transformer的表达能力:哪些架构选择重要,哪些不重要
这篇理论论文分析了填充Transformer的表达能力,表明与数值精度和模型深度相比,注意力类型、宽度和均匀性的影响很小。它建立了Transformer变体与电路复杂性类(如AC0和TC0)之间的等价关系,提供了稳健的特征描述。
什么是 Looped Transformers?清晰解释(8分钟阅读)
Looped transformers 在多次传递中重复使用相同的层,以参数数量换取计算量,用更少的权重实现更好的推理。文章追溯了这一想法到 Universal Transformer (2018),并解释了其最初因扩展定律和时机而失败的原因。
Transformer 以不擅长算术而闻名,所以我手动设置了它的权重(无需训练),它实现了 100% 准确的乘法 [P]
作者使用名为 Torchwright 的编译器手动编写 transformer 权重(无需训练)来实现精确乘法,在三位数运算上达到 100% 准确率,并发布了可处理最多 12 位数乘法的检查点。
现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计
本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。