超越嵌入转移:Grokking转移与稳定性中的组件角色

arXiv cs.LG 论文

摘要

本文研究了神经网络中Grokking的热启动转移中的组件角色,表明转移内部权重可以提高早期性能但存在不稳定性风险,并提出了稳定该过程的方法。

arXiv:2609.18078v1 Announce Type: new 摘要:热启动转移可以使算法任务快速泛化,然而目前尚不清楚哪些模型组件提供了这种增益,以及该增益在持续优化下是否保持稳定。我们研究了模块化算术上的跨算子转移,并将有效性(早期速度)与稳定性(达到后回撤)分开。在12个种子块(96次2^3因子设计加12次规模控制)中,进行了规模匹配的108次运行实验,转移内部注意力/MLP权重(B)以及令牌嵌入和读出头(E+U)可将早期准确率提高5.46个百分点(Holm p=0.0039),并将确认延迟缩短558步(Holm p=0.0088)。虽然读出头加内部块转移在1层模型中满足预设的±500步延迟等效标准(TOST p=0.0011,尽管在11/12配对种子中完全转移更快),一项前瞻性的2层复制研究证实了内部块优势(12/12种子,+704.67积分单位,p=4.88x10^-4),同时揭示了架构边界:省略供体嵌入会低于完全转移4475.6单位,超出±250单位的范围。持续的目标训练经常引发严重的Grokking后回撤。冻结转移的表征载体(E,U)几乎消除了离线回撤(19.40% -> 0.07%,Holm p=0.005859)。在线验证触发门控在2a+b上将真实最大回撤从22.06%降至0.60%(p=0.000488),前瞻性的确认扩展了对仿射、非线性二次和2层目标的保护(10.94-23.47个百分点的降低),区分了持续稳定与静态早期停止。在非阿贝尔群S_5中,未屏蔽的转移短暂激增(95.4%峰值),但一个前瞻性屏蔽组并未显示确认的益处(+0.15 ± 1.14个百分点)。这些结果确立了转移加速与轨迹稳定性之间的组件级分离,并揭示了参数屏蔽的经验边界。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:11

# 超越嵌入迁移:组件在理解迁移和稳定性中的角色
来源:https://arxiv.org/html/2609.18078

###### 摘要

热启动迁移可使算法任务快速泛化,但尚不清楚哪些模型组件提供了增益,以及该增益在持续优化下是否保持稳定。我们研究了模块算术上的跨算子迁移,并将*有效性*(早期速度)与*稳定性*(达到目标后的回撤)分离。在一项跨12个种子块、规模匹配的108次运行试验(包括96次\(23^3\)因子设计和12次规模控制运行)中,在迁移词嵌入和读出层(E+U)的同时迁移内部注意力/MLP权重矩阵(B),可将早期平均准确率提高5.46个百分点(Holm p=0.0039),并将确认延迟缩短558步(Holm p=0.0088)。虽然在单层模型中,读出层加内部块迁移满足预先指定的±500步平均延迟等效性标准(TOST p=0.0011,尽管在12对种子中完全迁移略微更快),但一项前瞻性的双层复现研究证实了内部块获取优势(12/12种子,+704.67积分单位,p=4.88×10⁻⁴),同时揭示了与架构相关的边界:省略供体嵌入会导致积分单位大幅下降4475.6,远超出预先指定的±250单位等效性范围。然而,持续的目标训练通常会引发严重的理解后复发。冻结迁移的表示载体(E, U)几乎消除了离线复发(19.40%→0.07%,Holm p=0.005859)。在线验证触发的门控将2a+b上的真实最大回撤从22.06%大幅削减至0.60%(p=0.000488),前瞻性验证在仿射、非线性二次方和双层目标上扩展了保护作用(降低10.94–23.47个百分点),同时区分了持续稳定化与静态早停。在非阿贝尔群S₅中,无防护迁移出现短暂激增(峰值95.4%),但前瞻性防护组未显示出确认的益处(+0.15±1.14 pp)。这些结果确立了迁移加速与轨迹稳定性之间组件层面的分离,并揭示了参数防护的经验边界。

## 1 引言

当使用权重衰减训练算法和代数推理任务时,过参数化神经网络通常表现出*理解现象*:训练损失几乎立即通过记忆降至零,但留出集的泛化延迟数千甚至数万个优化步(Power等,2022;Liu等,2022;Liu等,2023)。机制可解释性研究已证实,对于模块算术,延迟的泛化对应于在嵌入和注意力权重中逐步形成结构化的傅里叶乘法电路和循环表示流形(Nanda等,2023;Gromov,2023;Varma等,2023)。

图1:分离起飞速度与轨迹稳定性(N=10个块,230–239:60次确认性矩阵加10次探索性扩展)。(a) 测试准确率轨迹(±SEM)。完全迁移在第50步即达到90%,而表示条件需要250–500步。(b) 冻结E+U将峰值后复发率从19.40%降至0.07%(Holm p=0.005859)。探索性的full_carrier_frozen扩展结合了50步起飞和0.02%的复发率。最近,Xu等人(2025)证明,使用较弱模型学习的输入嵌入来初始化目标模型,可以加速算法任务的泛化。然而,在跨算子迁移中,仅关注输入表示仍遗留了一个问题:内部注意力/MLP权重矩阵(B)是否传递了独立的计算效用,以及热启动模型在持续优化过程中如何演变。实践中,无防护的微调常表现出急剧的理解后泛化复发,即初始增益被破坏而非单调细化。这引出三个具体问题:
1.  获取:内部注意力/MLP权重矩阵(B)是否在表示载体(E, U)之外提供了计算加速?这一需求是否随架构深度而变化?
2.  复发:热启动模型为何复发?在理解后泛化崩溃期间,哪些组件会同时发生退化?
3.  保护:针对参数层面的干预能否在不降低早期速度或最终精度的情况下抑制复发?这些保护措施在哪里会失效?
跨越这些问题,我们的核心见解是:*迁移加速和轨迹稳定性由不同的组件角色所主导*:内部注意力/MLP权重矩阵(B)对获取速度贡献显著,而防护表示载体则控制保留稳定性;随着深度增加,获取的载体需求变得依赖架构。我们的贡献如下:
1.  组件角色与架构依赖性:规模匹配的因子分解表明,内部块迁移提供了显著的增量获取加速(早期准确率+5.46 pp,Holm p=0.0039;双层复现中+704.67单位,p=4.88×10⁻⁴);然而,供体嵌入的作用随深度变化,在双层模型中省略供体嵌入会导致巨大的-4475.6单位的获取缺陷。
2.  获取与稳定性作为不同的生命周期属性:快速的热启动获取并不能保证在持续优化下的保留。在探究的一次复发中,因子状态替换将同时的功能缺陷主要定位在内部块,而线性读出层重拟合在谷底恢复了8.37–11.03个百分点,表明在表观泛化崩溃期间存在显著保留的线性解码能力。
3.  验证触发的载体防护及其边界:表示载体(E+U)防护强烈抑制离线复发(19.40%→0.07%,Holm p=0.005859),在线验证门控将2a+b上的最大回撤从22.06%大幅削减至0.60%(p=0.000488),并在仿射(+23.47 pp)和二次方(+10.94 pp)任务上产生一致收益。关键的是,我们识别了其经验边界:防护在双层模型中实现了确认的衰减但未完全保护(降低+15.35 pp,残余回撤65.23%),在非阿贝尔群S₅中未产生确认的益处(+0.15±1.14 pp)。

## 2 问题定义与双轨协议

### 2.1 任务定义与架构

我们研究了在两个经典代数设置下的算法迁移:(1) 阿贝尔模算术(p=113):源供体任务是模加法a+b(mod 113);目标任务是仿射模目标2a+b(mod 113)。序列格式为[a,b],预测标签c∈{0,...,p-1}。数据集包含113×113=12,769对,通过确定性舍入划分为20%训练集(N_train=2,554)、10%验证集(N_val=1,277)和70%测试集(N_test=8,938)。(2) 非阿贝尔对称群S₅:源任务是群乘法a∘b;目标任务是共轭运算a∘b∘a⁻¹。序列为两个操作数标记[a,b],其中a,b∈{0,...,119},预测置换索引c∈{0,...,119}。定义域包含120×120=14,400对,确定性划分为30%训练集(N_train=4,320)、20%验证集(N_val=2,880)和50%测试集(N_test=7,200)。模型采用标准的预层归一化Transformer(Power等,2022;Nanda等,2023),其中d_model=128,n_head=4,d_mlp=512。在完全因子迁移(或称完全二维权重迁移,记为full或E+U+B)中,网络迁移词嵌入(E)、读出矩阵(U)以及内部注意力/MLP权重矩阵(B),并对每个张量进行Frobenius范数匹配。位置嵌入、LayerNorm参数和MLP偏置保留其原生冷启动值(精确的参数张量映射和初始化约定详见附录B)。优化使用AdamW(Loshchilov & Hutter,2019),基础学习率η=10⁻³,权重衰减λ=1.0,动量β=(0.9, 0.98),批大小为512。确认性试验中的计算采用标准FP32精度(早期探索性扫描使用PyTorch AMP)。在载体冻结干预下,仅词嵌入W_E和读出头W_U被冻结(∇_θ=0);位置嵌入、LayerNorm和内部块保持完全可训练。

### 2.2 张量级尺度匹配(方向与幅值解耦)

为确保迁移收益反映参数*方向*而非任意的初始化*尺度*,种子块b中的所有目标初始化都与一个训练合格的供体检查点W_b^donor和一个原生冷启动W_b^cold配对。只有当源运行实现稳定的理解(定义为验证准确率在连续1000步持久性窗口内≥90%,即21次连续评估,间隔Δ=50),才被视为合格的供体检查点。在此21点持久性窗口精确完成时评估的供体检查点被保存并用作合格供体,供体优化在保存后立即终止,以防止事后峰值选择。对于任何迁移的参数张量θ,其方向被迁移,而其Frobenius范数被重新缩放以匹配原生冷启动:θ^transfer = (θ^donor / (‖θ^donor‖_F + 10⁻¹²)) · ‖θ^cold‖_F。这控制了张量级的Frobenius范数缩放差异,将参数方向从整体张量幅值中分离出来。

### 2.3 双轨评估指标协议

先前的迁移研究通常强调迁移是否*加速*学习,而这些增益在持续优化下的稳定性则较少被明确区分。我们将验证准确率A_val(t)与留出测试准确率A_test(t)区分开。测试准确率严格用于报告,从不用于控制触发、优化、超参数选择或确认性停止决策:

图2:组件定位与因子协同效应(N=12个正式块,210–221:96次因子运行加12次规模控制,共108次运行)。(a) 8个因子条件下的确认延迟RMST_30k(中位数和单个数据点)。完全迁移比表示迁移E+U加速确认+558.3步(Holm p=0.0088)。关键的是,同时迁移读出层和内部块(U+B)与完全迁移达到TOST等效(p=0.0011,Δ=-16.7步),而仅迁移内部块(B)在30k视野内未建立确认益处(p=0.50)。(b) 5k前准确率积分,证实完全迁移比E+U提供+5.46 pp更高的早期准确率(Holm p=0.0039)。

#### 有效性轨道(早期速度)

我们通过以下指标量化有效性:(1) 首次达到步t_reach = min{t: A_val(t) ≥ 0.90};(2) 5k前准确率积分I_5k = ∫₀⁵⁰⁰⁰ A_test(t) dt ∈ [0, 5000];以及(3) 全轨迹平均测试准确率Ā = (1/T) ∫₀ᵀ A_test(t) dt。

#### 稳定性轨道(保留与复发)

我们通过以下指标量化稳定性:(1) 21点持久性确认(H=1,000步,间隔Δ=50,要求A_val(t) ≥ 0.90在所有K=21次连续评估中)。对于每个种子块b,确认延迟为T_b,在统一的实验视界τ=30,000步处截断为min(T_b, τ)。在一组N个块中,受限平均生存时间由样本均值估计:RMST_τ̂ = (1/N) Σ_{b=1}^N min(T_b, τ) (1),假设在最大预算τ处进行管理删失;(2) 峰值后复发下降Δ_relapse = A_test(t_peak) - min_{t>t_peak} A_test(t)(离线阶段C的主要稳定性指标;最大回撤为补充指标);以及(3) 对于在线流式干预(§5.4–5.5),模型从在线验证触发步分叉:t_trig = min{t: A_val(t-Δ) ≥ q 且 A_val(t) ≥ q} (2),要求两次连续验证评估在间隔Δ=50下超过阈值q(模算术q=0.95;S₅ q=0.70)。在预先指定的触发后有限观察视界H步内(模算术组H=1,500;S₅组H=3,000),我们通过触发后真实最大回撤评估轨迹稳定性:D_H^trig = max_{t_trig ≤ t ≤ t_trig+H} [max_{t_trig ≤ s ≤ t} A_test(s) - A_test(t)] (3)。由于早停在t_trig处停止,其触发后回撤恒等为D_H^trig ≡ 0,与表2一致。

### 2.4 统计推断与家族错误率控制

所有成对比较均在配对种子块上使用精确的双向符号翻转排列检验(2^N完整枚举:阶段B中2^12=4,096;阶段C中2^10=1,024)。在阶段B中,家族错误率通过逐步Holm-Bonferroni程序(Holm, 1979)在α=0.05水平控制,分别针对预先指定的八个对比有效性家族(I_5k,表1)和……

相似文章

关于循环变换器中残差缩放:稳定性与可迁移性

arXiv cs.LG

本文分析了循环(权重共享)变换器中的残差缩放问题,表明权重共享需要比标准残差网络更强的缩放(1/N),并推导出一种因式参数化方法,使得超参数可以在不同循环次数之间迁移,无需重新调参。