超越前一层:稀疏MoE路由中的残差预测结构
摘要
本文研究稀疏混合专家模型中早期专家选择在超越最近层后的预测价值,发现跨层路由预测有显著增益。
arXiv:2609.17940v1 Announce Type: new
摘要:稀疏混合专家模型通过一系列专家选择来路由每个令牌。我们探究是否最近的选择足以概括这一轨迹来预测下一个路由器。使用冻结的OLMoE和JetMoE模型,我们在保留最近选择作为共同基线的同时,测量早期专家选择的留出预测增益。在OLMoE中,将历史从一层扩展到十一层,路由器对数的$R^2$从0.59879提升到0.66544。一项预注册的JetMoE复现在两个目标深度下产生四层增益0.14275和0.20528,配对自举区间高于零。这些增益在非线性解码中得以保留:将历史添加到小型多层感知机中,$R^2$提升0.17137和0.21861,而非线性解码最近状态仅比线性探测器增加0.00139和0.00936。参数匹配的控制保留了优势,并且交叉拟合的历史残差预测目标残差的$R^2$为0.20549和0.23556。这些发现识别了专家选择轨迹中超越相邻层持续性的残差预测结构。
查看缓存全文
缓存时间: 2026/09/17 09:05
# 超越前一层:稀疏MoE路由中的残差预测结构 来源:https://arxiv.org/html/2609.17940 \\paperurl https://github\.com/withfanta/moe\-routing\-dynamics/tree/main/code 李浩 归属:信息学系,信息与工程研究生院,电子通信大学,东京,日本 源代码:https://github.com/withfanta/moe-routing-dynamics/tree/main/code 原田泰行 归属:信息学系,信息与工程研究生院,电子通信大学,东京,日本 源代码:https://github.com/withfanta/moe-routing-dynamics/tree/main/code 清优一\* 归属:信息学系,信息与工程研究生院,电子通信大学,东京,日本 源代码:https://github.com/withfanta/moe-routing-dynamics/tree/main/code ###### 摘要 稀疏混合专家模型通过一系列专家选择来路由每个令牌。我们探究前一个选择是否足以概括这一轨迹以预测下一个路由器。使用冻结的OLMoE和JetMoE模型,我们在保留最新选择作为共同基线的前提下,测量更早专家选择带来的留出预测增益。在OLMoE中,将历史从一层扩展到十一层,路由器logit的R²从0.59879提高到0.66544。一个预先注册的JetMoE复现实验在两个目标深度处取得了0.14275和0.20528的四层增益,其配对自助法区间均大于零。这些增益在非线性解码下得以保持:向一个小型多层感知机添加历史记录,R²提高了0.17137和0.21861,而仅对最近状态进行非线性解码,相比线性探测器仅提高了0.00139和0.00936。参数匹配的对照实验保持了这一优势,并且交叉拟合的历史残差预测目标残差的R²分别为0.20549和0.23556。这些发现揭示了专家选择轨迹中存在超越相邻层持续性的残差预测结构。 11脚注文本:通讯作者:清优一。电子邮箱:[r2540015@gl\.cc\.uec\.ac\.jp](mailto:[email protected]);[tahara@uec\.ac\.jp](mailto:[email protected]);[seiuny@uec\.ac\.jp](mailto:[email protected])。 ORCID:李浩,0009\-0004\-2623\-286X (https://orcid.org/0009-0004-2623-286X);原田泰行,0000\-0002\-1939\-4455 (https://orcid.org/0000-0002-1939-4455);清优一,0000\-0002\-2552\-6717 (https://orcid.org/0000-0002-2552-6717)。 ## 1引言 一个令牌在稀疏混合专家模型中穿行,会获得一个跨越深度的专家选择轨迹。紧邻的前一个选择为该轨迹提供了一个自然的概括。一旦这个最近状态可用,更早的选择中还保留着多少预测结构?回答这个问题可以区分相邻层的持续性与更深层路由历史的额外价值。 跨层路由结构已启发了分析和架构设计。Read-ME将路由与主干解耦以支持预门控\[1 (https://arxiv.org/html/2609.17940#bib.bib4)\];RMoE跨层传播递归路由状态\[2 (https://arxiv.org/html/2609.17940#bib.bib3)\];PathMoE在连续块内共享路由器参数\[3 (https://arxiv.org/html/2609.17940#bib.bib5)\]。Labzin等人对齐路由器控制子空间并研究共享的线性动力学\[4 (https://arxiv.org/html/2609.17940#bib.bib6)\]。专家路径在MoE强化学习中也被记录和重放\[5 (https://arxiv.org/html/2609.17940#bib.bib7)\],而HeRo使用路由历史进行动态层跳过\[6 (https://arxiv.org/html/2609.17940#bib.bib8)\]。我们的问题关注现有预训练稀疏MoE中更老选择的增量预测价值,并且在比较的双方都明确包含了紧邻的前一个选择。 证据遵循一系列日益具体的问题。所选专家的来源比融合的专家输出更能预测后续路由。分解该来源后发现专家选择是主要的可获取信号。固定最近选择后,揭示了OLMoE中额外的历史增益\[7 (https://arxiv.org/html/2609.17940#bib.bib1)\],一个预先注册的JetMoE\[8 (https://arxiv.org/html/2609.17940#bib.bib2)\]实验在两个深度处复制了这一点。最后,非线性解码器和交叉拟合的残差预测测试了该增益是否仅仅因为线性探测器无法解码最近状态而产生。 我们做出三项贡献:(1)评估了超出显式前一层基线的路由历史价值;(2)在两种预训练MoE架构上提供了证据,包括一次预先注册的复现;(3)非线性与参数匹配的控制实验,以及残差预测,共同保持了历史效应。由此产生的测量为理解路由轨迹的哪些方面被局部选择状态概括提供了一个具体的目标。 表1:预测信号的来源。OLMoE中的留出路由器logit R²。EIPC在身份槽中保留所选贡献;EPD将选择身份与贡献内容分离。EIPC和EPD使用不同的样本和压缩预算,因此比较在每个面板内进行。EPD单层曲线使用每个表示的16个PCA分量。 EIPC:来源(64分量)目标融合身份打乱L8 0.19016 0.29939 -0.00149 L12 0.28705 0.46211 0.00396 目标 身份- 融合身份- 打乱 L8 0.10923 0.30088 L12 0.17506 0.45815 平均 0.14215 0.37952 EPD:L12(32分量)表示 R² 融合 0.20114 选择路径 0.66969 按路由器排名的内容 0.06732 完整来源 0.34007 路径+内容(事后) 0.66728 EPD:L12的单层预测 源层 选择路径 内容 1 0.14253 0.00914 2 0.25597 -0.00721 3 0.35859 -0.00605 4 0.41664 0.00556 5 0.40384 -0.01048 6 0.44991 -0.00814 7 0.44797 -0.00657 8 0.49381 0.02139 9 0.53850 0.00420 10 0.57216 0.00700 11 0.59927 0.01017 平均 0.42538 0.00173 ## 2衡量历史价值 ### 2.1状态、目标与比较 对于一个固定令牌,令S\_\{l\}表示在层l选择的专家的二元向量,令g\_\{l\}表示该层的原生路由器logit向量。层号从1开始。此处的 history 指同一令牌在模型深度上的跨越,不表示序列中的更早令牌。 一个探测器F\_\{k\}从k个紧邻的前一个选择状态(记为S\_\{l\-k:l\-1\})预测g\_\{l\}。我们评估 \mathcal\{R\}\_\{l\}\(k\)=R^\{2\}\_\{\\mathrm\{TEST\}\}\\\!\\left\(F\_\{k}\(S\_\{l\-k:l\-1\}\),g\_\{l\}\\right\), (1) 并衡量历史增益 \Delta\_\{l\}\(k\)=\mathcal\{R\}\_\{l\}\(k\)\-\mathcal\{R\}\_\{l\}\(1\)\. (2) 单层基线衡量相邻层的可预测性。正的\Delta\_\{l\}\(k\)衡量当被测试的探测器也接收更老选择时所获得的改进。通篇,R²是坐标级得分的均匀平均。目标logits在每个样本内居中,并使用FIT统计量标准化。 ### 2.2冻结评估与解码器控制 所有主干均为冻结、非量化,并以FP16进行评估:OLMoE\-1B\-7B\-0125(修订版9b0c1aa8)和jetmoe\-8b(d8fd02cc)。OLMoE从64个MLP专家中选择8个;JetMoE从8个中选择2个。我们使用WikiText\-103\-raw\-v1的训练集\[9 (https://arxiv.org/html/2609.17940#bib.bib9)\],将其划分为不相交的FIT和TEST块用于探测器。每个129令牌块在其128令牌上下文中的位置127贡献一个实验令牌。留出是相对于探测器拟合的;主干预训练重叠未被评估。完整模型标识符、修订版和协议在链接的代码归档中。 EIPC使用1,024 FIT和1,024 TEST样本;EPD及其事后RMO分析共享512/256样本。EPD排除了早期的EIPC和XEC块。JetMoE复现RMC使用512/256样本;NHD重用这些完全相同的捕获和分割。所有缩放器和主成分分析(PCA)变换都在FIT上拟合。线性探测器使用α=1的岭回归。 对于非线性比较,记R=S\_\{l\-1\}, H=S\_\{l\-4:l\-2\}, 和Y=g\_\{l\}。我们比较从R预测Y与从\[H; R\]预测Y。最近状态有八个原始二元坐标,更早历史有24个;NHD不使用PCA。两个MLP都有一个32单元的GELU隐藏层。一个77单元的仅最近MLP与历史模型的参数数量匹配到三个参数以内(1,317 对比 1,320)。训练使用全批量AdamW,学习率10^\{\-3\},权重衰减10^\{\-4\},最多300个epoch,验证耐心30。FIT内的固定384/128分割用于选择检查点;初始化种子为42、123和2026。 表2:历史记录的改进超越了前一层。顶部:嵌套历史窗口的留出R²;k包含紧邻的前一层。中部:OLMoE相对于k=1的增益以及连续窗口间的增益。底部:JetMoE增益,包含预先注册的k=4比较的95%配对自助法区间(10,000次重采样)。短横线表示不可用的窗口。 模型 / 目标 k=1 k=2 k=4 k=8 k=11 OLMoE / L12 0.59879 0.62320 0.64705 0.66265 0.66544 JetMoE / L12 0.20924 0.34982 0.35199 0.38275 – JetMoE / L20 0.13898 0.24936 0.34425 0.35463 – OLMoE 累计增益 – 0.02441 0.04826 0.06387 0.06665 OLMoE 逐步增益 – 0.02441 0.02385 0.01561 0.00279 JetMoE 目标 \Delta\_\{2\} \Delta\_\{4\} \Delta\_\{8\} \Delta\_\{4\} 的 95% CI L12 0.14057 0.14275 0.17351 [0.10998, 0.17916] L20 0.11038 0.20528 0.21565 [0.16891, 0.24396] 为了直接检查剩余的变异,分别用MLP从R预测Y和H。它们的残差为 \epsilon\_\{Y\}=Y\-f\(R\),\qquad\epsilon\_\{H\}=H\-h\(R\), (3) 其中f和h是相应的最近状态预测器。两折交叉拟合构建FIT残差:每个256样本折由在另一折上拟合的模型预测,验证在该训练折内部进行。一个岭探测器学习\epsilon\_\{H\}\mapsto\epsilon\_\{Y\}。TEST残差化器使用原始的FIT训练/验证协议;所有残差化器使用种子42。TEST历史残差的一个固定置换提供了一个描述性对照。这衡量了相对于拟合解码器家族的残差可预测性。 ## 3证据 ### 3.1专家选择承载可获取信号 EIPC比较了所选专家贡献的三种历史:它们的融合和、保留在专家身份槽中的向量,以及身份槽被打乱的相同向量。贡献在每次完整历史接收共同的64分量PCA预算前从2,048维投影到32维。身份保留相比融合在R²上提高了0.10923和0.17506;其平均增益为0.14215(表1 (https://arxiv.org/html/2609.17940#S1.T1))。打乱比较衡量压缩下的可访问性,因为融合和在压缩前是可恢复的。 EPD在32分量预算下分离二元选择路径、按排名排序的贡献内容、融合输出和完整来源。仅路径达到R²=0.66969,而内容达到0.06732。将内容添加到路径得到0.66728。单层路径预测通常向目标增强,从0.14253到0.59927,而内容接近于零。完整来源表示在PCA下保留了15.18%的方差,而路径为52.17%。这些结果确定选择身份是最强的可获取预测因子,并促使我们测试其信号中有多少来自前一层。 表3:非线性解码保持了历史优势(NHD)。所有三个初始化种子的原始状态岭分数和MLP分数。AA是仅最近MLP相对于仅最近岭的增益;BB是历史MLP相对于仅最近MLP的增益;B\_\{matched\}B使用参数匹配的仅最近MLP。残差分数从\epsilon\_\{H\}预测\epsilon\_\{Y\},并使用与联合预测分数不同的目标。置换控制打乱TEST历史残差,同时固定拟合的残差探测器。 目标 解码器 / 输入 参数 种子42 种子123 种子2026 平均 / 固定 L12 岭 / R – – – – 0.20972 L12 岭 / [H; R] – – – – 0.37188 L12 MLP / R 552 0.20871 0.21206 0.21257 0.21111 L12 匹配MLP / R 1,317 0.22051 0.21742 0.21633 0.21809 L12 MLP / [H; R] 1,320 0.38018 0.38677 0.38051 0.38249 L20 岭 / R – – – – 0.13948 L20 岭 / [H; R] – – – – 0.35382 L20 MLP / R 552 0.14678 0.15214 0.14760 0.14884 L20 匹配MLP / R 1,317 0.14602 0.15210 0.14688 0.14834 L20 MLP / [H; R] 1,320 0.36819 0.36339 0.37078 0.36745 目标 线性增益 AA BB B\_\{matched\} 残差 R² 置换 R² L12 0.16216 0.00139 0.17137 0.16440 0.20549 -0.33325 L20 0.21434 0.00936 0.21861 0.21912 0.23556 -0.32149 ### 3.2更老的选择在不同架构上增加价值 RMO在将OLMoE第11层表示固定的同时,将历史向更早的层扩展。最近状态和每个更早历史窗口分别接收16分量PCA变换。每个岭输入有32个坐标;基线用零填充更早块。第12层的预测从0.59879增加到0.66544(表2 (https://arxiv.org/html/2609.17940#S2.T2))。增益在较近的层中最为显著;从八层扩展到十一层历史增加了0.00279。此探索性分析使用了已观察到的EPD样本。 RMC在预先注册的目标层12和20上测试了JetMoE中的相同比较。最近的八维选择向量保持不变;更早历史接收八个PCA分量,为每个历史窗口产生16维输入。冻结的主要比较是k=4 对 k=1。其\Delta\_\{4\}值为0.14275和0.20528,并且两个配对自助法区间均排除零。所有10,000次重采样在两个目标处都给出正差异(种子314159)。两个目标都满足冻结规则:正基线,\Delta\_\{4\}\geq 0.02,且区间下限大于零。 JetMoE有独立的注意力和MLP混合体。捕获的MLP路由器通过对象标识被识别,并与从其输入直接重新计算的结果完全匹配(最大绝对logit差为0);它在每个块中都与注意力路由器不同。因此,整个复现涉及MLP专家选择。 ### 3.3增益在非线性解码下得以保持 线性历史增益的一个解释是,更老的选择暴露了最近状态中非线性存在的结构。NHD在未压缩选择向量的冻结JetMoE捕获上测试了这一解释。仅最近MLP相比岭提高了0.00139和0.00936,而添加历史记录使MLP提高了0.17137和0.21861(表3 (https://arxiv.org/html/2609.17940#S3.T3))。相应的参数匹配增益为0.16440和0.21912。每个初始化相对于两个仅最近对照都给出了正的历史增益。 交叉拟合的历史残差也预测目标残差:R²=0.20549和0.23556。置换TEST历史残差将这些分数降低到\-0.33325和\-0.32149。联合和残差结果一致:被测试的非线性最近状态解码器留下了大量可以从更老选择中获取的预测结构。两个目标都获得了冻结的描述性分类RESIDUAL\-HISTORY\-VALUE。 ## 4讨论与范围 专家轨迹预测路由,更老的选择在给定...
相似文章
超越几何互补性:稀疏混合专家路由中的一致性重叠
本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。
粘性路由:训练MoE模型以实现内存高效推理
StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。
通过有限专家库实现通信高效的专家路由
本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。
基于肘部的MoE路由:一种免训练的推理时插件用于专家选择
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。
一种稀疏 MoE 模型推理架构:通过分层与线性衰减增加激活参数量,无需训练或微调即可实现精简推理 [p]
一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。