输出稀释:MoE 模型中冗余但脆弱的表示
摘要
本文揭示,Mixture-of-Experts 模型在探测中编码道德内容的鲁棒性与密集模型相当,但由于输出稀释,它们更为脆弱。输出稀释是指聚合的专家输出稀释了信号,使表示容易受到噪声的影响。
arXiv:2608.25231v1 公告类型:新
摘要:Mixture-of-Experts (MoE) 模型看似在编码道德内容方面与密集模型同样鲁棒,但实则更为脆弱。在 OLMoE-1B-7B 中,线性探针能从几乎每个专家层组合中恢复道德价态,平均峰值层准确率超过 90%。然而,这些表示在匹配规模的密集模型能够容忍的激活噪声水平下会崩溃,鲁棒性相差 4.2 倍。
我们将此归因于输出稀释。由于 MoE 块在贡献残差流之前对活跃专家进行平均,到达下游层的前馈信号比密集 MLP 小近两个数量级。我们关注的道德信息在聚合后保持完整,但其规模极易被扰动淹没。路由本身在噪声下保持稳定,而脆弱性完全源于稀释的聚合。
检查点轨迹证实这是架构固有的,而非学习所得。专家从未专业化,准确率在最初几千步内即饱和。在稀疏架构中,冗余编码并不等同于鲁棒编码。
查看缓存全文
缓存时间: 2026/08/27 09:37
# MoE模型中冗余但脆弱的表征
来源:https://arxiv.org/html/2608.25231
## 输出稀释:MoE模型中冗余但脆弱的表征
Orion Reblitz-Richardson††脚注:Distiller Labs。通讯作者:Distiller Labs。2026年8月
###### 摘要
混合专家(MoE)模型似乎能像稠密模型一样稳健地编码道德内容,但其编码方式却脆弱得多。在OLMoE-1B-7B模型中,线性探测器能从几乎所有专家-层组合中恢复道德效价,峰值层平均准确率超过90%。然而,这些表征在匹配规模的稠密模型能轻松容忍的激活噪声水平下便会崩溃,鲁棒性相差4.2倍。我们将此追溯到*输出稀释*现象。由于MoE块在贡献到残差流之前对活跃专家输出进行了平均,到达下游层的前馈信号比稠密MLP小近两个数量级。我们所关注的道德信息在聚合后得以保留,但其规模极易被扰动淹没。路由本身在噪声下保持稳定,脆弱性完全源于稀释后的聚合结果。检查点轨迹分析证实这是架构特性,而非学习结果。专家从未专业化,准确率在最初数千步内就达到饱和。*在稀疏架构中,冗余编码并不等同于鲁棒编码。*
## 1 引言
混合专家(MoE)架构将每个词元路由到稀疏的专家模块子集,将表征空间划分为离散、可检查的单元。这种结构划分对对齐研究有自然影响:如果道德特征集中在特定专家中,MoE模型能提供稠密模型所缺乏的干预点(专家剪枝、专家专用微调、路由修改)。反之,如果道德特征均匀分布在所有专家中,MoE和稠密架构在对齐目的上等效,专家级分析的额外复杂性将毫无价值。
我们在OLMoE-1B-7B(Muennighoff等人,2024年)上测试这个问题,这是一个64专家、top-8路由的MoE语言模型,总参数6.9B(每个词元活跃参数1.3B),使用配套稠密OLMo模型研究(Reblitz-Richardson,2026年)中的道德探测和脆弱性方法论。OLMoE在此分析中具有独特优势:它是目前开源MoE模型中发布检查点记录最密集的(以5,000步间隔发布244个检查点),且其稠密对应模型OLMo-2 1B(来自同一实验室,具有可比的活跃参数数量和完整的检查点访问权限)提供了受控的架构比较。
我们报告四个共同指向单一机制的发现:
**发现1:MoE并未产生专家级道德专业化。**
几乎所有1,024个专家级探测器(64专家×16层)都能以远高于随机水平(1,020个超过75%)的准确率解码道德内容。在峰值层,每个专家单独都超过84%的准确率。专家准确率的基尼系数在所有层均低于0.03;道德编码在专家间的分布与稠密模型中神经元间的分布同样均匀。路由器表现出可忽略的道德内容偏好(最大差异仅1.8%)。
**发现2:MoE编码的脆弱性是稠密模型的4.2倍。**
尽管在探测准确率上匹配稠密OLMo-2 1B(峰值99.0% vs. 99.0%),OLMoE的道德编码在4.2倍更小的噪声下崩溃(平均临界σ* = 0.92 vs. 3.81)。这种脆弱性差距无法用较弱的单个专家表征或不稳定的路由来解释;两者单独来看都是稳健的。
**发现3:脆弱性源于输出稀释。**
MoE块的聚合输出(64个专家输出的top-8加权平均)对残差流的贡献规模,以跨输入的前馈块输出标准差衡量,比稠密MLP输出小74倍。这种*输出稀释*意味着相同的绝对噪声水平能淹没MoE的道德信号,却对稠密信号毫无影响。
**发现4:专业化在训练过程中从未出现。**
跨越OLMoE训练过程的11个检查点(从5K步到1.2M步,覆盖20B至5,033B词元),峰值层的基尼系数在每个检查点都保持在0.012至0.018之间(对比最终模型所有层的0.016–0.023,§4.2)。道德编码从最早可用的检查点就已存在(5K步时峰值准确率92.1%),并在1.2M步时稳定在93.7%,从未在特定专家中集中。准确率最高的前5名专家在相邻检查点间以近似随机的速率变化(Jaccard ≈ 0.09)。
输出稀释的发现对探测准确率作为对齐指标的可解释性有直接影响。两个模型可以产生相同的探测准确率分布(早期层高准确率,在整个网络中广泛编码),而底层信号的鲁棒性却相差近两个数量级。探测准确率衡量的是什么信息*存在*;而配套工作中发展的脆弱性测试(Reblitz-Richardson,2026年)衡量的是该信息编码得*多安全*。在MoE架构中,这两个指标的差距比在稠密模型中大得多,因为稀疏聚合瓶颈在保留信息内容的同时降低了信号规模。
本文贡献包括:首个MoE语言模型的专家级道德探测分析、首个量化MoE输出稀释效应及其与表征脆弱性关系的研究,以及基于相同探测方法的稠密与MoE模型受控比较。所有实验均在单台MacBook Pro M4 Pro(24 GB,MPS)上的基础(非指令微调)模型上运行。
## 2 相关工作
### 混合专家架构
稀疏MoE由Shazeer等人(2017年)引入,并由Fedus等人(2022年)和Lepikhin等人(2021年)扩展。近期的开源MoE模型包括Mixtral(Jiang等人,2024年)、DeepSeek-MoE(Dai等人,2024年)和OLMoE(Muennighoff等人,2024年)。OLMoE的独特之处在于发布了244个训练检查点,使得其他MoE模型无法进行的轨迹分析成为可能。
### 专家专业化
先前关于单个MoE专家学习内容的研究集中于语言特征(句法、词性)、领域特征(代码 vs. 自然语言)以及多语言模型中的语言特定专业化。Zuo等人(2022年)发现Switch Transformer专家按词元类型部分专业化。Chi等人(2022年)研究了专家利用模式。据我们所知,此前尚无工作研究MoE专家是否针对道德或伦理特征进行专业化。
### 语言模型中的道德探测
探测分类器(Conneau等人,2018年;Belinkov,2022年)在模型内部表征上训练轻量级分类器以测试编码的信息。道德探测专门将这种方法应用于道德推理特征,基于道德基础理论(Haidt,2012年;Graham等人,2013年)。配套工作(Reblitz-Richardson,2026年)发展了我们将扩展到MoE模型的逐层道德探测和脆弱性测试方法,确立了在探测准确率饱和后脆弱性仍能分辨结构。
### 激活扰动与表征鲁棒性
用于探测鲁棒性的高斯噪声注入与表征稳定性研究(Morcos等人,2018年)以及识别因果相关特征的激活扰动工作(Vig等人,2020年;Meng等人,2022年)相关。我们的脆弱性协议(Reblitz-Richardson,2026年)将这种方法适应于与对齐相关的特征,定义临界噪声作为量化鲁棒性指标。
### 稠密模型的道德编码
配套论文(Reblitz-Richardson,2026年)确立了稠密OLMo模型从早期层编码道德特征(编码深度低),在整个网络中广泛分布(编码广度高),且具有在探测准确率饱和后仍能继续分辨的脆弱性梯度。该项目先前的研究还表明,在稠密1B模型中抑制探测方向无法捕捉行为,这源于特征冗余,这促使我们研究MoE的结构划分是否能减少这种冗余。
### OLMo生态系统
OLMo(Groeneveld等人,2024年)和OLMoE(Muennighoff等人,2024年)由艾伦人工智能研究所开发,致力于开放科学,包括完整的训练数据、代码、中间检查点和评估基础设施。这种开放性使得受控的架构比较(§4.1)、输出规模测量(§4.4)和11检查点轨迹分析(§4.5)成为可能,这些是本文发现的核心。
## 3 方法
### 3.1 模型与比较设计
OLMoE-1B-7B(allenai/OLMoE-1B-7B-0924;Muennighoff等人,2024年)是一个16层MoE语言模型,每层64个专家,top-8路由,总参数6.9B(每个词元活跃参数1.3B),隐藏维度2048。每个专家是一个门控MLP,中间维度1024,使用SiLU激活。路由器是一个学习的线性投影(2048→64),后接softmax和带归一化权重的top-k选择。模型使用负载平衡辅助损失(λ=0.01)训练,以鼓励均匀的专家利用。
OLMo-2 1B(allenai/OLMo-2-0425-1B;OLMo Team,2025年)是一个16层稠密Transformer,1.5B参数,隐藏维度2048。它作为架构控制:同一实验室,相同训练理念,可比的活跃参数数量,相同的层数和隐藏维度。两个模型都是基础(非指令微调)检查点。所有实验使用相同的240对道德探测数据集(§3.5)、相同的探测器架构(§3.3)和相同的脆弱性协议(§3.4)。架构是自变量。
### 3.2 专家级激活收集
标准逐层探测(Reblitz-Richardson,2026年)在Transformer层输出上注册前向钩子以收集层后隐藏状态。对于专家级探测,我们绕过路由器并并行计算所有64个专家输出。对于每个输入文本,我们在每层钩取post_attention_layernorm以捕获预MoE隐藏状态 h ∈ ℝ^{s×d}(其中 s 是序列长度,d=2048)。然后我们通过直接应用每个专家的FFN权重到平均池化隐藏状态 \bar{h} = \frac{1}{s}\sum_{t}h_{t} 来计算专家输出:
gate_up_{e} = \bar{h} \cdot W_{e}^{gate_up\top} ∈ ℝ^{2k}
g_{e}, u_{e} = chunk(gate_up_{e}) ∈ ℝ^{k}
o_{e} = SiLU(g_{e}) ⊙ u_{e} \cdot W_{e}^{down\top} ∈ ℝ^{d}
其中 k=1024 是中间维度,e ∈ \{0,...,63\}。此计算使用 torch.einsum 对所有64个专家进行批处理,在每层单次操作中产生所有专家输出。对于路由器分析,我们还通过计算 \bar{h} \cdot W^{gate\top} ∈ ℝ^{64} 捕获路由器 logits,其中 W^{gate} 是路由器的学习权重矩阵。
干净聚合输出。为了产生MoE块用于下游探测的实际输出,我们应用标准路由:对路由器 logits 执行 softmax,选择 top-8,归一化权重,并计算选定专家输出的加权和。
### 3.3 探测器架构
所有探测器都是二元线性分类器:nn.Linear(d, 1),使用二元交叉熵损失、Adam优化器(lr=10^{-2})、训练50个周期。对于层级探测,d=2048(完整隐藏维度)。对于专家级探测,d=2048(专家输出维度,在OLMoE架构中等于隐藏维度)。对于扰动实验中使用的聚合MoE探测器,d=2048。探测器阈值为0(logit符号决定分类)。准确率在保留测试集(48对,96个文本)上报告。
### 3.4 脆弱性协议
我们扩展了配套工作(Reblitz-Richardson,2026年)的脆弱性测试协议。在标准协议中,将高斯噪声 𝒩(0, σ²I) 注入到层后隐藏状态,幅度 σ ∈ \{0.1, 0.3, 1.0, 3.0, 10.0\},每个级别的准确率在10个噪声种子上平均,临界噪声 σ* 是种子平均探测准确率首次低于0.6的最小 σ。遵循Reblitz-Richardson(2026年)的惯例,在平均时,其探测准确率从未低于阈值的层在网格最大值处被删失(未丢弃),因此 σ* 聚合是所有层的平均值。
对于MoE组件扰动实验(§4.4),我们将此协议扩展到MoE块内的三个扰动目标:
1. 路由器扰动。在softmax和top-k选择之前向路由器 logits 添加噪声。这改变了选择的专家及其聚合权重。
2. 专家扰动。在加权聚合之前向单个专家输出添加噪声。路由保持固定(干净 logits 决定专家选择和权重)。
3. 输出扰动。向最终聚合的MoE输出添加噪声(相当于标准脆弱性测试的控制条件)。
对于每种条件,探测器在干净聚合输出(训练集)上训练,并在每个噪声水平下的扰动输出(测试集)上评估。结果在每个噪声水平的10个随机种子上平均,以减少单个噪声实现的方差。
输出规模测量。为了解释组件脆弱性结果,我们测量每个组件的自然规模(跨测试文本的标准差),以及 OLMoE 和 OLMo-2 在相同输入文本上每层的前馈输出规模。
### 3.5 探测数据集
我们使用与配套工作(Reblitz-Richardson,2026年)相同的240对道德探测数据集:每个道德基础理论基础(关怀/伤害、公平/欺骗、忠诚/背叛、权威/颠覆、纯洁/堕落、自由/压迫)40个最小对,使用确定性种子从根据已发布质量准则构建的1,200对数据集中子采样。相似文章
除了更快之外,MoE 模型的意义何在?
讨论混合专家(MoE)模型在速度之外相对于密集模型的优势,考虑内存限制和扩展限制。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
少即是MoE:裁剪领域专用语言模型中的专家
本文介绍了Fisher-MoE,一种通过使用Fisher重要性裁剪FFN层中间维度来压缩混合专家模型的方法,实现了45%的权重内存减少和21%的吞吐量提升,且未造成显著的能力损失。
解耦的Mixture-of-Experts用于参数化知识注入
Decoupled Mixture-of-Experts (DMoE) 提出了一种用于参数化知识注入的模块化架构,将专家和路由器从基础模型中解耦,以实现高效的自回归推理并缓解灾难性遗忘。