MoE强化学习中的专家空间探索

arXiv cs.CL 论文

摘要

本文提出ESRL,一种通过探索专家路由路径来增强混合专家模型训练的强化学习框架,从而在数学、科学和编程任务上取得性能提升。

arXiv:2609.13058v1 公告类型:新 摘要: 强化学习(RL)已成为大型语言模型后训练的核心。近期在混合专家(MoE)模型强化学习方面的进展主要集中在提高优化稳定性和训练效率上,而将专家选择视为固定组成部分。由于路由决定了引发输出分布的稀疏计算路径,专家选择提供了额外的滚动多样性来源。通过实证分析,我们发现扰动专家路由能有效改变模型输出并增加滚动多样性,类似于提高解码温度。然而,直接扰动可能激活不合适的专家并显著降低滚动质量。受这些观察的启发,我们引入了专家空间探索强化学习(ESRL),一种架构感知框架,明确探索MoE模型的专家路由空间。ESRL保留高置信度专家作为锚点,并将随机路由限制在合理的候选池中,从而保留可靠的计算路径。扰动强度进一步根据路由器熵进行自适应,以避免过度扰动。为缓解扰动引入的路由不匹配,ESRL记录滚动过程中使用的专家路径,并在策略优化期间重放它们。实验表明,ESRL在采用top-K、top-1和共享专家路由的MoE主干上,以及在数学、科学和代码任务上均取得最佳性能,且无需额外采样或计算成本。具体来说,ESRL在Qwen3-30B-A3B上取得所有比较方法中的最佳性能,将平均Pass@1和Pass@8分别较GRPO提高3.2和4.5个百分点。对专家利用率和训练动态的进一步分析,揭示了利用MoE特定路由结构如何有益于强化学习训练。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:43

# 专家空间探索在混合专家强化学习中的应用  
来源:https://arxiv.org/html/2609.13058  
邮箱:\{hehy22\}@mails\.tsinghua\.edu\.cn;\{zhenghaolin,yegong\}@microsoft\.com  
作者:Zhenghao Lin, Xiao Liu  
单位:Microsoft Research  
*工作在微软实习期间完成  
†通讯作者  
Peng Cheng  
单位:Microsoft Research  
*工作在微软实习期间完成  
†通讯作者  
Yan Lu  
单位:Microsoft Research  
*工作在微软实习期间完成  
†通讯作者  
Yeyun Gong  
单位:清华大学  

#### 摘要  
强化学习已成为大语言模型训练后阶段的核心方法。近期针对混合专家模型的强化学习研究主要集中在优化稳定性和训练效率的提升,同时将专家选择视为固定组件。由于依赖于token的路由决定了导致输出分布的稀疏计算路径,专家选择提供了除传统token级采样之外的额外rollout多样性来源。通过实证分析,我们发现扰动专家路由能有效改变模型输出并增加rollout多样性,这类似于提高解码温度。然而,直接扰动可能激活不合适的专家并显著降低rollout质量。基于这些观察,我们引入专家空间探索强化学习(ESRL),一种架构感知框架,明确探索混合专家模型的专家路由空间。ESRL将高置信度专家保留为锚点,并将随机路由限制在合理的候选池内,从而保留可靠的计算路径。扰动强度还会根据路由器熵进行自适应调整,以避免过度扰动。为缓解扰动引入的路由失配,ESRL记录rollout期间使用的专家路径,并在策略优化时重放这些路径。实验表明,ESRL在具有Top-KK、Top-1和共享专家路由的混合专家主干模型上,在数学、科学和代码任务中均实现了最佳性能,且无需额外采样或计算成本。具体而言,在Qwen3-30B-A3B模型上,ESRL在所有对比方法中取得最佳表现,相比GRPO,平均Pass@1和Pass@8分别提升了3.2和4.5个百分点。对专家利用情况和训练动态的进一步分析揭示了如何利用混合专家特有的路由结构来促进强化学习训练。这些结果确立了专家路由作为强化学习探索中一个有效且互补的维度,超越了其架构角色。  
代码:[代码链接](https://github.com/strawberrymaster111/ESRL-Release.git)  
项目:[项目链接](https://strawberrymaster111.github.io/esrl-project-page/)  
(a)数学和通用基准测试上的Pass@1表现  
(b)扰动专家路由产生rollout多样性的示例  
图1:ESRL通过探索替代的稀疏计算路径提升性能  
(a)数学推理(OlympiadBench, AIME 2024, AMC, MinervaMath)和通用领域基准(GPQA, MMLU-Pro, MMLU-Rdux, LiveCodeBench v6)上的平均Pass@1  
(b)一个示例,说明在混合专家生成中的路由级探索。在相同前缀下,扰动路由器logits会改变所选专家和首token分布,产生替代响应  

## 1 引言  
强化学习已成为提升大语言模型推理能力的关键训练后范式,尤其在数学和代码生成方面(Ouyang等,2022;Shao等,2024;Guo等,2025)。近期针对混合专家模型的强化学习研究主要集中在优化稳定性和训练效率的提升,同时将专家选择视为固定的架构组件。然而,在混合专家模型中,每个token被动态路由到稀疏的专家集,这些专家的计算决定了后续token的分布(Shazeer等,2017;Fedus等,2022;Jiang等,2024)。因此,专家路由提供了将探索从token空间自然扩展到底层计算路径空间的途径。然而,标准的混合专家rollout依赖于确定性的Top-KK路由,导致相同的前缀反复激活相同的专家,而替代的路由路径未被探索。虽然采样token可能通过修改生成的前缀间接改变后续的路由决策,但它们并未显式地探索相同上下文下的替代专家路径。这一观察启发了我们的核心问题:*路由级扰动能否为混合专家大语言模型的强化学习提供一种超越传统token级采样的、架构感知的探索机制?*  

为检验扰动专家选择是否能产生有意义的探索,我们对路由噪声在模型生成上的影响进行了多层次的实证分析。我们发现,路由噪声改变了专家分配并拓宽了专家利用范围,从而激活了替代计算路径,这些路径在相同上下文下显著重塑了后续token的分布。在序列层面,路由扰动降低了Self-BLEU值,并展现出类似温度的精度-多样性权衡。随着强化学习训练的进行,策略变得集中,rollout多样性逐渐下降,引入额外多样性的能力变得尤为宝贵。然而,直接的路由扰动可能激活不合适的专家并显著降低rollout质量。基于这些观察,我们引入了专家空间探索强化学习(ESRL),这是一种架构感知框架,明确探索混合专家模型的专家路由空间。在生成过程中,ESRL扰动路由器logits,使得相同的前缀可以激活替代的专家路径,从而诱导不同的后续token分布。为缓解因专家匹配不佳导致的rollout质量下降,ESRL选择高置信度专家作为锚点,并从合理的候选池中对其他专家进行采样。扰动强度还会根据路由器熵进行自适应调整,鼓励在路由分布尖锐时进行探索,而在路由器已不确定时减少干扰。最后,为避免rollout与策略更新之间的专家路径不匹配,ESRL记录rollout期间使用的专家激活路径,并在策略优化时重放这些路径。这些组件共同实现了在稀疏计算路径上的受控且训练一致的探索,同时与传统的token级采样互补。  

我们在具有不同混合专家主干的模型上评估了ESRL,涵盖数学推理、科学推理和代码生成任务,包括Qwen3(Team,2025)、Sigma(Hu等,2025)和Moonlight(Liu等,2025a),覆盖了Top-KK、Top-1和共享专家路由结构。ESRL在所有设置中持续提升了对应的强化学习基线性能,特别是在Qwen3-30B-A3B-Base模型上,相比GRPO,在数学基准测试上的平均Pass@1和Pass@8分别提升了3.2和4.5个百分点。此外,这些改进在不同采样温度和rollout组大小下保持一致,ESRL在有限采样预算下维持了更多具有信息量的优势组并实现了更高的性能。我们后续的分析探讨了路由扰动对这些增益的贡献。消融研究表明,锚定专家防止了对可靠计算路径的过度干扰,而熵自适应噪声优于固定的扰动强度。此外,对扰动参数的分析表明,候选池大小决定了可访问的专家替代范围,而锚定专家的数量和扰动位置进一步塑造了精度-多样性的权衡。此外,将专家空间和token空间探索解耦的实验表明,仅路由噪声就能在没有token采样的情况下支持有效的强化学习训练,并改善了Pass@NN曲线,表明对解决方案路径的覆盖更广泛。这些发现表明,ESRL不仅控制了路由扰动的质量,还通过额外的、互补的计算路径维度增强了模型的探索能力。我们的贡献总结如下:1)我们实证分析了路由扰动如何影响专家利用、后续token分布和rollout多样性,确立了专家路由作为混合专家大语言模型强化学习的可行探索维度;2)我们提出了ESRL,它结合了锚定专家采样、熵自适应扰动和路由重放,以实现受控且稳定的专家空间探索;3)我们在不同的混合专家架构和任务领域验证了ESRL,展示了持续的性能增益、跨rollout配置的鲁棒性以及跨rollout采样预算的学习效率提升。  

## 2 路由扰动作为探索机制  
我们从多个角度研究路由扰动是否提供有意义的探索。首先分析其对专家路由和后续token分布的影响。然后考察序列级多样性在强化学习训练过程中的演变,以及路由扰动、rollout多样性和生成质量之间的关系。  

### 2.1 专家利用情况  
图2(a)显示了路由噪声对专家选择的影响。随着噪声尺度σ增大,全token专家变化率和top-1专家变化率均增加,而top-kk专家的Jaccard相似度下降。这些趋势表明,路由器扰动探索了超越Top-KK路由器所选路由路径的替代路径。图2(b)进一步表明,较大的噪声尺度通常导致各层间的变异系数更低,表明在路由器扰动下专家激活更均衡。这些结果共同证明,路由扰动拓宽了专家利用范围,并直接探索了稀疏计算路径。  

(a)不同噪声尺度下的专家选择分析  
(b)不同噪声尺度和层级下的专家负载分析  
图2:路由器扰动改变专家路径并拓宽专家利用范围  
实验在Qwen3-30B-A3B-Base上进行,该模型包含48个混合专家层,每层在128个路由专家中激活8个。向路由器logits添加了尺度为σ的高斯噪声。(a)全token和top-1分配变化随σ增加,而未扰动和扰动后Top-KK集的Jaccard相似度下降。(b)专家负载变异系数普遍下降,表明专家激活不那么集中。  

### 2.2 后续token分布偏移  
接下来我们研究专家级路由变化是否会传播到模型输出。给定相同的输入前缀和固定的模型参数,我们比较标准Top-K路由和扰动路由产生的后续token分布。图3(a)显示,随着路由噪声尺度σ增加,标准路由下的top-1 token在扰动logits下的排名逐渐降低,而标准和扰动后的top-20 token集的Jaccard相似度下降。图3(b)进一步使用PCA可视化了噪声在首token logit空间中引起的分布变化。每个水平轮廓代表给定噪声尺度下多个独立响应的整体分布。随着σ增加,质心轨迹逐渐远离未扰动的质心,分布轮廓在投影空间中覆盖越来越大的区域,揭示了首token logit的系统性位移和分散。这些结果共同表明,路由扰动既改变了高概率token候选,也改变了更广泛的后续token分布,将专家路径探索与输出级多样性联系起来。  

(a)高概率token候选的位移  
(b)不同噪声强度下后续token分布的PCA投影  
图3:路由变化传播到后续token分布  
(a)蓝线是路由扰动下未扰动top-1 token的排名,红线是扰动路由与未扰动路由之间Top-20 token的Jaccard相似度。(b)轮廓线表示将首token logit投影到共享PCA空间后95%高斯置信区域,增加σ同时导致质心位移和更大的分散性。  

### 2.3 序列级多样性与质量权衡  
接下来考察路由器扰动引起的token级分布偏移是否转化为序列级多样性。我们使用Self-BLEU来衡量为同一提示生成的多个响应之间的相似度,值越低表示多样性越高。图4(a)显示,提高解码温度始终降低Self-BLEU。更重要的是,为了保持相同的响应多样性,后期的检查点需要更高的采样温度,如图4(a)中的虚线所示。这与先前的研究发现一致,即策略在强化学习训练过程中变得越来越集中。然后我们考察直接的路由扰动,即在rollout期间向路由器logits注入噪声,而不控制哪些路由决策被改变。图4(b)绘制了在不同温度和噪声尺度下的精度-Self-BLEU关系。直接的路由扰动和仅温度采样都随着强度的增加而降低Self-BLEU,表明路由扰动对序列多样性具有类似温度的影响。特别是,T=1.0下的路由扰动包含了接近T=1.1下仅温度采样的操作点。然而,无约束的路由扰动在类似的Self-BLEU水平下通常产生较低的精度,表明它也可能激活不合适的计算路径。这些结果促使我们采用受控的专家空间探索形式,在增加多样性的同时限制质量下降。  

(a)无路由器扰动时不同温度和强化学习检查点下的Self-BLEU  
(b)温度和直接路由噪声扫描的精度-Self-BLEU权衡  
图4:路由扰动增加序列多样性但需要质量控制  
(a)更高温度下较低的Self-BLEU表示更大的多样性,而检查点间的向右移动揭示了强化学习过程中的多样性丧失。(b)彩色圆圈表示路由噪声配置,空心菱形表示温度设置。

相似文章

EMO:用于涌现模块化的专家混合模型预训练

Hugging Face Daily Papers

EMO 是一种专家混合模型(Mixture-of-Experts),通过将相似领域的词元与共享专家分组实现模块化部署,在保持与标准 MoE 相当的性能的同时,支持显著的专家剪枝(保留 25% 的专家即可保留 99% 的性能)且不会导致性能下降。

超越几何互补性:稀疏混合专家路由中的一致性重叠

Hugging Face Daily Papers

本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。

关于通过元强化学习学习探索的一些思考

OpenAI Blog

OpenAI研究人员引入了E-MAML和E-RL²两种元强化学习算法,旨在改进需要大量探索来发现最优策略的任务中的探索性能。该工作展示了这些算法在包括Krazy World和迷宫任务在内的新颖环境中的有效性。