TEXAS:面向下游混合专家大语言模型适配的任务专家感知监督

arXiv cs.CL 论文

摘要

提出TEXAS方法,用于混合专家大语言模型的下游适配,通过正确性条件激活发现任务相关专家,并应用词元级监督分配,在多个基准上提升性能。

arXiv:2608.06396v1 公告类型:新 摘要:混合专家(MoE)语言模型将每个词元路由到一小部分专家,这使得路由模式可用于在下游适配期间识别任务相关专家。然而,当前方法存在两个局限:任务专家通常从聚合路由统计中识别,这些统计反映的是使用情况而非与成功任务完成的关联;并且任务专家激活作为监督分配信号仍未得到充分利用。我们提出了任务专家感知监督(TEXAS),它将正确性条件的任务专家发现与词元级监督分配相结合。TEXAS 比较基础模型成功解决的实例与未能解决的实例上的专家激活,并保留在成功实例上激活更强的专家。在微调过程中,当失败实例中的答案词元激活这些专家时,TEXAS 会提高其权重。因此,TEXAS 利用现有的路由行为,而无需将适配限制在固定的专家子集或施加显式的目标路由分布。在三个 MoE 模型和六个基准上,TEXAS 在 18 个设置中的 17 个达到最佳或并列最佳性能,并平均比最强基线提高 1.3--1.5 个点。消融研究和进一步分析验证了所发现的专家以及由此产生的监督策略。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:00

# TEXAS:面向下游混合专家大语言模型适配的任务专家感知监督

Source: https://arxiv.org/html/2608.06396
Guanzhi Deng1, Haibo Wang2, Kuan Wu1, Xiangru Jian3, Shing Yin Wong1, Sichun Luo4, Zhuoran Wang1, Linqi Song1

###### 摘要

混合专家(MoE)语言模型将每个词元路由到少量专家子集,这使得路由模式可用于在下游适配中识别任务相关专家。然而,现有方法存在两个局限:任务专家通常是从聚合路由统计中识别的,而这些统计反映的是使用情况而非与成功任务完成的关联;并且任务专家激活作为监督分配信号仍未被充分探索。我们提出了任务专家感知监督(TEXAS),它将正确性条件化的任务专家发现与词元级监督分配相结合。TEXAS 比较基础模型在成功解决和未能解决的实例上的专家激活,并保留在成功实例上激活更强的专家。在微调过程中,当失败实例中的答案词元激活这些专家时,TEXAS 会提高其权重。因此,TEXAS 利用现有的路由行为,而不必将适配限制在固定的专家子集上,也不强加显式的目标路由分布。在三个 MoE 模型和六个基准测试上,TEXAS 在 18 个设置中的 17 个中取得最佳或并列最佳性能,并比最强基线平均提升 1.3–1.5 个百分点。消融和进一步分析验证了所发现专家及由此产生的监督策略的有效性。

## 引言

混合专家(MoE)架构通过使用路由器为每个词元稀疏激活一部分专家来扩展大语言模型(LLM),在不按比例增加每个词元计算量的情况下提升模型容量\(Shazeeret al.2017 (https://arxiv.org/html/2608.06396#bib.bib1); Feduset al.2022 (https://arxiv.org/html/2608.06396#bib.bib2); Lepikhinet al.2021 (https://arxiv.org/html/2608.06396#bib.bib3); Jianget al.2024 (https://arxiv.org/html/2608.06396#bib.bib4)\)。除了计算效率,这种路由机制还催生了专家专业化,不同专家在不同输入上表现出独特的功能行为和激活模式\(Daiet al.2024 (https://arxiv.org/html/2608.06396#bib.bib5); Xueet al.2024 (https://arxiv.org/html/2608.06396#bib.bib6)\)。近期研究进一步表明,路由决策编码了可用于识别和利用下游适配任务相关专家(以下简称任务专家)的信号\(Wanget al.2024 (https://arxiv.org/html/2608.06396#bib.bib7); Zhouet al.2024 (https://arxiv.org/html/2608.06396#bib.bib10); Li and Zhou2025 (https://arxiv.org/html/2608.06396#bib.bib15); Baiet al.2025 (https://arxiv.org/html/2608.06396#bib.bib9)\)。

参见图1:聚合激活频率无法可靠地识别与下游任务成功完成相关的专家。每个面板使用表1 (https://arxiv.org/html/2608.06396#Sx4.T1)中的对应训练集,每个点是一个 OLMoE 层–专家对。两个坐标轴分别表示聚合答案词元激活频率和 SuccessGap(定义为基础模型成功实例与失败实例之间的激活频率差)。蓝色和橙色点分别表示由 ESFT-Token 在 \(p=0.2\) (Wanget al.2024 (https://arxiv.org/html/2608.06396#bib.bib7)) 下选出的专家,并按 SuccessGap 正负分开显示。

现有方法通常使用在任务数据上聚合的路由统计(如平均门控分数或专家选择频率)来识别任务专家。然而,这些统计刻画的是聚合专家使用情况,而非专家激活与成功任务完成之间的关系。图1 (https://arxiv.org/html/2608.06396#Sx1.F1)显示,在数学推理、代码生成、通用知识和指令跟随中均存在一致的不匹配:频率选出的专家同时包含 SuccessGap 为正和为负的专家,而一些未被选中的专家却表现出大得多的正 SuccessGap。因此,聚合激活频率并不是识别与成功任务完成相关专家的完整代理。除任务专家识别外,现有 MoE 适配方法主要通过选择性专家微调或路由优化来利用专家专业化\(Wanget al.2024 (https://arxiv.org/html/2608.06396#bib.bib7); Baiet al.2025 (https://arxiv.org/html/2608.06396#bib.bib9); Liet al.2026 (https://arxiv.org/html/2608.06396#bib.bib8); Guoet al.2026a (https://arxiv.org/html/2608.06396#bib.bib11)\),而利用任务专家来决定应在何处分配更强的训练监督仍未被充分探索。

为解决这两个局限,我们提出了任务专家感知监督(TEXAS),这是一个用于下游 MoE 大语言模型适配的框架。TEXAS 首先通过比较基础模型在成功解决和未能解决的实例上的专家激活来识别任务专家,然后利用这些专家在训练时的激活来在词元级别分配更强的监督。对于基础模型失败的实例,激活所发现专家的答案词元会获得更高的交叉熵权重,而其他位置保留标准监督。因此,TEXAS 使用任务专家来引导监督分配,而不是选择可训练专家子集或直接规定路由行为。

我们在三个 MoE 大语言模型和六个下游基准上评估了 TEXAS,涵盖数学推理、代码生成、通用知识和指令跟随。TEXAS 在 18 个模型–任务设置中的 17 个中取得最佳或并列最佳性能,并比最强基线平均提升 1.3–1.5 个百分点。消融研究验证了正确性条件化专家发现、任务专家感知监督以及将更强监督聚焦于基础模型失败实例的重要性。进一步分析表明,与按聚合路由频率选出的专家相比,所发现的专家与成功任务完成之间的关联更强,功能上也更重要。这些分析还表明,TEXAS 强化了任务专家通路,并将更强监督导向任务相关词元。

我们的贡献总结如下:

- •我们指出现有利用任务专家进行下游 MoE 适配的方法存在两个局限:聚合路由统计不能可靠地捕捉专家与成功任务完成之间的关联,且任务专家作为分配训练监督的信号仍未被充分探索。
- •我们提出了 TEXAS,通过正确性条件化的激活比较来发现任务专家,并利用其在训练时的激活,在基础模型失败实例中动态提高激活这些专家的答案词元的权重,从而同时解决上述两个局限。
- •我们在三个 MoE 模型和六个下游基准上进行了大量实验。结果证明了 TEXAS 的有效性,同时受控消融和进一步分析验证了所发现的专家以及由此产生的监督分配。

## 相关工作

#### MoE 模型中的任务专家识别。

专家专业化是 MoE 架构的核心动机之一。近期 MoE 大语言模型引入了鼓励更强专业化的架构设计,例如 DeepSeekMoE 中的细粒度专家和共享专家\(Daiet al.2024 (https://arxiv.org/html/2608.06396#bib.bib5)\),而对开放 MoE 模型的分析则揭示了与词元身份、输入分布和模型行为相关的结构化专家分配\(Xueet al.2024 (https://arxiv.org/html/2608.06396#bib.bib6)\)。路由模式也被证明编码了语义和功能信息,可充当免训练表示\(Li and Zhou2025 (https://arxiv.org/html/2608.06396#bib.bib15)\),或揭示与特定下游能力相关的专家\(Zhouet al.2024 (https://arxiv.org/html/2608.06396#bib.bib10); Baiet al.2025 (https://arxiv.org/html/2608.06396#bib.bib9)\)。在这些观察的基础上,ESFT 使用平均门控分数或词元选择比例等聚合统计来识别任务专家\(Wanget al.2024 (https://arxiv.org/html/2608.06396#bib.bib7)\),而 CEFT 则先适配路由器,再根据选择频率选出上下文忠实的专家\(Baiet al.2025 (https://arxiv.org/html/2608.06396#bib.bib9)\)。这些方法主要从在任务或能力数据上聚合的路由统计中推导专家相关性。相比之下,TEXAS 通过比较基础模型成功实例与失败实例之间的专家激活来识别任务专家,直接将专家发现建立在模型正确性上。

#### 利用专家专业化进行 MoE 适配。

现有方法以多种方式利用专家专业化。ESFT 和 CEFT 选择性地微调各自选择程序识别出的专家。PERFT 引入了路由 PEFT 模块,而 CoMoE 则使用激活专家与未激活专家之间的对比目标来促进模块化和专业化\(Liuet al.2026 (https://arxiv.org/html/2608.06396#bib.bib13); Fenget al.2025 (https://arxiv.org/html/2608.06396#bib.bib14)\)。另一条工作线修改路由行为:RoMA 将路由权重与语义相似的成功示例对齐\(Liet al.2026 (https://arxiv.org/html/2608.06396#bib.bib8)\),R2-T2 在测试时向正确预测的邻居重新路由\(Liet al.2025 (https://arxiv.org/html/2608.06396#bib.bib16)\),其他方法则通过额外目标或更密集的路由器反馈来优化路由和专业化\(Guoet al.2026a (https://arxiv.org/html/2608.06396#bib.bib11); Pandaet al.2026 (https://arxiv.org/html/2608.06396#bib.bib17)\)。先前方法通过选择性专家更新、专门化适配设计或路由优化来利用专家专业化,而 TEXAS 则使用任务专家激活来决定应在何处施加更强的词元级监督。

## 方法

TEXAS 由两个紧密耦合的组件组成:一个正确性条件化的任务专家发现过程,以及一个用于下游 MoE 适配的任务专家感知监督策略。图2 (https://arxiv.org/html/2608.06396#Sx3.F2)给出了所提出框架的概览。

参见图2:TEXAS 概览。我们首先根据基础模型成功与失败拆分训练实例,并通过带候选过滤的正确性条件化激活差异来识别任务专家。在微调过程中,TEXAS 会提高其当前计算路径激活了所发现任务专家的答案词元的监督权重。

### 正确性条件化的任务专家发现

现有的专家选择方法通常使用聚合路由统计(例如任务数据上的激活频率或门控分数)来识别任务专家。然而,较高的总体使用率并不一定表示专家与成功任务完成相关。TEXAS 则通过比较基础模型在成功解决和未能解决的实例上的专家激活来发现任务专家。

给定一个下游训练集 \(\mathcal{D}\) 和一个基础 MoE 模型 \(\mathcal{M}_0\),我们对每个训练实例应用任务特定的推理和评估过程。\(\mathcal{M}_0\) 满足相应成功标准的实例构成成功子集 \(\mathcal{D}^+\),其余实例构成失败子集 \(\mathcal{D}^-\)。任务特定的推理过程和成功标准见附录 A。

然后,我们对参考答案执行教师强制的正向传播,以收集模型原生的 top-\(k\) 路由决策。对于每个实例 \(i\)、层 \(\ell\) 和专家 \(e\),我们将答案级激活率定义为

\[
a_{i,\ell,e}=\frac{1}{|\mathcal{A}_i|}\sum_{t\in\mathcal{A}_i}\mathbf{1}\left[e\in R_{i,t}^{(\ell)}\right],
\]

其中 \(\mathcal{A}_i\) 表示实例 \(i\) 的答案词元位置,\(R_{i,t}^{(\ell)}\) 是模型原生 top-\(k\) 路由器在层 \(\ell\) 为词元 \(t\) 选择的专家集合。

对于每个层–专家对,我们使用单侧 Welch \(t\) 检验比较其在成功实例与失败实例上的实例级激活率:

\[
H_0:\mu_{\ell,e}^+\leq\mu_{\ell,e}^

相似文章

MoEGen:用于实例自适应LoRA生成的专家混合方法

arXiv cs.CL

本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。