先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
摘要
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
arXiv:2608.10392v1 公告类型:新论文
摘要:混合专家(MoE)模型近期已超越固定数量完整专家的路由方式。共享专家设计保留可复用知识,细粒度方法在专家内部调整计算量,动态路由器自适应激活专家数量。然而,这些决策通常是独立做出的,忽略了一个基本依赖关系:提取可复用计算会同时改变剩余内容以及剩余部分所需的专家容量。我们通过将稀疏升级的前馈专家分解为键值通道来研究这一依赖关系。共激活的专家在部分值位置上对齐;移除这些位置会改变专家偏好;更大的共享覆盖率与更低的残余专家需求相关。这些观察引出一个原则:先共享,再路由剩余。我们将其实现为UniF-MoE,一个用于Token自适应MoE计算的统一框架。每个专家被划分为对齐的块。共享需求分数决定共享块数量和通路权重,键原型选择共享内容,互补需求通过累积路由质量决定残余专家数量。Gram正则化器分离并归一化路由器嵌入,促进多样的路由方向、稀疏的专家重叠以及简单的路由几何。在DomainBed和GLUE上的实验表明,这种统一设计相比具有代表性的静态和动态MoE提升了预测性能,同时减少了激活计算量、推理延迟和内存占用。代码可在 https://github.com/existence0420/UniF-MoE 获取。
查看缓存全文
缓存时间: 2026/08/12 08:29
# 词元自适应MoE计算的统一框架 来源:https://arxiv.org/html/2608.10392 ## 先共享,再路由剩余:词元自适应MoE计算的统一框架 ###### 摘要 混合专家(MoE)模型近期已超越路由固定数量完整专家的做法。共享专家设计保留了可复用知识,细粒度方法在专家内部改变计算量,动态路由器则调整激活专家的数量。然而这些决策通常独立进行,忽略了一个基本依赖关系:提取可复用计算会同时改变剩余内容及其所需的专家容量。我们通过将稀疏再利用的前馈专家分解为键值通道来研究这一依赖关系。共同激活的专家在部分值位置上对齐;去除这些位置会改变专家偏好;更大的共享覆盖度与更低的剩余专家需求相关。这些观察得出一个原则:先共享,再路由剩余。我们将其实例化为UniF-MoE,一个用于词元自适应MoE计算的统一框架。每个专家被
相似文章
ConMoE: 基于原型重分配的专家池整合实现MoE压缩
ConMoE提出了一种无需训练的混合专家模型压缩框架,通过选择一部分专家作为可重用原型,并确定性地将原始专家调用重新映射到这些原型,从而在不更新权重或微调的情况下减少内存占用。
UniMoMo:基于专家合并的大型推荐模型MoE加速
UniMoMo通过基于功能行为和路由流量合并专家来压缩基于MoE的推荐模型,在加速推理的同时保持质量。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由
EntropyMoE 为无分词器大语言模型引入了一种熵感知的专家混合架构,使用动态字节补丁作为路由单元,以实现稀疏条件计算。实验表明,在保持下游精度的同时,它在基线中取得了最低的留出法每字节比特数(bits-per-byte)。
UniPool:一种用于混合专家模型的全球共享专家池
UniPool 为混合专家(MoE)模型引入了一种共享专家池架构,在降低参数随深度增长的同时,相较于标准 MoE 基线提高了效率和性能。