聚焦关键:扩散MoE中利用显著性的精准路由
摘要
SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。
查看缓存全文
缓存时间: 2026/06/30 03:33
论文页面 - 聚焦关键之处:面向扩散MoE的显著性引导精确路由
来源:https://huggingface.co/papers/2606.26938
摘要
SharpMoE 通过利用干净潜特征引导显著令牌识别,解决了扩散模型中的路由效率问题,并采用轨迹路由损失在多步去噪过程中实现精确的计算资源分配。
混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)(MoE)架构已成为扩展扩散模型(https://huggingface.co/papers?q=diffusion%20models)在视觉生成(https://huggingface.co/papers?q=visual%20generation)领域的有力范式。近年来的进展集中在自适应地为不同令牌分配计算资源,以提升效率与性能。然而,我们指出现有扩散MoE框架中存在一个路由分配(https://huggingface.co/papers?q=routing%20assignment)问题:路由器无法准确地将更多计算资源分配给显著令牌(https://huggingface.co/papers?q=salient%20tokens)。我们的分析将这一失败归因于路由器在整个去噪过程(https://huggingface.co/papers?q=denoising%20process)中依赖受噪声污染的潜特征(https://huggingface.co/papers?q=latent%20features)。这种随机噪声掩盖了关键的结构与纹理信息,从而阻碍路由器有效区分显著令牌(https://huggingface.co/papers?q=salient%20tokens)。为解决此问题,我们提出 SharpMoE——一种后训练框架(https://huggingface.co/papers?q=post-training%20framework),采用显著性引导的精确路由机制,利用干净潜特征(https://huggingface.co/papers?q=latent%20features)作为无噪声的引导信号进行路由。通过绕过噪声扭曲的输入,SharpMoE 为路由器提供了清晰的显著性指导,使其即使在高噪声阶段也能识别显著令牌(https://huggingface.co/papers?q=salient%20tokens)。此外,我们引入了一种轨迹路由损失(https://huggingface.co/papers?q=trajectory%20routing%20loss),以约束整个多步去噪轨迹中的计算分配(https://huggingface.co/papers?q=compute%20allocation),确保沿生成展开过程的精确资源分配。大量实验表明,SharpMoE 是一种通用的即插即用解决方案,能够进一步增强预训练、已收敛的 MoE 模型,在视觉生成(https://huggingface.co/papers?q=visual%20generation)领域达到最新最佳性能。
查看 arXiv 页面(https://arxiv.org/abs/2606.26938) 查看 PDF(https://arxiv.org/pdf/2606.26938) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26938)
将本论文添加到您的智能体中:
hf papers read 2606.26938
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型
无
尚未有模型关联本论文
请在模型的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。
引用本论文的数据集
无
尚未有数据集关联本论文
请在数据集的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。
引用本论文的 Spaces
无
尚未有 Space 关联本论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。
包含本论文的收藏集
无
尚未有收藏集包含本论文
请将本论文添加到一个收藏集(https://huggingface.co/new-collection)中以关联本页面。
相似文章
粘性路由:训练MoE模型以实现内存高效推理
StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
基于肘部的MoE路由:一种免训练的推理时插件用于专家选择
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。
MoTE: 多任务视频理解中的任务专家混合
MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。