聚焦关键:扩散MoE中利用显著性的精准路由

Hugging Face Daily Papers 论文

摘要

SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。

混合专家(MoE)架构已成为扩展视觉生成中扩散模型的强大范式。最近的进展集中在自适应地在不同令牌之间分配计算资源,以提高效率和性能。然而,我们在现有扩散MoE框架中发现了一个路由分配问题:路由器无法准确地将更多计算资源分配给显著令牌。我们的分析将此失败归因于路由器在整个去噪过程中依赖被噪声污染的潜在特征。这种随机噪声掩盖了关键的结构和纹理信息,从而阻止路由器有效区分显著令牌。为了解决这个问题,我们提出了SharpMoE,一个具有利用显著性的精确路由机制的后训练框架,该框架使用干净的潜在特征作为无噪声的引导信号进行路由。通过绕过噪声扭曲的输入,SharpMoE为路由器提供了清晰的显著性引导,使其即使在噪声较高的阶段也能识别出显著令牌。此外,我们引入了轨迹路由损失,以约束整个多步去噪轨迹中的计算分配,确保在生成过程中精确分配资源。大量实验表明,SharpMoE作为一种通用的即插即用解决方案,进一步增强了预训练且已收敛的MoE模型,在视觉生成中实现了最先进的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/30 03:33

论文页面 - 聚焦关键之处:面向扩散MoE的显著性引导精确路由

来源:https://huggingface.co/papers/2606.26938

摘要

SharpMoE 通过利用干净潜特征引导显著令牌识别,解决了扩散模型中的路由效率问题,并采用轨迹路由损失在多步去噪过程中实现精确的计算资源分配。

混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)(MoE)架构已成为扩展扩散模型(https://huggingface.co/papers?q=diffusion%20models)在视觉生成(https://huggingface.co/papers?q=visual%20generation)领域的有力范式。近年来的进展集中在自适应地为不同令牌分配计算资源,以提升效率与性能。然而,我们指出现有扩散MoE框架中存在一个路由分配(https://huggingface.co/papers?q=routing%20assignment)问题:路由器无法准确地将更多计算资源分配给显著令牌(https://huggingface.co/papers?q=salient%20tokens)。我们的分析将这一失败归因于路由器在整个去噪过程(https://huggingface.co/papers?q=denoising%20process)中依赖受噪声污染的潜特征(https://huggingface.co/papers?q=latent%20features)。这种随机噪声掩盖了关键的结构与纹理信息,从而阻碍路由器有效区分显著令牌(https://huggingface.co/papers?q=salient%20tokens)。为解决此问题,我们提出 SharpMoE——一种后训练框架(https://huggingface.co/papers?q=post-training%20framework),采用显著性引导的精确路由机制,利用干净潜特征(https://huggingface.co/papers?q=latent%20features)作为无噪声的引导信号进行路由。通过绕过噪声扭曲的输入,SharpMoE 为路由器提供了清晰的显著性指导,使其即使在高噪声阶段也能识别显著令牌(https://huggingface.co/papers?q=salient%20tokens)。此外,我们引入了一种轨迹路由损失(https://huggingface.co/papers?q=trajectory%20routing%20loss),以约束整个多步去噪轨迹中的计算分配(https://huggingface.co/papers?q=compute%20allocation),确保沿生成展开过程的精确资源分配。大量实验表明,SharpMoE 是一种通用的即插即用解决方案,能够进一步增强预训练、已收敛的 MoE 模型,在视觉生成(https://huggingface.co/papers?q=visual%20generation)领域达到最新最佳性能。

查看 arXiv 页面(https://arxiv.org/abs/2606.26938) 查看 PDF(https://arxiv.org/pdf/2606.26938) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.26938)

将本论文添加到您的智能体中:

hf papers read 2606.26938

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型

尚未有模型关联本论文

请在模型的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。

引用本论文的数据集

尚未有数据集关联本论文

请在数据集的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。

引用本论文的 Spaces

尚未有 Space 关联本论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.26938 以关联本页面。

包含本论文的收藏集

尚未有收藏集包含本论文

请将本论文添加到一个收藏集(https://huggingface.co/new-collection)中以关联本页面。

相似文章

粘性路由:训练MoE模型以实现内存高效推理

arXiv cs.LG

StickyMoE提出了一种可微的路由一致性损失函数,鼓励相邻token在MoE模型中激活相同的专家,从而在边缘设备推理过程中将专家交换开销和缓存未命中率降低高达3.92倍,同时改善困惑度。