dMoE: 具有可学习块级专家的dLLMs
摘要
本文提出了dMoE,一种用于扩散大语言模型的块级混合专家框架,该框架将词元级专家分布聚合成块级路由,在保持性能的同时减少激活的专家数量和内存使用。
查看缓存全文
缓存时间: 2026/06/01 03:17
论文页面 - dMoE: 具备可学习块专家的扩散大语言模型
来源:https://huggingface.co/papers/2605.30876
摘要
扩散大语言模型与混合专家架构相结合时,面临块并行解码与令牌级专家选择之间的不匹配问题。dMoE 通过将令牌级分布聚合为块级路由来解决这一问题,从而减少激活的专家数量并提升效率。
扩散大语言模型(https://huggingface.co/papers?q=Diffusion%20Large%20Language%20Models)(dLLMs)近期作为一种有前景的自回归模型(https://huggingface.co/papers?q=autoregressive%20models)替代方案出现,在保持竞争力的同时天然支持并行解码(https://huggingface.co/papers?q=parallel%20decoding)。然而,随着 dLLMs 越来越多地与混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)(MoE)架构集成以扩展模型容量,块并行解码(https://huggingface.co/papers?q=block%20parallel%20decoding)与令牌级专家选择(https://huggingface.co/papers?q=token-level%20expert%20selection)之间出现了根本性不匹配。具体而言,每次 dLLM 前向传播会处理多个具有双向依赖关系的令牌,而传统 MoE 层则独立地为每个令牌进行路由。这种不匹配显著增加了唯一激活专家的数量,使推理过程愈发受内存限制。为解决此问题,我们提出 dMoE,一种简单而有效的块级 MoE 框架。dMoE 的核心思想是将每个块内的令牌级专家分布聚合成统一的块级专家分布(https://huggingface.co/papers?q=block-level%20expert%20distribution),并以此更协调地指导专家路由(https://huggingface.co/papers?q=expert%20routing)。通过这种方式,dMoE 在保持性能的前提下,大幅减少了推理过程中唯一激活专家的数量,从而缓解了内存瓶颈(https://huggingface.co/papers?q=memory-bound%20bottleneck)。在多种基准测试上的大量实验证明了 dMoE 的有效性。平均而言,dMoE 将唯一激活专家数量从 69.5 降至 14.6,同时保留了原始性能的 99.11%。此外,它减少了 76.64% 至 79.84% 的内存使用,并实现了 1.14 倍至 1.66 倍的端到端延迟(https://huggingface.co/papers?q=end-to-end%20latency)加速。代码地址:https://github.com/fscdc/dMoE
查看 arXiv 页面(https://arxiv.org/abs/2605.30876)查看 PDF(https://arxiv.org/pdf/2605.30876)项目页面(https://fscdc.github.io/dMoE/)GitHub(https://github.com/fscdc/dMoE)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30876)
在你的 agent 中获取此论文:
hf papers read 2605\.30876
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.30876 即可从此页面建立链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.30876 即可从此页面建立链接。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.30876 即可从此页面建立链接。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面建立链接。
相似文章
Inkling-Small-276B-12B,努力 "max" 对比 Qwen3.6-27B
Inkling-Small-276B-12B(一个混合专家模型,总参数量276B,活跃参数量12B)与 Qwen3.6-27B 之间的对比基准测试,使用 'max' 努力配置来评估性能。
Kimi K3 如何通过工程创新跻身前沿 [R]
Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。
Mixture-of-experts用于从IMU传感器进行手写轨迹重建
一种新的混合专家方法,用于从IMU传感器数据重建手写轨迹,该方法针对触摸阶段和悬停阶段分别设计了独立的专家模型,并提供了一个新的公开基准数据集。
数据融合与对比对齐用于无约束红外分子结构解析
本文针对从红外光谱中无约束分子结构解析的问题,提出了对编码器-解码器Transformer的改进,采用混合专家(MoE)解码器和对比对齐损失函数,在Top-K准确率上提升了超过10个百分点。
Chimera:混合视觉扩散Transformer的设计与Chinchilla式缩放
本文介绍了Chimera,一种具有原则性缩放方案的混合视觉扩散骨干网络,结合了Kimi Delta Attention、多头潜在注意力和稀疏混合专家,以高效处理长上下文图像和视频生成。它还提出了HeteroP,一种模块级超参数迁移方案,以及Chinchilla式缩放定律,用于训练一个具有20亿激活参数的110亿参数模型。