LLaDA MoE v2:扩展混合专家扩散语言模型
摘要
一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。
查看缓存全文
缓存时间: 2026/08/05 09:44
论文页面 - LLaDA MoE v2:扩展混合专家扩散语言模型
来源:https://huggingface.co/papers/2608.03457 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
扩散语言模型(dLLM)为自回归(AR)语言建模提供了一种替代方案,然而混合专家(MoE)dLLM 的扩展行为仍未被充分理解。我们系统地刻画了 MoE dLLM 的优化超参数、计算分配和架构如何随规模变化,并识别出与先前针对 AR 模型所报道的扩展趋势之间的定量差异。具体而言,在优化方面,最优名义批次大小随计算量增长得更快,而最优学习率则衰减得更快。在模型-数据分配方面,IsoFLOP 分析显示出轻微的数据侧倾斜:最优 token 预算的增长速度快于激活的模型侧计算量。对于 MoE 架构,在固定的激活容量下,更大的规模越来越倾向于更大的专家池,而适度的专家粒度始终保持有效,分配给共享专家的激活容量比例在不同规模下保持稳定。在这些发现的指导下,我们从零开始训练了 LLaDA MoE v2,一个 30B-A3B 的 dLLM,使用了 23.5T 个 token。LLaDA MoE v2 使用的预训练 token 数量约为 Qwen3 的 65%,在多个知识、推理和编程基准测试上接近 Qwen3。仅经过监督微调后,它在八个推理和编程基准中的七个上优于 SDAR Chat,并在多个任务上与 Qwen3 保持接近。这些结果为 MoE dLLM 建立了实用的扩展规律和设计原则。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03457) 查看 PDF (https://arxiv.org/pdf/2608.03457) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03457)
在您的 agent 中获取此论文:
hf papers read 2608\.03457
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03457 以从此页面链接到它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03457 以从此页面链接到它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03457 以从此页面链接到它。
包含此论文的集合 1
相似文章
LLaDA2.X (GitHub 仓库)
蚂蚁集团发布LLaDA2.X系列扩散语言模型,扩展至千亿参数,采用MoE架构,开源模型权重和训练代码。
通过L0正则化混合专家模型加速稠密LLMs
本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。
改进的大型语言扩散模型
iLLaDA是一个80亿参数的掩码扩散语言模型,具有完全双向注意力机制,从头开始在12万亿token上训练。与LLaDA相比,它在多个方面都有显著改进,并在多个基准测试上与Qwen2.5 7B保持竞争力。模型和代码已开源。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
LLaDA2.0-Uni:用扩散大语言模型统一多模态理解与生成
LLaDA2.0-Uni 在单一扩散式大语言模型架构内统一了多模态理解与生成。