SMELT: 计算匹配的MoE循环Transformer扩展定律
摘要
SMELT是一种方法,它在Mixture-of-Experts Transformer中循环中间层,以在匹配计算、参数和缓存预算的同时,提高训练效率和下游性能,从而实现更快的损失减少和实际收益。
查看缓存全文
缓存时间: 2026/09/02 03:43
论文页面 - SMELT:计算匹配的 MoE 循环 Transformer 的缩放定律
来源:https://huggingface.co/papers/2609.01343
摘要
在稀疏的混合专家 Transformer 中循环中间层,可以在匹配每 token FLOPs、参数和缓存预算的同时,提高训练效率和下游性能。
循环 Transformer(https://huggingface.co/papers?q=Looped%20Transformers)通过迭代共享的层块来增加有效深度,但大多数评估都在固定模型规模下进行,这混淆了架构优势与额外的 FLOPs。我们在紧密匹配每 token FLOPs、总非嵌入参数和 KV 缓存(https://huggingface.co/papers?q=KV%20cache)的条件下,研究了混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)Transformer 上的循环。通过一系列消融实验,我们得出了一个称为 SMELT(https://huggingface.co/papers?q=SMELT)(稀疏 MoE(https://huggingface.co/papers?q=Sparse%20MoE)Transformer,中间层循环两次)的方案,该方案将中间一半的层循环两次,同时在所有三个预算上匹配未循环的基线。我们将 SMELT(https://huggingface.co/papers?q=SMELT)扩展到四种规模,最大达到 540 亿个非嵌入参数,并为每种架构拟合了单独的类 Chinchilla(https://huggingface.co/papers?q=Chinchilla)缩放定律。SMELT(https://huggingface.co/papers?q=SMELT)的损失随计算量下降更快,在计算最优前沿上节省了 6.8%-18.0% 的训练 FLOPs。这种优势在超越验证损失预测的下游基准测试中也得以体现,在代码任务上效果最大,并且随着样本长度和上下文示例数量的增加而增长。机制分析表明,第二次处理减少了注意力汇聚(https://huggingface.co/papers?q=attention%20sink),并将质量重新导向与内容相关的 token,这种归纳偏置可能是观察到的性能提升的基础。这些结果表明,即使在预算匹配的情况下,循环也能改进 Transformer,提供了一个将深度重用转化为可衡量收益的实用方案。
查看 arXiv 页面(https://arxiv.org/abs/2609.01343)查看 PDF(https://arxiv.org/pdf/2609.01343)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01343)
在你的代理中获取此论文:
hf papers read 2609\.01343
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接它。
相似文章
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
循环Loopies!
Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。
内存高效型循环Transformer:循环语言模型中的计算与内存解耦
提出内存高效型循环Transformer(MELT),这是一种新型循环大语言模型架构,通过跨循环共享单一KV缓存,并结合插值过渡与注意力对齐蒸馏的分块训练方法,实现了推理深度与内存消耗的解耦。
@techNmak: 运行大型MoE模型最聪明的方式并不是增加更多GPU,而是不再把每个专家都视为值得占用GPU资源……
KTransformers 是一个优化大型混合专家模型推理和微调的框架,它通过将活跃的专家动态放置在 GPU 上,其余专家保留在 CPU 内存中,使得像 DeepSeek-V3 这样的大型模型能够在有限的消费级 GPU 内存上运行。
MESH:用于混合专家训练的内存高效Sinkhorn优化
本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。