SMELT: 计算匹配的MoE循环Transformer扩展定律

Hugging Face Daily Papers 论文

摘要

SMELT是一种方法,它在Mixture-of-Experts Transformer中循环中间层,以在匹配计算、参数和缓存预算的同时,提高训练效率和下游性能,从而实现更快的损失减少和实际收益。

循环Transformer通过迭代共享的层块来增加有效深度,但大多数评估在固定模型大小下进行比较,将架构优势与额外FLOPs混淆。我们研究了在Mixture-of-Experts Transformer上的循环,同时紧密匹配每个令牌的FLOPs、总非嵌入参数和KV缓存。通过一系列消融实验,我们得到了一种称为SMELT(Sparse MoE Transformer, middle layers Loop Twice)的方法,该方法循环中间一半的层两次,同时在所有三个预算上匹配未循环的基线。我们将SMELT扩展到四个大小,最大达54B非嵌入参数,并为每个架构拟合单独的Chinchilla风格扩展定律。SMELT的损失随计算减少更快,在计算最优前沿上节省了6.8--18.0\%的训练FLOPs。这种优势转移到了超出验证损失预测的下游基准测试上,在Code上最大,并随着样本长度和上下文中示例数量的增加而增长。机制分析表明,第二次访问减少了注意力汇聚,并将注意力重定向到与内容相关的令牌上,这种归纳偏置可能是观察到的性能增益的基础。这些结果表明,即使在预算匹配的情况下,循环也能改进Transformer,提供了一种实用的方法,将深度重用转化为可衡量的增益。
查看原文
查看缓存全文

缓存时间: 2026/09/02 03:43

论文页面 - SMELT:计算匹配的 MoE 循环 Transformer 的缩放定律

来源:https://huggingface.co/papers/2609.01343

摘要

在稀疏的混合专家 Transformer 中循环中间层,可以在匹配每 token FLOPs、参数和缓存预算的同时,提高训练效率和下游性能。

循环 Transformer(https://huggingface.co/papers?q=Looped%20Transformers)通过迭代共享的层块来增加有效深度,但大多数评估都在固定模型规模下进行,这混淆了架构优势与额外的 FLOPs。我们在紧密匹配每 token FLOPs、总非嵌入参数和 KV 缓存(https://huggingface.co/papers?q=KV%20cache)的条件下,研究了混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)Transformer 上的循环。通过一系列消融实验,我们得出了一个称为 SMELT(https://huggingface.co/papers?q=SMELT)(稀疏 MoE(https://huggingface.co/papers?q=Sparse%20MoE)Transformer,中间层循环两次)的方案,该方案将中间一半的层循环两次,同时在所有三个预算上匹配未循环的基线。我们将 SMELT(https://huggingface.co/papers?q=SMELT)扩展到四种规模,最大达到 540 亿个非嵌入参数,并为每种架构拟合了单独的类 Chinchilla(https://huggingface.co/papers?q=Chinchilla)缩放定律。SMELT(https://huggingface.co/papers?q=SMELT)的损失随计算量下降更快,在计算最优前沿上节省了 6.8%-18.0% 的训练 FLOPs。这种优势在超越验证损失预测的下游基准测试中也得以体现,在代码任务上效果最大,并且随着样本长度和上下文示例数量的增加而增长。机制分析表明,第二次处理减少了注意力汇聚(https://huggingface.co/papers?q=attention%20sink),并将质量重新导向与内容相关的 token,这种归纳偏置可能是观察到的性能提升的基础。这些结果表明,即使在预算匹配的情况下,循环也能改进 Transformer,提供了一个将深度重用转化为可衡量收益的实用方案。

查看 arXiv 页面(https://arxiv.org/abs/2609.01343)查看 PDF(https://arxiv.org/pdf/2609.01343)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01343)

在你的代理中获取此论文:

hf papers read 2609\.01343

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.01343 以从本页链接它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接它。

相似文章

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

循环Loopies!

Hugging Face Daily Papers

Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。