Looped MoE 的 Scaling Laws(缩放定律)

Hugging Face Daily Papers 论文

摘要

提出 Loop Scaling Laws,这是首个将循环(looped transformers)与稀疏性(MoE)和模型规模、数据量联合建模的缩放定律,研究表明在同等算力下,looped MoE 在推理基准上的表现可与约 2 倍规模的模型持平。

Looped transformers 和 Mixture-of-Experts(MoE)为高效扩展提供了两条互补的路径:在参数量固定的情况下,循环(recurrence)增加了计算深度;而在活跃计算量(active compute)固定的情况下,MoE 的稀疏性扩展了模型的总容量。然而,现有的缩放定律要么只建模循环,要么只建模稀疏性。在本工作中,我们提出 Loop Scaling Laws,这是首个将循环与稀疏性同模型规模和数据量联合建模的缩放定律。其核心是一个有界的、以稀疏度为条件的循环映射,用于刻画循环带来的有效参数增益,以及稀疏性如何提升这一增益。该定律对循环模型在留出数据上的损失预测比以往方法更准确,并且可以将标准的 dense 和 MoE 缩放定律作为特例恢复出来。除了预测能力之外,拟合出的定律还为在算力和显存约束下设计 looped MoE 模型提供了有原则的理论基础。下游评测进一步展示了这两个方向的互补优势:稀疏性带来了约 3 倍的活跃参数效率,循环在推理任务上带来了约 2 倍的总参数效率,而联合扩展则进一步推进了性能前沿。作为一项实用的延伸,我们在万亿 token 规模上验证了这些增益依然成立:在训练算力相同的条件下,一个采用定律推导出的循环参数的 looped MoE 在推理基准上可以匹配约 2 倍规模的非循环 MoE,同时还通过循环实现了测试时扩展(test-time scaling)。
查看原文
查看缓存全文

缓存时间: 2026/10/01 08:24

论文页面 - Scaling Laws for Looped Mixture of Experts

来源:https://huggingface.co/papers/2609.40316

摘要

Looped transformers(循环 Transformer)与 Mixture-of-Experts(MoE)为高效扩展提供了两条互补的路径:循环在固定参数量下增加计算深度,而 MoE 的稀疏性则在固定活跃计算量下扩大总容量。然而,现有的 scaling law 仍将循环与稀疏性孤立建模。在本工作中,我们提出 Loop Scaling Laws,即首个同时建模循环、稀疏性、模型规模与数据规模的 scaling law。其核心是一个有界的、以稀疏性为条件的循环映射,用于刻画循环带来的有效参数增益,以及稀疏性如何进一步提升这一增益。该定律对循环模型的 held-out loss 预测比已有方法更准确,并能将标准的 dense 与 MoE scaling law 作为特例还原出来。除了预测之外,拟合出的定律还为在计算与显存约束下设计循环 MoE 模型提供了有原则的依据。下游评测进一步展示了这两个维度的互补收益:在推理任务上,稀疏性带来约 3 倍的活跃参数效率,循环带来约 2 倍的总参数效率,而联合扩展则进一步推进了性能前沿。作为一项实用扩展,我们证明这些收益在 trillion-token 规模上依然成立:在相同训练计算量下,采用由定律导出的循环深度的循环 MoE,在推理基准上达到了约为其 2 倍规模的非循环 MoE 的表现,同时还能通过循环实现 test-time scaling(测试时扩展)。

查看 arXiv 页面 (https://arxiv.org/abs/2609.40316) 查看 PDF (https://arxiv.org/pdf/2609.40316) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.40316)

在你的 agent 中获取这篇论文:

hf papers read 2609.40316

还没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

没有模型与本论文关联

在模型的 README.md 中引用 arxiv.org/abs/2609.40316,即可从本页面链接到该模型。

引用本论文的数据集 0

没有数据集与本论文关联

在数据集的 README.md 中引用 arxiv.org/abs/2609.40316,即可从本页面链接到该数据集。

引用本论文的 Space 0

没有 Space 与本论文关联

在 Space 的 README.md 中引用 arxiv.org/abs/2609.40316,即可从本页面链接到该 Space。

包含本论文的合集 1

相似文章

突破两次循环:一种可扩展的循环混合专家模型配方

Hugging Face Daily Papers

论文提出了 LOOM,一种面向循环混合专家(Looped MoE)模型的可扩展配方,通过残差缩放与输入重注入来稳定循环过程,同时利用逐循环路由器(per-loop routers)提升专家使用的多样性,实现了稳定扩展至 9-12 次循环,并在 100M-1.7B 参数规模的模型上改善了困惑度与零样本准确率。

SMELT: 计算匹配的MoE循环Transformer扩展定律

Hugging Face Daily Papers

SMELT是一种方法,它在Mixture-of-Experts Transformer中循环中间层,以在匹配计算、参数和缓存预算的同时,提高训练效率和下游性能,从而实现更快的损失减少和实际收益。

大语言模型中的模型合并扩展定律

Hugging Face Daily Papers

本文建立了语言模型合并的实证扩展定律,确定了模型规模、专家数量与性能之间的幂律关系,从而能够为最佳模型组合提供预测性规划。

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。