突破两次循环:一种可扩展的循环混合专家模型配方

Hugging Face Daily Papers 论文

摘要

论文提出了 LOOM,一种面向循环混合专家(Looped MoE)模型的可扩展配方,通过残差缩放与输入重注入来稳定循环过程,同时利用逐循环路由器(per-loop routers)提升专家使用的多样性,实现了稳定扩展至 9-12 次循环,并在 100M-1.7B 参数规模的模型上改善了困惑度与零样本准确率。

循环 Transformer(Looped Transformers)为大语言模型引入了循环深度这一新的扩展维度:通过反复应用共享的 Transformer 块,它在不增加参数量的情况下提升了有效深度。然而,在 FLOPs 对齐的比较条件下,循环带来的收益对大规模 MoE LLM 而言仍不明确。主要原因是,额外迭代带来的增益衰减得很快,甚至可能转为性能下降,因此为循环投入的额外 FLOPs 并未带来实质性的改进。因此,以往的工作通常止步于两次循环。我们识别出了扩展循环 MoE 的两个主要障碍。其一,循环继承并放大了深度的诅咒:随着残差更新的累积,隐藏状态的方差随每一次迭代而增长,这会破坏深层递归的稳定性,导致表征发生漂移。其二,循环 MoE 面临专家选择坍缩的问题:路由器在不同循环之间反复选择同一批专家,因此额外的迭代只增加了计算量,却没有增加计算多样性。基于这一诊断,我们提出了 LOOM,其构建基于一个单一原则:每一次循环都应贡献新的计算,同时保持递归状态的稳定。LOOM 通过缩放残差更新以限制方差增长,并在每一次循环中重新注入输入嵌入来稳定递归;同时通过调用不同专家的逐循环路由器,以及将早期输出向后传递的 Looping Residual,实现多样化的计算。在 100M-1.7B 规模模型上的实验表明,LOOM 可稳定扩展至 9-12 次循环。在接近等 FLOPs 的条件下,700M 模型在 5 次循环时表现最佳,困惑度从 18.36 降至 16.54,平均零样本准确率从 38.84% 提升至 39.53%。在不做 FLOP 对齐的情况下,用 60B token 训练的 1.7B 模型在 9 次循环时达到峰值,困惑度从 9.62 降至 7.77,平均零样本准确率从 42.4% 提升至 47.7%。代码已在 https://github.com/hed-ucas/LOOM 开源。
查看原文
查看缓存全文

缓存时间: 2026/10/05 04:45

论文页面 - 超越两次循环:一种可扩展的 Looped Mixture-of-Experts 配方

来源:https://huggingface.co/papers/2610.01153

摘要

LoopedTransformers 引入了循环深度(recurrent depth)这一新的大语言模型扩展轴:通过重复应用共享的 Transformer 块,它们在不增加参数量的情况下提升了有效深度。然而,在 FLOPs 对齐的比较条件下,循环对于大规模 MoE 大语言模型的收益仍不明确。其主要原因在于,额外迭代带来的增益会迅速衰减,甚至可能转为性能退化,因此用于循环的额外 FLOPs 很难换来实质性的提升。因此,以往的工作通常只停留在两次循环的设定上。

我们指出了扩展 Looped MoE 的两个主要障碍。第一,循环继承并放大了深度的诅咒:随着残差更新不断累积,隐状态方差会随每一次迭代增长,这使得深层循环变得不稳定,并导致表征漂移。第二,Looped MoE 面临专家选择坍塌(expert selection collapse)的问题:路由器在多次循环中反复选择相同的专家,因此额外的迭代只是增加了计算量,却没有增加计算的多样性。

基于上述诊断,我们提出了 LOOM,它建立在一个核心原则之上:每一次循环都应该贡献新的计算,同时保持循环状态的稳定。LOOM 通过缩放残差更新以约束方差增长,并在每一次循环中重新注入输入嵌入,从而稳定循环状态;同时,它通过逐循环路由器(激活不同的专家)以及一种将先前输出向后传递的循环残差(Looping Residual)来增加多样性。在 100M–1.7B 规模模型上的实验表明,该方法可稳定扩展至 9–12 次循环。在近似等 FLOPs 条件下,700M 模型在 5 次循环时表现最佳,将困惑度从 18.36 降至 16.54,并将平均零样本准确率从 38.84% 提升至 39.53%(相比非循环基线)。在不做 FLOPs 匹配的条件下,在 600 亿 token 上训练的 1.7B 模型在 9 次循环时达到峰值,困惑度从 9.62 降至 7.77,平均零样本准确率从 42.4% 提升至 47.7%。代码已开源:https://github.com/hed-ucas/LOOM

查看 arXiv 页面 (https://arxiv.org/abs/2610.01153) 查看 PDF (https://arxiv.org/pdf/2610.01153) GitHub0 (https://github.com/hed-ucas/LOOM) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2610.01153)

引用此论文的模型 0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。

引用此论文的 Spaces 0

暂无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。

收录此论文的合集 0

暂无合集收录此论文

将此论文添加到合集 (https://huggingface.co/new-collection),即可从此页面链接到该论文。

相似文章

Looped MoE 的 Scaling Laws(缩放定律)

Hugging Face Daily Papers

提出 Loop Scaling Laws,这是首个将循环(looped transformers)与稀疏性(MoE)和模型规模、数据量联合建模的缩放定律,研究表明在同等算力下,looped MoE 在推理基准上的表现可与约 2 倍规模的模型持平。

循环Loopies!

Hugging Face Daily Papers

Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。