突破两次循环:一种可扩展的循环混合专家模型配方
摘要
论文提出了 LOOM,一种面向循环混合专家(Looped MoE)模型的可扩展配方,通过残差缩放与输入重注入来稳定循环过程,同时利用逐循环路由器(per-loop routers)提升专家使用的多样性,实现了稳定扩展至 9-12 次循环,并在 100M-1.7B 参数规模的模型上改善了困惑度与零样本准确率。
查看缓存全文
缓存时间: 2026/10/05 04:45
论文页面 - 超越两次循环:一种可扩展的 Looped Mixture-of-Experts 配方
来源:https://huggingface.co/papers/2610.01153
摘要
LoopedTransformers 引入了循环深度(recurrent depth)这一新的大语言模型扩展轴:通过重复应用共享的 Transformer 块,它们在不增加参数量的情况下提升了有效深度。然而,在 FLOPs 对齐的比较条件下,循环对于大规模 MoE 大语言模型的收益仍不明确。其主要原因在于,额外迭代带来的增益会迅速衰减,甚至可能转为性能退化,因此用于循环的额外 FLOPs 很难换来实质性的提升。因此,以往的工作通常只停留在两次循环的设定上。
我们指出了扩展 Looped MoE 的两个主要障碍。第一,循环继承并放大了深度的诅咒:随着残差更新不断累积,隐状态方差会随每一次迭代增长,这使得深层循环变得不稳定,并导致表征漂移。第二,Looped MoE 面临专家选择坍塌(expert selection collapse)的问题:路由器在多次循环中反复选择相同的专家,因此额外的迭代只是增加了计算量,却没有增加计算的多样性。
基于上述诊断,我们提出了 LOOM,它建立在一个核心原则之上:每一次循环都应该贡献新的计算,同时保持循环状态的稳定。LOOM 通过缩放残差更新以约束方差增长,并在每一次循环中重新注入输入嵌入,从而稳定循环状态;同时,它通过逐循环路由器(激活不同的专家)以及一种将先前输出向后传递的循环残差(Looping Residual)来增加多样性。在 100M–1.7B 规模模型上的实验表明,该方法可稳定扩展至 9–12 次循环。在近似等 FLOPs 条件下,700M 模型在 5 次循环时表现最佳,将困惑度从 18.36 降至 16.54,并将平均零样本准确率从 38.84% 提升至 39.53%(相比非循环基线)。在不做 FLOPs 匹配的条件下,在 600 亿 token 上训练的 1.7B 模型在 9 次循环时达到峰值,困惑度从 9.62 降至 7.77,平均零样本准确率从 42.4% 提升至 47.7%。代码已开源:https://github.com/hed-ucas/LOOM
查看 arXiv 页面 (https://arxiv.org/abs/2610.01153) 查看 PDF (https://arxiv.org/pdf/2610.01153) GitHub0 (https://github.com/hed-ucas/LOOM) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2610.01153)
引用此论文的模型 0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。
引用此论文的 Spaces 0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2610.01153,即可从此页面链接到该论文。
收录此论文的合集 0
暂无合集收录此论文
将此论文添加到合集 (https://huggingface.co/new-collection),即可从此页面链接到该论文。
相似文章
Looped MoE 的 Scaling Laws(缩放定律)
提出 Loop Scaling Laws,这是首个将循环(looped transformers)与稀疏性(MoE)和模型规模、数据量联合建模的缩放定律,研究表明在同等算力下,looped MoE 在推理基准上的表现可与约 2 倍规模的模型持平。
循环Loopies!
Loopie引入了循环混合专家Transformer,在相同计算预算下性能优于普通Transformer,在2025年国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)中无需工具即获得金牌水平表现。
通过L0正则化混合专家模型加速稠密LLMs
本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。
大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行
一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。