20B循环模型(论文)以10%的预训练token匹配或超越Qwen3 Coder 30B
摘要
Loopie模型采用循环变换器架构,仅用10%的预训练token即可匹配或超越Qwen3 Coder 30B的性能,展现出强大的推理能力和高效的扩展性。
暂无内容
查看缓存全文
缓存时间: 2026/07/21 16:45
# 循环不已! 来源:https://arxiv.org/html/2607.16051 \authorTwo 高子天 \authorTwo 陈奕龙 \authorTwo 肖逸昊 \authorTwo 杨新宇 \authorThree 陶然 \authorThree Joey Zhou \authorThree Bryan Dai \metadata\[\] 查看完整的作者贡献请点击此处 (https://arxiv.org/html/2607.16051#Sx1)。 ###### 摘要 我们提出了 Loopie 系列,包含两个混合专家(MoE)模型:一个 20B 参数(2B 激活参数)模型和一个 6B 参数(0.6B 激活参数)模型。循环神经网络长期以来面临一个挑战:当预训练算力增加 \(N\) 倍时,将参数数量扩大 \(N\) 倍通常优于将模型循环 \(N\) 次。Loopie 解决了这一挑战。大量消融实验(包括与普通 30B-A3B 模型的比较)表明,在相同算力预算下,Loopie 显著优于普通 Transformer 基线。借助新颖的后训练方法,Loopie 具备了强大的推理能力,并达到了前沿推理性能。 ![[无标题图片]](https://arxiv.org/html/2607.16051v2/x3.png) ###### 目录 1. [引言](#S1) 2. [Loopie 系列](#S2) 1. [架构](#S2.SS1) 2. [为什么采用层循环?](#S2.SS2) 3. [动机](#S2.SS3) 4. [Loopie 配方](#S2.SS4) 5. [结果](#S2.SS5) 6. [可扩展性](#S2.SS6) 7. [消融实验](#S2.SS7) 8. [为什么只用两个循环步骤?](#S2.SS8) 3. [预训练](#S3) 1. [评估](#S3.SS1) 2. [初始化](#S3.SS2) 3. [学习计划](#S3.SS3) 4. [阶段 1:多轮高质量预训练](#S3.SS4) 5. [阶段 2:高质量退火](#S3.SS5) 4. [后训练](#S4) 1. [监督预训练](#S4.SS1) 2. [强化学习](#S4.SS2) 3. [结果](#S4.SS3) 5. [相关工作](#S5) 1. [循环 Transformer](#S5.SS1) 2. [归纳偏置](#S5.SS2) 3. [理论、机制与缩放](#S5.SS3) 4. [架构、训练目标与推理](#S5.SS4) 5. [上下文、算法与组合泛化](#S5.SS5) 6. [抽象推理](#S5.SS6) 6. [未来工作](#S6) 7. [结论](#S7) 8. [致谢](#S8) 9. [参考文献](#bib) 10. [附录 A 架构细节](#Ax1) 11. [附录 B 预训练细节](#Ax2) 12. [附录 C 缩放阶梯细节](#Ax3) 13. [附录 D 监督预训练细节](#Ax4) ## 1. 引言 循环 Transformer(最早作为通用 Transformer 提出\[dehghani2018universal\])最近重新成为传统深度缩放的有力替代方案。它不是堆叠不同的层,而是在循环步骤中反复应用同一模型,这紧密联系了 Transformer 中的参数共享方法\[lan2019albert; dehghani2018universal\]。这种循环方法在语言建模、算法学习和抽象推理等多个领域展现了强大的实证性能\[gao2025universal; yang2023looped; jolicoeurmartineau2025trm; wang2025hierarchical; dehghani2018universal; saunshi2025latentthoughts; bay2025mixture; geiping2025scalinglatent; zhu2025scalinglatent; frey2026adaptive; huang2026equilibrium\]。越来越多的研究表明,循环计算特别适合复杂问题。循环 Transformer 在上下文学习与数据拟合任务上可以超越普通 Transformer,并且能够以更少的参数实现上下文中的多步梯度下降\[yang2023looped; fan2024looped; giannou2023looped; gatmiry2024can; gatmiry2024role; chen2025bypassing\]。关于循环 Transformer 的研究还表明,循环计算允许浅层参数化在推理任务上接近更深层的非绑定模型\[saunshi2025latentthoughts; jeddi2026loopformer; geiping2025scalinglatent; zhu2025scalinglatent\]。这些优势在抽象推理任务(如 ARC-AGI、数独和迷宫)上尤为明显,近期循环模型的结果表明,循环为组合泛化、规则发现和归纳推理提供了强大的归纳偏置\[wang2025hierarchical; jolicoeurmartineau2025trm; gao2025universal\]。 最近的工作开始将循环 Transformer 扩展到十亿参数的语言模型。Ouro 模型通过四个循环步骤达到 1.4B 和 2.6B 参数,相对于更大的密集基线显示出较强的参数效率\[zhu2025scalinglatent\]。Huginn 扩展到 3.5B 参数,并利用 32 个循环步骤将参数转化为潜在计算\[geiping2025scalinglatent\]。其他系统进一步研究了自适应循环、高效推理、记忆-计算权衡以及稳定循环语言模型的缩放规律\[bay2025mixture; jeddi2026loopformer; frey2026adaptive; prairie2026parcae\]。 然而,这些进展暴露了一个基本的计算会计问题:在预训练期间将模型循环 \(N\) 次也会将预训练计算量乘以 \(N\)。因此,循环 Transformer 不仅应与具有相同参数量的普通 Transformer 进行比较,还应与在相同预训练计算预算下训练的非循环模型进行比较。这一观点与语言模型缩放和计算最优训练分析一致,这些分析将质量视为参数、数据和总训练 FLOPs 的函数,而非仅参数数量\[kaplan2020scaling; hoffmann2022training; prairie2026parcae\]。例如,Ouro-2.6B(4 次循环)应与参数数量接近 2.6B × 4 = 10.4B 的基线模型进行比较;同样,考虑预训练计算量后,Huginn-3.5B(32 次循环)应与大得多的 112B 参数基线模型进行比较。这引出了我们的核心问题:*在相同预训练计算预算下,循环 Transformer 能否匹配或超越普通 Transformer?* 我们用 Loopie 系列回答了这个问题:两个循环 MoE 大语言模型——Loopie-20B-A2B 和 Loopie-6B-A0.6B,每个模型使用两个循环步骤训练。我们的核心思想是 Loopie 配方,一种计算匹配的缩放配方,它解决了递归深度缩放的主要担忧:在固定预训练计算预算下,普通参数缩放否则会主导循环\[hoffmann2022training; prairie2026parcae\]。借助新颖的后训练方法,Loopie 具备了强大的推理能力,并达到了前沿推理性能。我们的贡献有三方面: - • **计算匹配缩放**。我们引入了 Loopie 配方来解决循环 Transformer 的固定计算挑战,并通过大量消融实验进行了验证。 - • **可扩展的循环 MoE 模型**。我们通过训练 Loopie-20B-A2B 和 Loopie-6B-A0.6B 证明循环计算可扩展到大型 MoE 语言模型。 - • **大规模后训练**。我们通过大规模后训练(包括一个新颖的监督预训练阶段)扩展了 Loopie,使其具备强大的推理能力。 图 1:层循环与模型循环的对比示意图。上图为层循环(Loopie 采用的循环方式),其中每个 Attention/MoE 层在输出传递到下一层之前被循环应用。我们证明这种方式在 MoE 骨干网络上性能更好,同时训练效率更高。下图为传统的全模型循环模式(我们称之为模型循环),即遍历整个层堆叠然后重复。这种模式被之前的循环模型(如 Ouro 和 Huginn\[zhu2025scalinglatent; geiping2025scalinglatent\])使用。 ## 2. Loopie 系列 本节介绍 Loopie 系列,从架构到其可扩展性的证据。我们首先定义 Loopie 的层循环模式,并将其与之前循环语言模型中使用的经典模型循环模式进行对比。然后,我们在固定预训练计算预算下进行设计动机分析,在这个预算下,使用递归深度的模型必须与将相同计算用于普通非递归容量的普通 Transformer 进行比较。基于这一动机,我们引入 Loopie 配方,一种用于选择存储宽度、存储深度和递归深度的计算匹配缩放配方。接着,我们展示主要的计算匹配结果,考察优势是否在不同模型规模上持续存在,并通过消融实验分离层循环模式的贡献。最后,我们讨论为什么 Loopie 只使用两个循环步骤。 ### 2.1 架构 Loopie 在很大程度上遵循了 Qwen3-MoE 架构。具体来说,其骨干网络是仅解码器的混合专家 Transformer,其注意力机制、稀疏模式以及其他架构细节与 Qwen3-MoE 系列保持一致。详细的架构规格见附录 A 架构细节。关键的架构差异在于循环计算的应用方式。Loopie 不是简单地将整个模型重复多次,而是采用了一种我们称为层循环的不同循环模式。之前的循环语言模型,如 Ouro 和 Huginn\[zhu2025scalinglatent; geiping2025scalinglatent\],主要使用我们称为模型循环的模式。在模型循环中,整个 Transformer 堆叠被递归展开:对于一个有三层、两个循环步骤的模型,计算顺序是 Layer 1 → Layer 2 → Layer 3 → Layer 1 → Layer 2 → Layer 3。相比之下,Loopie 使用层循环,其中每一层在计算移动到下一层之前被循环应用。对于同样的三层、两步例子,计算顺序变为 Layer 1 → Layer 1 → Layer 2 → Layer 2 → Layer 3 → Layer 3。也就是说,每个块对隐藏状态进行局部迭代,然后将得到的循环表示传递给下一层。图 1 展示了这种差异。 ### 2.2 为什么采用层循环? 层循环不仅是循环计算的不同顺序;它改变了迭代优化在模型内部发生的位置,从而影响缩放行为、执行效率以及参数在有效深度上的共享性质。我们采用层循环是因为它提供了三个在大规模预训练中特别重要的优势。 #### **更好的实证缩放**。在我们的预训练实验中,层循环的表现优于模型循环。如图 2 所示,层循环在预训练初期在下游基准上略低于模型循环,但在大约 1.2 万亿训练 token 后超越模型循环,并且之后提升更快。因此,模型循环的早期优势并没有随着训练预算的增加而持续。 图 2:Loopie-6B-A0.6B 的层循环与模型循环变体在下游基准平均得分上的比较。虽然层循环在训练初期落后于模型循环,但在后期超越了模型循环。 #### **基础设施友好的执行**。虽然层循环和模型循环具有相同名义上的层应用次数和理论 FLOPs,但层循环提供了更好的执行局部性。同一层的重复应用在前向和后向计算图中相邻,这缩短了参数和梯度贡献的重用距离,并简化了激活检查点和梯度累积,特别是在参数分片或卸载的情况下。这种局部性对流水线并行特别有利,因为层的所有循环应用在激活向前传递之前都保持在同一个流水线阶段内。相比之下,模型循环要求每个微批次重复遍历整个流水线,并在每个循环边界将最后阶段的输出路由回第一阶段,这引入了循环依赖,可能使调度复杂化,增加通信开销和流水线气泡,并降低设备利用率。 #### **自然的参数共享模式**。例如,考虑一个像 Qwen3-30B-A3B 这样有 48 层的模型,进行两次模型循环。第三个物理层在有效深度 3 和 48+3=51 处被应用。这两次调用发生在前序计算量显著不同的位置,因此接收到的隐藏状态处于相隔很远的有效深度。先前的分析表明,Transformer 表示在深度上是非均匀组织的:较低层和最终层可能与相对同质的中间层有显著差异,而不同的语言抽象往往在网络的不同阶段最容易获取\[sun2025transformer; tenney2019bert; jawahar2019bert\]。这些观察并不直接证明梯度冲突,但它们表明,相隔很远的有效深度的隐藏状态不应对共享变换提出相同的功能需求。因此,模型循环要求一个参数集适应可能异构的深度相关角色。相比之下,层循环在相邻有效深度上重用一层,导致更局部且可能更一致的参数共享模式。 ### 2.3 动机 尽管概念上吸引人,但循环 Transformer 历来是在不完全反映现代大规模语言模型预训练约束的环境中研究的。特别是,许多先前工作集中在密集、权重共享或循环 Transformer 变体上,并且主要将循环作为提高参数效率的机制进行评估\[zhu2025scalinglatent; geiping2025scalinglatent\]。这使得两个重要问题未得到充分探索。 首先,现代前沿语言模型越来越依赖混合专家架构,正如最近的 Qwen3、Kimi K2.5、GLM-5、DeepSeek-V4 和 MiniMax-M2 模型系列所展示的\[qwen3; kimi2026kimi25; glm5team2026glm5; deepseekai2026deepseekv4; minimax2026m2\]。MoE 模型扩展了总模型容量,同时保持每个 token
相似文章
@HuggingPapers: LoopCoder-v2 已发布。一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的高分,击败了...
LoopCoder-v2 是一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的成绩,性能超越 30 倍参数规模的模型。模型和代码已在 Hugging Face 上开源。
@DorothyDDU: LoopCoder-v2 已发布 Loop Transformers 重复使用同一个块进行循环隐藏状态优化——让模型“思考”更多……
本文介绍了LoopCoder-v2,一个70亿参数的并行循环变换器系列,用于代码生成,并研究了最优循环次数,发现两个循环能带来显著提升,而更多循环则会导致性能下降。
循环 Loopie!
Loopie 是一种新型循环 Transformer 模型,通过新颖的后训练流程,在 2025 年国际数学奥林匹克竞赛(IMO)和国际物理奥林匹克竞赛(IPhO)中无需外部工具即获得金牌表现。在相同计算预算下,它优于普通 Transformer。
Multilingual-Multimodal-NLP/LoopCoder-V2 · Hugging Face
LoopCoder-V2 是一个基于 Parallel Loop Transformer (PLT) 构建的 7B 参数指令调优代码模型,展示了非单调测试时扩展特性,其中两个循环提供了最佳的收益-成本权衡,并在代码生成和推理基准测试上显著优于基线模型。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。