RecurTrace:具有循环时间记忆的自适应潜在推理
摘要
RecurTrace 引入了循环时间记忆和自适应停止机制,以改善语言模型中的潜在推理,在 MathQA 上实现了更高的准确性,并且与固定循环方法相比优化了计算量。
arXiv:2609.03379v1 公告类型:新
摘要:重复一个中间层的小块可以增加语言模型的有效推理深度,而无需添加参数或生成额外的令牌,最近的研究表明这种潜在循环可以改进推理。然而,两个设计选择限制了这些增益。每次迭代只能看到先前的输出,无法直接访问之前的计算。此外,固定的循环次数在简单输入上浪费了深度,而在困难输入上计算不足。我们引入了 RecurTrace,它使用循环自身的轨迹来解决这两个限制。具体来说,循环记忆注意力让每个循环层沿着循环时间轴关注其自身在先前迭代的状态,使模型能够重新访问之前的计算,而不仅仅依赖最新状态。一个停止头随后读取循环状态并预测是否继续,由一个预言机监督,该预言机识别何时额外深度仍然能减少损失。在相同循环骨干上的受控 MathQA 比较中,RecurTrace 以平均 2.0 次循环达到 56.9% 的准确性,在匹配计算下超过最佳固定循环深度 2.2 个百分点。相比之下,ACT 和 PonderNet 退化为一次循环,CALM 以 5.6 次循环仅达到 54.1%,而较强的 LoopUS-Conf 和 TaH-Mismatch 基线分别在 3.2 次循环时达到 55.3% 和 2.1 次循环时达到 55.7%。最后,RecurTrace 在 0.6B、1.7B、4B 和 8B 的相同预算微调基线上提高了生成准确性,增益随模型规模从 0.6 到 3.4 个百分点增长。
查看缓存全文
缓存时间: 2026/09/04 06:26
# MathQA准确率与平均循环次数关系图(1.7B模型,3次训练×8次评估种子)。数据点表示各训练种子的均值±1标准差;虚线标注最佳固定深度准确率(54.71%)。RecurTrace在约2次循环时达到56.92%准确率,比TaH-Mismatch基准高出1.25个百分点。内插图显示:固定深度准确率在2次循环时达到峰值。来源:https://arxiv.org/html/2609.03379
###### 摘要
重复执行中间层的小模块可以在不增加参数或生成额外token的情况下,提升语言模型的有效推理深度。近期研究表明,这种潜在循环能改善推理能力。然而,两种设计选择限制了性能提升:每次迭代仅能看到前一次输出,无法直接访问早期计算结果;固定循环次数会导致简单输入浪费计算深度,而复杂输入则缺乏足够计算资源。我们提出RecurTrace方法,通过循环自身的轨迹同时解决这两个限制。具体而言,循环记忆注意力机制允许每个循环层沿循环时间轴关注其自身在前几次迭代中的状态,使模型能够回溯早期计算,而非仅依赖最新状态。停止预测头则读取循环状态并预测是否需要继续循环,并通过神谕监督器识别何时额外深度仍能降低损失。在受控MathQA对比实验中,RecurTrace在相同循环骨架上以平均2.0次循环达到56.9%准确率,在相同计算量下比最佳固定循环深度高出2.2个百分点。相比之下,ACT和PonderNet收敛至1次循环,CALM仅以5.6次循环达到54.1%准确率,而更强的LoopUS-Conf和TaH-Mismatch基线分别以3.2次循环达到55.3%和以2.1次循环达到55.7%。最后,RecurTrace在0.6B、1.7B、4B和8B模型规模上均提升了生成准确率,性能增益随模型规模从0.6增长至3.4个百分点。
RecurTrace:基于循环时间记忆的自适应潜在推理
王宇翔1,2 冯昆宇1 沈英达1 许浩宁2 王俊宇2 吴志诚1,3,4
图1:MathQA准确率与平均循环次数关系图(1.7B模型,3次训练×8次评估种子)。数据点表示各训练种子的均值±1标准差;虚线标注最佳固定深度准确率(54.71%)。RecurTrace在约2次循环时达到56.92%准确率,比TaH-Mismatch基准高出1.25个百分点。内插图显示:固定深度准确率在2次循环时达到峰值。
## 1 引言
Transformer在处理简单问题和复杂问题时使用相同的层数。这种设计便于训练,但在推理阶段存在资源浪费。推理质量与有效深度成正比,无论深度来源于堆叠更多层、将思维链展开为token序列(Wei等人2022),还是在潜在空间迭代处理模块(Saunshi等人2025;Geiping等人2025)。其中,潜在循环能在不产生额外推理token的情况下增加有效深度——它在推理时增加深度却不引入新参数或延长输出,同时保持分词器和解码循环不变。
但两个问题阻碍了潜在循环实现其潜力。第一是循环遗忘问题:循环模块用相同层重复处理自身输出,仅传递单个隐藏状态。早期迭代的计算结果必须融入该状态或被后续传递覆盖。无法访问自身历史的循环无法实现跨迭代推理。第二是计算预算分配问题:循环模型为整个数据集固定迭代次数,导致简单问题获得与复杂问题相同的循环次数。
图1展示了这种代价:在MathQA数据集上,1.7B循环模型在2次循环时达到54.7%准确率峰值,在8次循环训练上限处保持约53.6%准确率,而在16次循环时降至47.5%。更多循环起初无益甚至有害,因此固定预算无法适应所有输入。
针对记忆问题,两项并行研究为循环语言模型添加外部存储:Frey等人(2026)的门控键值库和MeSH(Yu等人2025)的多槽缓冲区与读写路由器,两者都增加了额外参数和学习型读写机制。针对预算分配问题,自适应计算时间ACT(Graves 2016)和PonderNet(Banino、Balaguer和Blundell 2021)在计算惩罚或几何先验下停止;CALM(Schuster等人2022)等置信度规则在中间状态确定时退出;混合递归(Mixture-of-Recursions)为每个token分配独立递归深度但路由器需从头训练(Bae等人2025)。
对于预训练模型的循环模块,额外循环惩罚会导致停止过早,置信度阈值会导致停止过晚。我们的起点是:循环过程本身已生成解决两个问题所需的一切,无需外部机制。早期迭代计算的状态即现成记忆,当前状态包含是否需要更多循环来改变答案的证据。
因此,我们提出RecurTrace,将预训练Qwen3模型(Yang等人2025)转化为具有学习型停止机制的记忆增强循环推理器。针对遗忘问题,我们为每个循环层添加循环记忆注意力模块。沿循环时间轴,每个token从当前状态关注自身在前次循环中的状态,使层能读取一两个迭代前计算的内容。该模块与现有自注意力并列,增加少量参数且不跨token位置混合信息,因此不会泄露未来token信息。针对预算分配问题,我们训练停止预测头读取循环状态,预测更深循环是否仍有帮助。其监督来自神谕器:为每个训练样本记录答案停止改善时的深度,该测量目标直接使用,不添加计算惩罚或置信度代理。推理时模型循环至预测头判断停止,因此深度按输入分配而非固定设置。
记忆与停止预测头相互依存:没有记忆时,额外循环收效甚微,预测头无法通过延长输入处理获得增益;没有预测头时,所有输入获得相同循环次数,记忆带来的有益循环在简单输入上浪费,在复杂输入上则被剥夺。
图1预览了MathQA上的结果:RecurTrace以2.0次循环达到56.9%准确率,在相同平均深度下比最佳固定循环预算提高2.2个百分点,并超越所有测试的自适应计算基线(包括近期LoopUS(Park等人2026)和Think-at-Hard(Fu等人2026b))。RecurTrace也易于采用:所有基础权重保持冻结,添加模块仅占约2.2%参数,初始几乎不活跃——单次循环能精确复现预训练模型,为更多循环构建安全基线。在0.6B、1.7B、4B和8B规模上,RecurTrace均提升了相同预算基线的生成准确率,增益随模型规模增长至8B时的3.4个百分点,并在所有规模上降低了教师强制损失。
我们的贡献包括:
- • **循环记忆注意力**:沿循环时间轴的注意力机制,使每个token读取自身在前次循环中的状态。循环模块保持完全权重绑定且不携带外部存储。
- • **神谕蒸馏停止判断**:序列级停止预测头,由更深层循环是否仍降低损失进行监督,而非先验、惩罚或置信度规则。在六项任务上匹配或超越最佳固定深度。
- • **单模型适应所有深度**:单个训练模型服务所有测试时循环深度,无需为每个预算训练独立模型。该方案在0.6B至8B规模上保持准确率和似然增益。
## 2 相关工作
#### 循环与递归深度Transformer
通过复用层增加深度而不引入新参数的方法可追溯至通用Transformer(Dehghani等人2019)、权重绑定模型如ALBERT(Lan等人2020)和深度平衡模型(Bai、Kolter和Koltun 2019)。该方法在推理任务中成效显著:Saunshi等人(2025)证明循环k层模块可媲美kL层网络;Geiping等人(2025)采样迭代次数以实现更深展开;Zhu等人(2025)大规模预训练循环模型。Encode-Think-Decode(Koishekenov、Lipani和Cancedda 2026)重运行预训练中间块,CoTFormer(Mohtashami、Pagliardini和Jaggi 2025)交替循环与新鲜表征。
普通循环方法仅在迭代间传递前次输出,不保留中间状态的可寻址记录。RecurTrace添加该记录并沿循环时间轴通过注意力读取。Dreamer(Knupp等人2026)在循环稀疏专家架构中沿深度进行注意力,而RecurTrace将其循环时间读取和停止机制嫁接到冻结的密集模型上。
外部存储位于循环过程之外,包括Frey等人(2026)的门控记忆库和MeSH(Yu等人2025)的多槽缓冲区。DiscoLoop(Fu等人2026a)和PonderLM(Zeng等人2026)将重新编码的预测反馈至循环。RecurTrace保持模块权重绑定且不添加存储,仅查询循环已产生的轨迹。并行的LoopUS(Park等人2026)同样将预训练模型重构为编码-思考-解码块与选择性门控,不保留可寻址历史,并采用我们发现会过度消耗循环预算的置信度规则退出。
图2:RecurTrace架构。冻结编码器馈入权重绑定模块,该模块循环至可变深度,在首次循环后重新注入输入。在每个循环层前,循环记忆注意力读取三循环滑动窗口中的同位置状态。随机深度训练支持多种深度,而神谕蒸馏停止预测头预测额外循环是否有益,为复杂输入分配更多计算。停止后,剩余冻结层生成答案。
#### 自适应计算与早退
自适应计算时间ACT(Graves 2016)累积停止概率,PonderNet(Banino、Balaguer和Blundell 2021)在步骤几何先验下停止。针对预训练模型,深度自适应解码(Elbayad等人2020)、DeeBERT(Xin等人2020)和CALM(Schuster等人2022)在层确信时提前退出;深度混合(Mixture-of-Depths,Raposo等人2024)仅对部分token使用每层。混合递归(Mixture-of-Recursions)通过从头训练的路由器按token调整递归深度(Bae等人2025);Think-at-Hard(Fu等人2026b)仅对一次传递后预测错误的token进行迭代。
我们调整循环模块重复频率,按序列停止,并使用标记更深层循环是否降低损失的神谕监督预测头,而非先验、惩罚、置信度或token不匹配规则。因此它询问增加深度对序列何时有益,而非单个token是否错误。
#### 测试时计算扩展
思维链提示(Wei等人2022)、自一致性(Wang等人2023)和自适应测试时扩展(Zhai等人2026)使用额外解码计算;强化学习训练推理模型(Zhang等人2025)。互补方向保持潜在性:添加暂停token(Goyal等人2024)或隐藏状态反馈作为连续思维(Hao等人2025;Wei等人2025)。
潜在循环按token扩展计算而不产生token,RecurTrace探讨如何让每次循环发挥作用及何时停止。
RecurTrace始于具有L层Transformer的预训练LLM,其中层ℓ将隐藏状态h映射为层ℓ(h)。我们指定连续的k层中间模块B={s,...,s+k-1}作为循环思考块,在推理时重复T次。块前层作为编码器,块后层作为解码器,遵循编码-思考-解码视图(Koishekenov、Lipani和Cancedda 2026)。图2展示其设计。三个要素使循环有效:跨迭代携带信息的记忆、暴露模型于多种深度的变深度训练、以及为每个输入选择深度的停止预测头。
#### 循环块选择
我们将块置于迭代收益最大处。遵循Koishekenov、Lipani和Cancedda(2026)的角距离探针,首先定位相邻层表征移动最小的宽阔中间段(最接近固定点行为),再通过行为消融选择紧凑的三层窗口。这为28层0.6B和1.7B Qwen3基础模型确定第12-14层,为36层4B和8B模型确定第15-17层。探针核心与后期块控制组效果相当或较弱(附录B)。
#### 循环计算
设e为块输入(s-1层输出),x_ℓ^(t)表示层ℓ在循环t时产生的状态。每个首次循环后的迭代开始时重新注入块输入:
h ← h + α·RMSNorm(e)
其中标量α以ReZero风格(Bachlechner等人2021)初始化为零,因此注入初始为空操作。重新输入锚定了深度增长时的循环过程(Geiping等人2025),这一设计源于深度思考...相似文章
@machinestein: ICML 2026:TRMs中的潜在推理实际上是策略改进算子 为什么递归推理,尤其是…
论文揭示了基于transformer的推理模型(TRMs)中的潜在推理实际上充当了策略改进算子,并提出了一种算法,将学习和推理效率提升高达18倍。
LaTER:通过潜在探索与显式验证实现高效的测试时推理
本文介绍了 LaTER,一种两阶段推理范式,它将潜在探索与显式思维链(Chain-of-Thought)验证相结合,从而在保持准确率的同时,降低大型语言模型的标记使用量并提升效率。
端到端学习标量奖励模型的潜在推理轨迹
提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
Looped语言模型改进组合工具调用
Looped语言模型通过利用循环计算来增强组合工具调用,在多步任务中提高准确性,同时自适应推理优化了性能和计算成本之间的平衡。研究表明,这些模型对于可靠的智能体系统很有前景。