将循环深度改造进预训练语言模型:两种参数预算下的安装、外推、迁移与保持

arXiv cs.CL 论文

摘要

本文探索了如何以微创方式将循环深度改造进预训练语言模型(如Qwen2.5-0.5B),证明所得模型能够执行更深的潜在推理,外推到受监督深度之外,并优于为在token中推理而微调的稠密模型,同时也揭示了灾难性干扰的极限。

arXiv:2608.11233v1 公告类型:新 摘要:一个稠密的预训练语言模型可以被改造为具有循环深度,并学习一种迭代的潜在状态转移,这种转移在仅用最终结果进行退火后依然保留。Qwen2.5-0.5B-Instruct被拆分为前奏(Prelude)、一个权重共享的循环块(Recurrent Block)和尾声(Coda),并具有一条保持恒等映射的单循环路径,以及在后续循环上的重入桥。在循环1处,该改造在预注册的ARC基准测试组上不劣于其基础模型。有三项发现。第一,该机制是一种可复用的过程,而非终端答案查找,并且可以在两种参数预算下安装:冻结基础权重之上的6M(600万)训练参数,以及180M(1.8亿)全块参数。在中间步骤监督下,模型每个循环计算一个任务步骤,并且当只对最终答案评分时,该行为仍然持续。适配器在整体上与全块相当(83.8%对84.0%),在深度11以内领先,之后则落后。在受控的语言表述上,语言微调达到了79%–86%(零样本迁移很小);而从已安装机制开始的适配器语言训练,比匹配的新训练高出18.6个百分点,包括在保留测试集上的表现。第二,该操作可外推到其受监督深度的大约1.5倍,在深度18以内保持70%的准确率。第三,一个同等规模、经过草稿本(scratchpad)训练的模型在其学习到的范围内与循环模型相当,但超出该范围后崩溃。循环模型总体胜出:84%对72%;在深度10之外保持了53%对2.5%;回答速度快了7.6倍。因此,在系统级比较中,迭代式Transformer可以在潜在空间中进行更深的推理,且速度比针对同一任务微调的同等或更大模型更快。第二个任务(将规则反向运行)暴露了其极限:逆向过程可以单独学习,但没有任何延续训练能够在保留已安装机制和通用能力的同时学会它——这是一个灾难性干扰的边界。学习到的深度选择问题仍然悬而未决。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:25

# 将循环深度改造进预训练语言模型:两个参数预算下的安装、外推、迁移与保持
Source: https://arxiv.org/html/2608.11233

###### 摘要

一个稠密的预训练语言模型可以被改造为具有循环深度,并学习一种在仅结果退火(outcome-only annealing)后依然持续的迭代式潜在转移。Qwen2.5-0.5B-Instruct 被拆分为前奏(Prelude)、权重共享的循环块(Recurrent Block)和尾声(Coda),并带有一条保持恒等性的单循环路径,以及一个可训练的桥接模块,在后续循环中重新注入前奏表示。在循环 1 时,该改造在预注册的 ARC 测试组上相对于基础模型保持非劣效。本文有三个发现。第一,该机制是一种可复用的程序而非最终答案查找,并且能在两种预算下安装:冻结基础权重上的 600 万训练参数,以及 1.8 亿的全块参数。在中间步骤监督下,模型每个循环计算一个任务步骤,在仅对最终答案评分时依然持续,并且会越过问题的目标深度继续步进。适配器在总体上与全块相当(83.8% 对 84.0%),在深度 11 之前领先,之后落后。在语言微调下,全块变体在任务的控制性语言渲染上达到 79%-86%,而零样本迁移在两种预算下都极少;从已安装机制开始的适配器语言训练比匹配的新鲜训练高出 18.6 个百分点,包括在保留测试集上。第二,该操作可外推到其监督深度的大约 1.5 倍,在深度 18 之前保持 70% 的准确率。第三,一个相同规模的模型被微调为以 token 写出推理过程,在学习范围内与循环模型相当,但超出后崩溃。循环模型总体胜出,84% 对 72%,在深度 10 之后保持 53% 对 2.5%,并且以更少的输出 token 回答了 7.6 倍。这种系统级比较表明,迭代式 transformer 可以在潜在空间中进行更深层的推理,且比在相同任务上微调的相当或更大模型更快。第二个训练任务(反向运行规则)暴露了极限:反向任务在隔离条件下可学习(63/64),但在任一预算下,没有一种继续训练能在保留已安装机制和通用能力的同时获得该任务,这是一条灾难性干扰边界。学习深度选择仍是一个有待未来研究的开放问题。

## 1 引言

Transformer 通常通过在设计中增加层数或在生成时增加 token 来获得额外计算。循环深度模型提供了第三条轴:对隐藏状态反复应用共享变换。这可以在不增加不同块参数数量的情况下增加有效深度,并为自适应计算和潜在迭代计算创造了自然的位置。本研究的动机部分来自小规模从零训练的递归推理器:即层次推理模型(HRM)和微型递归模型(TRM),它们表明迭代潜在计算能使具有数百万参数的网络执行确定性推理任务,击败更大的模型 [Wang et al., 2025](https://arxiv.org/html/2608.11233#bib.bib24);[Jolicoeur-Martineau, 2025](https://arxiv.org/html/2608.11233#bib.bib12)。大多数循环深度工作(包括那条路线)都是从零训练循环架构。这里的问题是,这种能力是否可以改为安装:

> 一个预训练的、经过指令调整的稠密语言模型能否被精准改造为循环深度系统,恢复稳定的迭代机制,在奖励深度的任务上胜过已注册的稠密方法,同时不损害基础模型的通用能力,并且以多少参数成本实现?

由于重复块接收到的状态分布与预训练时遇到的不同,仅循环往往会使激活偏离流形。因此,必须在后续迭代中重新注入输入上下文,而且将上下文与携带状态组合的路径必须在所用优化器下切实接收到训练信号——这一性质不能想当然。此外,必须正确设计评估,以确保在循环中的正确位置、在模型被训练产生的表面上读取预测。循环机制本身意味着正确的状态可能被进一步迭代带到答案之后。最后,已巩固的机制可能被额外训练抹除。因此,模型转换被视为一个取证工程和测量问题。该程序使用精确恒等性检查、带有限差分交叉校验的梯度路径审计、强制深度评估、冻结行清单、同读取器评分、配对统计检验、检查点哈希和护栏硬停止。阴性结果在定位边界时会被保留和报告,而不是作为失败的调优实验被丢弃。

在相同手术上,以两种训练预算研究该改造。循环区域的整块适配(优化器标记参数 182,163,457 个,前向激活参数 180,556,929 个,见第 3.5 节)提供了语言训练迁移结果和基准保持测试组(第 10 节和第 7 节)。适配器预算(前向激活参数 601 万,预训练基础权重不变)提供了安装下限、匹配的深度剖面,以及自身的持续性和保持结果(第 6.2、9.4 和 11.4 节)。这两个预算构成了本文的指导性比较:较小的干预是否足以安装和运行该机制,以及较大的训练预算能带来什么。答案是一次测得的交叉(

相似文章

面向大型语言模型的卷积

arXiv cs.CL

本技术报告探讨了在Transformer块中为大型语言模型的查询/键/值投影添加轻量级深度可分离卷积,提供局部归纳偏置,以极小的参数成本提高下游任务准确性。

面向大型语言模型归因引导的持续学习

arXiv cs.LG

本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。