运行上下文的recirculation修复技术

Reddit r/singularity 论文

摘要

论文介绍了'recirculation',这是一种针对基础模型的推理时架构增强技术,通过改进状态跟踪,显著降低了困惑度并提高了准确性,在生成过程中无额外延迟。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:11

# 循环重激活
来源:https://arxiv.org/html/2608.17981
Michael C. Mozer††注明共同第一作者。感谢Lei Bao、Mukul Bhutani和Lan Le对本研究的贡献。Shoaib Ahmed Siddiqui*
单位:Google DeepMind
邮箱:[[email protected]](mailto:[email protected])
Danny Sawyer
单位:Google DeepMind
邮箱:[[email protected]](mailto:[email protected])
Sunny Sanyal††注明该工作在DeepMind学生研究员期间完成。
单位:University of Texas, Austin
邮箱:[[email protected]](mailto:[email protected])
Rosanne Liu
单位:Google DeepMind
邮箱:[[email protected]](mailto:[email protected])

###### 摘要
我们描述了一种针对现成基础模型的推理时架构增强方法,该方法显著降低了困惑度,并提升了生成和推理任务的准确率。我们的方法在生成过程中基本不引入额外延迟,但在预填充阶段需要串行处理。基于前馈Transformer中状态更新受限于模型深度这一根本限制,我们的技术——循环重激活(recirculation)——引入了一种特定形式的递归,使模型能够充当动态系统并追踪信念状态。我们将此技术与思维链计算区分开来——后者更适合复杂推理而非基本状态追踪——同时也区别于流行的深度递归技术(循环)和代价高昂的递归Transformer训练。我们还提出并评估了循环重激活的自适应变体,该变体只需对超参数进行轻量调整,同时冻结原始模型权重。相对于现成的基线模型,自适应循环重激活在Gemma3系列上实现了显著提升,包括在一系列数据集上降低23%的困惑度,在GSM8k上提升21%的准确率,并在其他下游任务上实现可靠的准确率提升。我们这种免训练的方法通过利用模型本身来指导架构修改而取得成功,这暗示了一条由训练网络属性引导的、而非强制人为设计选择的架构演进路径。

## 1 状态追踪
追踪动态变化、不断演进的事态的能力,对于理解语言、推理情境以及建模周围世界至关重要。传统的状态追踪方法,如循环神经网络和卡尔曼滤波器,涉及对潜在变量进行迭代、顺序更新以捕捉动态。Transformer在训练和预填充阶段的并行操作,排除了以传统方式进行状态追踪的可能(Mozer et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib61))。Transformer学习到了多种巧妙的解决方案,使其在有限序列长度内能够有效地进行状态追踪(Li et al., 2025a (https://arxiv.org/html/2608.17981#bib.bib16); Piotrowski et al., 2025 (https://arxiv.org/html/2608.17981#bib.bib18); Prakash et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib19); Shai et al., 2024 (https://arxiv.org/html/2608.17981#bib.bib20))。然而,Transformer也可能无法追踪理解论证结构和社交互动所需的状态信息。基础模型中的状态追踪失败会导致多轮对话连贯性丧失(Laban et al., 2025 (https://arxiv.org/html/2608.17981#bib.bib6))、信息收集效率低下(Sawyer et al., 2025 (https://arxiv.org/html/2608.17981#bib.bib27)),以及在多智能体环境中通信与协作的崩溃(Davidson et al., 2025 (https://arxiv.org/html/2608.17981#bib.bib12); Khatua et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib11))。追踪缺陷可能导致一系列推理失败,源于无效的工作记忆、不稳定的心智理论表征以及缺乏稳健的内部世界模型(Song et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib60))。缺乏适当的状态追踪,模型可能在解释中摇摆不定,并且无法察觉自身的不一致性,例如,图1 (https://arxiv.org/html/2608.17981#S1.F1)中多义词“bank”的含义(Lepori et al., 2025 (https://arxiv.org/html/2608.17981#bib.bib7)),这被称为语境化错误。尽管模型同时接受两种“bank”(河岸/银行)解释的信念状态是完全合理的,但在承诺采用“河岸”解释后,一个社交能力强的沟通者应当承认这种含义的反转。

用户:Fred今天请假并拿出了他的钓鱼竿。他开车去了bank。当他到达bank时,他应该穿靴子还是人字拖?
模型:虽然人字拖在休闲日可能更舒适,但对于钓鱼来说,尤其是在河岸上,它们并非最佳选择。原因如下:……
用户:Fred很可能在这个bank找到ATM吗?
模型:Fred很可能在bank找到ATM。大多数银行,尤其是在钓鱼热门水域附近的银行,都设有ATM以方便客户。
**图 1**:由于未能追踪状态而导致的语境化错误示例。此示例由Gemini 2.5 Flash在2025年生成,受Lepori et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib7)启发。尽管模型有时回答正确,且更新更强大的模型已大大降低此错误的敏感性,但该示例揭示了核心架构的一个根本弱点。

一般来说,模型和人类都无法维系和追踪信念状态,因为状态分布在维度上会爆炸性增长。人们采用启发式方法,如采样(Vul et al., 2014 (https://arxiv.org/html/2608.17981#bib.bib8),例如)、将分布坍缩为原型案例(Tversky and Kahneman, 1971 (https://arxiv.org/html/2608.17981#bib.bib10)),或形成最符合前提的具体心智模型(Johnson-Laird, 1983 (https://arxiv.org/html/2608.17981#bib.bib9)),有点类似最大后验估计。所有这些方法仍然需要状态追踪,只是没有显式表示不确定性。

图2 (https://arxiv.org/html/2608.17981#S1.F2)a说明了在Transformer中进行状态追踪的挑战,使用了图1 (https://arxiv.org/html/2608.17981#S1.F1)中的银行对话。输入步骤沿水平轴展示,Transformer的块(或层)沿垂直轴展示。每列代表一个输入标记的处理过程,激活从底部流向顶部。文本“day off work”和“fishing pole”的处理展示在左侧的列中。Lepori et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib7)使用一种名为Patchscopes (Ghandeharioun et al., 2024 (https://arxiv.org/html/2608.17981#bib.bib22)) 的技术表明,当处理多义词“bank”时,浅层反映了该词的歧义性:其嵌入是其含义(河岸和金融机构)的混合。在堆栈的更深的层中(黄色高亮部分),嵌入由前面的文本(由蓝色箭头表示)进行语境化,并通过将嵌入推向河岸表征来选择该多义词语境适当的解释。由于架构是前馈的,Transformer的浅层无法访问此解释。因此,当模型被要求对ATM问题制定响应时,初始处理阶段仅看到“bank”的歧义表征。如果模型基于歧义表征(蓝色箭头)承诺给出响应(黄色高亮),它将选择错误的响应。尽管之前已将“bank”解释为河岸,但它未能访问此状态,而是基于歧义“bank”与ATM之间的强关联回应“是的”。Lepori et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib7)将这种延迟消歧描述为一场竞赛,模型的响应生成可能快于其内部语义收敛的速度。参考图注。

**图 2**:处理图1 (https://arxiv.org/html/2608.17981#S1.F1)示例时Transformer激活的示意图。网格状矩形表示Transformer块,行对应网络深度(从下到上为浅到深),列对应输入步骤(从左到右为第一个到最后一个)。(a) Transformer中状态表征的深度可能限制其用于推理的能力(改编自Lepori et al. (https://arxiv.org/html/2608.17981#bib.bib7), 2025 (https://arxiv.org/html/2608.17981#bib.bib7))。(b) 循环重激活将表征从Transformer深处推送到浅层,使状态可用于信息处理。

Lepori et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib7)通过一项干预实验获得了支持此解释的证据,如图2 (https://arxiv.org/html/2608.17981#S1.F2)b所示。他们按照常规方式处理输入序列,直到呈现bank标记的步骤。在这一步,他们将激活从歧义解决后的深层复制到浅层,然后继续处理输入序列。如图中箭头所示的这项干预,使语境化错误减少了60%。注:完整实验基于大量生成的问答集,其中包含一个需要正确语境化才能回答的关键标记,并仅对关键标记进行激活修补。Nikankin et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib97)还表明,在视觉语言模型中,将视觉标记的激活修补回较浅层可以提高性能。在此实验中,Lepori et al. (2025) (https://arxiv.org/html/2608.17981#bib.bib7)将浅层中的嵌入向量替换为深层对应的向量,但仅针对在给定上下文中预先识别为关键的特定标记。假设我们不是针对特定标记进行这种操作,而是针对每个标记位置以*无差别*方式进行,结果可能是什么?很可能是灾难性的,因为模型并未经过训练来容纳由此产生的反馈放大。但是,如果不是用一个嵌入向量替换另一个,而是仅从深层向浅层*泄漏*少量激活呢?这种泄漏可能足以丰富表征,而不至于将表征推离分布。因此,我们可能会观察到这种操作在*推理时*带来的好处,而*无需修改完全训练好的模型权重*。即使在不进行微调的情况下,此方案也可能有效,因为Transformer的残差流就像一个共享黑板,所有层都可以向其写入,这鼓励了跨层表征的对齐(Elhage et al., 2021 (https://arxiv.org/html/2608.17981#bib.bib70))。这里所说的对齐,是指深层与浅层通信时,可以假设特征之间存在1:1的对应关系,我们不需要任意的适配器,如全秩仿射变换或交叉注意力。

为什么会存在对齐?考虑残差流中嵌入向量的某个特定特征,并假设它与一个语义上有意义的概念相关联,例如“湿度”。无论该特征在堆栈中早期还是晚期被激活,由于加法的交换性,其对输出分布的直接效果是相同的。一些输入标记,如“pool”或“tears”,可能直接在输入嵌入中激活湿度特征。而像“bank”这样的歧义标记,由于多义性,可能不会为湿度特征产生多少内在激活。然而,如果我们从深层反馈消歧后的“bank”,湿度特征将被放大,为后续处理提供有用信息。注:此论点并不否认特征的来源层可能改变其作用,事实上,向下泄漏激活的论点正是为了利用角色的变化。层归一化是角色可能依赖深度的一种方式。然而,层归一化虽然可能改变特征的大小甚至极性,但不会重新定向特征。人们可能还会担心特征擦除:一旦特征不再需要,它可能会被“取消计算”。最近的研究缓解了这一担忧,该研究表明,当强迫每层输出与早期层正交的方向以防止特征擦除时,Transformer学习得同样好,甚至更好(Oh et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib62); Zhang et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib96))。

## 2 提出的方法:循环重激活
我们现在形式化我们的方法,我们称之为*循环重激活*,它涉及逐步运行一个大型语言模型,并在每一步之后,将深层的部分激活泄漏到浅层。图3 (https://arxiv.org/html/2608.17981#S2.F3)a展示了总体图景,其中递归箭头指定了一种可能的源层和目标层对。由于此图未指定递归如何与输入步骤协调,因此该图是模糊的,可能对应于几种不同的想法(Mozer et al., 2026 (https://arxiv.org/html/2608.17981#bib.bib61)),其中之一是循环重激活,另一个是文献中非常流行的想法——*循环Transformer*(Dehghani et al., 2019 (https://arxiv.org/html/2608.17981#bib.bib42); Giannou et al., 2023 (https://arxiv.org/html/2608.17981#bib.bib41))。出于教学目的,我们先讨论循环Transformer,然后描述其与循环重激活的关系。

循环Transformer是标准架构的一种参数高效变体。标准Transformer堆叠深度序列的*独特*Transformer块,而循环Transformer则多次应用一组共享的块。图3 (https://arxiv.org/html/2608.17981#S2.F3)b通过垂直方向展开图3 (https://arxiv.org/html/2608.17981#S2.F3)a的深度,并水平方向展开输入步骤,描绘了一个循环Transformer。在步骤1,呈现第一个输入令牌,计算激活堆栈,并在图中的第6层(循环的*源*),激活被传递到架构的第二个副本的第3层(循环的*目标*),然后传播活动到输出。彩色矩形表示当前输入令牌,深色轮廓的矩形是在给定步骤计算激活的块,阴影块是冻结的(或被KV缓存替换),浅色轮廓的矩形是当前步骤无关的占位符。随着每个输入步骤被处理,单个堆栈运行,而早期的堆栈被冻结(或处于KV缓存中)。该图展示了模型的逐步操作,正如自回归解码中所使用的那样。然而,当输入序列固定时——如在预训练或预填充阶段——整个序列可以并行计算。循环Transformer中的递归仅存在于深度方向:图3 (https://arxiv.org/html/2608.17981#S2.F3)b中的箭头在堆栈内定向。相比之下,循环重激活中的递归同时存在于深度*和*步骤方向,如图3 (https://arxiv.org/html/2608.17981#S2.F3)c所示。图3 (https://arxiv.org/html/2608.17981#S2.F3)c可以被视为将图3 (https://arxiv.org/html/2608.17981#S2.F3)b在步骤i的顶部堆栈和步骤i+1的底部堆栈的操作合并在一起。在循环重激活中,每个递归步骤(除了最开始的)并行运行两个输入堆栈。

相似文章

面向长时程LLM推理的上下文回收

arXiv cs.CL

本文介绍了ContextForge,一种层次化内存架构,将LLM上下文窗口视为可回收工作空间,在长时程任务上实现了显著的令牌和速度改进,同时在拥有2.76亿行的企业基准上保持了准确性。

语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。

残差上下文扩散语言模型(2分钟阅读)

TLDR AI

本文介绍了残差上下文扩散(RCD)模块,该模块通过回收扩散语言模型中丢弃的令牌表示来提高效率和准确性,在具有挑战性的推理任务上实现了5–10%的准确性提升,并将去噪步骤减少了多达4–5倍。