@hooshaaii: 大语言模型通常在训练后停止学习。"In-Place Test-Time Training" 通过实时更新MLP权重改变了这一点。

X AI KOLs Timeline 论文

摘要

本文介绍了In-Place Test-Time Training,这是一个在推理过程中实时更新MLP权重的框架,使大语言模型能够动态适应并处理长达128k个令牌的长上下文。

大语言模型通常在训练后停止学习。 "In-Place Test-Time Training" 通过在提示时实时更新MLP权重改变了这一点! 它将冻结的KV缓存转化为动态内存,使模型能够实时“学习”128k上下文。🧠 🔗https://t.co/iojXRi64vv https://t.co/7OhEpGStuI
查看原文
查看缓存全文

缓存时间: 2026/08/28 05:50

大语言模型通常在训练完成后便停止学习。

“原位测试时训练“改变了这一现状,它在您提供提示时实时更新MLP权重!

它将冻结的KV缓存转化为动态记忆,使模型能够即时“学习“128k上下文。🧠

🔗https://t.co/iojXRi64vv https://t.co/7OhEpGStuI


原位测试时训练

来源:https://arxiv.org/html/2604.06169 1]字节跳动Seed 2]北京大学\贡献[⋆]同等贡献\贡献[†]通讯作者

(2026年4月7日)

摘要

静态的“先训练后部署“范式从根本上限制了大型语言模型(LLMs)在真实世界任务固有的持续新信息流中动态调整其权重的能力。测试时训练(TTT)提供了一个引人注目的替代方案,它在推理时更新一部分模型参数(快权重),但其在当前大语言模型生态系统中的潜力受到关键障碍的阻碍,包括架构不兼容、计算效率低下以及快权重目标与语言建模任务未对齐。在本文中,我们提出了原位测试时训练(In-Place TTT),这是一个无缝地赋予大语言模型测试时训练能力的框架。原位测试时训练将普遍存在的MLP模块的最终投影矩阵视为其可适配的快权重,无需从头进行昂贵的再训练,即可实现对LLMs的“即插即用“式增强。此外,我们用一个量身定制、具有理论基础且明确与自回归语言建模任务中下一词预测任务对齐的目标,替代了TTT通用的重建目标。这个有原则的目标,结合高效的分块更新机制,产生了一个可扩展且与上下文并行性兼容的算法。大量实验验证了我们框架的有效性:作为一种原位增强,它使一个40亿参数的模型在长达128k上下文的任务中取得了卓越性能;当从头预训练时,它始终优于具有竞争力的TTT相关方法。消融研究结果进一步深入揭示了我们设计选择的合理性。总而言之,我们的结果确立了原位TTT是迈向LLMs持续学习范式的一个有前景的步骤。

1引言

大型语言模型(LLMs)已在一系列复杂任务上展现出非凡能力[8 (https://arxiv.org/html/2604.06169#bib.bib8),11 (https://arxiv.org/html/2604.06169#bib.bib11),51 (https://arxiv.org/html/2604.06169#bib.bib51),39 (https://arxiv.org/html/2604.06169#bib.bib39)]。这一成功很大程度上建立在静态的“先训练后部署“范式之上,模型首先从海量语料库中获取知识,然后在推理期间保持固定。然而,这种设计带来了根本性的限制:一旦部署,模型的权重无法更新,从而阻止了对流式输入词元提供的特定上下文进行动态适应。因此,在测试时,模型处理和推理长期演变任务的能力受到限制[9 (https://arxiv.org/html/2604.06169#bib.bib9),45 (https://arxiv.org/html/2604.06169#bib.bib45)],也无法像人类一样从无限的经验流中持续学习[44 (https://arxiv.org/html/2604.06169#bib.bib44)]。

上下文学习[8 (https://arxiv.org/html/2604.06169#bib.bib8),56 (https://arxiv.org/html/2604.06169#bib.bib56)]通过在上下文中保留所有过去的输入词元,提供了一种缓解此问题的方法。然而,其有效性受限于模型的上下文窗口,而该窗口又受到事实上的注意力机制二次复杂度的限制[52 (https://arxiv.org/html/2604.06169#bib.bib52)]。这一瓶颈催生了一系列旨在高效扩展上下文窗口的架构解决方案研究[6 (https://arxiv.org/html/2604.06169#bib.bib6),42 (https://arxiv.org/html/2604.06169#bib.bib42),10 (https://arxiv.org/html/2604.06169#bib.bib10),17 (https://arxiv.org/html/2604.06169#bib.bib17)]。与此不同,测试时训练(TTT)已成为一种新范式[47 (https://arxiv.org/html/2604.06169#bib.bib47),53 (https://arxiv.org/html/2604.06169#bib.bib53),48 (https://arxiv.org/html/2604.06169#bib.bib48),3 (https://arxiv.org/html/2604.06169#bib.bib3),63 (https://arxiv.org/html/2604.06169#bib.bib63)]。TTT不仅仅使静态模型更高效,它使模型能够动态更新参数并适应任何特定上下文,直接针对前述限制。具体而言,TTT引入了少量模型参数子集,称为快权重[43 (https://arxiv.org/html/2604.06169#bib.bib43)],这些参数可以随每个新输入动态更新。通过最小化一个自监督重建目标,这些快权重压缩并内化上下文信息,充当一个富有表现力的、在线演变的状态。

尽管概念上具有吸引力,但在当前的大语言模型生态系统中释放TTT的潜力仍受到关键障碍的阻碍:(i) 现有的TTT方法通常依赖于标准Transformer模块之外的专用层,这些层通常需要从头进行昂贵的预训练才能达到令人满意的性能[47 (https://arxiv.org/html/2604.06169#bib.bib47),53 (https://arxiv.org/html/2604.06169#bib.bib53),67 (https://arxiv.org/html/2604.06169#bib.bib67),48 (https://arxiv.org/html/2604.06169#bib.bib48)];(ii) 经典的TTT机制本质上是顺序的[47 (https://arxiv.org/html/2604.06169#bib.bib47),48 (https://arxiv.org/html/2604.06169#bib.bib48)]。虽然现有工作探索了分块加速[49 (https://arxiv.org/html/2604.06169#bib.bib49),3 (https://arxiv.org/html/2604.06169#bib.bib3),30 (https://arxiv.org/html/2604.06169#bib.bib30),63 (https://arxiv.org/html/2604.06169#bib.bib63)],但TTT作为主要词元混合器的角色迫使依赖小块来维持性能,从而成为饱和现代加速器所需大规模并行的瓶颈;以及(iii) TTT快权重更新中普遍使用的通用重建目标并未明确针对控制自回归语言模型的因果性、下一词预测任务进行优化,可能阻碍其最终性能。

为弥合这一差距,我们提出了原位测试时训练(In-Place TTT),这是一个旨在通过直接解决上述障碍,无缝地赋予LLMs测试时训练能力的框架。我们的核心洞察是重新利用现有的MLP模块,采用原位设计,而非引入新的专用层(解决障碍i)。具体而言,原位TTT将MLP模块的最终投影矩阵视为其快权重,在推理过程中对其进行原位更新。这种“即插即用“设计无需修改模型架构,保留了预训练权重的完整性,并无需从头进行昂贵的再训练即可实现即时适应。

为解决计算效率低下和目标未对齐问题,我们进一步为语言建模设计了定制的适配机制。遵循先前的工作[49 (https://arxiv.org/html/2604.06169#bib.bib49),3 (https://arxiv.org/html/2604.06169#bib.bib3),30 (https://arxiv.org/html/2604.06169#bib.bib30),67 (https://arxiv.org/html/2604.06169#bib.bib67),63 (https://arxiv.org/html/2604.06169#bib.bib63)],我们用可扩展的分块更新规则替代了低效的逐词元更新(解决障碍ii)。此外,我们的原位设计与注意力机制互补运行。这种协同作用消除了独立TTT层所需的小块,从而确保在现代加速器上实现高吞吐量。同时,我们超越了先前工作[48 (https://arxiv.org/html/2604.06169#bib.bib48),67 (https://arxiv.org/html/2604.06169#bib.bib67)]的通用重建目标,引入了一个明确与下一词预测(NTP)目标对齐的新颖目标(解决障碍iii)。基于严格的理论分析,我们表明这种NTP对齐的目标鼓励快权重存储对自回归语言建模有预测价值的信息,从而产生一个高效且可扩展的算法。

基于这些有原则的设计选择,我们的原位TTT为增强LLMs的动态、持续适应能力提供了一个实用且有效的框架。我们在不同计算规模的语言建模任务上进行了大量实验,以此作为探究模型在长期演变任务中潜力的实际代理。通过相对廉价的持续训练,我们的原位TTT使Qwen3-4B-Base在上下文长达128k的任务中实现了卓越性能。此外,我们通过在长达32k长度的语料库上从头进行预训练,将原位TTT与具有竞争力的TTT相关方法进行了比较,验证了我们框架的架构优势。最后,对状态大小、块大小和快权重目标的消融研究提供了更深入的见解,证实了每个设计选择的关键作用。总而言之,我们的结果确立了原位TTT是迈向LLMs持续学习范式的一个有前景的步骤。

2预备知识:测试时训练

本节介绍测试时训练(TTT),这是一种使模型在推理时动态适应新数据的范式[47 (https://arxiv.org/html/2604.06169#bib.bib47),48 (https://arxiv.org/html/2604.06169#bib.bib48),67 (https://arxiv.org/html/2604.06169#bib.bib67)]。我们将首先阐述TTT机制,然后讨论成功将TTT应用于LLMs的关键要求,这直接激发了我们的框架。

TTT机制。其核心是,TTT机制利用快权重[2 (https://arxiv.org/html/2604.06169#bib.bib2),43 (https://arxiv.org/html/2604.06169#bib.bib43)],记为W。这些权重构成一个小型神经网络fW(⋅):Rd→Rdf_{\mathbf{W}(\cdot):\mathbb{R}^{d}\to\mathbb{R}^{d}),在测试时被快速更新。与训练后冻结的标准模型权重不同,快权重W充当动态记忆,持续从序列中存储和检索上下文信息。

为了处理输入序列x=[x1,x2,…,xN]\mathbf{x}=[x_{1},x_{2},\dots,x_{N}]),每个词元xi∈Rdx_{i}\in\mathbb{R}^{d})通常被投影以获得TTT操作所需的必要输入,例如查询(qiq_{i}\)、(kik_{i})和(viv_{i})。然后TTT机制通过两个核心的顺序操作运行:

  1. 更新操作:快权重W被更新,以将键kik_{i}与其对应的值viv_{i}关联起来。这被框定为一个优化步骤,最小化损失函数L(⋅,⋅)\mathcal{L}(\cdot,\cdot))(例如,均方误差),该函数衡量这种关联的差异。直观地说,这一步将(ki,vi)(k_{i},v_{i})对中的信息编码到神经记忆fWf_{\mathbf{W}})中。给定学习率η\eta,更新规则为:Wi←Wi−1−η∇WL(fWi−1(ki),vi).\mathbf{W}_{i}\leftarrow\mathbf{W}_{i-1}-\eta\nabla_{\mathbf{W}}\mathcal{L}\big(f_{\mathbf{W}_{i-1}}(k_{i}),v_{i}\big).
  2. 应用操作:新更新的网络fWf_{\mathbf{W}})(现在由Wi参数化)用于处理查询qiq_{i}),即oi=fWi(qi)o_{i}=f_{\mathbf{W}_{i}}(q_{i}))。此输出oio_{i}丰富了来自前面键值对的上下文信息,因为该信息现在已编码在Wi\mathbf{W}_{i})中。

虽然这个两步公式描述了TTT的高级机制,但具体的实现细节可能有很大差异。事实上,众多近期研究探索了丰富的设计空间,研究不同的损失函数、更复杂的优化器以及替代的神经记忆参数化,以提高性能和效率[54 (https://arxiv.org/html/2604.06169#bib.bib54),3 (https://arxiv.org/html/2604.06169#bib.bib3),5 (https://arxiv.org/html/2604.06169#bib.bib5),32 (https://arxiv.org/html/2604.06169#bib.bib32)]。这些设计选择对快权重存储、检索和遗忘序列信息的效率有关键影响,从而将TTT机制定位于不同的数据模态和任务。

LLMs生态系统中TTT的要求。尽管TTT作为动态适应范式很有前景,但要在LLMs生态系统中释放其潜力,必须解决几个关键挑战。要使TTT成为可行且有效的组件,它必须满足以下要求:

  • 架构兼容性。我们称一个架构与LLMs兼容,如果它可以预训练检查点热启动。然而,当前的TTT机制通常被开发为旨在替代注意力的独立循环层,而非补充它[47 (https://arxiv.org/html/2604.06169#bib.bib47),53 (https://arxiv.org/html/2604.06169#bib.bib53),67 (https://arxiv.org/html/2604.06169#bib.bib67),48 (https://arxiv.org/html/2604.06169#bib.bib48),29 (https://arxiv.org/html/2604.06169#bib.bib29)]。这需要从头进行昂贵的预训练,为主导LLMs生态系统的数十亿参数模型设置了重大采用障碍。因此,一个关键要求是无需根本性架构修改的“即插即用“设计。
  • 计算效率。该机制必须在现代并行加速器上高效运行。TTT经典的逐词元更新规则本质上是顺序的,因此严重阻碍了GPU和TPU的并行处理能力[47 (https://arxiv.org/html/2604.06169#bib.bib47),48 (https://arxiv.org/html/2604.06169#bib.bib48),3 (https://arxiv.org/html/2604.06169#bib.bib3)]。这种操作效率低下使得细粒度更新对于高吞吐量语言建模不切实际。因此,高效的TTT实现必须超越逐词元方案并确保可扩展性,例如采用分块更新机制[36 (https://arxiv.org/html/2604.06169#bib.bib36),49 (https://arxiv.org/html/2604.06169#bib.bib49),3 (https://arxiv.org/html/2604.06169#bib.bib3),30 (https://arxiv.org/html/2604.06169#bib.bib30)]。
  • 为语言建模量身定制的学习目标。TTT中主流的自监督目标是重建,即模型学习关联(kik_{i},viv_{i})对,其中viv_{i}通常来自输入词元xix_{i}本身[47 (https://arxiv.org/html/2604.06169#bib.bib47),48 (https://arxiv.org/html/2604.06169#bib.bib48),67 (https://arxiv.org/html/2604.06169#bib.bib67),53 (https://arxiv.org/html/2604.06169#bib.bib53),29 (https://arxiv.org/html/2604.06169#bib.bib29)]。虽然这个通用目标使TTT机制能够存储信息,但其与语言建模最终目标——预测下一个词元——的直接相关性无法保证。目标值vv的选择仍然是一个关键但尚未充分探索的设计决策,对于捕获LLMs所需的复杂因果依赖关系来说可能不是最优的。

3原位测试时训练

为满足第2节[2 (https://arxiv.org/html/2604.06169#S2)]概述的要求,我们提出了原位测试时训练(In-Place TTT),这是一个旨在为LLMs解锁TTT能力的框架。我们首先介绍我们的整体框架,它通过原位设计重新利用现有的MLP模块来解决架构不兼容问题,同时通过分块更新机制确保计算效率(第3.1节[3.1 (https://arxiv.org/html/2604.06169#S3.1)])。

相似文章

学习,快与慢:走向持续适应的LLMs

Hugging Face Daily Papers

一种针对LLMs的快慢学习框架,将固定的慢权重与优化的快上下文权重相结合,在持续学习场景中实现了高达3倍的样本效率提升,并减少了灾难性遗忘。

不要让LLM说话,直接探测它(8分钟阅读)

TLDR AI

本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。