@Oliviacoder1: MIT刚刚让每家AI公司的数十亿美元赌注看起来尴尬不已。他们解决了AI记忆问题。不是通过构建更大的……
摘要
MIT CSAIL研究人员提出了一种新颖的AI记忆方法,通过将文档存储在外部,并让AI自行导航和查询,从而避免了上下文腐烂,以更低成本实现了1000万令牌的有效上下文。
查看缓存全文
缓存时间: 2026/06/15 09:14
MIT刚刚让每家AI公司的十亿美元赌注看起来尴尬至极。他们解决了AI的记忆问题。不是通过构建更大的大脑,而是通过教它如何阅读。论文于2025年12月31日发布。三位MIT CSAIL研究员。一个简直显而易见的想法。还有一个结果,让过去五年的上下文窗口军备竞赛看起来完全打错了仗。以下是没人解决的问题。
地球上的每个AI模型都有一个硬上限:上下文窗口,即它一次能在工作记忆中保留的最大文本量。一旦超出这个界限,就会发生一些丑陋的事情——研究人员给它起了一个临床名称:上下文腐烂(context rot)。你往AI的上下文里塞得越多,它处理已有内容的表现就越差。事实变得模糊。埋藏在中间的信息消失。模型并没有因为你喂给它更多数据而变得更强大,反而变得更加困惑。你给它你的整个代码库,它读了三份文件后就忘了之前读的。你给它一份500页的法律文件,它读到第400页时就丢失了第12页的条款。
于是行业建立了一种变通方案:RAG(检索增强生成)。把文档切成块,存储在数据库中,需要时检索相关块。这始终是一个伪装成解决方案的折中方案。检索器在AI阅读任何内容之前猜测哪些块重要。如果它猜错了——而且它经常猜错——AI就永远看不到它需要的信息。分块行为破坏了远距离段落之间的所有关系。完整的图景被撕成碎片,AI蒙着眼睛试图重新拼凑。两个糟糕的选择。一个破碎的行业。
三位MIT研究者和一个12月31日的截止日期。这是他们构建的:完全不要将文档放入AI的记忆中。这就是整个想法。这就是突破。将文档作为一个Python变量存储在AI的上下文窗口之外。告诉AI这个变量存在以及它有多大。然后让路。当你提问时,AI不会试图记住任何东西。它表现得像一个在图书馆里面对电脑的人类专家。它编写代码。它用正则表达式搜索文档。它切割到所需的精确章节。它扫描结构。它导航。它精确找到相关的内容,只将这部分拉入它的活动窗口。然后它做了一件递归的事:当AI找到相关材料时,它会生成更小的子AI实例,并行阅读和分析这些部分。每个专注,每个快速,每个回报给根部AI。根部AI综合所有内容并产生答案。没有摘要,没有删除,没有信息丢失,没有衰减。原始文档的每个字节都保持完整、可访问和可查询,只要你需要。
现在来看数字。在难度最高的长上下文推理基准上,标准前沿模型的得分接近零。完全崩溃。GPT-5在一个需要追踪超过75,000个token的复杂代码历史的基准上,甚至无法解决10%的问题。RLMs(递归语言模型)在同样的基准上解决了问题,而且效果显著。在所有替代方法上获得了两位数的百分比提升。成功处理高达1000万个token的输入——超出模型原生上下文窗口100倍。每次查询的成本:堪比或低于标准的大规模上下文调用。再读一遍:一百倍的上下文,更好的答案,相同的价格。
军备竞赛的时间线让这更加刺痛。2020年的GPT-3:4,000个token。GPT-4:32,000。Claude 3:200,000。Gemini:100万。Gemini 2:200万。每一代,每一家公司,花费数十亿美元,都赌在同一个假设上:更多的上下文等于更好的性能。MIT刚刚证明了那个假设从一开始就是错误的。不是稍微错误,而是根本性错误。过去五年上下文窗口研究的整个前提——AI记忆的解决方案是更大的窗口——是错误问题的错误答案。正确的问题从来不是:你能强迫AI在脑子里装下多少?而是:你能教会AI知道去哪里找吗?
一个人类专家拿到一份10,000页的档案,不会在回答你问题之前读完全部10,000页。他们会导航、搜索、找到相关部分,深入阅读,然后综合答案。RLMs是第一个以同样方式工作的AI架构。代码是开源的。现在就在GitHub上。免费。没有许可费,没有API成本。作为你现有LLM API调用的替代品,你的应用程序甚至不会注意到差异——除了它突然能处理以前完全失败的输入。
Prime Intellect——该领域领先的AI研究实验室之一——已经将RLMs称为一个主要研究方向,并描述了下一步:通过强化学习教模型管理自己的上下文,使智能体能够解决跨越数小时甚至数周的任务。上下文窗口战争结束了。MIT通过离开战场赢得了战争。
来源:Zhang, Kraska, Khattab · MIT CSAIL · arXiv:2512.24601
论文:http://arxiv.org/abs/2512.24601
GitHub:http://github.com/alexzhang13/rlm
递归语言模型
来源:https://arxiv.org/html/2512.24601
Alex L. Zhang
MIT CSAIL
[email protected]
& Tim Kraska
MIT CSAIL
[email protected]
& Omar Khattab
MIT CSAIL
[email protected]
摘要
我们研究通过推理时间扩展,使大型语言模型(LLM)能够处理任意长度提示的问题。我们提出递归语言模型(RLMs),这是一种通用的推理范式,将长提示视为外部环境的一部分,并允许LLM通过编程方式检查、分解提示,并在提示片段上递归调用自身。我们发现,RLMs可以成功处理超出模型上下文窗口限制一个数量级以上的输入,即使对于较短的提示,其质量也显著优于普通前沿LLM以及常见的上下文处理与编码框架(例如,在评估的基准中,对GPT-5的中位数提升:对比压缩方法为26%,对比带子调用的CodeAct为130%,对比Claude Code为13%),同时在四个不同的长上下文任务中具有可比成本。在小规模实验中,我们后训练了第一个围绕RLM的模型。我们的模型RLM-Qwen3-8B比基础模型Qwen3-8B中位数提升28%,甚至在三个长上下文任务上接近原始GPT-5的质量。代码可在 https://github.com/alexzhang13/rlm 获取。
1 引言
参考图注
图1:GPT-5与对应的RLM(递归深度=1)使用GPT-5在三个复杂度递增的长上下文任务上的比较:S-NIAH、OOLONG和OOLONG-Pairs。对于每个任务,我们将输入长度从2^13扩展到2^20。GPT-5的性能随着输入长度和任务复杂度的增加而显著下降,而RLM保持强劲性能。超出红色区域的输入无法放入GPT-5的272K token上下文窗口,但RLM能有效处理。§3(https://arxiv.org/html/2512.24601#S3)中有其他模型和基准的额外实验。
前沿推理模型具有有限的上下文窗口,即使在其限制内,也往往出现上下文腐烂(Hong等,2025(https://arxiv.org/html/2512.24601#bib.bib37)),如图1(https://arxiv.org/html/2512.24601#S1.F1)所示,当提示变长时质量急剧下降。虽然我们期望通过训练、架构和基础设施的改进,上下文长度会稳步上升,但我们感兴趣的是:**是否可能将通用LLM的上下文大小扩展几个数量级?**随着LLM开始广泛用于长期任务(必须常规处理数千万甚至数亿个token),这一问题变得日益紧迫。
我们通过扩展推理时间计算的角度来研究这个问题。我们受到推理模型(另一种推理策略)的启发,它们已成为LLM的基本接口,不仅带来了实证收益,还提供了与普通Transformer相比的额外理论表达能力(Merrill and Sabharwal, 2024(https://arxiv.org/html/2512.24601#bib.bib51))。尽管大多数处理长上下文的推理时间方法都是特定于任务的(Wu等,2021(https://arxiv.org/html/2512.24601#bib.bib52);Chang等,2024(https://arxiv.org/html/2512.24601#bib.bib53)),但最流行的通用方法是上下文压缩或紧凑化(Khattab等,2021(https://arxiv.org/html/2512.24601#bib.bib16);Smith, 2025(https://arxiv.org/html/2512.24601#bib.bib17);OpenAI, 2025a(https://arxiv.org/html/2512.24601#bib.bib21);Wu等,2025(https://arxiv.org/html/2512.24601#bib.bib5)),其中来自用户请求或智能体轨迹的上下文一旦超过长度阈值就会被反复总结。不幸的是,紧凑化很少能表达需要密集访问整个提示的任务。它假设提示早期出现的某些细节可以安全地遗忘,以便为新内容腾出空间。
参考图注
图2:递归语言模型(RLM)将提示视为环境的一部分。它将输入提示作为变量加载到REPL环境E中,并编写代码来窥视、分解,并在变量的编程片段上递归调用自身。
我们引入递归语言模型(RLMs),这是一种通用推理范式,用于大幅扩展LLM的有效输入和输出长度。关键洞察是:任意长的用户提示不应直接送入神经网络(如Transformer),而应被视为环境的一部分,LLM需要与之进行符号化和递归的交互。该系统作为一个抽象的“语言模型”,没有上下文限制。如图2(https://arxiv.org/html/2512.24601#S1.F2)所示,RLM暴露与LLM或推理模型相同的外部接口:它接受任意结构的字符串提示,并产生字符串响应。给定提示P,RLM初始化一个读取-求值-打印循环(REPL)编程环境,其中P被设置为一个变量的值。然后它向LLM提供关于REPL环境的一般上下文(例如字符串P的长度),并允许它编写代码来窥视和分解P,并迭代地观察执行产生的任何副作用。关键在于,RLM鼓励LLM通过编写符号程序(在需要的输入片段上调用LLM自身)来理解、转换和执行输入提示。通过将提示本身视为外部对象并启用符号递归,RLM解决了近期关于编码智能体、检索智能体和子智能体委托工作中表达能力上的局限性。特别是,先前的编码智能体和检索智能体将某些指定的外部数据源(如文件系统或搜索文档库)视为获取片段的环境。然而,它们只能在面对压缩之前用片段填满底层LLM的上下文窗口。同样,先前的自我委托方法(Anthropic, 2025(https://arxiv.org/html/2512.24601#bib.bib22);Sentient AI, 2025(https://arxiv.org/html/2512.24601#bib.bib47);Schroeder等,2025(https://arxiv.org/html/2512.24601#bib.bib27);Sun等,2025(https://arxiv.org/html/2512.24601#bib.bib25))允许LLM作为子智能体调用自身。然而,它们受到底层LLM有限输出长度的限制,因为它们被设计为自回归地口头表达子调用,而不是编程式地产生它们。
我们使用一个前沿闭源模型(GPT-5;Singh等 2025(https://arxiv.org/html/2512.24601#bib.bib1))和一个前沿开源模型(Qwen3-Coder-480B-A35B;Qwen Team 2025b(https://arxiv.org/html/2512.24601#bib.bib41))在四个复杂度不同的任务上评估RLMs:深度研究(Chen等,2025(https://arxiv.org/html/2512.24601#bib.bib12))、信息聚合(Bertsch等,2025(https://arxiv.org/html/2512.24601#bib.bib11))、代码仓库理解(Bai等,2025(https://arxiv.org/html/2512.24601#bib.bib8)),以及一个合成配对推理任务(即使是前沿模型也会灾难性失败)。我们将RLMs与直接LLM调用、上下文紧凑化、检索工具使用智能体以及带/不带子调用的代码生成智能体进行了比较。我们发现RLMs即使在1000万+ token规模下也表现出极强的性能,在长上下文处理上大幅优于其他方法,通常具有两位数的百分比收益,同时保持可比成本。特别是,如图1(https://arxiv.org/html/2512.24601#S1.F1)所示,RLMs在更长的上下文和更复杂的任务上表现出远没有那么严重的退化。
最后,在小规模上,我们后训练了第一个原生递归语言模型,证明RLMs可以通过少量额外训练快速改进。虽然一个小型开源模型(Qwen3-8B;Yang等2025(https://arxiv.org/html/2512.24601#bib.bib44))即使在RLM框架下也难以解决长上下文任务,但我们简单的通用训练配方仅使用来自无关领域的1000个样本,就将其在四个评估任务上的性能中位数提升了28.3%。
2 递归语言模型
给定一个最大上下文大小为K的基础神经语言模型M,递归语言模型(RLM)是M周围的一个推理时间框架,它将用户提示视为环境的一部分,同时不丧失通过不同的M调用密集处理其内容的能力。给定一个任意长度的提示字符串P ∈ Σ^,RLM与一个持久的外部环境E交互,并返回一个响应字符串Y ∈ Σ^(图2(https://arxiv.org/html/2512.24601#S1.F2))。我们期望实现无界输入token(|P| ≫ K)、无界输出token以及无界语义范围,例如能够执行Ω(|P|)或Ω(|P|^2)的语义工作。算法1(https://arxiv.org/html/2512.24601#algorithm1)描述了RLM如何实现这一点。
给定一个提示P,RLM初始化一个持久的REPL编程环境,其中包含一个字符串形式的用户提示变量,以及一个用新提示调用子RLM的函数。然后启动RLM循环。在第一次迭代中,算法调用根部神经模型M,仅使用关于用户提示的(常量大小)元数据,如它的长度、一个短前缀以及如何访问其各部分。根部通过提示(附录C(https://arxiv.org/html/2512.24601#A3))和/或微调(附录A(https://arxiv.org/html/2512.24601#A1))被指示像RLM一样操作:即生成帮助理解和转换其提示P部分的代码,并将中间值和最终响应构建到新变量中,可能通过在循环中调用子RLM。在第4节(https://arxiv.org/html/2512.24601#S4)中,我们发现现有的LLM可以通过提示做到这一点,并且训练一个8B模型使其原生递归是有前景的。RLM循环的每次迭代在REPL中执行代码,更新REPL状态(中间变量),并在stdout中收集任何打印的文本。只有关于stdout的(常量大小)元数据,如一个短前缀和长度,被附加到M的历史记录中用于下一次迭代。1这是关键:它迫使M依赖变量和子调用来管理长字符串,而不是污染其窗口。
相似文章
@MSFTResearch: AI 智能体无法记住过去的对话。它们必须不断重新加载或检索上下文,随着任务变长和复杂,效率变得越来越低…
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。
@rohanpaul_ai: AI记忆存在测量问题。 "多少上下文?" 告诉我们越来越少的信息。 重要的是代理记住什么……
本文探讨了AI记忆的测量问题,并指出MemoraX AI在首个Agent Memory Leaderboard商业产品中排名第一,强调了代理记忆系统的进步。
我们是否都在悄悄重建记忆系统,因为当前AI的长期记忆实际上并不奏效?
文章讨论了当前AI记忆方案在生产中常见的失败情况,如事实陈旧、摘要漂移和供应商锁定,指出真正的瓶颈在于记忆治理而非检索。
@rohanpaul_ai: 来自上海大学论文的一个宏大想法——赋予AI模型人类式记忆。想象一下阅读一本巨大的悬疑小说……
本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。
@jiqizhixin: 如果AI的记忆不必随着每多一句话而膨胀呢?牛津大学、Technion、AITHYRA 等…
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。