@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…

X AI KOLs Following 论文

摘要

MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。

// 记忆即模型 // 该论文为任何 LLM 增加一个单独训练的记忆模型,由其代为存储、检索和整合事实。 它将记忆更新与基础模型权重更新解耦。它实现了持续学习的鲁棒性,且没有灾难性遗忘,而这是 RAG 无法做到的。 向量存储是一个带有学习编码器的数据库。MeMo 是一个具有明确接口的学习子系统。这种区别很重要,因为智能体需要能够每周吸收新知识,而无需重新训练或处理向量数据库的变更。 其核心观点是,智能体中的记忆应该是模块化的、可学习的、有门控的,而不是上下文窗口的权宜之计。 论文:https://arxiv.org/abs/2605.15156 在我们的学院中学习构建有效的AI智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/05/20 22:36

// 记忆即模型 //

本文为任意大语言模型(LLM)增加一个单独训练的记忆模型,由其负责事实的存储、检索和整合。

它将记忆更新与基础模型权重更新解耦,实现了持续学习鲁棒性,且不会发生灾难性遗忘——这是检索增强生成(RAG)未能达成的特性。

向量数据库是一个附带了学习型编码器的数据库。而MeMo则是一个具备明确接口的学习型子系统。这一区别至关重要,因为智能体需要能够每周摄入新知识,而无需重新训练或处理向量数据库的频繁更新。

其核心立场是:智能体中的记忆应当是模块化的、可学习的且有门控机制的,而不是依赖于上下文窗口的权宜之计。

论文:https://arxiv.org/abs/2605.15156

在我们的学院中学习构建有效的AI智能体:https://academy.dair.ai


MeMo: 记忆即模型

来源:https://arxiv.org/html/2605.15156 Ryan Wei Heng Quek1,2,3,4, Sanghyuk Lee5,6,7⁣∗{ }^{5,6,7\hskip 0.85358pt*} Alfred Wei Lun Leong4,8⁣∗{ }^{4,8\hskip 0.85358pt*} Arun Verma9⁣∗†{ }^{9\hskip 0.85358pt*\dagger} Alok Prakash9, Nancy F. Chen3, Bryan Kian Hsiang Low1,2,4,9, Daniela Rus7,9, Armando Solar-Lezama7,9 1 新加坡国立大学数据科学研究所,新加坡 2 新加坡国立大学研究生院综合科学与工程项目,新加坡 3 新加坡科技研究局(A*STAR),新加坡 4 新加坡国立大学计算机科学系,新加坡 5 东京大学,日本 6 Liquid AI,美国 7 麻省理工学院计算机科学与人工智能实验室(CSAIL),美国 8 AI新加坡,新加坡 9 新加坡-麻省理工学院研究与技术联盟中心,新加坡 [email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected]

摘要

大语言模型(LLM)在广泛的任务中展现出强大的性能,但在预训练后直至后续更新之前,它们始终处于冻结状态。许多实际应用需要及时、特定领域的信息,这推动了对高效机制的需求,以便整合新知识。本文介绍MeMo(记忆即模型),一个模块化框架,它将新知识编码到一个专用的记忆模型中,同时保持LLM参数不变。与现有方法相比,MeMo具有以下优势:(a) 捕获复杂的跨文档关系;(b) 对检索噪声鲁棒;(c) 避免LLM中的灾难性遗忘;(d) 不需要访问LLM的权重或输出对数概率,从而支持与开源和专有闭源LLM的即插即用集成;(e) 其检索成本在推理时与语料库大小无关。我们在三个基准测试(BrowseComp-Plus、NarrativeQA和MuSiQue)上的实验结果表明,MeMo在不同设置下均取得了优于现有方法的性能。

1 引言

大语言模型(LLM)在 diverse 任务中展示了卓越能力 (kojima2023largelanguagemodelszeroshot, (https://arxiv.org/html/2605.15156#bib.bib1); ArXiv23_zhao2023survey, (https://arxiv.org/html/2605.15156#bib.bib2); survey-llms-code-generation, (https://arxiv.org/html/2605.15156#bib.bib3))。尽管取得了这些成功,但这类模型在预训练后基本上处于“冻结”状态 (xu2024knowledgeconflictsllmssurvey, (https://arxiv.org/html/2605.15156#bib.bib4)),直至后续更新,导致其预训练知识随着世界演变而日益过时。对于需要最新 (cheng2024dateddatatracingknowledge, (https://arxiv.org/html/2605.15156#bib.bib5); kasai2024realtimeqawhatsanswer, (https://arxiv.org/html/2605.15156#bib.bib6)) 或特定领域 (singhal2022largelanguagemodelsencode, (https://arxiv.org/html/2605.15156#bib.bib7); wu2023bloomberggptlargelanguagemodel, (https://arxiv.org/html/2605.15156#bib.bib8)) 知识的应用而言,这种对静态知识的依赖构成了根本性的架构局限 (lewis2021retrievalaugmentedgenerationknowledgeintensivenlp, (https://arxiv.org/html/2605.15156#bib.bib9); kandpal2023largelanguagemodelsstruggle, (https://arxiv.org/html/2605.15156#bib.bib10))。重新训练是一种自然的解决方案,但在现代规模下成本高得令人望而却步 (wu2022sustainable, (https://arxiv.org/html/2605.15156#bib.bib11)),因此需要一种高效机制,在不进行完整重新训练的情况下,将新的外部知识整合到LLM中。

参照图注 图1:MeMo训练与推理管线概览。在记忆模型训练期间(左),一个冻结的生成器模型通过事实提取、整合、验证、实体浮现和跨文档合成,将目标语料库转化为一个反射QA数据集,然后用该数据集训练一个专用的记忆模型。在推理期间(右),冻结的执行器模型通过一个结构化的多轮协议查询记忆模型来回答复杂的用户查询:它将输入分解为更简单、有针对性的子查询,从记忆模型检索中间响应,并对其进行推理以产生对用户查询的最终答案。

现有的将新知识整合到LLM中的方法分为三类。① 非参数化方法在推理时通过词法 (bm25, (https://arxiv.org/html/2605.15156#bib.bib12))、稠密 (nvembedv2, (https://arxiv.org/html/2605.15156#bib.bib13)) 或基于图的检索器 (lewis2020retrieval, (https://arxiv.org/html/2605.15156#bib.bib14); graphrag, (https://arxiv.org/html/2605.15156#bib.bib15); gutierrez2024hipporag, (https://arxiv.org/html/2605.15156#bib.bib16); gutierrez2025rag, (https://arxiv.org/html/2605.15156#bib.bib17)) 从外部存储中检索相关信息,然后通过上下文学习 (incontextlearning, (https://arxiv.org/html/2605.15156#bib.bib18); dong-etal-2024-survey-in-context-learning, (https://arxiv.org/html/2605.15156#bib.bib19)) 将其整合。然而,这些方法受限于有限的上下文窗口,并且当相关信息分布在多个文档中时,难以综合跨文档关系 (tang2024multihop, (https://arxiv.org/html/2605.15156#bib.bib20); lin2025optimizingmultihopdocumentretrieval, (https://arxiv.org/html/2605.15156#bib.bib21))。② 参数化方法通过持续预训练 (ke2023continual, (https://arxiv.org/html/2605.15156#bib.bib22)) 或直接在目标语料库上进行微调 (ouyang2022training, (https://arxiv.org/html/2605.15156#bib.bib23); wang2023self, (https://arxiv.org/html/2605.15156#bib.bib24); chung2024scaling, (https://arxiv.org/html/2605.15156#bib.bib25)) 将知识内化到模型参数中。虽然有效,但它们在计算上成本高昂,易于发生灾难性遗忘 (luo2025empiricalstudycatastrophicforgetting, (https://arxiv.org/html/2605.15156#bib.bib26)),并且倾向于记忆训练分布而非获取可迁移的知识,从而限制了对未见查询的泛化能力 (chu2025sft, (https://arxiv.org/html/2605.15156#bib.bib27))。③ 潜在记忆方法 (chevalier2023autocompressor, (https://arxiv.org/html/2605.15156#bib.bib28); mu2023gist, (https://arxiv.org/html/2605.15156#bib.bib29); ge2024icae, (https://arxiv.org/html/2605.15156#bib.bib30); zhang2026memgen, (https://arxiv.org/html/2605.15156#bib.bib31)) 将知识压缩为软令牌或其他特定于模型的表示,但存在表示耦合问题:记忆与用于生成这些表示的特定模型紧密绑定,限制了跨LLM的迁移能力。

我们引入MeMo(记忆即模型),这是一个模块化框架,其中专用记忆模型在新知识上训练,执行器模型在推理时通过有针对性的子查询从记忆模型检索相关信息,然后对检索到的信息进行推理以响应用户查询。MeMo结合了上述三种范式的互补优势,同时减轻了各自的局限性。与非参数化方法一样,它能够通过将记忆与推理模型分离,在不改变的情况下利用现成的顶尖模型;它与参数化方法一样,能够将知识内化到模型参数中;并且它与潜在记忆方法一样,具有紧凑、可查询的记忆工件这一优点。因此,MeMo提供以下优势:(a) 捕获复杂的跨文档关系;(b) 对检索噪声鲁棒;(c) 通过保持执行器模型参数不变来避免灾难性遗忘;(d) 不需要访问执行器模型的权重或输出对数概率,从而支持与开源和专有LLM的即插即用集成;(e) 由于其记忆模型大小固定,检索成本在推理时与语料库大小无关。然而,设计MeMo以在训练期间全面捕获跨文档关系,同时在推理时准确回答任意查询,带来了两个关键挑战,我们将在下面概述并通过新颖方法加以解决。

① 训练记忆模型。记忆模型的一个核心挑战是确保它能在推理时准确回答多样的、未见过的查询,包括那些需要跨文档推理和长上下文理解的查询。一种自然的方法是直接使用标准数据增强技术(如释义 (li2022data, (https://arxiv.org/html/2605.15156#bib.bib32); chen2023empirical, (https://arxiv.org/html/2605.15156#bib.bib33); allen2024physics, (https://arxiv.org/html/2605.15156#bib.bib34))、对生成的问答对进行额外采样 (alberti2019synthetic, (https://arxiv.org/html/2605.15156#bib.bib35); puri2020training, (https://arxiv.org/html/2605.15156#bib.bib36)),或针对性的补全(模型识别并完成语料库中缺失的知识)(feng2024don, (https://arxiv.org/html/2605.15156#bib.bib37); jie2024self, (https://arxiv.org/html/2605.15156#bib.bib38)))在原始语料库上训练。然而,这些方法未能将相关事实整合成组合式表示,而这些表示对于对未见查询进行鲁棒泛化至关重要 (chu2025sft, (https://arxiv.org/html/2605.15156#bib.bib27))。考虑到这一挑战,我们设计了一个新颖的五步数据合成管线,由生成器模型(第4.1节)引导,将语料库提炼成一个反思问答(QA)数据集:“反思”是组合式表示,能在多种查询变体下暴露底层语料库知识(如图1(左)所示,详见第4.1节)。我们通过监督微调在合成的反思QA数据集上训练记忆模型(见第4.2节),使记忆模型能够捕获比基于检索的方法更复杂的跨文档关系和组合结构。

② 查询记忆模型。在推理时,复杂或组合式查询通常需要多步推理和跨多个文档的信息聚合。通过单轮或无结构的多轮交互天真地查询记忆模型,无法可靠地检索回答此类查询所需的知识。为解决这一问题,我们设计了一个三阶段推理管线,其中执行器模型通过一个结构化的多轮协议查询并从记忆模型检索信息,将复杂的用户查询分解为与共享反思接口对齐的有针对性子查询(如图1(右)所示,更多细节见第4.4节)。与基于检索的方法不同,此方法的检索成本与语料库大小无关,并且对检索噪声鲁棒(见第5.2节)。关键在于,由于MeMo将执行器模型视为黑盒,不访问其权重、梯度或输出对数概率,它支持与包括开源和专有闭源模型在内的任何LLM实现即插即用集成。

我们的方法遵循一个单一设计原则:“反思”,即源自语料库的结构,这些结构无需了解未来查询,却自然而然地充当了任何查询访问底层语料库(而无需直接观察它)的精确接口。在训练期间,记忆模型内化了这些反思;执行器模型在推理时通过有针对性的子查询检索相关知识。基于上述挑战及提出的解决方法,我们总结本文的主要贡献如下:

  • • 新颖的数据合成管线。我们提出了一个五步数据合成管线,使用生成器模型(可能等于或小于执行器模型的LLM)将目标语料库提炼成反思,使专用记忆模型能够以组合形式内化知识,捕获更复杂的跨文档关系,并在推理时对各种未见查询变体进行鲁棒泛化(见第4.1节和第4.2节)。
  • • 结构化的多轮协议。我们引入了一个结构化的多轮协议,该系统将复杂查询系统地分解为与共享反思接口对齐的有针对性子查询。该协议支持与任意LLM(包括专有闭源LLM)的即插即用集成,并且检索成本与语料库大小无关(见第4.4节)。
  • • 实证验证。我们在BrowseComp-Plus、NarrativeQA和MuSiQue上评估MeMo,展示了与参数化和非参数化基线相比的强大性能。我们进一步通过实验验证了MeMo对检索噪声的鲁棒性(见第5节)。

2 相关工作

非参数化方法。非参数化替代方法 (bm25, (https://arxiv.org/html/2605.15156#bib.bib12); nvembedv2, (https://arxiv.org/html/2605.15156#bib.bib13); gutierrez2025rag, (https://arxiv.org/html/2605.15156#bib.bib17)) 完全避免参数更新,而是在推理时提供新知识。具体来说,上下文学习(ICL)(incontextlearning, (https://arxiv.org/html/2605.15156#bib.bib18); dong-etal-2024-survey-in-context-learning, (https://arxiv.org/html/2605.15156#bib.bib19)) 将相关知识直接插入提示中,避免了灾难性遗忘。然而,ICL随着上下文长度的增加而扩展性变差:自回归生成的计算成本 (vaswani2023attentionneed, (https://arxiv.org/html/2605.15156#bib.bib39)) 导致随着知识库的增长而产生显著的令牌开销和推理延迟 (gelada2025scalingcontextrequiresrethinking, (https://arxiv.org/html/2605.15156#bib.bib40)),即使是明确的长上下文模型也会随着上下文长度的增加而表现出显著的性能下降 (liu2024lost, (https://arxiv.org/html/2605.15156#bib.bib41); hsieh2024ruler, (https://arxiv.org/html/2605.15156#bib.bib42))。检索增强生成(RAG)(lewis2020retrieval, (https://arxiv.org/html/2605.15156#bib.bib14); graphrag, (https://arxiv.org/html/2605.15156#bib.bib15); gutierrez2024hipporag, (https://arxiv.org/html/2605.15156#bib.bib16); gutierrez2025rag, (https://arxiv.org/html/2605.15156#bib.bib17)) 通过在推理时选择性地检索相关知识块来解决这一可扩展性瓶颈。然而,RAG系统高度

相似文章

Memora: 平衡抽象与具体性的和谐记忆表示

Hacker News Top

Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。