Metis:记忆基础模型
摘要
该论文介绍了记忆基础模型,其首个原型Metis通过全新架构和训练数据,赋予基础模型原生记忆能力。
arXiv:2607.26760v1 公告类型:新
摘要:近期AI智能体的进展日益将原生能力内化到其底层基础模型中,催生了多模态基础模型和大型推理模型。然而,智能体记忆仍然主要通过外部模块实现,原生记忆能力在很大程度上未被探索。本文通过引入记忆基础模型,向此方向迈出了第一步,赋予基础模型原生记忆能力。我们从两个角度形式化原生记忆:骨干网络中持久且动态演化的记忆状态,以及通过模型计算自主存储和利用信息的原生记忆过程。我们展示了原生记忆在架构、端到端优化和效率方面的优势。基于此形式化,我们提出了Metis,这是记忆基础模型的首个原型。Metis引入了一种新架构,为基础模型配备了原生记忆状态,使得历史信息能够被压缩到模型中并通过记忆注意力访问。我们构建了大规模的记忆特定训练数据,并引入了多个优化目标,通过中期训练获取这些原生记忆过程。Metis的在线记忆维护无需梯度,记忆更新仅需一次前向传播。在推理时,所有学习到的模型权重保持冻结,而原生记忆状态通过标准前向计算自主转换。通过大量实验,我们展示了Metis展现出原生记忆能力,并进一步详细分析了其优势、局限和行为。为促进未来对记忆基础模型的研究,我们开源了项目和模型检查点。
查看缓存全文
缓存时间: 2026/07/30 09:59
# \titlefont Metis: 记忆基础模型 来源: https://arxiv.org/html/2607.26760 \useunder \ul1\]MemTensor(上海)科技有限公司\。2\]中国人民大学\。3\]新加坡国立大学\。4\]上海交通大学\。5\]同济大学 郭子良1∗\。孙一航1,4∗\。张西冲1∗\。郝希璇1\。林泽浩1\。杨张3\。赵晓燕3\。申桐1,4\。唐波1\。徐志勤 John Xu4\。严俊驰4\。王浩芬5\。陈旭2†\。熊飞宇1\。李志宇1†\。蔡达生3 \[\[\[\[[[email protected]](https://arxiv.org/html/2607.26760v1/mailto:[email protected])[[email protected]](https://arxiv.org/html/2607.26760v1/mailto:[email protected])(2026年7月29日) ###### 摘要 近年来,AI智能体逐渐将原生能力内化到其底层基础模型中,催生了多模态基础模型和大型推理模型。然而,智能体记忆仍然主要通过外部模块实现,原生记忆能力在很大程度上尚未被探索。本文在此方向上迈出了第一步,提出了**记忆基础模型**,赋予基础模型原生记忆能力。我们从两个角度形式化**原生记忆**:主干网络内持续且动态演变的记忆状态,以及通过模型计算自主存储和利用信息的原生记忆过程。我们证明,原生记忆在架构、端到端优化和效率方面具有优势。基于这一形式化,我们提出了Metis,这是记忆基础模型的第一个原型。Metis引入了一种新架构,为基础模型配备了原生记忆状态,允许历史信息被压缩到模型中并通过记忆注意力进行访问。我们构建了大规模记忆专用训练数据,并引入了多个优化目标,通过中期训练获取这些原生记忆过程。Metis的在线记忆维护是无梯度的,记忆更新仅需一次前向传播。在推理时,所有学习到的模型权重保持冻结,而原生记忆状态通过标准前向计算自主变换。通过大量实验,我们展示了Metis的原生记忆能力,并进一步详细分析了其优势、局限和行为。为促进记忆基础模型的未来研究,我们开源了项目和模型检查点。 ## 1 引言 近年来,大型基础模型取得了快速发展,在语言建模[zhao2023survey, minaee2024large]、代码生成[jiang2026survey, chen2021evaluating, roziere2023code]和复杂推理[xu2025toward, wei2022chain, guo2025deepseek]等多个方面展现了显著性能。这为构建能够处理更复杂任务的AI智能体奠定了坚实基础。除了基础模型的推理能力,记忆是AI智能体的另一项关键能力,负责保留过去信息并利用其支持未来推理[zhang2025survey, hu2025memory]。在以往的大多数工作中,记忆是通过基础模型外部的模块实现的,而非原生集成到其架构中[zhong2024memorybank, xu2026mem, packer2024memgptllmsoperatingsystems, li2025memos]。代表性的方法使用检索增强生成(RAG)来检索相关文本信息并将其纳入提示以辅助推理[zhong2024memorybank]。然而,外部记忆存在若干局限性,如图1所示。首先,外部记忆与主干网络解耦,具有分离的目标和处理阶段[zhong2024memorybank, packer2024memgptllmsoperatingsystems]。外部记忆通常旨在构建信息丰富的上下文作为输入,而主干网络仅对构建的上下文执行条件语言建模。因此,外部记忆可能无法提供最有用的信息来支持主干推理,主干网络也可能无法最优地利用记忆。其次,外部记忆难以进行端到端优化,因为梯度无法有效通过离散记忆操作传播[zhang2025learn]。因此,执行领域特定的后训练变得极具挑战性。尽管一些基于强化学习的策略[zhang2026memrl, guo2026memfactory]可以通过奖励信号优化记忆操作部分缓解此问题,但存在效率问题。最后,外部记忆需要对主干网络外部的存储执行额外的显式操作,这不可避免地增加了在线推理延迟[zhang2025survey]。 为解决外部记忆的局限性,我们引入了**记忆基础模型**,赋予大型基础模型**原生记忆**能力。它将记忆从外部模块转变为主干网络的内部机制,直接参与前向计算。具体来说,记忆基础模型能够基于输入指令和其原生记忆生成响应,并实现自主记忆变换。我们从两个关键方面定义原生记忆: * **原生记忆状态**。与传统大型基础模型不同,记忆基础模型在多次推理间具有原生的状态性,能够在主干网络内部从先前推理中构建、维护和利用记忆状态。其记忆状态动态地表示为主干网络参数的一部分,其语义空间在预训练或中期训练阶段对齐。 * **原生记忆过程**。与记忆工程不同,记忆基础模型在其推理过程中原生地集成了记忆过程。特定的记忆操作,如记住、遗忘和更新,伴随主干网络的前向计算自主完成,这些操作基于输入指令影响原生记忆状态。 记忆基础模型旨在将记忆能力内化到模型的前向计算中。记忆状态可以表示为主干网络的动态参数,记忆过程通过计算执行。因此,与通用基础模型类似,记忆基础模型可以通过后训练以数据驱动的方式优化和适应特定领域。这一转变类似于从大型基础模型到大型推理模型[guo2025deepseek]的演变,其中思维链(CoT)[wei2022chain]被原生集成到推理中以提升性能和效率。此外,由于原生记忆过程可以集成到模型的计算中,这为提升记忆处理的并行效率奠定了基础。 请参阅图例 图1:从外部记忆到原生记忆。 在本文中,我们实现了记忆基础模型的第一个原型,命名为Metis。我们设计了一种新的模型架构,该架构具有受快速权重编程(FWP)[ba2016using]启发的原生记忆状态,可通过记忆注意力集成到主干计算中。具体来说,我们提出Metis块作为原生记忆的基本单元。每个Metis块主要由一个超记忆块和一个局部记忆块组成。此外,我们通过设计特定的优化目标赋予Metis原生记忆过程,包括记忆重建和记忆操作目标。这两个目标分别对应记忆状态的压缩上限和操作目标。我们还设计了一个正则化目标以提高在复杂场景下的鲁棒性。为支持此训练,我们从公开数据集中合成大规模记忆专用数据,使Metis能够通过中期训练获得原生记忆能力。最后,我们进行了大量实验以证明我们提出框架的有效性,并从更多方面进行分析。 从一般角度看,记忆的一个根本问题源于在线信息的时间流特性。在存储阶段,记忆系统无法确定接收到的信息将来如何被使用。在推理阶段,原始信息不再可访问,只能利用存储的信息。因此,记忆可以被视为一个预测问题,模型预测接收到的信息将来如何被利用。与机器学习中的其他预测任务一样,记忆能力也可以在预训练阶段获得并泛化到其他领域,而记忆基础模型可以提供架构和优化基础。 尽管具有这些有前景的特性,实现记忆基础模型仍然极具挑战性,因为其最终目标是完全消除对上下文中外部记忆的依赖。虽然Metis在记忆相关任务上取得了出色的性能,但仍面临若干局限性。首先,其在长期任务上性能下降,因为压缩到固定大小参数时存在信息丢失。其次,在某些情况下会出现信息混淆,可能是由潜在空间内的语义混合导致。尽管存在这些局限性,Metis为实现记忆基础模型提供了一条潜在路径。为惠及研究界和工业界,我们在https://github.com/MemTensor/Metis开源了我们的项目。 我们的贡献总结如下: * 我们介绍了记忆基础模型和原生记忆,并给出了形式化定义,从原生记忆状态和原生记忆过程的角度进行了进一步分析。 * 我们提出了记忆基础模型的第一个原型Metis,通过新颖的记忆架构和优化任务实现。 * 我们进行了大量实验验证我们模型的有效性,并随后从多角度进行了详细研究。我们还公开了我们的项目以惠及研究界和工业界。 本文其余部分组织如下。第2节提供了记忆基础模型的形式化定义。第3节详细介绍了Metis的模型架构。之后,我们在第4节介绍我们的数据构建流程,并在第5节概述优化方法。第6节展示了大量实验结果和分析。最后,我们在第7节回顾相关工作,并在第8节总结全文。 ## 2 记忆基础模型 在本节中,我们给出记忆基础模型的形式化定义。然后,从原生记忆状态和过程的角度介绍原生记忆。之后,我们将记忆基础模型与先前工作进行对比。最后,我们从终身学习和AI智能体发展趋势的角度进一步讨论记忆基础模型。 ### 2.1 定义 我们在多步场景下定义记忆基础模型。令一个连续交互过程形式化为离散时间步序列 \( t \in \{1,2,\dots,T\} \)。在每个时间步 \( t \),基础模型接收输入指令序列 \( X_t \) 并生成响应序列 \( Y_t \)。对于不带记忆的传统基础模型,生成完全依赖于当前输入上下文。响应中第 \( k \) 个 token 的自回归解码通常表示为: \[ y_{t,k} \sim P(y \mid X_t, Y_{t,<k}), \] 其中 \( Y_{t,<k} \) 是到第 \( k-1 \) 个 token 的已解码 token 序列。对于记忆基础模型,生成同时依赖于当前输入和模型当前的记忆状态。我们将时间步 \( t \) 上、生成第 \( k \) 个 token 之前的记忆状态定义为 \( S_{t,k} \)。记忆基础模型的生成过程可表示为: \[ y_{t,k} \sim P(y \mid X_t, Y_{t,<k}, S_{t,k}), \] 在每次生成之后,记忆过程 \( \mathcal{M} \) 基于当前模型参数 \( \theta \)、当前输入和记忆信息转换记忆状态,以影响未来推理。记忆转换可表示为: \[ S_{t,k+1} = \mathcal{M}(X_t, Y_{t,k}, S_{t,k}; \theta), \] 每次交互结束时,记忆状态跨时间步传递到下一次交互: \[ S_{t+1,1} = S_{t,|Y_t|+1}. \] 通过将此记忆过程无缝集成到模型计算中,记忆基础模型在多个推理步骤间保持持久状态,并自主管理记忆操作。 ### 2.2 原生记忆状态 如第2.1节所述,记忆基础模型在时间步和生成步骤间保持持久状态。我们将原生记忆状态定义为包含领域无关压缩先验的动态模型参数。具体而言,原生记忆状态是模型参数的子集,这些参数在每次推理步骤后根据输入指令自主变化。在形式上,令 \( \Theta_t \) 表示时间步 \( t \) 后的全部模型参数。这些参数分为两组:学习参数 \( \hat{\Theta} \) 和基于当前输入更新的记忆参数 \( S_t \)。在预训练或中期训练阶段,模型学习如何更新 \( S_t \)。在推理阶段,状态 \( S_t \) 根据输入指令动态变化: \[ \Theta_t = \hat{\Theta} \cup \{S_t\}, \quad S_{t+1} = S_t + \Delta S_t, \] 其中 \( \Delta S_t \) 是基于输入 \( X_t \) 计算的更新量。原生记忆状态与输入指令在相同的语义空间内对齐,使模型能够以端到端的方式压缩并利用相关信息。 ### 2.3 原生记忆过程 原生记忆过程涉及将记忆操作集成到模型的计算中。传统外部记忆系统通常包括显式过程,如: \[ \text{存储}(I_t), \quad \text{检索}(Q_t), \quad \text{合并}(\tilde{I}_t, S_t), \] 其中 \( I_t \) 是新信息,\( Q_t \) 是查询,\( \tilde{I}_t \) 是检索到的信息。然而,这些过程需要外部存储和检索机制,导致计算与模型本身分离。对于记忆基础模型,记忆过程对应于模型计算过程中动态参数的变换。具体来说,原生记忆过程被实现为: \[ S_{t+1} = S_t + f(X_t; \theta), \] 其中 \( f(X_t; \theta) \) 是由基础模型及其内存架构参数化的函数。该函数在一个 end-to-end 数据驱动框架内同时处理存储、检索和合并。该公式涵盖了经典记忆操作,如记住(添加新信息)、遗忘(衰减旧信息)和更新(修改现有信息)。 ### 2.4 对比 我们现在将记忆基础模型与现有框架进行对比。图1提供了直观比较。 **LLM + 外部记忆**:这些系统通过检索模块存储和检索来自外部数据库的信息 [zhong2024memorybank, lewis2020retrieval]。检索到的内容与输入提示拼接,形成扩展上下文。然而,存储、检索和合并操作发生在模型之外。这种分离导致缺乏端到端优化,因为记忆系统无法针对下游任务进行联合训练。此外,它需要额外的延迟,因为外部数据库访问和上下文序列长度增加。 **记忆基础模型**:相比之下,记忆基础模型将记忆操作直接集成到其架构和计算中。作为前向计算的一部分,以端到端方式学习何时存储、检索和合并信息。这种设计消除了对外部数据库的依赖,并减少了与显式记忆访问相关的延迟。由于记忆操作通过前向计算自动执行,记忆基础模型也可以从数据驱动优化中受益。 ### 2.5 讨论 我们从终身学习 [thrun1998lifelong] 和 AI 智能体发展趋势的角度进一步讨论记忆基础模型。 **与终身学习的关系**:终身学习旨在使模型能够从连续的数据流中学习,同时避免灾难性遗忘 [mccloskey1989catastrophic]。记忆基础模型与终身学习部分相关,因为两者都涉及在长时间跨度内维护和利用信息。然而,它们的主要焦点不同。终身学习主要旨在从顺序到达的任务中持续学习而不遗忘 [li2024continual]。相比之下,记忆基础模型旨在为智能体的推理提供信息,智能体信息仅被使用一次而不一定是“学习”。记忆基础模型通过压缩和存储历史指令及其上下文的表示来实现记忆,这自然也是终身学习的先决条件。因此,记忆基础模型可以提供一个基础架构,在此基础上可以通过持续学习技术实现终身学习。 **AI 智能体的趋势**:AI 智能体领域的近期进展显示出将原生能力直接集成到大型基础模型中的清晰趋势。例如,大型推理模型 [guo2025deepseek] 现在已经原生地在其推理步骤中包含了思维链能力 [wei2022chain],而不是在外部调用它。类似地,多模态基础模型 [liu2024llava] 已经原生地将视觉能力集成到其架构中,而不是依赖于单独训练的视觉模块。记忆基础模型遵循相同的方向——将记忆能力从外部组件转变为基础模型的原生特性。这种趋势反映了向更统一、高效和可端到端优化的智能体架构的普遍转变。 ## 3 模型架构 在本节中,我们首先回顾因果语言模型的背景知识。然后,详细介绍 Metis 架构的两个关键组件:原生记忆状态和原生记忆过程。最终的高层架构如图2所示。 ### 3.1 背景:因果语言模型 我们重温标准的因果语言模型架构,该架构由堆叠的 Transformer 块组成 [vaswani2017attention]。每个 Transformer 块包括一个多头自注意力(MHSA)子层和一个前馈网络(FFN)子层,均带有残差连接和层归一化。 **Transformer 块**。令第 \( l \) 个 Transformer 块的输入为 \( \mathbf{H}^{(l-1)} = [\mathbf{h}_1^{(l-1)}, \dots, \mathbf{h}_L^{(l-1)}] \in \mathbb{R}^{L \times d} \),其中 \( d \) 是隐藏维度,\( L \) 是序列长度。MHSA 操作计算查询 \( \mathbf{Q}^{(l)} = \mathbf{H}^{(l-1)} \mathbf{W}_Q^{(l)} \)、键 \( \mathbf{K}^{(l)} = \mathbf{H}^{(l-1)} \mathbf{W}_K^{(l)} \) 和值 \( \mathbf{V}^{(l)} = \mathbf{H}^{(l-1)} \mathbf{W}_V^{(l)} \),其中 \( \mathbf{W}_Q^{(l)}, \mathbf{W}_K^{(l)} \in \mathbb{R}^{d \times d_k} \),\( \mathbf{W}_V^{(l)} \in \mathbb{R}^{d \times d_v} \)。注意力输出通过缩放点积计算: \[ \mathbf{A}^{(l)} = \text{softmax}\left( \frac{\mathbf{Q}^{(l)} \mathbf{K}^{(l)\top}}{\sqrt{d_k}} + \mathbf{M} \right) \mathbf{V}^{(l)}, \] 其中 \( \mathbf{M} \) 是因果掩码,如果 \( i > j \) 则 \( M_{ij} = -\infty \),否则为 0。然后,它将投影后的输出注意力添加到残差中: \[ \mathbf{H}^{\prime(l)} = \mathbf{H}^{(l-1)} + \mathbf{A}^{(l)} \mathbf{W}_O^{(l)}, \] 其中 \( \mathbf{W}_O^{(l)} \in \mathbb{R}^{d_v \times d} \)。最后,\( \mathbf{H}^{\prime(l)} \) 经过带残差连接的 FFN: \[ \mathbf{H}^{(l)} = \mathbf{H}^{\prime(l)} + \text{FFN}(\text{Norm}(\mathbf{H}^{\prime(l)})), \] 其中激活 \( \mathbf{H}^{(l)} \) 也是第 \( (l+1) \) 层的输入。 **因果语言模型**。我们将输入 token 序列记为 \( X = (x_1, x_2, \dots, x_L) \)。因果语言模型首先将这些离散 token 映射为连续向量表示。令 \( \mathbf{E} \in \mathbb{R}^{|\mathcal{V}| \times d} \) 表示 token 嵌入矩阵,其中 \( |\mathcal{V}| \) 是词汇表大小。初始隐藏状态 \( \mathbf{H}^{(0)} \in \mathbb{R}^{L \times d} \) 通过提取对应嵌入并与位置嵌入结合获得。之后,此初始表示通过堆叠的 \( N \) 个 Transformer 块逐层处理: \[ \mathbf{H}^{(l)} = \text{TransformerBlock}^{(l)}(\mathbf{H}^{(l-1)}), \quad \text{for } l = 1,2,\dots,N. \] 然后,最终隐藏状态 \( \mathbf{H}^{(N)} \) 表示上下文化的输入,语言模型头将此最终状态映射回词汇空间以预测下一个 token 的概率分布。该过程通常通过一个归一化后的线性投影以及 softmax 函数建模: \[ P(\cdot \mid x_{\leq i}) = \text{Softmax}(\text{Norm}(\mathbf{H}_{(i)}^{(N)}) \mathbf{W}_{\text{LM}}), \] 其中 \( \mathbf{H}_{(i)}^{(N)} \in \mathbb{R}^d \) 是位置 \( i \) 处的最终隐藏向量,\( \mathbf{W}_{\text{LM}} \in \mathbb{R}^{d \times |\mathcal{V}|} \) 是投影矩阵。采样 \( x_{i+1} \sim P(x_{i+1} \mid x_{\leq i}) \) 后,此新 token 被追加到序列中,模型重复该过程直到解码出序列结束 token 或达到最大长度。在预训练阶段,因果语言模型使用标准自回归下一个 token 预测目标进行优化。它最小化训练序列的负对数似然: \[ \theta = \arg\min_\theta \sum_{X \in \mathcal{D}} \sum_{i=1}^{|X|-1} -\log P(x_{i+1} \mid x_{\leq i}; \theta), \] 其中 \( \mathcal{D} \) 表示预训练语料库,\( \theta \) 涵盖模型所有可训练参数。 ### 3.2 原生记忆状态 为实现原生记忆状态,我们在 Transformer 块内部提出了 Metis 块,如图2(b)所示,其中每个 Metis 块由一个局部记忆块和一个超记忆块组成,如图2(c)所示。局部记忆块负责维护先前信息的密集表示,而超记忆块为原生记忆过程构建参数化函数空间以变换记忆状态。 **局部记忆块**。局部记忆块维护当前步的记忆状态,因此我们在第 \( l \) 个局部记忆块内定义一个密集记忆网络 \( \mathbf{M}^{(l)} \in \mathbb{R}^{d_k \times d_v} \)。在时间步 \( t \),我们将其记为 \( \mathbf{M}_t^{(l)} \)
相似文章
@AdinaYakup: Memtensor Research Group 发布 Metis 记忆基础模型,可能是首个将记忆内化到…的 LLM
Memtensor Research Group 发布了 Metis,这是一个 LLM 系列(4B/9B/27B),将记忆内化到骨干网络中,从而无需外部 RAG。该模型在单次前向传播中完成记忆读写,并以冻结权重的方式部署,如同标准 LLM。
@dair_ai: // 记忆即模型 // 该论文为任何LLM增加一个单独训练的记忆模型,用于存储、检索和整合…
MeMo 引入了一种模块化记忆模型,可为任何 LLM 增强存储、检索和整合新知识的能力,无需重新训练或担心灾难性遗忘。它在 BrowseComp-Plus、NarrativeQA 和 MuSiQue 等基准测试上优于基于 RAG 的方法。
Metis:桥接文本与代码记忆以实现自我进化智能体
Metis 开展了一项对比文本记忆与代码记忆的受控研究,发现两者具有互补的权衡特性。它提出了一种分层双表示记忆系统,在 AppWorld 基准测试中,任务准确率最高提升 20.6%,执行成本最高降低 22.8%。
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
基础模型代理的部署时记忆化
本文提出了基础模型代理中“部署时记忆化”的概念,分析了记忆设计选择(摘要激进程度、检索广度、删除模式)如何影响个性化效用、提取风险和删除保真度,并提出了新的指标,如个性化召回率、对抗提取率和遗忘残留分数。