大语言模型的记忆
摘要
本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。
arXiv:2607.25380v1 Announce Type: new
摘要:记忆已发展成大型语言模型(LLM)中的基础架构维度,从计算的隐式副产品转变为一系列显式、可控的机制。尽管近期进展引入了多种策略——涵盖瞬态注意力、循环状态动态、参数高效适应以及可扩展查找存储——但这种快速演进导致了高度碎片化的研究格局。在本综述中,我们提出了一个以架构为中心的系统性LLM记忆分类法。我们的框架沿三个正交轴描述记忆:表示(隐式与显式)、更新动态(离线与在线)以及持久性(短期与长期)。我们进一步形式化了支配记忆写入、路由、状态转换和整合的粒度机制。这种统一视角阐明了计算耦合与独立可寻址记忆之间的概念边界,有效弥合了不同的架构范式。此外,我们批判性地分析了混合记忆架构、系统级效率权衡以及多维度评估方法。通过将这些分散的进展整合为一个连贯的框架,本综述描绘了以记忆为中心的LLM设计的轨迹,并为未来可扩展和自适应语言建模的创新提供了原则性基础。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 大型语言模型的记忆机制 来源:https://arxiv.org/html/2607.25380 Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, 和 Jie Tang Sining Zhoubian, 清华大学, zbsn21@tsinghua\.mails\.edu\.cn\. Dan Zhang, 新加坡国立大学, zhangdan25@nus\.edu\.sg\. Evgeny Kharlamov, 博世AI, evgeny\.kharlamov@de\.bosch\.com\. Jie Tang, 清华大学, jietang@tsinghua\.edu\.cn\. ###### 摘要 记忆已成为大型语言模型(LLMs)中一个基础性的架构维度,从计算隐含的副产品转变为一系列显式、可控的机制。虽然近期的进展引入了多种策略——涵盖临时注意力、递归状态动态、参数高效适配以及可扩展的查找存储——但这种快速演进导致研究领域高度碎片化。在本综述中,我们提出了一种系统性的、以架构为中心的LLM记忆分类法。我们的框架沿三个正交轴刻画记忆:表示(隐式与显式)、更新动态(离线与在线)以及持久性(短期与长期)。我们进一步形式化了决定记忆写入、路由、状态转换和整合的粒度机制。这种统一视角阐明了计算耦合记忆与独立可寻址记忆之间的概念边界,有效弥合了不同的架构范式。此外,我们批判性地分析了混合记忆架构、系统级效率权衡以及多维评估方法。通过将这些分散的进展整合到一个连贯的框架中,本综述描绘了以记忆为中心的LLM设计的发展轨迹,并为未来可扩展和自适应语言建模的创新提供了原则性基础。 ## I 引言 大型语言模型(LLMs)在推理、编程、对话和长上下文理解方面展现了卓越的能力。虽然其成功很大程度上归功于缩放定律(涵盖参数、数据和计算),但一个同样基础的架构维度正日益显现:**记忆**。从调节词元间交互的临时注意力机制,到递归状态动态和持久化的测试时参数适应,现代LLM越来越依赖多面记忆系统来跨扩展序列和交互保留、检索和更新信息。 历史上,**神经语言模型中的记忆主要是隐式的**。Transformer注意力提供了一种受固定上下文窗口限制的内容可寻址工作记忆,实现了灵活的短期信息聚合。然而,其计算和存储开销随序列长度呈二次增长。随后的进展通过稀疏注意力[[14](https://arxiv.org/html/2607.25380#bib.bib12), [78](https://arxiv.org/html/2607.25380#bib.bib13), [8](https://arxiv.org/html/2607.25380#bib.bib14)]、结构化状态空间模型[[26](https://arxiv.org/html/2607.25380#bib.bib1), [16](https://arxiv.org/html/2607.25380#bib.bib17)]以及耦合递归和注意力动态的混合架构[[42](https://arxiv.org/html/2607.25380#bib.bib6), [64](https://arxiv.org/html/2607.25380#bib.bib7)]扩展了这一范式。虽然这些发展显著扩展了可访问的上下文长度并提升了计算效率,但它们常常引入性能权衡。此外,这些架构中的记忆本质上是短暂的,并与前向计算图紧密耦合。 最近,出现了一种截然不同的架构转变。如图1 (https://arxiv.org/html/2607.25380#S1.F1)所示,越来越多的研究纳入了**显式和持久化的记忆机制**,这些机制在短暂的推理之外自适应演化,为模型提供了能力扩展的正交途径。诸如Titans[[6](https://arxiv.org/html/2607.25380#bib.bib8)]和端到端测试时训练[[63](https://arxiv.org/html/2607.25380#bib.bib28)]等方法实现了部署期间的动态参数更新。基于查找的架构,包括Engram[[13](https://arxiv.org/html/2607.25380#bib.bib9)],将记忆存储与密集计算解耦。嵌套和多时间尺度更新策略[[7](https://arxiv.org/html/2607.25380#bib.bib27)]进一步模糊了传统训练与推理之间的边界。与此同时,条件参数模块和混合专家(MoE)架构[[15](https://arxiv.org/html/2607.25380#bib.bib39), [34](https://arxiv.org/html/2607.25380#bib.bib38)]根据输入上下文选择性激活参数子集,构成了一种结构化的条件记忆形式。总体而言,这些进步表明记忆正转变为一个主要的、显式的架构设计维度,而不再是缩放的副产品。 尽管进展迅速,文献中仍缺乏一个统一的视角来阐明这些不同记忆机制之间的概念关系。基于注意力的缓存、递归序列状态、测试时适应、检索模块和条件参数路由常常被孤立研究,尽管它们处理的是基本同构的问题:**存储什么、何时以及如何更新、如何与前向计算交互、保留时长以及底层的存储粒度**。如果没有一个原则性的结构框架,比较方法论、分析系统级权衡以及识别未探索的设计空间仍然极其困难。 在本综述中,我们提出了一种系统性的、以架构为中心的LLM记忆处理方法。我们引入了一个全面的分类法,沿三个正交轴刻画记忆:1)表示形式,区分隐式计算记忆与显式参数化或结构化存储;2)持久性,捕捉保留信息的时间跨度;以及3)更新动态,描述记忆表示何时以及如何演变。这一分类法有助于对广泛的近期架构进行连贯解释,阐明其结构和概念上的相互依赖关系。通过以记忆为中心的视角重新审视这些分散的进展,本综述旨在整合一个新兴的研究前沿,并为未来的架构创新提供原则性基础。在图2 (https://arxiv.org/html/2607.25380#S1.F2)中,我们总结了本综述的核心内容和分类结构。 参见标题 图1: LLM中记忆的演进。随着记忆从计算的隐含副产品转变为现代LLM和AI代理中的显式架构设计维度,出现了具有不同存储形式、持久性属性和更新动态的多样化记忆机制。这一概念转变促使我们提出一个统一的分类法来刻画和比较记忆架构。 我们的主要贡献有三个方面: - **我们提出了一个统一的LLM架构记忆分类法,建立了精准的术语来描述隐式、显式、持久化和自适应的记忆机制(参见第II节 (https://arxiv.org/html/2607.25380#S2))。** - **我们系统性地回顾了计算驱动和参数化记忆系统的最新进展,涵盖混合架构、多时间尺度更新策略和条件参数路由(参见第III节 (https://arxiv.org/html/2607.25380#S3)和第IV节 (https://arxiv.org/html/2607.25380#S4))。** - **我们批判性地分析了以记忆为中心的模型的系统级权衡和多维评估方法,强调了持续存在的开放挑战和有前景的未来研究方向(参见第V节 (https://arxiv.org/html/2607.25380#S5)和第VI节 (https://arxiv.org/html/2607.25380#S6))。** LLM的记忆 分类法 (§II (https://arxiv.org/html/2607.25380#S2)) 表示 (§II-A (https://arxiv.org/html/2607.25380#S2.SS1)) 更新动态 (§II-B (https://arxiv.org/html/2607.25380#S2.SS2)) 持久性 (§II-C (https://arxiv.org/html/2607.25380#S2.SS3)) ∙ **隐式**: 计算耦合 (KV缓存, 隐状态) ∙ **显式**: 解耦接口 (数据存储, 参数模块) ∙ **离线**: 仅在训练期间更新 (预训练, MoE) ∙ **在线**: 在推理期间更新 (TTT, 递归状态) ∙ **短期**: 短暂,受限于上下文窗口 (注意力缓存) ∙ **长期**: 跨上下文/会话持久化 (Titans, Engram) 隐式记忆 (§III (https://arxiv.org/html/2607.25380#S3)) 基于注意力的 (§III-A (https://arxiv.org/html/2607.25380#S3.SS1)) 稀疏与选择性 (§III-B (https://arxiv.org/html/2607.25380#S3.SS2)) 递归 (§III-C (https://arxiv.org/html/2607.25380#S3.SS3)) 例如,Transformer (KV缓存), StreamingLLM, HyperMLP, 滑动窗口和动态序列混合注意力 例如,选择性注意力, RATTENTION, MoBA, NSA, 内容路由和局部-全局KV访问 例如,Mamba-3, RWKV-7, Gated DeltaNet-2, 对数线性注意力, 卡尔曼线性注意力 显式记忆 (§IV (https://arxiv.org/html/2607.25380#S4)) 参数化 (§IV-A (https://arxiv.org/html/2607.25380#S4.SS1)) 基于查找 (§IV-B (https://arxiv.org/html/2607.25380#S4.SS2)) MoE (§IV-C (https://arxiv.org/html/2607.25380#S4.SS3)) 多时间尺度 (§IV-D (https://arxiv.org/html/2607.25380#S4.SS4)) 例如,Titans, TTT-E2E, MEMORYLLM, LM2, In-Place TTT, 和专用可写模块 例如,kNN-LM, PlugLM, Engram, ExplicitLM, 可编辑数据存储, 和哈希查找槽 例如,Switch Transformer, Mixtral, DeepSeek-MoE, 路由专家子网络作为条件记忆 例如,嵌套学习 (Hope), 慢-快模块, 连续记忆, 和层次化更新调度 系统与评估 (§V (https://arxiv.org/html/2607.25380#S5)) 混合架构 (§V-A (https://arxiv.org/html/2607.25380#S5.SS1)) 效率与管理 (§V-B (https://arxiv.org/html/2607.25380#S5.SS2)) 评估 (§V-C (https://arxiv.org/html/2607.25380#S5.SS3)) 例如,Jamba, Kimi Linear, OLMo Hybrid, AMOR, HAM, 固定和自适应路由互补记忆 例如,CommVQ, PagedAttention, 记忆缓存, 瓶颈Transformer, 和KV整合 例如,RULER, LongBench, ∞\inftyBench, L-Eval, SCROLLS, 召回, 结构化推理, 和效率诊断 未来方向 (§VI (https://arxiv.org/html/2607.25380#S6)) 开放挑战 ∙ 记忆的统一理论 ∙ 终身参数化记忆 ∙ 自适应记忆分配 ∙ 硬件-算法协同设计 ∙ 多维评估框架 图2: LLM记忆的主要内容和分类法。 ## II 大型语言模型中记忆的分类法 尽管关于记忆增强型大型语言模型的研究日益增多,但“记忆”一词常常被模糊使用,指代不同抽象层次上的异质机制或系统。在本综述中,我们专注于**模型级别的记忆机制和系统**,即那些在模型架构或其推理时动态中实例化的记忆,并排除依赖外部编排或工程流程的代理级别或基于提示的记忆系统。 为了提供一个统一且原则性的视角,我们沿三个正交轴组织现有方法:**表示**、**更新动态**和**持久性**。这些轴分别捕捉什么被存储为记忆、何时以及如何更新,以及记忆持续多久。重要的是,我们的分类法并非旨在成为僵化的分类,而是一个揭示看似不同方法背后共同结构的概念框架。 在表I (https://arxiv.org/html/2607.25380#S2.T1)中,我们总结了近期的LLM记忆系统研究工作,按三个轴进行了分类。 表I: 基于所提议分类法的现代LLM记忆系统的代表性研究总结。表格沿三个轴对模型进行了分类:表示、更新动态和持久性。注意,所有模型通过其主要记忆机制表示,某些模型可能在同一轴内同时包含多个特征。 | 系统/模型 | 年份 | 更新动态 | 持久性 | 主要范式 | | --- | --- | --- | --- | --- | | **隐式记忆** | | | | | | Transformer (KV缓存) [67](https://arxiv.org/html/2607.25380#bib.bib43) | 2017 | 在线 | 短期 | 基于KV的注意力 | | Sparse Transformer [14](https://arxiv.org/html/2607.25380#bib.bib12) | 2019 | 在线 | 短期 | 稀疏注意力模式 | | Big Bird [78](https://arxiv.org/html/2607.25380#bib.bib13) | 2020 | 在线 | 短期 | 稀疏化注意力 | | Longformer [8](https://arxiv.org/html/2607.25380#bib.bib14) | 2020 | 在线 | 短期 | 局部和全局注意力 | | StreamingLLM [73](https://arxiv.org/html/2607.25380#bib.bib15) | 2023 | 在线 | 短期 | 带滑动窗口的注意力汇聚 | | RetNet [62](https://arxiv.org/html/2607.25380#bib.bib22) | 2023 | 在线 | 长期 | 保持网络(递归) | | Mamba / Mamba-2 [26](https://arxiv.org/html/2607.25380#bib.bib1) | 2024 | 在线 | 长期 | 状态空间递归 | | RWKV (Eagle/Finch) [53](https://arxiv.org/html/2607.25380#bib.bib3) | 2024 | 在线 | 长期 | 带矩阵状态的线性递归 | | Samba [56](https://arxiv.org/html/2607.25380#bib.bib30) | 2024 | 在线 | 长期 | 交错Mamba和滑动窗口 | | Jamba / Jamba-1.5 [42](https://arxiv.org/html/2607.25380#bib.bib6) | 2024 | 在线 | 长期 | 混合SSM-注意力块 | | 选择性注意力 [40](https://arxiv.org/html/2607.25380#bib.bib4) | 2024 | 在线 | 短期 | 门控/自适应注意力 | | LightTransfer [81](https://arxiv.org/html/2607.25380#bib.bib31) | 2024 | 在线 | 短期 | 逐层混合适应 | | Expansion Span [51](https://arxiv.org/html/2607.25380#bib.bib33) | 2025 | 在线 | 长期 | 带跨度扩展注意力的混合 | | MoBA [45](https://arxiv.org/html/2607.25380#bib.bib79) | 2025 | 在线 | 短期 | 内容路由稀疏KV块 | | Gated Delta Networks [74](https://arxiv.org/html/2607.25380#bib.bib2) | 2025 | 在线 | 长期 | 带Delta规则的门控递归 | | RWKV-7 [54](https://arxiv.org/html/2607.25380#bib.bib81) | 2025 | 在线 | 长期 | 向量门控广义Delta递归 | | 对数线性注意力 [27](https://arxiv.org/html/2607.25380#bib.bib82) | 2025 | 在线 | 长期 | 递归状态的对数层级 | | KDA / Kimi Linear [65](https://arxiv.org/html/2607.25380#bib.bib65) | 2025 | 在线 | 长期 | 通道门控Delta记忆 | | MoM [19](https://arxiv.org/html/2607.25380#bib.bib46) | 2025 | 在线 | 长期 | 路由多状态递归 | | 混合二次-线性Transformer [32](https://arxiv.org/html/2607.25380#bib.bib63) | 2025 | 在线 | 长期 | 固定互补KV-RNN记忆 | | RATTENTION [2](https://arxiv.org/html/2607.25380#bib.bib5) | 2025 | 在线 | 短期 | 局部-全局最小滑动窗口 | | Mamba-3 [39](https://arxiv.org/html/2607.25380#bib.bib85) | 2026 | 在线 | 长期 | 复值MIMO状态空间递归 | | Gated DeltaNet-2 [28](https://arxiv.org/html/2607.25380#bib.bib48) | 2026 | 在线 | 长期 | 解耦Delta规则状态编辑 | | Kaczmarz线性注意力 [84](https://arxiv.org/html/2607.25380#bib.bib49) | 2026 | 在线 | 长期 | 投影校准线性注意力 | | 卡尔曼线性注意力 / Gated KalmaNet [60](https://arxiv.org/html/2607.25380#bib.bib50), [55](https://arxiv.org/html/2607.25380#bib.bib51) | 2026 | 在线 | 长期 | 概率递归状态估计 | | 下一潜在预测 [66](https://arxiv.org/html/2607.25380#bib.bib52) | 2026 | 离线 | 长期 | 潜在信念状态归纳 | | HyperMLP [46](https://arxiv.org/html/2607.25380#bib.bib44) | 2026 | 在线 | 短期 | 动态序列混合注意力 | | 记忆缓存 [5](https://arxiv.org/html/2607.25380#bib.bib45) | 2026 | 在线 | 长期 | 缓存递归状态快照 | | AMOR [83](https://arxiv.org/html/2607.25380#bib.bib61) | 2026 | 在线 | 长期 | 熵门控注意力精炼 | | HAM [47](https://arxiv.org/html/2607.25380#bib.bib62) | 2026 | 在线 | 长期 | 混合注意力与递归 |
相似文章
StageMem:面向语言模型的生命周期管理记忆框架
StageMem 提出了一种面向语言模型的生命周期管理记忆框架,该框架将记忆划分为瞬态、工作状态和持久状态三个阶段,并引入明确的置信度与强度指标,将记忆视为一种有状态的处理流程而非静态存储,从而在容量受限的条件下更精准地管理信息的保留与遗忘。
δ-mem:大型语言模型的高效在线记忆机制
本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
大语言模型中涌现模块化认知架构
本文研究模块化认知架构是否在大语言模型中涌现,发现大语言模型发展出专门化的神经网络,反映了人脑在认知领域的组织结构,表明模块化是智能系统的一个基本属性。
面向高效大语言模型服务:系统感知KV缓存优化综述
一篇系统综述,回顾系统感知的KV缓存优化技术,用于高效的大语言模型服务,将现有工作组织为执行/调度、放置/迁移和表示/保留三个维度。