User as Engram: 将每位用户的记忆内化为局部参数化编辑
摘要
提出了User as Engram方法,将每位用户的记忆存储为哈希键控记忆表中的稀疏局部参数化编辑,受海马体记忆印迹启发,与每位用户的LoRA相比,实现了更好的推理准确性和记忆效率。
arXiv:2606.19172v1 Announce Type: new
摘要:语言模型中的个人记忆涉及两个问题:内容和推理技能。大脑将两者分开(每个事件在海马体中形成稀疏、局部的记忆印迹,而共享技能的解读则由缓慢的新皮质负责),因此新事实无需覆盖其他内容。目前大多数个性化方法将用户的事实保存在权重之外,以自然语言记忆文件或检索索引的形式存在。当事实被写入模型时,标准做法是使用每位用户的LoRA适配器,这与大脑的做法相反,将内容和技能合并为一个全局权重增量。将用户的事实作为LoRA写入会污染与其无关的文本;而将相同事实作为局部Engram行写入则在数学上保持不变,导致内存占用大约缩小33,000倍。
因此,我们提出User as Engram:将用户的内容作为精确编辑存储在Engram模型的哈希键控记忆表中,而推理技能则通过一个共享的适配器承载。这种分层设计与每位用户的LoRA的直接召回相匹配,同时平均提供5.6倍更高的间接推理准确性,并且不会使任何用户比未触及的基础模型在推理方面更差。这种编辑是一个玻璃盒:写入一个事实时,会在触发点精确启动其查找,添加答案所需的值,保持其他每个位置不变,并且如果写入错误层则会失败。由于不同用户的事实落在不相交的哈希槽中,他们的编辑可以组合:许多用户同时存在于一个共享表中,以加法且无损的方式堆叠,而每位用户的LoRA作为一个单一的全局权重增量,只能容纳一个用户。在检索时,每位用户的Engram表不会随着检索器必须搜索的群体而增长,因此超过大约100个事实时,它就能超越在2.5倍更大模型上的检索流水线。
查看缓存全文
缓存时间: 2026/06/18 05:42
# 用户即印记:将每个用户的记忆内化为本地参数编辑 来源:https://arxiv.org/html/2606.19172
###### 摘要
语言模型中的个人记忆涉及两个问题,而非一个:*内容*(关于用户的特定事实)和*推理能力*(将这些事实转化为答案的技能)。大脑将这两者分开(对每个情节在海马体中存储一个稀疏、本地的*印记*,而缓慢的新皮层则提供解释这些情节的共享技能),因此新事实无需覆盖其他一切。当前大多数个性化方法将用户事实存储在权重*之外*,例如自然语言记忆文件或检索索引中。当事实被写入模型*内部*时,标准方法是为每个用户使用LoRA适配器,这与大脑的做法相反,将内容和技能融合成一个全局权重增量。将用户事实作为LoRA写入会污染与之无关的文本;而将相同的事实作为本地*印记行*写入,则会在数学上保持模型其他部分不变,内存占用大约减少33,000倍。因此,我们提出**用户即印记**:将用户的内容作为外科手术式编辑,写入印记模型基于哈希键的记忆表中,而推理能力则承载在**一个共享**适配器中。这种分层设计实现了与每个用户LoRA同等的直接回忆性能,同时平均间接推理准确率高出5.6倍,并且从未使任何单个用户在推理方面比未修改的基础模型更差。这种编辑是一个玻璃箱:写入一个事实会在其确切的触发点开启查询,添加答案所需的值,保持其他所有位置逐位不变,若写入错误层则会失效。由于不同用户的事实落入不重叠的哈希槽中,它们的编辑是可*组合*的:多个用户可以同时共存于一个共享表中,累加且无损;而每个用户的LoRA,作为一个单一的全局权重增量,只允许容纳一个用户。在检索时,每个用户的印记表不会随着检索器需要搜索的用户群体规模而增长,因此一旦事实数量超过约100个,它就能超越在2.5倍更大的模型上运行的检索管道。
## 1 引言
Maya与她的AI助手交谈了近一年。在这几个月里,助手了解到她的心脏病医生是Elena Vasquez医生,Vasquez在Lakeside Cardiology执业,Maya对青霉素严重过敏,并且她在2024年成为素食者。一个有用的助手必须用这种*个人记忆*做三件事:按需回忆事实(“我的心脏病医生是谁?”),在问题间接时进行推理(“我下个月要去加州看望女儿,该去哪里做心脏检查?”),并且绝不让一个用户的事实泄露给另一个用户。从单个Transformer骨干网(Vaswani et al., 2017 (https://arxiv.org/html/2606.19172#bib.bib7))为数百万这样的用户提供服务,是一个尚未解决的架构问题。
人类记忆已经解决了这个问题的一个版本。大脑不是通过轻微调整每个突触来记录新事实,而是将情节作为稀疏、本地的痕迹(*印记*)写入海马体,而缓慢、分布的新皮层则提供解释它的通用技能(Semon, 1921 (https://arxiv.org/html/2606.19172#bib.bib2); Tonegawa et al., 2015 (https://arxiv.org/html/2606.19172#bib.bib4); McClelland et al., 1995 (https://arxiv.org/html/2606.19172#bib.bib3))。将快速、本地的存储与缓慢、共享的存储分开,正是让我们能够学习Maya对青霉素过敏,而不会干扰我们一般推理过敏反应的方式。
语言模型中的个人记忆同样具有两部分结构:*内容*(用户的特定事实)和*推理能力*(将事实转化为答案),两者相互排斥。内容是私有的,且因用户而异,因此需要自己的本地存储;推理能力对所有人是通用的,因此应一次学习并共享(图1 (https://arxiv.org/html/2606.19172#S1.F1))。
参见图注
图1:**用户即印记**将个人记忆分为两层,模仿大脑的互补学习系统。
**顶部(内容)**。每个用户的事实被写为印记模型单个哈希键记忆表中的几行本地覆盖(彩色);该表的其他行保存预训练时学到的通用知识(灰色)。写入仅触及该用户的行(在所有其他文本上Δbpb=+0.0001),且不同用户哈希到不同地址,因此它们从不重叠:快速、稀疏、本地的痕迹,类似海马体的印记。
**底部(推理能力)**。一个单一的共享LoRA适配器,适配于冻结的Mini-Engram骨干网,在其他用户群体上训练一次,并在所有用户间分摊:缓慢、共享的新皮层。唯一的每个用户状态是那几行彩色行;下方所有内容都是共享的。
三类方法处理个人记忆。在部署系统中,占主导地位的两类都是非参数化的:上下文学习(ICL, Brown et al. 2020 (https://arxiv.org/html/2606.19172#bib.bib8); Min et al. 2022 (https://arxiv.org/html/2606.19172#bib.bib10)),最常见的是自动提取的自然语言记忆文件,将事实保留在提示中;以及检索增强生成(RAG, Lewis et al. 2020 (https://arxiv.org/html/2606.19172#bib.bib11); Gao et al. 2023 (https://arxiv.org/html/2606.19172#bib.bib12)),在查询时获取它们。这两类都保持模型权重不变,我们将在全文(第6.4节 (https://arxiv.org/html/2606.19172#S6.SS4)–6.5节 (https://arxiv.org/html/2606.19172#S6.SS5))中与检索进行直接比较。第三类方法将事实写入权重*内部*,且只有这类方法将内容和推理能力混为一谈,将它们存储在同一参数*中。在权重大小方法中,标准方法是为每个用户训练LoRA(Hu et al., 2022 (https://arxiv.org/html/2606.19172#bib.bib23))基于每个用户的事实(第2节 (https://arxiv.org/html/2606.19172#S2))。LoRA没有地址:要使一个事实更可能发生,梯度下降会弯曲最便宜地拟合该事实的Q/K/V/O方向,而这些相同的方向也会在无关文本上触发,因此编辑天生是全局的,而非训练的副作用。全局增量也是单租户的:两个用户的LoRA无法共享一个模型而不合并成一个相互干扰的组合增量,因此每个用户需要自己的权重副本。
#### 我们的方法:内容在记忆表中,技能在共享适配器中。
用户即印记将Maya的每个事实作为外科手术式编辑,写入印记预训练模型(Cheng et al., 2026 (https://arxiv.org/html/2606.19172#bib.bib6))基于哈希键的记忆表中,其门控查询仅通过确定性哈希在后缀n-gram上触发;推理能力是一个*共享*的LoRA适配器,在预留的群体上训练一次,因此唯一的每个用户状态是记忆行,每次请求时交换。该表是*内容可寻址*的,并且在非其键时保持惰性,因此写入一个事实仅在其触发器n-gram被读取时改变输出(第4.3节 (https://arxiv.org/html/2606.19172#S4.SS3),图7 (https://arxiv.org/html/2606.19172#S4.F7))。这就解释了为什么表,而非权重,是存储用户事实的正确地点:写入是隔离的,后缀n-gram索引与个人事实被查询的方式(通过其表面形式)匹配,且每行大小固定约88 KB,其地址每次请求时交换,因此存储量随用户数量增长,而非模型大小。隔离自然而然地带来了可组合性:由于不同用户占据不重叠的地址,它们的覆盖映射是可交换的,并可累加地堆叠在一个共享表中,从而同时将多个用户(或一个公司存储层叠加在个人存储层之上)放入同一个模型(图1 (https://arxiv.org/html/2606.19172#S1.F1),第5.3节 (https://arxiv.org/html/2606.19172#S5.SS3))。
#### 论文组织。
本文其余部分阐述四个核心主张:
1. 1.将事实存储在共享权重中的代价(第3节 (https://arxiv.org/html/2606.19172#S3))。在一个受控基础上,将事实作为LoRA写入与作为印记行写入相比,在无关文本上的额外损失相差约33,000倍(3次随机种子均值),这是LoRA存储事实方式的属性,而非我们如何调优的结果。额外损失始终存在;可见的损害(推理变差)仅出现在弱基础上,并且在强大的指令调优基础上消失,后者自身就能回答问题。我们通过改变基础强度来开启和关闭这种损害。
2. 2.用户即印记,机制完全公开(第4节 (https://arxiv.org/html/2606.19172#S4)):一种将用户事实书写为对印记模型记忆表的微小本地编辑的方法。与LoRA的更改不可见地散布在整个模型中不同,印记写入的每一步都可以在训练后的模型上观察:它在确切的触发点开启记忆查询,添加答案所需的值且不改变其他任何内容(每个其他位置逐位不变),如果写入错误的层则会停止工作(图7 (https://arxiv.org/html/2606.19172#S4.F7) 和 8 (https://arxiv.org/html/2606.19172#S4.F8))。我们发布四个Mini-Engram检查点(178 M–1.22 B;印记的纳米级公开复现)、所有代码和数据,以及一个50行代码、支持多租户且无跨用户泄漏的服务器。
3. 3.一种分层设计(第6节 (https://arxiv.org/html/2606.19172#S6)),将每个用户的印记内容与一个共享推理适配器(一个人工互补学习系统)配对,并在直接回忆、间接推理(平均比每个用户的LoRA高5.6倍)、污染以及每个用户推理退化方面击败所有一体化基线。该领先优势在个人→医学模式转换中依然保持。
4. 4.与检索的部署规模比较(第6.4节 (https://arxiv.org/html/2606.19172#S6.SS4)–6.5节 (https://arxiv.org/html/2606.19172#S6.SS5)):哪种方法获胜由每个用户的事实数量和用户群体规模决定,而非基准测试大小。由于每个用户的印记表不会随用户群体规模增长,一旦知识库超过约100个事实,它就能超越一个强大的检索管道(运行在2.5倍更大的模型上)。
## 2 背景
#### 印记架构。
Cheng等人(2026 (https://arxiv.org/html/2606.19172#bib.bib6))作为DeepSeek系列稀疏模型的一部分(Dai et al., 2024 (https://arxiv.org/html/2606.19172#bib.bib14); DeepSeek-AI, 2024 (https://arxiv.org/html/2606.19172#bib.bib55)),引入了*条件记忆*作为与混合专家(MoE, Shazeer et al. 2017 (https://arxiv.org/html/2606.19172#bib.bib13); Dai et al. 2024 (https://arxiv.org/html/2606.19172#bib.bib14))互补的稀疏形式。在每个token位置t,规范化后的标记的后缀n-gram通过K个乘法XOR头哈希到质数大小的嵌入表E_{n,k}。检索到的行e_t由学习到的W_K, W_V投影,并由注意力风格的标量α_t = σ(RMS(h_t)^⊤ RMS(W_K e_t)/√d)门控。输出α_t W_V e_t被添加到选定印记层的残差流中。关键是,地址z_{t,n,k}从输入token ID确定性地得出——在前向传播之前已知——因此表可以卸载到主机DRAM中,而无需GPU竞争。
#### LoRA即记忆家族。
每个用户/每个文档的LoRA适配器(Su et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib25); Tan et al., 2024 (https://arxiv.org/html/2606.19172#bib.bib28); Zhuang et al., 2024 (https://arxiv.org/html/2606.19172#bib.bib29); Charakorn et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib31); Tan et al., 2024b (https://arxiv.org/html/2606.19172#bib.bib32); Bini et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib30))训练一个低秩增量(Hu et al., 2022 (https://arxiv.org/html/2606.19172#bib.bib23); Houlsby et al., 2019 (https://arxiv.org/html/2606.19172#bib.bib24); Mangrulkar et al., 2022 (https://arxiv.org/html/2606.19172#bib.bib15))——属于更广泛的参数高效微调家族,包括前缀调优(Li & Liang, 2021 (https://arxiv.org/html/2606.19172#bib.bib94))和自适应秩及量化变体(Zhang et al., 2023 (https://arxiv.org/html/2606.19172#bib.bib95); Dettmers et al., 2023 (https://arxiv.org/html/2606.19172#bib.bib96))——应用于冻结基础之上的Q/K/V(有时还包括MLP)矩阵。每个用户通过(观察、事实、问答)混合数据的NTP进行拟合,通过教师知识蒸馏(DyPRAG (Tan et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib26)), DistilledPRAG (Chen et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib27))),或通过超网络发射(T2L (Charakorn et al., 2025 (https://arxiv.org/html/2606.19172#bib.bib31)))。所有变体*全局地编辑模型权重*:每次前向传播都会看到LoRA的更改。
#### 用户即印记的位置。
这两种方法——印记存储和每个用户的LoRA——锚定了个人记忆方法的图谱,该图谱沿两个轴分类(图2 (https://arxiv.org/html/2606.19172#S2.F2)):方法在查询时是否支付上下文token,以及存储一个事实是否保持模型其余部分不变。上下文学习、检索和外部记忆系统保持模型本地,但每次查询支付上下文;每个用户的LoRA和知识编辑不支付上下文,但全局改变权重。用户即印记是唯一位于剩余角落的方法——零上下文成本下的本地编辑——本文其余部分将证明这一位置。我们将更广泛的文献推迟到第9节 (https://arxiv.org/html/2606.19172#S9)。
参见图注
图2:**用户即印记在个人记忆方法中的位置**。基于上下文的方法(上下文学习、检索、记忆系统)保持模型不变,但在查询时支付上下文token(左上);基于权重的方法(每个用户的LoRA、知识编辑)不支付上下文,但全局编辑模型(右下)。用户即印记占据剩余角落:零上下文成本下的本地编辑。坐标轴是定性的。
## 3 每个用户的LoRA全局污染
权重是存储知识的绝佳场所——预训练将数百万个事实精确地打包其中,大约每个参数2-4比特(Allen-Zhu & Li, 2025 (https://arxiv.org/html/2606.19172#bib.bib81))。但该容量是*共享的*,且事实是*不可压缩的*:每个事实必须显式存储,并最终与其他每个事实纠缠在一起——这是权重的一个独特份额,不会随着更好的训练而缩小(Li, 2026b (https://arxiv.org/html/2606.19172#bib.bib82))。对于每个人都会查询的事实来说,这没问题。但将*一个用户*的事实作为*每个用户的权重编辑来存储*是个糟糕的地方,这并非因为容量不足。每个用户的LoRA编辑每一层的Q/K/V/O,因此其编辑是无条件的(每次前向传播的一部分),且必须从少量示例中为每个用户拟合。随之而来两个问题,我们将测量两者:编辑是全局的,因此污染了与用户无关的文本;事实一旦训练进去,是*被回忆但不易推理*的。第一个问题是每个基础上都要付出的架构代价;第二个问题对个性化最为重要,这也是为什么事实应该属于共享推理可以读取的存储,而不是每个用户的权重副本。
### 3.1 相同基础上的架构污染(Mini-Engram-d20)
我们固定基础模型(Mini-Engram-d20@1536,1.22 B参数),并在本文中使用的合成用户事实集上训练每个用户的LoRA(rank-64 on Q/K/V,每个事实1,500步,单token金标准)。对于20个测试用户中的每一个,我们在编辑前后测量在保留的262 K token ClimbMix分片(与用户事实无关的文本)上的val_bpb。每个用户的印记行联合OPT在相同协议下测量。相似文章
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
通过参数化记忆扩展自进化智能体
来自阿里巴巴/Qwen和北京大学的研究人员提出了TMEM——一种自进化参数化记忆框架。该框架利用在线LoRA权重更新,使LLM智能体能够在单个回合内真正从经验中学习,而非仅依赖提示空间中的记忆。TMEM在多个基准测试(包括LoCoMo、LongMemEval-S和CL-Bench)上均优于基于摘要和基于检索的基线方法。
Engram在自回归图像生成中是否进行记忆检索?
本文研究Engram模块(一种关联记忆机制)在自回归图像生成中是提供内容可寻址检索,还是仅作为门控架构的侧通路。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。