MemoryForge:为类人LLM智能体合成终身记忆

arXiv cs.CL 论文

摘要

本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。

arXiv:2608.00007v1 公告类型:新 摘要:为大型语言模型(LLM)配备类人的人设对于智能体应用(如角色扮演和用户模拟)至关重要。传统的基于提示的方法通过注入静态文本档案来进行描述性条件化,这往往使智能体因缺乏真实的生活记忆而表现出通用行为。为填补这一空白,我们引入了基于记忆的条件化范式,该范式受认知心理学启发,用自传体记忆库取代抽象档案,使冻结的LLM能够动态检索与情境相关的记忆来指导其行为。我们将其使能任务形式化为定制化的终身记忆合成,并提出MemoryForge,一个从简短目标人设中合成此类终身记忆的新框架。MemoryForge包含三个关键组件:用于社会历史背景化的上下文生成器、用于向目标身份发展连贯性的生活组织器,以及一个在广泛时间摘要与高保真情景体验之间取得平衡的多分辨率模拟器。在用于角色扮演的PersonaGym和用于用户模拟的SimulatorArena上的实验表明,MemoryForge合成的记忆库使冻结的LLM在多个指标和LLM骨干网络上表现出比强描述性条件化基线更类人的行为。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# MemoryForge:合成类人LLM智能体的终身记忆  
来源:https://arxiv.org/html/2608.00007

Bohan Tang  
LIGHTSPEED  
bohantang@global\.tencent\.com  

&Yiwen Guo†  
Independent Researcher  
guoyiwen89@gmail\.com  

###### 摘要

为大型语言模型(LLM)赋予人类般的用户人设,对于角色扮演和用户模拟等智能体应用至关重要。传统的基于提示(prompt)的方法依赖描述性条件化(descriptive conditioning),通过注入静态文本画像来驱动行为;但由于缺乏真实的生活记忆,这类智能体往往表现出同质化的通用行为。为弥补这一空白,我们提出基于记忆的条件化(memory-based conditioning)这一受认知心理学启发的范式:用自传体记忆库替代抽象画像,使冻结的LLM能够动态检索与情境相关的记忆来引导自身行为。我们将这一支撑任务形式化为定制化终身记忆合成(customized lifelong memory synthesis),并提出MemoryForge——一个从简短目标人设中合成此类终身记忆的新框架。MemoryForge包含三个关键组件:用于社会历史背景锚定的上下文生成器(Context Generator)、用于向目标身份形成发展连贯性的生命组织器(Life Organizer),以及一个在多尺度时间摘要与高保真情景体验之间取得平衡的多分辨率模拟器(Multi-Resolution Simulator)。在面向角色扮演的PersonaGym和面向用户仿真的SimulatorArena上的实验表明,MemoryForge合成的记忆库能使冻结LLM在多项指标和多个LLM骨干上比强描述性条件化基线展现出更类人的行为。代码见此处 (https://github.com/Tencent/MemoryForge)。

MemoryForge:合成类人LLM智能体的终身记忆

Bohan Tang  
LIGHTSPEED  
bohantang@global\.tencent\.com  

Yiwen Guo†  
Independent Researcher  
guoyiwen89@gmail\.com  

††footnotetext:†通讯作者。

## 1 引言

随着大型语言模型(LLM)推动AI智能体(Sumers et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib27); Wang et al.,2024a (https://arxiv.org/html/2608.00007#bib.bib31); Xi et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib35))的广泛部署,新兴应用越来越要求这些系统超越任务执行,表现出以特定人设为基础的类人行为。例如,角色扮演智能体必须在开放域对话中维持身份(Park et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib19); Tu et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib28)),而有效的用户模拟器必须反映人类动态(Dou et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib6); Zhou et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib41))。因此,让LLM与目标人设保持一致的行为越来越重要。为实现这一目标,微调方法通过大量对话数据将人设嵌入模型参数(Shao et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib26); Wang et al.,2024b (https://arxiv.org/html/2608.00007#bib.bib32); Yang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib37))。虽然有效,但逐人设训练成本高昂,且不适用于专有API,限制了其实用性。这些限制引发了对提示(prompt)方法的关注,即我们称之为描述性条件化的范式。该范式保持骨干LLM冻结,将静态文本画像(如人口统计锚定的背景故事(Moon et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib17))和分类学引导的叙事(Wang et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib34)))注入上下文窗口,以引导下游LLM行为。

图1:现有描述性条件化方法与MemoryForge的比较。

然而,根据认知心理学,描述性条件化存在两个关键局限。第一,静态注入:人设文本通常原封不动地注入每一次交互(Ge et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib10); Moon et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib17))。无论智能体面对的是面试还是家庭晚餐,人设文本都保持不变。这与人类认知的运作方式相冲突:人类会根据当前情境激活不同的记忆(Conway,2005 (https://arxiv.org/html/2608.00007#bib.bib3); Tulving,1983 (https://arxiv.org/html/2608.00007#bib.bib29))。第二,行为刻画不足:人设通常以特质标签和脚本化对话为基础(Wang et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib34)),而心理学表明,行为倾向不应仅仅被理解为抽象描述符,更应被理解为由一生中累积经验塑造的模式(Erikson,1963 (https://arxiv.org/html/2608.00007#bib.bib8); McCrae and Costa Jr,1999 (https://arxiv.org/html/2608.00007#bib.bib16))。例如,一个被朋友欺骗的“谨慎”之人,与一个在风险规避家庭中长大的人,其行为会有所不同,因为背后的因果记忆不同。由于缺乏与情境相关的生活记忆支撑,模型会退回到预训练刻板印象,产生同质化行为(Zhou et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib41))。因此,要同时解决这两个局限,需要一个记忆库,它(1)支持与情境相关的检索,并且(2)覆盖完整的发展轨迹。

在本工作中,我们探索一种新范式:基于记忆的条件化。我们不注入一个描述人设的固定画像,而是合成一个结构化的终身记忆库,冻结LLM从中检索与情境相关的记忆,作为动态条件化上下文。遵循这一精神,我们将这一支撑任务形式化为定制化终身记忆合成:给定一段简短的人设描述,生成覆盖完整发展轨迹的记忆库。该任务需要同时满足三个设计目标:轨迹必须具有社会历史背景上的真实性(realistic),向目标身份可控地收敛(controllable),并在跨越数十年的生命周期上保持高效(efficient)。虽然模拟一个角色的生命是自然的思路,但现有模拟器(Park et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib19); Piao et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib21); Zhang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib39); Duan et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib7))在这三方面都有所欠缺。它们的环境通常是虚构沙盒或当下快照,缺乏逐年的背景锚定。作为开放式的前向引擎,它们提供的朝目标身份引导的机制有限。此外,它们通常以单一时间分辨率进行模拟,使得完整生命周期的模拟在计算上不可行。为弥补这些空白,我们提出MemoryForge——一个通过三个关键LLM驱动组件实现定制化终身记忆合成的新框架。上下文生成器通过从描述中推断合理的社会文化与历史背景来实现真实性。生命组织器通过将生命周期分解为以里程碑锚定的阶段,确保向目标身份收敛,从而实现可控性。多分辨率模拟器通过镜像人类自传体记忆的三层级结构来实现高效性。它为常规阶段生成人生阶段摘要,为重复性活动生成一般事件摘要,并为塑造身份的关键时刻生成高保真的事件特定经验,从而使数十年的时间尺度变得可处理,同时产生一种天然兼容认知驱动检索的记忆结构。图1 (https://arxiv.org/html/2608.00007#S1.F1) 展示了与现有方法的对比。

我们在两个捕捉正交类人维度的公开基准上进行了大量实验。PersonaGym衡量智能体在角色扮演中能否对人设保持类人表现(Samuel et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib24))。SimulatorArena衡量智能体在任务导向场景中是否表现得像真实用户(Dou et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib6))。在这两个基准上,MemoryForge在2种不同LLM骨干下的多项指标上均优于5个强基线(Moon et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib17); Ge et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib10); Li et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib14); Wang et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib34); Yang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib37))。我们的贡献有四个方面:

- 我们提出基于记忆的条件化作为一种新的人设条件化范式,LLM由与情境相关的记忆所引导。
- 我们将定制化终身记忆合成形式化,即从简短目标人设生成终身自传体记忆库的任务。
- 我们提出MemoryForge,一个为类人LLM智能体合成终身自传体记忆库的新框架。
- 我们通过实验证明,合成的终身记忆提升了冻结LLM在角色扮演和用户模拟中的类人程度。

## 2 相关工作

### LLM智能体人设

为LLM赋予目标人设的研究沿两条路线展开。*微调*使用人设专属语料和特质标注数据将角色烙入模型权重(Shao et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib26); Wang et al.,2024b (https://arxiv.org/html/2608.00007#bib.bib32); Zhou et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib40); Yang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib37); Li et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib14)),但该方法计算成本高,不适用于主导真实场景的闭源API,并且在需要频繁修改人设时不实用。*基于提示*的方法保持骨干LLM冻结,并对输入上下文进行工程化。这些方法通常属于我们所说的描述性条件化范式,覆盖了从详细描述程度的一个谱系:一段式扁平卡片(Ge et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib10))、人口统计锚定的背景故事(Moon et al.,2024 (https://arxiv.org/html/2608.00007#bib.bib17))、以及包含数百个属性的分类学采样深度叙事(Wang et al.,2025b (https://arxiv.org/html/2608.00007#bib.bib34))。尽管描述逐步变得更为丰富,基于提示的方法都有一个共同格式:将一段缺乏生活记忆情境支撑的固定文本注入上下文窗口。我们的基于记忆的条件化范式偏离了这条描述性主轴。它为冻结LLM配备一个结构化的终身自传体记忆库,支持按需进行动态的、与情境相关的记忆检索。

### 基于LLM的模拟

基于LLM的模拟沿两条互补的轴线快速发展。*社会层面*模拟器在共享世界中填充多个智能体,以研究涌现的集体行为(Park et al.,2023 (https://arxiv.org/html/2608.00007#bib.bib19); Piao et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib21); Zhang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib39))。*个体层面*模拟器则针对单个用户行为的行为真实性,以已经掌握的画像为条件——无论该画像来自简短描述(Wang et al.,2025a (https://arxiv.org/html/2608.00007#bib.bib33))、从交互日志中提取(Duan et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib7))、还是通过对真实人物进行深度访谈重建而来(Park et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib20))。其共同范式是*前向推演*:给定一个起始画像,模拟接下来会发生什么。相反,MemoryForge反转了这一方向:给定目标身份,合成该身份赖以形成的终身记忆库。在此基础上,我们将模拟重新定义为受控的生成原语,服务于记忆合成。

### LLM智能体的记忆

记忆已成为LLM智能体的一个重要研究对象,沿三条主线展开:将交互历史组织为结构化存储(Xu et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib36); Kang et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib12); Liu et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib15))、雕刻一个抵抗漂移的持久自我基底(Platnick et al.,2025 (https://arxiv.org/html/2608.00007#bib.bib22); Li et al.,2025a (https://arxiv.org/html/2608.00007#bib.bib13))、以及学习何时写入、检索或遗忘什么(Cai et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib2); Zhang et al.,2026 (https://arxiv.org/html/2608.00007#bib.bib38))。在这类文献中,输入被假设为*已经存在*——来自过去的对话或观测到的轨迹;它们都不会为一个从未被观测过的*全新*虚拟人设生成记忆库。我们不是*管理*来自其他地方的记忆,而是从一段简短人设描述中*合成*一个终身自传体记忆库。

## 3 方法

本节首先形式化定制化终身记忆合成任务(§3.1 (https://arxiv.org/html/2608.00007#S3.SS1))。随后,我们详细阐述MemoryForge的三个关键组件——MemoryForge是一个从简短人设描述中自主合成终身自传体记忆的新框架(§3.2 (https://arxiv.org/html/2608.00007#S3.SS2))。

### 3.1 问题定义

给定一段简短的人设描述π\pi(例如“纽约的一位35岁科学家”),我们的目标是按照人类自传体记忆的层级(Conway and Pleydell-Pearce,2000 (https://arxiv.org/html/2608.00007#bib.bib4)),合成一个自传体记忆库Mπ=(L,G,E)\mathcal{M}_{\pi}\;=\;(\mathcal{L},\mathcal{G},\mathcal{E})。三个层级分别是人生阶段L={li}i=1P\mathcal{L}=\{\ell_{i}\}_{i=1}^{P}、一般事件G={gj}j=1Ng\mathcal{G}=\{g_{j}\}_{j=1}^{N_{g}}和事件特定体验E={ek}k=1Ne\mathcal{E}=\{e_{k}\}_{k=1}^{N_{e}}:每个li\ell_{i}总结一个语义上稳定的人生阶段,每个gjg_{j}捕捉重复性或典型事件,每个eke_{k}记录一个具体时刻。由于π\pi指定了目标身份但未指定其发展轨迹,我们将合成建模为从p(Mπ∣π)p(\mathcal{M}_{\pi}\mid\pi)中采样,并要求所得到的生命历程是连贯且与身份一致的。受自传体记忆的社会文化理论(Conway and Pleydell-Pearce,2000 (https://arxiv.org/html/2608.00007#bib.bib4); Nelson and Fivush,2004 (https://arxiv.org/html/2608.00007#bib.bib18))启发,我们通过三个设计目标来操作化这一要求:(1)**真实性**,将记忆锚定于合理的社会历史条件;(2)**可控性**,使轨迹自我连贯并确保其蕴含π\pi;(3)**高效性**,镜像人类自传体记忆的层级结构,而不是均匀地模拟数十年。

### 3.2 MemoryForge

为满足上述设计目标,我们提出MemoryForge。我们将MemoryForge的合成过程形式化为一个联合分布,以概念性地定义其生成框架:
p(Mπ∣π)=pctx(c∣π)⋅porg(P∣c,π)⋅∏i=1Ppsim(li,Gi,Ei|P≤i,c,π,si),p\left(\mathcal{M}_{\pi}\mid\pi\right)\;=\;p_{\mathrm{ctx}}\!\left(c\mid\pi\right)\cdot\;p_{\mathrm{org}}\!\left(\mathcal{P}\mid c,\pi\right)\cdot\!\prod_{i=1}^{P}p_{\mathrm{sim}}\!\left(\ell_{i},\mathcal{G}_{i},\mathcal{E}_{i}\bigl|\mathcal{P}_{\leq i},c,\pi,s_{i}\right),(1)
其中cc是一个上下文 co

相似文章

受人类启发的LLM智能体记忆架构

arXiv cs.AI

微软研究人员提出了一种受生物学启发的LLM智能体记忆架构,该架构结合了睡眠阶段巩固和基于干扰的遗忘机制,以高效管理持久性记忆。

MemGym:面向LLM智能体的长时记忆环境

arXiv cs.CL

MemGym是一个基准测试,用于评估LLM智能体在长时任务中的记忆形成,它统一了现有的智能体gym和合成流水线,并采用记忆隔离得分。它涵盖工具使用对话、多轮搜索、编码和计算机使用,并包含一个轻量级奖励模型(MemRM)以实现高效评估。