利用纵向生命轨迹缓解LLM代理的身份本质主义

arXiv cs.CL 论文

摘要

本文提出了一种名为LifeMem的纵向记忆框架,旨在缓解LLM代理中的身份本质主义,通过增强多样性和动态演化,提高它们在社会模拟中与人类数据的对齐程度。

arXiv:2608.19621v1 公告类型:新 摘要:大语言模型(LLMs)为社会模拟提供了一种可扩展的方法,但其可信度取决于代理的构建方式。现有方法可以部分重现群体级模式,但往往未能捕捉人类般的多样性。我们的分析表明,静态档案代理表现出比人类更强的人口分离和组内压缩,这一模式与身份本质主义一致:人口标签可以鼓励模型将群体平均趋势视为个体特征,同质化组内响应。我们认为,这一限制源于两个相关因素:稀疏、静态的代理表示,以及仅提示记忆在持续整合经验方面的有限能力。受互补记忆系统的启发,我们提出了LifeMem,一个纵向记忆框架,它将结构化生命事件检索与代理特定参数记忆相结合,用于经验整合。在Add Health和Understanding Society数据集上使用三个LLMs进行的实验表明,LifeMem在响应分布、整体和组内多样性,以及跨生命阶段的个体响应变化模式方面提高了与人类数据的对齐程度。这些发现凸显了纵向生命事件记忆在构建更忠实且动态演化的社会代理方面的价值。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:08

# 通过纵向生命轨迹缓解大语言模型代理中的身份本质主义  
来源:https://arxiv.org/html/2608.19621  
周宇佳\\corresponding  
杜邦德  
苏维航  
曹新源  
潘青怡  
艾青瑶\\corresponding  
吴悦悦  
张敏  
刘一麟  

###### 摘要  
大语言模型(LLMs)为社会模拟提供了一种可扩展的方法,但其可信度取决于代理的构建方式。现有方法能在一定程度上复现群体层面的模式,却常常未能捕捉到类人的多样性。我们的分析表明,具有静态画像的代理相比人类表现出更强的人口特征分离性和组内压缩性,这一模式与身份本质主义一致:人口标签可能促使模型将群体平均趋势视为个体特征,从而同质化组内回应。我们认为,这种局限性源于两个相互关联的因素:稀疏、静态的代理表征,以及仅依赖提示的记忆在持续整合经验方面的有限能力。受互补记忆系统启发,我们提出了LifeMem——一个纵向记忆框架,它将结构化的生命事件检索与代理特定的参数记忆相结合,以实现经验整合。在“青少年健康”和“理解社会”两个数据集上,使用三种LLM进行的实验表明,LifeMem在回应分布、整体和组内多样性,以及跨生命阶段个体内部回应变化模式方面,都提升了与人类数据的对齐程度。这些发现凸显了纵向生命事件记忆在构建更忠实、动态演化的社会代理方面的价值。  
代码——https://github\.com/halsayxi/LifeMem  

## 引言  
大语言模型(LLMs)为社会模拟提供了可扩展的基础,使研究人员能够在传统调查或实验成本高昂或难以实施时,研究人类的观点、态度、行为和互动(2 (https://arxiv.org/html/2608.19621#bib.bib1);3 (https://arxiv.org/html/2608.19621#bib.bib2);35 (https://arxiv.org/html/2608.19621#bib.bib23))。此类模拟的可信度关键取决于代理的构建方式。大多数方法通过人口标签、人格或静态画像来实例化代理(3 (https://arxiv.org/html/2608.19621#bib.bib2);40 (https://arxiv.org/html/2608.19621#bib.bib3);6 (https://arxiv.org/html/2608.19621#bib.bib4);22 (https://arxiv.org/html/2608.19621#bib.bib5))。尽管这些表征能有效地基于个体属性来调整模型,但它们产生的回应往往比人类数据缺乏多样性(6 (https://arxiv.org/html/2608.19621#bib.bib4);44 (https://arxiv.org/html/2608.19621#bib.bib18);48 (https://arxiv.org/html/2608.19621#bib.bib16);45 (https://arxiv.org/html/2608.19621#bib.bib42))。这种多样性的坍缩可能反映了一种身份本质主义的形式(44 (https://arxiv.org/html/2608.19621#bib.bib18))。在社会心理学中,本质主义将社会类别视为具有稳定的内在本质,使同一类别的成员看起来根本上是相似的(38 (https://arxiv.org/html/2608.19621#bib.bib17);5 (https://arxiv.org/html/2608.19621#bib.bib28))。在社会模拟中,当静态身份标签对代理回应的预测性过强,压缩组内变异而放大组间差异时,就会出现相应的模式。图1 (https://arxiv.org/html/2608.19621#Sx1.F1)展示了一个与此模式一致的回应空间分析。这种扭曲可能夸大人口差异,强化刻板印象,并对从模拟群体中得出的结论造成偏差。  

**图1说明**:静态人口条件作用产生与身份本质主义一致的模式。我们将2000名随机抽样的世界价值观调查第7轮受访者(19 (https://arxiv.org/html/2608.19621#bib.bib47))分为三个社会经济地位组,并将人类回应与画像条件作用的Llama-8B代理的回应进行比较。每个个体的回应被连接起来并投影到二维PCA空间。单独的投影显示人类具有更大的组内变异和重叠(轮廓系数−0\.02),而代理则表现出更强的组内压缩和组间分离(轮廓系数0\.19)。轮廓系数是在PCA投影前的原始回应空间中计算的。

我们将这种局限性归因于代理记忆的内容和形式。首先,人口属性仅提供了对个体稀疏且静态的描述,忽略了与人际差异和个体内变化相关的更丰富、演变的经验(14 (https://arxiv.org/html/2608.19621#bib.bib13);11 (https://arxiv.org/html/2608.19621#bib.bib12))。其次,基于提示的条件作用可能导致多样性坍缩(45 (https://arxiv.org/html/2608.19621#bib.bib42))。如图3 (https://arxiv.org/html/2608.19621#Sx5.F3)所示,仅有显式记忆并不能确保积累的经验被持续整合到代理中。

受认知科学启发,我们提出了LifeMem,一个用于构建动态演化LLM社会代理的纵向记忆框架。人类记忆通常被认为依赖于互补系统:海马体系统快速保存个体经验,而新皮层则逐渐将跨经验的信息整合成持久的表征(32 (https://arxiv.org/html/2608.19621#bib.bib43);24 (https://arxiv.org/html/2608.19621#bib.bib50))。LifeMem将这种区分转化为两个互补组件来表示生活经验:(1)结构化生命事件记忆,明确保留事件内容、时间和支持检索的证据;(2)代理特定的LoRA适配器,将积累的经验编码为跨问题持续存在并随时间更新的参数记忆。通过结合更丰富的纵向信息和持久的参数记忆,LifeMem针对代理记忆的内容和表征方面的局限性,旨在构建更忠实反映个体差异和时间变化的代理。

我们在“青少年健康”(20 (https://arxiv.org/html/2608.19621#bib.bib15))和“理解社会”(8 (https://arxiv.org/html/2608.19621#bib.bib14))数据集上,使用三个来自不同系列的指令微调LLM对LifeMem进行评估:Llama-3\.1-8B-Instruct(以下简称Llama-8B)(16 (https://arxiv.org/html/2608.19621#bib.bib44))、Ministral-3-8B-Instruct-2512(28 (https://arxiv.org/html/2608.19621#bib.bib45))和Qwen3\.5-9B(39 (https://arxiv.org/html/2608.19621#bib.bib46))。与静态条件作用、面向多样性的提示、非参数记忆和控制基线相比,LifeMem在回应分布、整体和组内多样性,以及跨生命阶段的个体内部回应变化方面,都提升了与人类数据的对齐程度。

我们的贡献是:
- • 我们识别了静态画像LLM代理中的身份本质主义,它降低了组内多样性并夸大了组间差异。
- • 我们提出了LifeMem,结合结构化生命事件记忆和代理特定参数记忆,以对多样且演化的个体进行建模。
- • 在两项纵向调查和三种LLM中,LifeMem提升了与人类分布、多样性及个体内部变化的对齐程度。

## 相关工作  
当前基于LLM的社会模拟通常依赖于人格条件作用和静态代理表征。LLMs越来越多地被用作实验参与者和调查受访者(2 (https://arxiv.org/html/2608.19621#bib.bib1);3 (https://arxiv.org/html/2608.19621#bib.bib2);40 (https://arxiv.org/html/2608.19621#bib.bib3);6 (https://arxiv.org/html/2608.19621#bib.bib4);22 (https://arxiv.org/html/2608.19621#bib.bib5);30 (https://arxiv.org/html/2608.19621#bib.bib6))。现有方法通常从访谈、交互历史或社交媒体记录构建代理(36 (https://arxiv.org/html/2608.19621#bib.bib25);13 (https://arxiv.org/html/2608.19621#bib.bib11);27 (https://arxiv.org/html/2608.19621#bib.bib26);12 (https://arxiv.org/html/2608.19621#bib.bib35);18 (https://arxiv.org/html/2608.19621#bib.bib36)),支持与人群的部分对齐。然而,人格条件作用可能降低回应方差或引入偏差(6 (https://arxiv.org/html/2608.19621#bib.bib4);7 (https://arxiv.org/html/2608.19621#bib.bib27);44 (https://arxiv.org/html/2608.19621#bib.bib18))。此外,静态画像可能将个体压缩为人口类型(48 (https://arxiv.org/html/2608.19621#bib.bib16);22 (https://arxiv.org/html/2608.19621#bib.bib5))。这种模式类似于身份本质主义,它将稳定属性归因于社会类别(38 (https://arxiv.org/html/2608.19621#bib.bib17);5 (https://arxiv.org/html/2608.19621#bib.bib28)),尽管人口条件作用本身并非本质主义的(44 (https://arxiv.org/html/2608.19621#bib.bib18))。更广泛地说,LLM社会代理通常是固定的,而不是根据时间顺序的观察进行更新。相比之下,纵向研究区分了人际差异与个体内变化,并使用详细的生活事件历史来更好地刻画个体轨迹(11 (https://arxiv.org/html/2608.19621#bib.bib12);14 (https://arxiv.org/html/2608.19621#bib.bib13))。

**图2说明**:LifeMem概览。(a) 个体生命轨迹包含多样的纵向经验。(b) 结构化记忆支持显式检索,而代理特定的LoRA适配器通过递归更新将经验整合为参数记忆。(c) 由此产生的代理状态随生命阶段演化。(d) 代理从相似的人口画像初始化,可能产生同质化的观点。(e) LifeMem产生多样且动态的观点。

先前工作在输出、提示、记忆或参数层面提高多样性。输出层方法修改采样、解码(21 (https://arxiv.org/html/2608.19621#bib.bib29);37 (https://arxiv.org/html/2608.19621#bib.bib7);26 (https://arxiv.org/html/2608.19621#bib.bib30);43 (https://arxiv.org/html/2608.19621#bib.bib31);10 (https://arxiv.org/html/2608.19621#bib.bib32);47 (https://arxiv.org/html/2608.19621#bib.bib9);49 (https://arxiv.org/html/2608.19621#bib.bib10)),或人类参与(1 (https://arxiv.org/html/2608.19621#bib.bib8))以增加回应多样性,但由此产生的变异通常是随机的,而非基于个体经验。提示层方法引入多语言、反刻板印象、基于传记的、群体对齐的或集合人格(46 (https://arxiv.org/html/2608.19621#bib.bib19);41 (https://arxiv.org/html/2608.19621#bib.bib20);30 (https://arxiv.org/html/2608.19621#bib.bib6);15 (https://arxiv.org/html/2608.19621#bib.bib33);23 (https://arxiv.org/html/2608.19621#bib.bib34);4 (https://arxiv.org/html/2608.19621#bib.bib39)),但它们通常缺乏个体的演化表征。记忆方法存储、检索、更新或遗忘经验(31 (https://arxiv.org/html/2608.19621#bib.bib21);25 (https://arxiv.org/html/2608.19621#bib.bib22);35 (https://arxiv.org/html/2608.19621#bib.bib23);50 (https://arxiv.org/html/2608.19621#bib.bib40);29 (https://arxiv.org/html/2608.19621#bib.bib38);17 (https://arxiv.org/html/2608.19621#bib.bib37)),但仅靠检索可能无法支持持久的整合。参数层方法将知识或身份编码到模型参数或激活中(42 (https://arxiv.org/html/2608.19621#bib.bib24);9 (https://arxiv.org/html/2608.19621#bib.bib41);45 (https://arxiv.org/html/2608.19621#bib.bib42)),但通常不根据纵向观察进行更新。

## 方法论  
本节阐述纵向模拟任务,并介绍LifeMem的双记忆框架。然后描述其用于显式事件检索的结构化记忆,以及用于跨轮次整合经验的参数记忆。

### 问题形式化  
设$\mathcal{I}=\{1,\ldots,N\}$表示个体群体,$\mathcal{W}=\{1,\ldots,T\}$表示有序的纵向轮次。每个个体$i$具有一个从背景信息构建的静态画像$P_i$,以及在轮次$t$观察到的一系列生命事件 $\mathcal{E}_{i,t}=\{e_{i,t,k}\}_{k=1}^{K_{i,t}}$,(1)  
其中$e_{i,t,k}$表示第$k$个观察到的生命事件,$K_{i,t}=|\mathcal{E}_{i,t}|$。  
到轮次$t$的累积轨迹为 $\mathcal{T}_{i,\leq t}=\bigcup_{\tau=1}^{t}\mathcal{E}_{i,\tau}$。(2)  
对于评估问题$q_{t,j}$,LifeMem预测 $\hat{y}_{i,t,j}=F_{\theta,A_{i,t}}\left(P_{i},R_{i,t}(q_{t,j}),q_{t,j}\right)$,(3)  
其中$\theta$是冻结的基础LLM,$A_{i,t}$是代理特定的LoRA适配器,$R_{i,t}(q_{t,j})$包含从结构化记忆中检索到的事件。LifeMem将依赖于问题的证据与持久的个体状态相结合,以建模人际差异和个体内变化。

### LifeMem概览  
LifeMem是一个受互补学习系统理论启发的双记忆框架,该理论区分了海马体系统中对特定经验的快速编码与新皮层中的逐渐整合(32 (https://arxiv.org/html/2608.19621#bib.bib43);34 (https://arxiv.org/html/2608.19621#bib.bib48);33 (https://arxiv.org/html/2608.19621#bib.bib49))。在LifeMem中,结构化记忆存储明确且可追溯的生命事件,而代理特定的LoRA适配器将积累的经验整合为持久的参数记忆,如图2 (https://arxiv.org/html/2608.19621#Sx2.F2)所示。两种记忆接收相同的纵向事件流,但扮演互补的角色。结构化记忆为问题提供相关证据,而参数记忆则跨问题和轮次整合积累的经验,无需将完整轨迹重复添加到提示中。时间衰减优化检索优先级,而重放在顺序适配器更新期间保留早期信息。

### 海马体结构化记忆  
每个生命事件$e_{i,t,k}$源自一个调查问题-回答对,并转换为第二人称陈述$x_{i,t,k}$,同时保留其原始问题和回答。冻结的编码器$g_\phi$将该陈述映射为嵌入 $\mathbf{h}_{i,t,k}=g_{\phi}(x_{i,t,k})$。(4)  
结构化记忆存储每个事件及其嵌入和轮次索引:  
$\mathcal{M}^{S}_{i,t}=\left\{\left(e_{i,\tau,k},\mathbf{h}_{i,\tau,k},\tau\right)\mid 1\leq\tau\leq t\right\}$。(5)  
新事件被追加,而不删除早期记录,从而保留观察轨迹的可追溯记录。对于问题$q$,检索结合语义相关性和时间衰减:  
$\operatorname{Score}_{t}(q,e_{i,\tau,k})=\operatorname{sim}\left(g_{\phi}(q),\mathbf{h}_{i,\tau,k}\right)\exp[-\lambda(t-\tau)]$,(6)  
其中$\lambda\geq 0$控制对近期事件的偏好。这种衰减修改检索优先级,而不是删除较旧的经验,当相关性足够时它们仍然可用。前$K$个事件构成检索到的证据:  
$R_{i,t}(q)=\operatorname{Top-K}_{e\in\mathcal{M}^{S}_{i,t}}\operatorname{Score}_{t}(q,e)$。(7)  
选中的陈述被插入推理提示中,提供依赖于问题的证据,而无需暴露...

相似文章

MemoryForge:为类人LLM智能体合成终身记忆

arXiv cs.CL

本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。

从存储到经验:大语言模型智能体记忆机制演进综述

Hugging Face Daily Papers

本综述论文提出了一种大语言模型(LLM)智能体记忆机制的演进框架,将其发展划分为三个阶段:存储、反思和经验。文章分析了长程一致性和持续学习等核心驱动力,旨在为下一代智能体的设计提供指导原则。

重新思考自进化大语言模型智能体的持续经验内化

arXiv cs.CL

本文研究了大语言模型智能体在多轮迭代经验内化过程中出现能力渐进式崩溃的原因,并提出了一套从经验粒度、注入模式和训练机制三个维度出发的鲁棒解决方案。主要发现包括:原则级经验、逐步注入方式以及离策略上下文蒸馏能够带来更稳定、更可持续的持续学习效果。