智能体记忆系统能否追踪演化状态?

arXiv cs.AI 论文

摘要

本文介绍了StateMemBench,一个用于评估LLM智能体记忆系统中状态追踪的基准测试,并提出了StateMem,一种提高长交互中当前状态准确性的方法。

arXiv:2608.19652v1 公告类型:新 摘要:随着基于LLM的智能体被部署于更长、更高风险的任务中,其记忆系统仍然存在关键缺口。尽管现有记忆基准主要关注回忆型任务,但我们认为一个有效的记忆系统必须追踪世界状态的演化;在长时间交互中,事实、约束和决策会被修订,答案必须反映当前状态而非已被取代的状态。我们将这种能力定义为状态追踪,并在StateMemBench中实例化它,这是一个包含234个多会话场景的基准测试,涵盖两种对话长度范围。其闭合池评分系统评估答案是反映当前状态、已被取代的状态,还是其他失败情况,通过设计将状态追踪失败与其他错误分离开来。我们的分析表明,这个任务对现有记忆系统、检索增强基线和长上下文基线来说都是具有挑战性的。然后我们提出StateMem,一种状态优先的记忆方法,它显式追踪取代关系和依赖关系,并展示在DeepSeek-V4-Flash上,它相对于最强的同架构基线提高了1.8倍(0.205 -> 0.363)的当前状态准确性,在Qwen-3.5-9B上相对于最强的记忆系统提高了1.6倍(0.149 -> 0.233),同时与长上下文基线保持竞争力。最后,我们展示相同的状态方法可以作为轻量级单次调用包装器应用于现有记忆系统,在StateMemBench上跨越六个记忆和检索后端,将当前状态准确性提升+32到+67个百分点。一个长度和成本匹配的对照实验将+15到+32个百分点归因于状态结构而非增加的上下文。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:59

# 智能体记忆系统能否追踪动态状态?
来源:https://arxiv.org/html/2608.19652

###### 摘要
随着基于大语言模型的智能体被部署于更长周期、更高风险的任务中,其记忆系统仍存在关键缺陷。现有记忆基准主要关注信息召回类任务,但我们认为有效的记忆系统必须追踪世界动态状态的演变:当事实、约束条件和决策在长交互过程中被修正时,系统给出的答案必须反映当前状态而非已被取代的旧状态。我们将这种能力定义为“状态追踪”,并构建了StateMemBench基准测试——包含234个多会话场景,覆盖两种对话时长模式。其闭集评分机制可判定答案反映的是当前状态、已被取代的状态,或均不符合,从而在设计上将状态追踪失败与其他错误类型区分开来。分析表明,现有记忆系统、检索增强基线以及长上下文基线在此任务上均面临挑战。我们进而提出StateMem——一种以状态为先的记忆方法,显式追踪状态替代关系与依赖关系,实验显示其在DeepSeek-V4-Flash模型上将当前状态准确率提升至最强同架构基线的1.8倍(0.205→0.363),在Qwen-3.5-9B模型上提升至最强记忆系统的1.6倍(0.149→0.233),同时保持与长上下文基线相当的竞争力。最后,我们证明该状态追踪方法可作为轻量级包装器应用于现有记忆系统,在StateMemBench上为六种记忆与检索后端带来+32至+67点的当前状态准确率提升。长度与成本匹配的对照实验表明,其中+15至+32点的提升源于状态结构设计而非单纯增加上下文长度。

## 1 引言
参见标题图1:StateMemBench聚焦状态追踪:在跨会话修正过程中维护当前生效的事实、规则及推导值,该能力可与信息召回分离。
智能体现已能够执行(并被部署于)跨多会话的任务,从管理端到端研究流程(8 (https://arxiv.org/html/2608.19652#bib.bib29); 19 (https://arxiv.org/html/2608.19652#bib.bib27))到自主处理软件代码库(31 (https://arxiv.org/html/2608.19652#bib.bib26); 35 (https://arxiv.org/html/2608.19652#bib.bib25))。智能体持续工作的能力既是其核心能力的重要基准(16 (https://arxiv.org/html/2608.19652#bib.bib15)),也离不开记忆功能。因此,各种智能体记忆管理策略应运而生——从扩展模型有效上下文(6 (https://arxiv.org/html/2608.19652#bib.bib28))到构建外部记忆系统(23 (https://arxiv.org/html/2608.19652#bib.bib4); 5 (https://arxiv.org/html/2608.19652#bib.bib10)),相应评估基准也层出不穷(30 (https://arxiv.org/html/2608.19652#bib.bib11); 13 (https://arxiv.org/html/2608.19652#bib.bib31); 20 (https://arxiv.org/html/2608.19652#bib.bib8))。现有系统和基准高度聚焦于优化相关事实的召回能力,这无疑是人类与大语言模型记忆的重要组成部分。但我们认为,随着智能体处理的任务日益耗时且复杂,其追踪动态演变状态的能力变得至关重要,而现有系统大多忽视了这一点。如图1所示(https://arxiv.org/html/2608.19652#S1.F1),我们不仅期望智能体记忆系统能识别最新标注数量为1200,更要理解该变化在状态层面的意义。我们将这种缺陷称为“状态漂移”:相关事实虽存在于组装好的上下文中,但智能体却基于过时或不完整的版本执行操作。障碍并非*检索*事实本身,而是*追踪*该事实与当前状态的相关性——我们将在§3(https://arxiv.org/html/2608.19652#S3)中形式化定义此能力。尽管近期已有基准和记忆系统(29 (https://arxiv.org/html/2608.19652#bib.bib24); 4 (https://arxiv.org/html/2608.19652#bib.bib23))开始将状态视为记忆的一等公民,且几乎所有系统都在某种意义上更新或修正记忆,但尚无系统能将状态追踪与其他共存错误清晰分离。我们填补了这一空白,并为智能体记忆领域做出四项重要贡献:
- • 我们将**状态追踪**定义为独立于信息召回的能力,并设计标注流程以分离状态漂移与其他错误。在现有多个记忆基准中,漂移导致的失败占比最高,且即使在完美检索条件下仍然存在(§3(https://arxiv.org/html/2608.19652#S3);占比率为人工判定上限值)。
- • 我们提出StateMemBench——专注于状态追踪问题的多领域基准测试,包含234个跨三个领域、涵盖短/长对话周期的多会话场景。
- • 我们提出StateMem——一种简洁的以状态为先的方法,实验证明其在DeepSeek模型上将当前状态准确率提升至最强同架构基线的1.8倍(0.205→0.363),在Qwen-9B模型上提升至最强记忆系统的1.6倍(0.149→0.233),并在两个模型上均超越同架构长上下文基线(均为0.149)。
- • 我们证明状态追踪维度**具有可分离性**:StateMem的轻量级答案时包装器形式可提升所有应用后端的性能,通过长度与成本匹配的对照实验证明,其中归因于状态结构设计而非简单增加上下文长度的提升幅度为+15至+32点(§6.4(https://arxiv.org/html/2608.19652#S6.SS4))。

## 2 相关工作
##### 面向大语言模型智能体的长期记忆系统
现有记忆系统多通过显式读写操作的虚拟内存层级(23 (https://arxiv.org/html/2608.19652#bib.bib4))、基于反思的记忆流(24 (https://arxiv.org/html/2608.19652#bib.bib9))、链接式记忆结构(34 (https://arxiv.org/html/2608.19652#bib.bib3))或周期性摘要(32 (https://arxiv.org/html/2608.19652#bib.bib13))来优化召回能力。但我们认为信息召回与状态追踪属于正交维度:即使实现完美检索,系统仍需解析检索到的事实中哪些当前有效(§3.2(https://arxiv.org/html/2608.19652#S3.SS2))。尝试解决此问题的系统较少。Zep(26 (https://arxiv.org/html/2608.19652#bib.bib7))通过为知识图谱边添加有效时间区间并在检测到矛盾时使其失效,实现单事实有效性追踪。同期提出的STALE(4 (https://arxiv.org/html/2608.19652#bib.bib23))同样聚焦状态追踪并传播更新,但其通过预定义模式下的LLM仲裁器实现,而StateMem采用确定性的无LLM依赖图遍历。此外,STALE隐式构建冲突,检测需要常识推理;而我们的评估平台StateMemBench显式提供冲突,将状态维护与常识推理任务分离。

##### 对话状态追踪
“状态”一词在对话状态追踪(DST)任务中已被广泛使用。我们的工作与DST的区别在于**状态定义**与**评估方式**。DST规范表征形式(无论是基于领域本体的槽位-值对(28 (https://arxiv.org/html/2608.19652#bib.bib32); 3 (https://arxiv.org/html/2608.19652#bib.bib33)),还是其模式引导(27 (https://arxiv.org/html/2608.19652#bib.bib34))与开放词汇(10 (https://arxiv.org/html/2608.19652#bib.bib35))的放松形式),并直接评估该表征。而我们**不要求状态采取特定形式**:状态即记忆系统为正确回答所需维护的内容,评估纯属行为层面。此外,DST数据集为协作性质——用户目标在单轮对话中单调累积,而StateMemBench通过跨会话对抗性修正事实及用户/智能体决策,诱发并测量状态过时导致的失败(15 (https://arxiv.org/html/2608.19652#bib.bib37); 1 (https://arxiv.org/html/2608.19652#bib.bib36))。

##### 面向大语言模型智能体的记忆基准测试
现有众多基准测试评估智能体记忆能力:长对话记忆基准(20 (https://arxiv.org/html/2608.19652#bib.bib8); 30 (https://arxiv.org/html/2608.19652#bib.bib11); 18 (https://arxiv.org/html/2608.19652#bib.bib30))评估模型回答用户消息相关问题的能力,从表层事实回忆到更复杂的隐含意图。部分研究聚焦响应个性化(13 (https://arxiv.org/html/2608.19652#bib.bib31)),这与长对话记忆存在交叉。类似地,用户交互基准(36 (https://arxiv.org/html/2608.19652#bib.bib16); 2 (https://arxiv.org/html/2608.19652#bib.bib17))评估工具调用智能体的客服技能,在受控环境中测量约束遵守情况,但这些均为单会话场景,智能体未必需要记忆功能。近期研究进一步脱离用户对话范畴,相关基准(37 (https://arxiv.org/html/2608.19652#bib.bib18); 9 (https://arxiv.org/html/2608.19652#bib.bib14))评估智能体利用记忆系统自主/半自主完成任务的能力。特别值得注意的是,29 (https://arxiv.org/html/2608.19652#bib.bib24)评估智能体记忆系统能否通过交互学习环境变化,他们称之为**动态状态追踪**。该任务旨在学习*环境*动态的世界模型,通过长达115115M词元的轨迹进行评估,因此将任务与大规模检索纠缠。StateMemBench则专注于分离验证:在**已持有相关事实**的前提下,记忆系统能否维护当前生效状态——将状态追踪能力与检索和推理过程分离。

## 3 问题表述:状态漂移
长期运行的智能体即使在相关上下文存在时仍会失败。具体而言,**状态漂移**发生于:先前建立或更新的事实、约束或依赖关系虽存在于组装好的上下文中,但智能体却基于过时或不完整的状态版本执行操作,而非决策时生效的版本。这区别于**获取状态**的失败——更好的检索无法修复状态维护能力的缺陷。

### 3.1 定义与标注
我们结合相邻失败类型进行漂移分析。例如:检索失败中标准事实不存在;模式不匹配中答案正确但格式错误。对于更复杂的相邻类型如推理失败,我们采用如下测试:推理过程必须显式涉及当前最新值,但仍出错。每个(案例,轮次,槽位)失败点仅在排除所有其他解读后才被标记为漂移;无法归类的点将被丢弃而非默认分配(*确认失败* = 此筛选集)。采用对抗性过滤器加跨模型族判定(附录A(https://arxiv.org/html/2608.19652#A1)),使所有排除判定*偏向*非漂移。我们在LongMemEval神谕集(30 (https://arxiv.org/html/2608.19652#bib.bib11))、MemoryArena(MA)(9 (https://arxiv.org/html/2608.19652#bib.bib14))和τ2(2 (https://arxiv.org/html/2608.19652#bib.bib17))上应用该方法。两轮判定在LongMemEval上达成κ=0.67的漂移二元决策一致性,在MA-shopping上原始一致率为91.6%(流行度校正κ=0.83);跨族判定器(GPT-4o)一致性κ=0.37(表7(https://arxiv.org/html/2608.19652#A1.T7))。两名人工标注员在结构化协议下独立标注,并盲法描述失败类型(不知分类体系),结果复现相同类别——每个盲法描述均映射至现有类别。当人类判定与判定器不同时,其标记的漂移*更少*,因此判定器比率已是保守流程中的上限值(完整一致性统计见附录A(https://arxiv.org/html/2608.19652#A1))。漂移也非推理缺陷:在n=50对LongMemEval测试项中,启用DeepSeek-V4-Flash的推理链反而无益(84.0%→76.0%;麦克尼马尔检验p=0.34;附录A(https://arxiv.org/html/2608.19652#A1)),而明确的状态维护在该任务上有效(§6.4(https://arxiv.org/html/2608.19652#S6.SS4))。

### 3.2 完美检索下漂移持续存在
在LongMemEval神谕集上,设计保证召回率=1.0,因此所有残余失败不可能伪装成检索失败。DeepSeek-V4-Flash在306题中失败36题;两个模型族判定器均确认44.4%(16/36;威尔逊95%置信区间[30%,60%])为状态漂移——在保证证据下成为最大确认失败类别(表1(https://arxiv.org/html/2608.19652#S3.T1))。漂移尤其集中于决策整合多源信息的场景:多会话问题漂移率(71.4%,10/14)几乎是知识更新问题漂移率(25.0%,2/8)的三倍,两种判定器族结果一致。详见附录B(https://arxiv.org/html/2608.19652#A2)。

### 3.3 跨基准普遍性
漂移在不同基准中普遍存在但占比各异(表1(https://arxiv.org/html/2068.19652#S3.T1)):在MA-shopping(63.5%)和τ2-bench-Z(16题中10题失败)中占主导,但在MA-travel中降至19.0%(此时理解失败占46.5%)。需注意这些占比率为LLM判定器标签,人工标注员倾向标记更少漂移(见附录A(https://arxiv.org/html/2608.19652#A1))。然而此标注无法揭示错误状态值胜出的原因:判定器能对漂移失败达成共识,但对其机制(如更强的竞争项或未应用的真实修正)模式一致性κ接近零。为研究机制需更明确控制变量,因此我们构建StateMemBench——每个场景的失败机制在设计上固定,被取代值作为评分结果(表2(https://arxiv.org/html/2068.19652#S4.T2)对比现有基准)。

表1:跨基准失败模式分布。每单元格为该基准确认失败中分配至各类别的占比;漂移列已高亮。†LongMemEval神谕集中每个标准事实均设计存在于提示中,因此该基准无检索失败可能。小样本τ2-bench-Z结果(n=16)报告于§3.3(https://arxiv.org/html/2068.19652#S3.SS3)。标注、仲裁及逐行详情见附录A(https://arxiv.org/html/2068.19652#A1)。

## 4 StateMemBench
表2:与包含状态追踪评估的智能体记忆及长期运行基准对比。(✓)=部分满足。*规模*以各基准原生单位报告。列定义与各基准论证见附录C(https://arxiv.org/html/2068.19652#A3)。
我们发布StateMemBench——一个旨在直接测量记忆系统**状态追踪能力**的基准测试。我们将说明失败模式的定义与计算方式,并概述基准领域、场景生成流程及验证机制。

### 4.1 失败模式作为策略偏差
我们通过机制而非手工分类来定义失败模式。我们生成...

相似文章

EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体

Hugging Face Daily Papers

EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。

SAM:面向长程推理智能体的状态自适应记忆

Hugging Face Daily Papers

本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。