ArborMem:使用记忆森林导航交互状态
摘要
ArborMem为大型语言模型引入了一个在线记忆框架,该框架将对话表示为可导航的交互状态森林,在记忆基准测试中超越基线,并推出了BranchMemEval作为新的诊断基准测试。
arXiv:2608.17534v1 Announce Type: new
摘要:大型语言模型越来越多地作为持久会话助手,需要记忆来保留相关经验并保持跨交互的连续性。现有方法通过长上下文处理、选择性检索和结构化记忆组织来改善对对话历史的访问。然而,大多数系统将记忆访问视为检索相关信息,而没有首先确定当前轮次恢复的先前交互状态。这一限制在对话交织多个任务、人员和计划时变得尤为重要,这些可能被中断并稍后重新访问。我们引入ArborMem,一个在线记忆框架,它将长期运行的对话表示为可导航的交互状态森林。每个分支保留局部连贯的轨迹,而森林维护多个轨迹,这些轨迹可能在之后恢复。对于每个新输入,ArborMem定位相关状态,恢复其分支本地上下文,并通过跨分支检索的可重用证据进行增强,从而在不混淆语义相关但结构不同的轨迹的情况下保持交互连续性。现有的长期记忆基准测试涵盖了多种记忆和推理能力,但没有明确隔离分支结构挑战。因此,我们引入BranchMemEval,一个用于交织和可恢复交互轨迹的受控诊断基准测试。在LongMemEval、LoCoMo、BEAM 100K和BranchMemEval上的实验表明,ArborMem在三个既定基准测试上超越了最强基线3.36到10.31个百分点,在BranchMemEval上超越了5.0个百分点。其优势在受限读取预算下增长,而完整内存查询仍低于半秒。
查看缓存全文
缓存时间: 2026/08/19 09:58
# ArborMem:使用记忆森林导航交互状态
来源:https://arxiv.org/html/2608.17534
Yuemeng Xu¹, Yilun Yao¹, Dingsiyi¹, Xinyu Tan, Yaoming Li, Guangxiang Zhao, Weihong Lin, Lin Sun, Xiangzheng Zhang, Tong Yang\*
¹ 通信作者
###### 摘要
大型语言模型日益作为持续的对话助手使用,需要能够保留相关经验并维持跨交互连续性的记忆。现有方法通过长上下文处理、选择性检索和结构化记忆组织来改进对对话历史的访问。然而,大多数系统在检索相关历史信息时,并未首先确定当前对话轮次延续的是哪个先前的交互状态。当对话交织了多个可能被中断并稍后重新访问的任务、人员和计划时,这一局限性变得尤为重要。
我们提出了 ArborMem,一个在线记忆框架,它将长时间运行的对话表示为一个可导航的交互状态森林。每个分支保留一条局部连贯的轨迹,而森林则维护多条后续可能恢复的轨迹。对于每个新输入,ArborMem 定位相关状态,恢复其分支局部上下文,并用跨分支检索的可重用证据进行增强,从而在保持交互连续性的同时,避免混合语义相关但结构不同的轨迹。
现有的长期记忆基准涵盖了多样化的记忆和推理能力,但并未明确分离分支结构的挑战。因此,我们引入了 BranchMemEval,一个针对交织和可恢复交互轨迹的受控诊断基准。在 LongMemEval、LoCoMo、BEAM 100K 和 BranchMemEval 上的实验表明,ArborMem 在三个既定基准上比最强基线高出 3.36 至 10.31 个百分点,在 BranchMemEval 上高出 5.0 个点。在受限读取预算下,其优势进一步扩大,而完整的记忆查询时间仍低于半秒。
## 引言
大型语言模型正日益作为持续的对话助手,而非一次性的问答系统。随着交互跨越数天或数周,用户期望助手能记住先前的讨论,跟踪进行中的任务,并恢复早期的计划。然而,语言模型除了其当前上下文中的信息外,没有持久的状态。因此,长期运行的对话代理需要记忆来保留相关经验,并在用户需求演变时保持连续性(14 (https://arxiv.org/html/2608.17534#bib.bib17))。现有方法通过多种方式改进了对对话历史的访问。长上下文模型直接暴露更多历史,最新的前沿模型支持百万级令牌的上下文窗口(5 (https://arxiv.org/html/2608.17534#bib.bib1))。然而,上下文窗口仍然是有界的,并且使信息可见并不能确保它会被可靠地识别和使用(12 (https://arxiv.org/html/2608.17534#bib.bib2))。选择性记忆系统则将历史外化为检索段落、摘要、情景记录或提取的事实,如 Generative Agents (17 (https://arxiv.org/html/2608.17534#bib.bib6))、MemoryBank (27 (https://arxiv.org/html/2608.17534#bib.bib7)) 和 Mem0 (4 (https://arxiv.org/html/2608.17534#bib.bib9))。其他方法通过层次化存储、链接笔记、树或时间知识图谱来组织记忆,包括 MemGPT (15 (https://arxiv.org/html/2608.17534#bib.bib8))、A-MEM (23 (https://arxiv.org/html/2608.17534#bib.bib11))、MemTree (19 (https://arxiv.org/html/2608.17534#bib.bib12)) 和 Graphiti (18 (https://arxiv.org/html/2608.17534#bib.bib13))。参见图1图 1:交互状态定位的动机示例。虽然最近的对话轮次涉及 Sam 的会议行程,但未明确说明的后续问题恢复了早先的论文修订轨迹。
尽管取得了这些进展,但大多数系统将记忆访问视为检索相关历史信息,而未首先确定当前轮次延续的是哪个先前的交互状态。图 1 (https://arxiv.org/html/2608.17534#Sx1.F1) 阐明了这种区别。对话交织了两条关于 Sam 论文修订和会议行程的持久轨迹。虽然最近的轮次涉及行程,但未明确说明的后续问题返回到了早先的论文讨论。因此,基于相关性的检索器可能会混合这两条线索,而正确的解释需要首先确定当前轮次延续的交互上下文。在持续交互中,这种情况很常见,助手必须管理多个可能被中断并稍后恢复的任务、人员、项目和计划。因为这些轨迹可能涉及重叠的实体或相似的状态,但仍然保持独立,长期记忆必须维护它们之间的连续性,而不仅仅是保留信息。
我们提出 ArborMem,一个在线记忆框架,它将长时间运行的对话表示为一个可导航的交互状态森林。每个分支保留一条局部连贯的轨迹,而森林维护多条后续可能恢复的轨迹。对于每个新输入,ArborMem 识别相关分支,恢复其局部上下文,并通过跨分支检索的可重用证据进行补充。此设计在保持交互连续性的同时,实现了信息的重用,避免了混合语义相关但结构不同的轨迹。
现有的长期记忆基准广泛涵盖了事实回忆、时间推理、知识更新、多跳推理和超长对话,但并未明确分离分支结构的挑战,如主题交织、延迟轨迹恢复以及对并行议程的混淆。为了解决这一差距,我们进一步引入了 BranchMemEval,一个针对分支结构对话记忆的受控诊断基准。
我们在 LongMemEval、LoCoMo、BEAM 100K 和 BranchMemEval 上评估了 ArborMem。ArborMem 在三个既定基准上比最强基线高出 3.36 至 10.31 个百分点,在 BranchMemEval 上高出 5.0 个点。在受限读取预算下,其优势进一步扩大,这表明当只能访问一小部分记忆时,状态定位支持更有效的证据选择。尽管增加了路由和上下文组装,完整的记忆查询时间仍低于半秒。
我们的贡献有三个方面。首先,我们确定了交互状态定位是可靠长期对话记忆的关键要求:系统应在选择历史证据之前确定当前轮次延续的是哪个先前的轨迹。其次,我们提出了 ArborMem,它将演进的对话状态组织为可导航的记忆森林,恢复连贯的分支局部上下文,并跨分支检索可重用证据,同时不混淆不同的交互轨迹。第三,我们引入了 BranchMemEval,一个针对分支结构对话记忆的受控诊断基准,并证明 ArborMem 在既定的长期记忆基准和我们受控评估中始终优于强大的基线。
## 相关工作
### 长期和结构化代理记忆
长上下文模型暴露了更多的交互历史,但评估表明,可见性并不能保证可靠的访问,并且性能对证据位置仍然敏感(2 (https://arxiv.org/html/2608.17534#bib.bib3); 6 (https://arxiv.org/html/2608.17534#bib.bib4); 12 (https://arxiv.org/html/2608.17534#bib.bib2))。选择性记忆方法则将历史外化为对话轮次、摘要、事实或连贯段落(11 (https://arxiv.org/html/2608.17534#bib.bib5); 16 (https://arxiv.org/html/2608.17534#bib.bib10); 20 (https://arxiv.org/html/2608.17534#bib.bib22))。代理记忆系统进一步支持检索、反思、更新、遗忘、巩固和层次化管理(17 (https://arxiv.org/html/2608.17534#bib.bib6); 27 (https://arxiv.org/html/2608.17534#bib.bib7); 4 (https://arxiv.org/html/2608.17534#bib.bib9); 15 (https://arxiv.org/html/2608.17534#bib.bib8))。最近的系统通过链接笔记、层次化树或时间、事件中心和实体关系图来组织记忆(23 (https://arxiv.org/html/2608.17534#bib.bib11); 19 (https://arxiv.org/html/2608.17534#bib.bib12); 26 (https://arxiv.org/html/2608.17534#bib.bib26); 8 (https://arxiv.org/html/2608.17534#bib.bib23); 18 (https://arxiv.org/html/2608.17534#bib.bib13))。这些方法主要确定存储、组织或检索什么信息,其结构基于语义关联、层次结构、事件或实体关系。相比之下,ArborMem 使用记忆拓扑来表示跨交互轨迹的连续性,并分别检索可重用证据,防止语义相关但不同的状态被合并。
### 对话结构与交互状态定位
对话结构已通过主题分割、回复预测和对话解缠结(从交织的对话中恢复线索或层次结构)进行了研究(1 (https://arxiv.org/html/2608.17534#bib.bib14); 13 (https://arxiv.org/html/2608.17534#bib.bib16); 10 (https://arxiv.org/html/2608.17534#bib.bib25); 25 (https://arxiv.org/html/2608.17534#bib.bib15))。这些研究表明,对话并非总是可以表示为单一的按时间顺序排列的序列,但主要分析的是固定转录文本。相比之下,ArborMem 将交互结构维护为演进的记忆状态,并在线决定每个输入是延续现有轨迹还是开始新的轨迹。其交互状态不仅捕获主题或回复关系,还捕获解释所需的任务、实体、目标、假设和局部上下文。
现有基准涵盖了事实、时间和多会话记忆,EverMemBench 进一步考虑了跨主题交织和线索恢复(22 (https://arxiv.org/html/2608.17534#bib.bib18); 14 (https://arxiv.org/html/2608.17534#bib.bib17); 21 (https://arxiv.org/html/2608.17534#bib.bib19); 7 (https://arxiv.org/html/2608.17534#bib.bib24))。然而,它们并未将分支定位、延迟恢复或并行线索混淆作为受控诊断因素进行分离;BranchMemEval 正是针对这些能力。
图 2:ArborMem 概览。已提交的记忆状态由对话森林和可重用证据库组成。对于每个输入,ArborMem 定位恢复的交互状态,重建其分支局部轨迹,并用跨分支证据进行增强。生成后,完成的交互和提取的记忆被提交,供后续轮次使用。
## 可导航记忆森林
我们将长期运行的对话记忆表示为可导航的交互状态森林,维护多条可能被中断并稍后恢复的轨迹。在轮次 t 之后,系统维护一个已提交的状态 S_t = (F_t, M_t),(1) 其中 F_t 是交互状态森林,M_t 是可重用证据库。每个节点代表一个已提交的局部状态,每条父边代表状态的延续,每条从根到节点的路径形成一条局部连贯的轨迹。在轮次 t,F_{t-1} 决定了解释新输入的主要上下文,而 M_{t-1} 则提供跨轨迹边界的可重用事实和记录。系统仅读取 S_{t-1};在生成响应后,它将完成的交互附加到选定的轨迹或开始新的根,并提交更新的状态 S_t。这种分离在保持交互连续性的同时,允许跨分支的信息重用。
## ArborMem
如图 2 (https://arxiv.org/html/2608.17534#Sx2.F2) 所示,ArborMem 通过三个阶段实现可导航记忆森林。给定新的输入 u_t 和已提交的状态 S_{t-1},它首先定位恢复的交互状态,然后组装分支局部上下文和跨分支证据以生成 a_t,最后提交完成的交互以产生 S_t。
### 记忆状态
#### 对话森林。对话森林 \mathcal{F}_t 表示交互连续性。每个节点由一次用户-助手交互创建,代表该轮次后建立的局部状态。它存储原始交互、节点和路径摘要、提取的实体和关键词、向量表示,以及包括其父节点、根节点、深度和全局序列位置在内的结构元数据。森林在线增长:每个新交互都附加到先前建立的状态或作为新根插入。从根到节点的路径形成一条局部连贯的轨迹,该轨迹可能在后续恢复。因此,拓扑结构编码的是语义话语的连续性,而不仅仅是语义相关性;语义相关的交互不必属于同一条局部轨迹。
#### 可重用证据库。证据库 \mathcal{M}_t 包含可能在引入它的轨迹之外重用的信息。它维护原子事实和结构化记录。原子事实捕获紧凑信息,如偏好、标识符、日期和项目详情,而结构化记录则表示助手生成的工件、事件和可变状态条目。每条项目都保留来源和修订元数据,便于溯源和筛选或降低过时信息的优先级。
### 状态定位
给定新的输入 u_t 和已提交的森林 \mathcal{F}_{t-1},ArborMem 识别输入应在哪个交互状态下解释。定位遵循优先级级联。具有明确延续提示的输入直接附加到活动状态,而明确的时间返回提示则通过全局交互时间线解决。这些快速路径处理那些无需进行一般检索即可识别目标状态的情况。对于其他输入,ArborMem 从三个来源构建混合候选集 \mathcal{C}_t。语义召回通过 FAISS 向量搜索检索候选节点(9 (https://arxiv.org/html/2608.17534#bib.bib27))。关键词召回使用提取的内容词、词元化形式和实体术语查询词汇和实体索引。当检测到明确的主题锚点时,也会将主题匹配的节点添加到候选集中。
每个候选节点 v \in \mathcal{C}_t 随后使用分支感知表示根据当前输入进行重排序。此表示包含候选的主题键(如果有)、其路径摘要、节点摘要和提取的实体。因此,交叉编码器不仅评估候选节点本身,还评估指向它的交互轨迹。实现的定位分数是交叉编码器分数和辅助路由信号的加法组合:
s_t(v) = s_{\mathrm{ce}}(v) + s_{\mathrm{key}}(v) + s_{\mathrm{rec}}(v) + s_{\mathrm{topic}}(v),
(2)
其中 s_t(v) 表示候选节点 v 对于当前输入 u_t 的定位分数。这里,s_{\mathrm{ce}} 是分支感知的交叉编码器重排序分数,s_{\mathrm{key}} 是基于规则的关键词和实体调整,s_{\mathrm{rec}} 是新近度偏差,s_{\mathrm{topic}} 是可选的主题锚点调整。选择父状态为 p_t = {argmax_{v \in \mathcal{C}_t} s_t(相似文章
MemForest:一种具有分层时间索引的高效智能体记忆系统
MemForest 提出了一种面向长上下文 LLM 智能体的记忆框架,通过并行块提取和分层时间索引来提高可扩展性并降低延迟,在基准测试中实现了 6 倍的吞吐量提升。
Arbor:树搜索作为自主代理的认知层
Arbor 引入了结构化树搜索作为自主代理的认知层,通过制衡多代理架构,实现多日、全栈 LLM 推理优化,相比供应商基线,吞吐量-延迟提升高达 193%。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。
δ-mem:大型语言模型的高效在线记忆机制
本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。