MemFuse:基于碎片化观察的多源记忆融合
摘要
MemFuse推出了MemFuseBench,一个用于评估AI智能体中多源记忆融合的基准测试,并提出了MemFuse——一种结构化的记忆系统,可在整合碎片化观察的同时保持来源的可追溯性。
arXiv:2608.18704v1 公告类型:新
摘要:长期记忆对于在扩展交互中运行的智能体至关重要,然而现有的记忆系统和基准测试主要关注单源文本历史。但在现实场景中,相关信息通常分散在应用程序和设备之间,以及用户和时间之间,要求智能体将分散的观察整合为连贯的情景记忆,同时保留其来源出处。为了解决这些差距,我们引入了**MemFuseBench**,一个用于*多源记忆融合*的基准测试。MemFuseBench通过Scene-to-Sensor流程构建,该流程将可控场景合成为带来源标签的观察、基于证据的问题和对抗性干扰项。它能够系统地评估时间推理、跨源证据融合和对噪声的鲁棒性。我们进一步提出了**MemFuse**,一种结构化的记忆系统,它在事件层原子记忆中保留源级证据,并在因果融合图中将相关原子事件组织为集群层融合记忆。在检索过程中,MemFuse检索并组织相关的证据片段,同时保持对原始源事件的可追溯性。在MemFuseBench上的实验表明,在所有三种LLM设置下,MemFuse在评估的记忆系统中实现了最佳的整体性能,并在需要跨源证据融合的问题上一致提高了性能。
查看缓存全文
缓存时间: 2026/08/20 10:17
# MemFuse:从碎片化观察中实现多源记忆融合
来源:https://arxiv.org/html/2608.18704
袁法立,吴文浩(感谢:实习期间完成的工作),刘旭乐,王志,邵坤 \\corresponding
###### 摘要
长期记忆对于执行跨长时间交互任务的智能体至关重要,但现有的记忆系统和基准测试主要关注单源文本历史。然而,在现实场景中,相关信息往往分散在不同应用、设备、用户和时间中,这要求智能体在保持信息来源可追溯性的同时,将分散的观察整合成连贯的情景记忆。为解决这些不足,我们提出了 **MemFuseBench**,一个用于**多源记忆融合**的基准测试。MemFuseBench 采用“场景-传感器”流程构建,该流程可将可控场景合成为带来源标签的观察、基于证据的问题以及对抗性干扰项。该基准能够系统性地评估时间推理、跨源证据融合以及对噪声的鲁棒性。我们进一步提出了 **MemFuse**,一种结构化记忆系统。它在事件层原子记忆中保留来源级证据,并在一个因果融合图中,将相关的原子事件组织成集群层的融合记忆。在检索过程中,MemFuse 检索并组织相关的证据片段,同时保持与原始源事件的可追溯性。在 MemFuseBench 上的实验表明,在三种大语言模型设置下,MemFuse 在所有被评估的记忆系统中取得了最佳的整体性能,并且在需要跨源证据融合的问题上持续提升了性能。
代码:https://github\.com/Darwin\-Agent/Mi\-Memory/tree/master/MemFuse
## 引言
随着智能体需要在长时间交互中维持有用的上下文,长期记忆系统受到了越来越多的关注。现有的系统将过去的交互存储为记录、摘要或结构化的记忆以供检索(15;4;22;10;7;1;17;11),当相关上下文构成连贯历史时,这些系统运作良好。然而,随着用户期望的增长,智能体需要记住的不仅是用户明确告知的内容,还包括来自设备、应用程序和其他用户的有用观察。在这种情况下,同一个底层事件可能由来自不同来源的碎片化事件表示,因此有必要在不丢失其来源的情况下整合互补的观察。我们将这个记忆层面的问题称为**多源记忆融合**:在保持事件层溯源性的同时,检索和整合分布的语义事件。
现有的记忆基准主要评估会话回忆、时间更新或对交互历史的长时间上下文推理(14;20;18;8;24)。最近的基准考虑了异构数字痕迹和多模态证据(3;2),但它们没有专门测试记忆系统是否能够将带来源标签的碎片化事件链接成可追溯的证据,以回答融合导向的问题。因此,目前仍然难以测试一个系统是否能从不同来源恢复互补的观察。
为应对这些挑战,我们首先介绍了 **MemFuseBench**,一个用于多源记忆融合的基准测试。从可控场景出发,其“场景-传感器”流程生成带来源标签的观察、基于证据的问题和对抗性干扰项。图 1 展示了一个需要来自多个来源的证据、同时忽略一个合理干扰项的问题实例。该基准包含 357 个问题,涉及 6 个诊断类别中的 7,823 个事件。
为进一步支持多源记忆融合,我们提出了 **MemFuse**,一种图结构的记忆系统。它将事件层记忆保留为证据层,并在一个因果融合图中,将相关事件组织成集群层记忆。在检索时,MemFuse 使用智能体搜索来恢复紧凑的集群记忆及其可追溯的源事件。
总而言之,我们的贡献包括:(1)将多源记忆融合确定为一个针对碎片化、带来源标签事件的记忆层面研究问题;(2)推出了 MemFuseBench,一个面向此场景的融合中心基准测试,包含六个诊断类别和答案检查表,并由可扩展的基于大语言模型的合成和审阅-校正验证流程支持;(3)提出了 MemFuse,一种结构化记忆系统,它在事件层原子记忆中保留来源级证据,并在一个因果融合图中将相关事件融合到集群层记忆中;以及(4)通过跨多个模型的实验验证了 MemFuseBench 和 MemFuse,其中 MemFuse 在所有三种大语言模型设置下,在所有被评估的检索和记忆系统中取得了最佳的整体分数。
**图 1**:一个 MemFuseBench 实例,需要融合来自家庭对话、工作日历和电话通话的证据,同时拒绝一个在错误日期的合理干扰项。
## 相关工作
##### 长期智能体记忆。
智能体记忆系统将过去的交互存储为记录、摘要、链接笔记或分层记忆单元,以便后续检索(16;15;27;13;19;4;22;26;10;7;1;17)。最近的工作还引入了结构化或基于图的记忆,以连接相关经验并支持多步检索(9;21;23;11)。这些系统改进了对扁平日志的组织,但主要假设的是会话或交互历史,而不是来自不同来源的碎片化观察。
##### 记忆基准。
LoCoMo、LongMemEval 和 MemBench 评估会话回忆、时间更新、拒绝回答和长时间上下文推理(14;20;18)。EverMemBench 和 GroupMemBench 将这一方向扩展到长期交互记忆和多方对话(8;24)。LifeBench 和 SMMBench 通过使用异构数字痕迹或独立来源的多模态证据,更接近现实场景(3;2)。它们拓宽了记忆评估的输入来源,但并未将任务设计的重点放在链接、融合和追踪分布的事件片段上。
##### 多源记忆融合。
以事件为中心的资源和生活记录系统将异构记录组织成事件结构,用于时间或常识推理(5;25;6)。多传感器融合研究来自多个传感器的信号或决策如何被配准、估计或组合(12)。这些研究方向与多源证据相关,但它们并不关心智能体记忆:没有一个研究涉及长期记忆系统在保留原子溯源性的同时,如何分组和检索碎片化的观察,以用于下游的问答。
## MemFuseBench
大多数记忆基准评估单一会话历史内的回忆。最近的基准将输入拓宽到异构或多模态痕迹,但没有一个能够隔离出核心困难:对跨越设备、应用程序、用户和时间的碎片化证据进行推理,其中没有单一记录足够。评估这一点需要两个现有基准缺乏的特性:暴露溯源的源级证据标注,以及答案真正依赖于从多个来源拼接碎片的问题。
因此,我们构建了 MemFuseBench,将带来源标签的事件流与只能通过跨源融合碎片化原子事件来回答的基于证据的问题配对,并附带惩罚捷径检索的对抗性干扰项。
### 数据集构建
每个 MemFuseBench 实例包含特定来源的事件流以及一个问题及其参考答案和答案检查表。我们使用“场景-传感器”流程构建这些实例,该流程将可控的潜在场景转化为特定来源的观察、基于证据的问题以及对抗性的非证据事件。审阅-校正验证会检查和修复中间产物,以确保在注入干扰项的情况下,其一致性、证据支持度和答案得以保持。
**图 2**:MemFuseBench 总体构建框架。左图总结了构建流程,其六个阶段分为三个阶段:事件构建、问答生成和噪声注入。右图显示了审阅-校正验证过程,其中候选样本被检查、修改和迭代,直到产生最终被接受的样本。
##### 构建流程。
核心构建方法是“场景-传感器”生成,它通过自顶向下的细化(而非直接生成问答对)来构建每个实例。它首先固定一个高级的地面真值——稳定的人格以及一个因果关联的场景时间线(*世界上发生了什么*),然后将每个潜在活动投射为具体的、带时间戳的、特定来源的事件流(*每个设备观察到了什么*),从中派生出基于证据的问题。图 2 总结了该框架,它被组织为六个阶段:
1. **人格构建**。采样稳定的人格及其共享上下文——日程安排、关系以及具有可观察模态的多设备清单——形成人格-来源图,该图约束了所有后续阶段。
2. **场景构建**。将人格的日常活动组织成按事件分组的、因果关联的故事情节事件。这个时间线是潜在的地面真值,随后被折射为特定来源的事件。
3. **事件流合成**。将场景渲染为特定来源的事件,交织常规、周期性、噪声和冲突事件,使得每个来源只提供部分视图。这产生了带时间戳的事件流。
4. **跨类别问题生成**。派生跨越表 1 中六个诊断类别的问题,生成一个包含问题、参考答案和答案检查表的问答池。
5. **问答过滤**。过滤问答池,移除语义重复项、常识捷径以及其标注证据无法支持参考答案的项目,只保留可回答、有证据支持、不重复的项目。
6. **对抗性噪声注入**。注入语义相似的干扰项以使检索复杂化,同时保持黄金证据集可审计且不变,因此最终样本既包含黄金证据也包含合理的非证据干扰项。
##### 验证协议。
由于该流程以自顶向下的方式逐步构建每个实例,不一致的人格-来源图会将错误传播到每个后续产物。为防止这种情况,MemFuseBench 在每件中间产物进入下一阶段之前,都对其应用**审阅-校正验证**:*审阅者*使用特定于阶段的提示标记结构、语义和一致性问题;*校正者*修复这些问题;这个审阅-校正过程迭代进行,直到审阅者发现没有剩余问题。标准是特定于阶段的,并针对两个目标。对于前四个阶段,验证目标是**内部一致性**:人格-来源图、场景时间线、事件流和问答池必须各自自洽并与上游产物对齐。对于对抗性噪声注入,验证目标转为**答案保持**:注入的干扰项必须使检索复杂化,但不改变黄金证据集或参考答案。
我们进一步进行了模型引导的验证:在给定完整上下文的情况下,GPT-5\.5、Claude Opus 4\.6 和 Gemini 3\.1 Pro 各自独立回答并评估每个问题,对于它们意见不一致的样本,进行人工检查和修正。此过程导致约 20% 的 357 个问答实例进行了至少一次修订。
### 数据集分析
该流程生成了 MemFuseBench,包含六个场景数据集,每个数据集都配对了跨越六个诊断类别的基于证据的问题。平均而言,一个场景包含 1,303\.8 个原子事件和 110\.6k 个 token(基于 Gemini 3\.1 Flash Lite 分词器)。表 1 总结了最终的 357 个问题;平均每个问题需要来自 9\.4 个不同事件的证据。
**表 1**:当前 MemFuseBench 发布版本的按类别统计。括号中的短标签用于结果表。\#Q 是问题数量;Avg\. Events 是每个问题所需的平均不同证据事件数。
## MemFuse
我们针对更现实的场景,其中相关证据分散在设备、应用程序、用户和时间中,这需要一个记忆系统,它在保留每个观察的溯源性的同时,对相关片段进行分组和推理。MemFuse 将溯源保留与记忆聚合分离:事件层原子记忆保留来源证据,集群层融合记忆总结相关证据,因果融合图连接这两个记忆层。基于此结构,MemFuse 存储传入的原子事件,将相关事件分组到融合记忆中,提出经过验证的融合操作来构建图,并执行融合感知的检索以进行基于证据的答案生成。图 3 展示了总体架构。
**图 3**:MemFuse 系统概览。它接受带来源标签的原子事件流,并在两层记忆中组织它们。事件层原子记忆保留每个事件的来源证据。集群层融合记忆将相关事件摘要为紧凑的检索单元。因果融合图连接原子事件和集群节点,以支持可追溯的融合。在检索过程中,系统使用智能体搜索来恢复相关的集群记忆及其源事件,然后生成答案。
### 前提
给定一个归一化的、带来源标签的原子事件流 \(\mathcal{E}=\{e_{i}\}_{i=1}^{n}\),MemFuse 将记忆组织为两层:
- • **事件层原子记忆 \(\mathcal{M}_{E}\)**:每个事件被存储为一个不可变的、带索引的记忆,保留其溯源性以供后续的语义关联。
- • **集群层融合记忆 \(\mathcal{M}_{V}\)**:相关事件被分组为紧凑的检索单元,每个单元是一个**融合节点** \(v \in \mathcal{V}\),由成员集 \(\mu(v) \subseteq \mathcal{E}\)、作为检索入口点的融合摘要 \(y_{v}\),以及将 \(v\) 关联回其源事件的回溯指针定义。
整体记忆状态为 \(\mathcal{M}=\{\mathcal{M}_{E},\mathcal{M}_{V},\mathcal{G}\}\)。相似文章
StateFuse:面向多智能体系统的确定性冲突保留内存
StateFuse是一种面向多智能体系统的冲突感知复制内存契约,它保留矛盾的观察结果而非将其合并,从而在不追求通用准确性提升的前提下,实现更安全的弃权和可审计的修正。
MemForest:一种具有分层时间索引的高效智能体记忆系统
MemForest 提出了一种面向长上下文 LLM 智能体的记忆框架,通过并行块提取和分层时间索引来提高可扩展性并降低延迟,在基准测试中实现了 6 倍的吞吐量提升。
MEME:多实体与动态记忆评估
MEME 基准测试在多实体和动态变化的条件下评估 AI 记忆系统,揭示了即便采用先进的检索技术,在依赖关系推理方面依然存在显著挑战。
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
Memora: 平衡抽象与具体性的和谐记忆表示
Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。