Eywa:基于溯源的人工智能代理长期记忆架构

arXiv cs.CL 论文

摘要

Eywa是一种基于溯源的人工智能代理长期记忆架构,它存储不可变的源证据,验证提取的记忆,并在LoCoMo、LongMemEval-S和BEAM上取得了强劲的基准测试结果。

arXiv:2605.30771v1 公告类型:新 摘要:跨会话持久存在的人工智能代理需要能够检索、审计、更新和删除的记忆。现有的记忆系统通常将源证据、提取的事实、检索到的上下文和答案策略合并到一条不透明的提示路径中,使得故障难以诊断:错误的答案可能源于缺失的证据、不支持提取、过时的状态、检索损失或答案模型行为。我们提出了Eywa,一种基于溯源的记忆架构,围绕“证据优先于信念”构建。Eywa在推导规范事实之前存储不可变的源证据,根据类型化信号和源支持验证提取的记忆,并通过确定性的多路径读取通道检索有界的记忆上下文,检索过程中零LLM调用。检索到的上下文与答案指令分开返回,使得相同的记忆基质可以跨前沿、预算和本地答案模型进行评估。在冻结的、工件记录的检索配置下,Eywa在LoCoMo C1-C4分割上使用Claude Sonnet 4.6写入和QA角色达到了90.19%的评判准确率。在LongMemEval-S上,它达到了88.2%的检索充分性准确率。在BEAM(一个包含700个问题的技术记忆压力基准测试)上,它达到了81.45%的平均要点分数和85.29%的通过分数≥0.5。每个问题的完整工件,包括问题、标准答案、模型答案、检索到的上下文和标签,已在https://eywa.to/research上发布。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:28

# Eywa:基于溯源的AI智能体长期记忆系统 来源:https://arxiv.org/html/2605.30771(2026年5月) Eywa:基于溯源的AI智能体长期记忆系统  
Resham Joshi  
[email protected]  
https://eywa.to/  

![[无标题图片]](https://arxiv.org/html/2605.30771v1/figures/eywa_logo_wordmark.png)  

基准测试和制品:https://eywa.to/research  

需要在多个会话中持续运行的AI智能体,必须具备可检索、可审计、可更新和可擦除的记忆能力。现有的记忆系统常常将源证据、提取的事实、检索到的上下文以及答案策略,全部混入一个不透明的提示路径中,导致故障难以诊断:一个错误的答案可能源自缺失的证据、未经支持的提取、过时的状态、检索失败或答案模型的行为。我们提出了 **Eywa**,一种基于溯源的记忆架构,其核心理念是 **先有证据,后有信念**。Eywa 在推导出规范事实之前,先存储不可变的源证据;基于类型化信号和源支持验证提取的记忆;通过一个确定性的多路径读取通道(检索路径中调用零次LLM)检索限定范围的记忆上下文。检索到的上下文与答案指令分离返回,使得同一记忆基底可以被前沿模型、低成本模型和本地答案模型评估。在冻结的、由制品记录检索配置的情况下,Eywa 在使用 Claude Sonnet 4.6 进行写入和问答角色时,在 LoCoMo C1–C4 分支上达到了 90.19% 的评判准确率。在 LongMemEval-S 上,其检索充分性准确率达到 88.2%。在 BEAM(一个包含 700 个问题的技术记忆压力基准测试)上,其平均得分达到 81.45%,pass@score≥0.5 的占比达到 85.29%。完整的每问题制品(包括问题、标准答案、模型答案、检索上下文和标签)已发布于 https://eywa.to/research。

## 1 引言

人类记忆不仅仅是事实的存档。它支持自我连续性、社会协作以及面向未来的行动:自传体记忆帮助人们维持身份认同、从过往经历中学习、做出决策并随着时间推移维系关系(Conway and Pleydell-Pearce, 2000(https://arxiv.org/html/2605.30771#bib.bib19);Bluck et al., 2005(https://arxiv.org/html/2605.30771#bib.bib18);Schacter et al., 2007(https://arxiv.org/html/2605.30771#bib.bib20))。对话同样依赖记忆。说话者通过记住与特定伙伴已建立的内容、仍不确定的信息以及后续交流中可安全假设的内容,来构建共同基础(Clark and Brennan, 1991(https://arxiv.org/html/2605.30771#bib.bib21))。对于需要在几天、多个项目和多个会话中与用户交互的AI智能体,其类似要求不是生物学的保真度,而是功能上的连续性:智能体必须保留重要的过往证据、更新过时的信念、检索相关上下文,并能解释某个记忆中的主张为何成立。

大型语言模型使这一需求更加凸显。现代LLM能够在提示内生成流畅且上下文合适的响应,但其原生计算受限于有限的工作上下文。扩展这一窗口是有价值的,前沿系统如 Gemini 1.5 在非常大的输入上展示了令人印象深刻的长上下文检索能力(Gemini Team et al., 2024(https://arxiv.org/html/2605.30771#bib.bib24))。然而,更大的窗口并不等同于记忆架构。Transformer 注意力在长序列长度下仍然代价高昂(Dao et al., 2022(https://arxiv.org/html/2605.30771#bib.bib25)),实证研究表明,当相关证据出现在提示中间或任务超出模型有效上下文大小时,长上下文模型可能无法可靠地使用信息(Liu et al., 2024(https://arxiv.org/html/2605.30771#bib.bib22);Hsieh et al., 2024(https://arxiv.org/html/2605.30771#bib.bib23))。更重要的是,仅扩展上下文并不能决定应该存储什么、修订什么、忘记什么,或者用户如何审计和擦除已记住的信息。

因此,先前的工作已从无状态提示转向显式的智能体记忆。Generative Agents 引入了记忆流、反思和规划作为可信赖长期行为(Park et al., 2023(https://arxiv.org/html/2605.30771#bib.bib2))的核心机制。Reflexion存储失败的反馈以改进后续智能体尝试(Shinn et al., 2023(https://arxiv.org/html/2605.30771#bib.bib26))。MemoryBank 维护长期用户记忆以实现对话个性化(Zhong et al., 2024(https://arxiv.org/html/2605.30771#bib.bib27)),而 MemGPT 将记忆管理视为一个虚拟上下文问题,信息在工作存储和档案存储之间移动(Packer et al., 2023(https://arxiv.org/html/2605.30771#bib.bib5))。最近的基准测试如 LoCoMo 和 LongMemEval 使得这一问题在多会话对话、时间推理、知识更新、放弃回答和跨会话检索等方面变得可测量(Maharana et al., 2024(https://arxiv.org/html/2605.30771#bib.bib6);Wu et al., 2025(https://arxiv.org/html/2605.30771#bib.bib7))。面向生产的研究系统,包括 Mem0、Supermemory、Zep/Graphiti、A-MEM、MemoryOS 以及基于图的 RAG 方法,进一步表明外部记忆、时间结构和图组织可以改善长期智能体(Chhikara et al., 2025(https://arxiv.org/html/2605.30771#bib.bib1);Supermemory, 2026(https://arxiv.org/html/2605.30771#bib.bib32);Rasmussen et al., 2025(https://arxiv.org/html/2605.30771#bib.bib3);Xu et al., 2025(https://arxiv.org/html/2605.30771#bib.bib4);Kang et al., 2025(https://arxiv.org/html/2605.30771#bib.bib12);Jiménez Gutiérrez et al., 2024(https://arxiv.org/html/2605.30771#bib.bib28))。

尽管取得了这些进展,一个实际的失败点仍未得到充分明确:当基于记忆的答案错误时,往往不清楚哪一层出了问题。原始对话可能包含了正确的证据,但提取器可能遗漏了它。提取器可能创建了一个看似合理但未经支持的事实。检索可能找到了该事实,但将其排在了上下文预算之外。答案模型可能收到了证据但仍然拒绝回答、过度概括或为错误的人回答。端到端的分数将这些情况归为一个数字,使得在不做猜测的情况下改进系统变得困难。

本文提出 **Eywa**,一种用于AI智能体的基于溯源的长期记忆架构。Eywa 围绕“先有证据,后有信念”原则构建:在任何 LLM 推导的事实成为规范记忆之前,原始对话证据首先被保留。写入路径存储不可变的证据,检测类型化信号(如日期、实体、决策、更正和硬锚点),并在提取的事实被提升为规范事实之前,根据其源证据进行验证。规范事实始终链接到推导它们的证据,从而允许后续检查、修复和删除。溯源建立了源支持,而不是外部真相。如果用户说了假话、模棱两可的话或讽刺的话,Eywa 可以保留该主张的来源以及提取的信念是否得到该来源支持,但世界级真相验证在记忆层之外进行。

Eywa 还将记忆检索与答案合成分离。其读取路径通过确定性多路检索(包括规范事实、观察、时间元数据、实体范围、关键词搜索和向量相似度)进行,检索路径中不调用 LLM。检索到的证据随后在明确的答案策略下传递给答案模型。这种分离使得可以独立于生成最终响应的模型来测量记忆系统:相同的检索架构可以服务于前沿 API 模型、小型本地模型或更严格的拒绝策略。

我们在 LoCoMo C1–C4、LongMemEval-S 和 BEAM 上,使用角色显式、追踪保留的运行方式评估 Eywa。LongMemEval-S 和 BEAM 测试不同的记忆行为,因此我们按照它们各自的协议报告结果,而不是将其简化为单个平均值。在这些设置下,核心结果不仅在于 Eywa 得分高,而且每个分数都可以通过产生该分数的问题、证据、事实、检索上下文、答案和评判标签逐问题进行检查。

#### 贡献

1. 一种基于溯源的记忆模型,将不可变的源证据与规范的LLM推导信念分开。
2. 一种双层写入路径,具有类型化信号检测和硬锚点验证功能,用于减少未经支持的提取记忆。
3. 一种确定性多路读取路径,无需LLM调用即可检索记忆上下文,并保持对源证据的可追溯性。
4. 一种模型可分离的答案接口,表明同一检索证据可被托管前沿模型、托管低成本模型和本地模型消费。
5. 一种追踪级评估协议,分别报告写入路径、问答和评判角色,并保留每问题的溯源信息以供独立检查。

## 2 背景与相关工作

最近的一项综述(Hu et al., 2025(https://arxiv.org/html/2605.30771#bib.bib15))沿着三个轴组织智能体记忆:**形式**(词元级、参数化、潜在)、**功能**(事实性、经验性、工作性)和**动态**(形成、演化、检索)。这一分类法很有用,因为它将记忆的表示与维护记忆的操作分离开来。Eywa 遵循这一区分:它不将记忆视为单一存储,而是视为一个生命周期,包括证据捕获、事实形成、修订、检索和答案时使用。

#### 长上下文与检索限制

应对长周期交互的一种方法是增加模型的上下文窗口。Gemini 1.5 表明百万词元上下文可以大幅扩展模型可以依赖的条件(Gemini Team et al., 2024(https://arxiv.org/html/2605.30771#bib.bib24))。同时,长上下文并不能消除对记忆管理的需求。注意力在长序列长度下仍然计算昂贵(Dao et al., 2022(https://arxiv.org/html/2605.30771#bib.bib25)),而像“迷失在中间”(Lost in the Middle)和 RULER 等研究表明,模型在长提示中仍然可能无法可靠地检索或使用相关证据(Liu et al., 2024(https://arxiv.org/html/2605.30771#bib.bib22);Hsieh et al., 2024(https://arxiv.org/html/2605.30771#bib.bib23))。这些发现推动了能够选择、组织和检索证据而非重放所有先前交互的记忆系统。

#### 经验与反思记忆

Generative Agents 引入了一个记忆流,其中观察被检索、反思并用于规划(Park et al., 2023(https://arxiv.org/html/2605.30771#bib.bib2))。Reflexion 存储来自失败尝试的反馈,以便后续智能体行为无需参数更新即可改进(Shinn et al., 2023(https://arxiv.org/html/2605.30771#bib.bib26))。MemoryBank 将此路线扩展到长期对话个性化,包括随时间更新和遗忘用户记忆的机制(Zhong et al., 2024(https://arxiv.org/html/2605.30771#bib.bib27))。这些系统确立了记忆不仅仅是存储;它是在重复交互中控制行为的主动面。

#### 分层与操作系统视角

MemGPT 将记忆管理视为一个虚拟上下文问题,使用操作系统类比,信息在工作上下文和档案存储之间移动(Packer et al., 2023(https://arxiv.org/html/2605.30771#bib.bib5))。MemoryOS 开发了相关的层次结构,包括短期、中期和长期个人记忆,以及受存储管理启发的更新和检索模块(Kang et al., 2025(https://arxiv.org/html/2605.30771#bib.bib12))。这些方法强调容量管理:决定哪些内容应立即可用,哪些应压缩或换出,哪些应在以后检索。

#### 生产级记忆层

Mem0 提供了一个实用的记忆层,用于提取、更新和检索显著的对话记忆,并具有用于关系结构的图增强变体(Chhikara et al., 2025(https://arxiv.org/html/2605.30771#bib.bib1))。Supermemory 提供了一个开源记忆引擎和托管 API,用于跨 AI 工具添加、搜索和注入持久用户上下文,并包含 SDK、MCP 支持和应用连接器(Supermemory, 2026(https://arxiv.org/html/2605.30771#bib.bib32))。LangMem 为基于 LangGraph 的智能体提供记忆管理组件(LangChain, 2025(https://arxiv.org/html/2605.30771#bib.bib8))。OpenAI 的 ChatGPT 记忆将保存的记忆和聊天历史引用控制作为产品功能公开,但其内部记忆架构并未公开说明(OpenAI, 2026(https://arxiv.org/html/2605.30771#bib.bib9))。这一系列工作很重要,因为它将记忆视为必须在延迟、成本、隐私和产品控制约束下运作的基础设施。

#### 图与时序结构化检索

图结构化记忆是多跳和时间演化信息的自然拟合。Zep/Graphiti 构建了一个具有双时间模型(跟踪真实世界有效性和系统摄取时间)的时间感知知识图谱(Rasmussen et al., 2025(https://arxiv.org/html/2605.30771#bib.bib3))。GraphRAG 风格的方法展示了图结构如何支持对大型知识源的查询聚焦检索和摘要(Edge et al., 2024(https://arxiv.org/html/2605.30771#bib.bib11))。HippoRAG 从神经生物学启发的检索角度带来了互补视角,使用图结构和海马索引思想对知识源进行长期记忆(Jiménez Gutiérrez et al., 2024(https://arxiv.org/html/2605.30771#bib.bib28))。A-MEM 使用受 Zettelkasten 启发的过程,其中 LLM 随时间创建、链接和演化记忆笔记(Xu et al., 2025(https://arxiv.org/html/2605.30771#bib.bib4))。这些系统共同表明,关系结构、时间有效性和记忆演化是长期智能体行为的核心。

#### 近期智能体记忆架构

Hindsight 将智能体记忆组织成独立的逻辑网络,分别用于世界事实、经验、观察和意见,并具有明确的保留、回忆和反思操作(Latimer et al., 2025(https://arxiv.org/html/2605.30771#bib.bib29))。这强调了知识论角色分离和基于配置文件的推理。True Memory 认为在摄取时进行提取是错误的原语,而应专注于基于逐字保留事件的检索(Adler and Zehavi, 2026(https://arxiv.org/html/2605.30771#bib.bib31))。Eywa 与这些系统最为接近,它将记忆视为一种架构,而非向量存储功能。其区别在于基于溯源的证据分离:源证据作为权威基质存储,而提取的事实是经过验证、可修订的索引,指向该证据,而不是其有损替代品。Eywa 还保持检索无 LLM,并将答案策略与检索到的记忆上下文分开返回。

#### 基准测试与评估

LoCoMo(Maharana et al., 2024(https://arxiv.org/html/2605.30771#bib.bib6))评估非常长期的对话记忆,基于较长、多会话的对话。其公开基准版本包含 10 个对话,共 1,986 个问答问题:841 个单跳、282 个多跳、321 个时间推理、96 个开放领域知识和 446 个对抗性问题。遵循近期记忆系统结果表中使用的已发表结果惯例,我们报告四个非对抗性类别作为主要的 C1–C4 比较分支。LongMemEval(Wu et al., 2025(https://arxiv.org/html/2605.30771#bib.bib7))

相似文章

MemEye:面向多模态智能体记忆的视觉中心评估框架

Hugging Face Daily Papers

MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。