ECHO:一个认知启发的、可审计的长时程代理记忆平面
摘要
ECHO 是一个认知启发的、可审计的记忆架构,适用于长时程代理,在 LoCoMo 和 LongMemEval-S 等基准测试中表现出高检索性能。
查看缓存全文
缓存时间: 2026/08/25 04:24
# 面向长期代理的认知启发可审计记忆平面
来源:https://arxiv.org/html/2608.21755
Hong Miao 致谢:于谦、苗宏、郭博洋对本工作贡献相等。郭博洋 致谢:于谦、苗宏、郭博洋对本工作贡献相等。姜庭一 赵珊 乐天星 李林天 刘梦 致谢:所有作者均来自XDream Robotics,中国上海市浦东新区愚人路188弄1号茉莉社区T2楼(邮箱:{ethan,harold,ray,poluz,chloe,letianxing,lynk,meng.liu}@xdreamrobo.com)。
###### 摘要
长期代理需要能够识别相关经验、解决修订问题并暴露可验证来源的记忆系统。我们提出ECHO(具身上下文与历史编排),这是一种受情景编码、巩固、上下文重现、再巩固和执行控制启发的可审计记忆架构与服务原型。这是功能上的启发而非神经等效;实证分析聚焦于检索与上下文构建。
开发运行在1,536个LoCoMo第1-4类问题上达到96.29%的Hit@10和73.64%的回合Recall@5,在全部500个LongMemEval-S问题上达到97.60%的Hit@10、88.84%的回合Recall@5和88.71%的会话Recall@5。五历史BEAM门控失败,而在独立的匹配91个问答样本中,Mem0 OSS得分为64.84%,ECHO为41.76%(精确McNemar检验p=.00107),且历史聚类区间跨越零点。事后审计发现查询扩展规则中存在特定来源短语。尽管运行时未使用标准答案字段,但启用扩展的检索得分因此是描述性开发测量值,而非独立确认。
###### 索引术语:
认知记忆、代理记忆、双时态数据、证据检索、来源、长上下文评估、记忆系统
## I 引言
考虑一个能够记住用户旧地址、更正后的新地址以及发生更正的对话的助手。最近邻存储可能检索到两个地址。一个有用的记忆系统必须做得更多:保留原始体验,在不重写历史的情况下表示修订,决定请求时间点哪个值有效,并返回证明该决策的证据。这是存储过去与维护一个能够安全约束现在的过去之间的区别。
因此,持久助手和具身代理需要记忆*平面*,而不仅仅是向量索引。这样的平面必须协调四个可分离的职责:持久体验捕获、结构化状态演变、上下文敏感发现以及受控地实现为答案或行动。任何边界上的失败都可能在有利的标题分数下幸存。检索器可能返回一个相关回合,却遗漏了计算所需的其他事件;语义上接近的陈旧值可能比当前修订排名更高;或者阅读器可能获得了正确的证据但仍然回答错误。
现有的长期记忆基准揭示了问题的多个方面。LoCoMo测试多会话事实、时序和多跳记忆[12 (https://arxiv.org/html/2608.21755#bib.bib2)];LongMemEval测试在带时间戳的历史记录上的信息提取、知识更新、时序推理、多会话综合、偏好和弃权[23 (https://arxiv.org/html/2608.21755#bib.bib3)];BEAM将连贯历史扩展到数百万令牌和广泛记忆操作[20 (https://arxiv.org/html/2608.21755#bib.bib4)]。这些基准很有价值,但标题分数通常混合了阅读器、提示、检索截止、数据修订和评判器。单一的Hit@kk还掩盖了恢复了多少标注证据以及记忆API是否暴露了衡量该覆盖范围所需的来源信息。因此,可能无法判断失败是源于候选发现、时序解析、证据打包还是答案实现。
我们将记忆作为可审计的认知基础设施来研究。ECHO遵循*编码、组织、召回和演变*的持续循环:不可变事件保留情景;投影构建类型化修订;混合路径提议候选项;双时态账本单独决定当前性;来源闭包恢复操作所需的依赖关系;执行边界将内部推导与可见答案分隔开。认知映射启发了这种分解,但未提出解剖学、生物学或临床主张。
实证结果刻意包含负面证据。LongMemEval-S显示,在完整的冻结运行中,问题命中率和证据覆盖率可以同时很高。而单历史BEAM开发试点则显示,完美的Hit@10可能与不完整的证据共存。最重要的是,新鲜历史BEAM门控未能复现试点结果,且匹配的91个问答样本更支持Mem0 OSS。这些结果缩小而非削弱了贡献:它们区分了架构所保证的内容与当前排序器和回答器已演示的内容。
本文做出五项贡献:
- •我们将情景痕迹、语义巩固、再巩固、上下文召回和执行控制转化为明确、可测试的系统承诺,并严格声明非神经等效。
- •我们指定并单元测试了一个类型化双时态权威组件,其中有效时间、事务时间、修订状态、来源和冲突是显式的,而语义相似性不能决定事实的当前性。
- •我们实现了一个面向工作者的检索管道,并在明确的系统边界处评估检索、来源闭包和受限上下文行为。
- •我们报告了LoCoMo和LongMemEval-S的冻结描述性检索产物、一个限定范围的BEAM开发试点,以及一个失败的、预先注册的五历史BEAM门控,保留了问题级审计、失败、延迟、上下文大小和哈希值,同时披露了查询扩展污染风险。
- •我们提供了一个协议匹配的91个问题ECHO与Mem0 OSS问答比较,包含配对统计和一个可观察性契约,当基线未暴露来源谱系时禁止分配来源指标。
证据在整个过程中是阶段分离的。ECHO检索、匹配抽样问答和作者报告的产品得分使用不同的估计量;没有一个被悄悄转换为另一个。结果是一个架构与审计研究,其主张与相应的实证边界和评估协议保持一致;报告的结果仅限于这些设定范围。
## II 问题公式化
### II-A 事件、状态与两个时间轴
令交互历史为一个仅追加的事件流E=\(e1,...,eT\)E=\(e\_\{1\},\\ldots,e\_\{T\}\)。每个事件包含不可变的源身份、说话者或操作者、观察文本、源顺序和可用时间戳。投影将事件映射到类型化命题和状态修订。状态记录为:
s=\(k,v,τv,τt,ρ,π,g,σ\),s=\(k,v,\\tau\_\{v\},\\tau\_\{t\},\\rho,\\pi,g,\\sigma\),(1)
其中k为类型化实体-关系键,v为值,τv为有效时间区间,τt为事务或已知时间区间,ρ为修订关系,π为不可变来源,g为账本代,σ为状态(如活动、被取代、撤销或未解决)。有效时间表示命题在建模世界中为真的时间;事务时间表示系统记录它的时间。这种分离遵循既定的双时态数据库语义[21 (https://arxiv.org/html/2608.21755#bib.bib5)]。
对于查询视图t=\(tv,tt\)t=\(t\_\{v\},t\_\{t\}\),账本解析为:
S\(k,t\)=\{s:s\.k=k,tv∈s\.τv,tt∈s\.τt,s\.g≤gvisible\}\.\\mathcal\{S\}\(k,t\)=\\\{s:s\.k=k,\\;t\_\{v\}\\in s\.\\tau\_\{v\},\\;t\_\{t\}\\in s\.\\tau\_\{t\},\\;s\.g\\leq g\_\{\\mathrm\{visible\}\}\\\}\.\(2\)
如果S\\mathcal\{S\}包含一个受支持的活动修订,则该状态可以被回答。如果为空,则证据缺失。如果包含不兼容的未解决修订,系统不能选择最相似的一个;它要么在请求时披露最小冲突集,要么弃权。
我们通过一个三值解析器使该权威边界显式化:
Resolve\(k,t\)=\{s,Sadm\(k,t\)=\{s\},⊥miss,Sadm\(k,t\)=∅,⊥conflict,\|Sadm\(k,t\)\|\>1,\\operatorname\{Resolve\}\(k,t\)=\\begin\{cases\}s,&\\mathcal\{S\}\_\{\\mathrm\{adm\}\}\(k,t\)=\\\{s\\\},\\\\ \\bot\_\{\\mathrm\{miss\}\},&\\mathcal\{S\}\_\{\\mathrm\{adm\}\}\(k,t\)=\\varnothing,\\\\ \\bot\_\{\\mathrm\{conflict\}\},&\|\\mathcal\{S\}\_\{\\mathrm\{adm\}\}\(k,t\)\|\>1,\\end\{cases\}\(3\)
其中可容许性要求兼容的有效时间、已知时间、修订状态、来源和可见账本代。语义相似性故意不在公式(3)中出现;它可能发现一个状态,但不能使该状态具有权威性。
### II-B 证据与答案操作
检索命中不一定构成充分证据。令u为一个证据单元,Π\(u\)为其来源谱系。对于选定的状态或导出结果,证据闭包Γ\(u\)包含起源事件、所需的修订链接以及验证结果所需的依赖关系。候选发现首先联合特定路径的结果:
H\(q\)\\displaystyle\\mathcal\{H\}\(q\)=⋃r∈RTopMr\(Hr\(q\)\),\\displaystyle=\\bigcup\_\{r\\in\\mathcal\{R\}\}\\operatorname\{Top\}\_\{M\_\{r\}\}\\bigl\(\\mathcal\{H\}\_\{r\}\(q\)\\bigr\),\(4\)
F\(u∣q\)\\displaystyle F\(u\\mid q\)=∑r∈Rαrφr\(u,q\)\+λSupport\(session\(u\)\),\\displaystyle=\\sum\_\{r\\in\\mathcal\{R\}\}\\alpha\_\{r\}\\phi\_\{r\}\(u,q\)\+\\lambda\\,\\operatorname\{Support\}\(\\operatorname\{session\}\(u\)\),\(5\)
其中路径包括词汇、语义、类型化状态和邻域发现。融合分数F仅用于排序检查;当前性仍是公式(3)的输出。一个容许的上下文则是一个原子闭包打包问题:
x⋆\\displaystyle\\mathbf\{x\}^\{\\star\}=argmax∑u∈Hx∈\{0,1\}\|H\|xuU\(u∣q,o\),\\displaystyle=\\arg\\max\_\{\\mathbf\{x\}\\in\\\{0,1\\\}^\{\|\\mathcal\{H\}\|\}\}\\sum\_\{u\\in\\mathcal\{H\}\}x\_\{u\}\\,U\(u\\mid q,o\),\(6\)
s\.t\.∑u∈Hxutokens\(Γ\(u\)\)≤B,C=⋃u:xu⋆=1Γ\(u\),\\displaystyle\\sum\_\{u\\in\\mathcal\{H\}\}x\_\{u\}\\,\\operatorname\{tokens\}\(\\Gamma\(u\)\)\\leq B,\\qquad C=\\bigcup\_\{u:x\_\{u\}^\{\\star\}=1\\}\\Gamma\(u\),\(7\)
针对效用条件化的证据单元H\\mathcal\{H\}和预算B。打包器可能推迟不适合的原子闭包,但不能悄悄地只包含结论而丢弃其所需的支持。
公共问题诱导操作,如事实、计数、列表、时序查询或时序算术。操作决定哪些证据必须完整,以及需要哪种答案表面。重要的是,内部完整性不等于可见完整性。
### II-C 目标与主张分类
对于问题q、冻结上下文C、内部推导z和表面契约h,阅读器计算:
z\\displaystyle z=D\(q,C,o\),\\displaystyle=D\(q,C,o\),\(8\)
a\\displaystyle a=R\(q,z,h\)\.\\displaystyle=R\(q,z,h\)\.\(9\)
D可以枚举成员或保留时序端点。R仅发出q所请求的答案。我们优化所有行的严格答案正确性,同时报告支持召回、弃权行为、令牌使用和延迟。检索指标诊断C;它们绝不能替代a的正确性。
因此,系统目标是受限的,而非单一的检索分数。对于评估行i=1,...,ni=1,\\ldots,n,我们报告:
J=1n∑i=1n1\[ai≡yi\]−λsLstale−λcLconflict−λfLfalseabstain−λbB ̄,\\begin\{split\}\\mathcal\{J\}=\\{\\}&\\frac\{1\}\{n\}\\sum\_\{i=1\}^\{n\}\\mathbb\{1\}\[a\_\{i\}\\equiv y\_\{i\}\]\-\\lambda\_\{s\}L\_\{\\mathrm\{stale\}\}\-\\lambda\_\{c\}L\_\{\\mathrm\{conflict\}\}\\\\ &\-\\lambda\_\{f\}L\_\{\\mathrm\{false\\ abstain\}\}\-\\lambda\_\{b\}\\overline\{B\},\\end\{split\}\(10\)
受制于来源闭包和代际围栏不变式。第一项是端到端答案正确性;其余项暴露了高Hit@kk可能隐藏的安全性和成本失败。
我们在本文中区分四个证据级别:阶段级检索、匹配可见开发、冻结候选评估和新鲜确认评估。只有最后两个可以支持最终优越性语言,并且只有当它们的预先注册门控通过时。
## III ECHO 记忆平面
### III-A 认知启发与工程承诺
人类记忆并非统一存储。情景-语义区分将时间定位的经验与组织的知识分开[22 (https://arxiv.org/html/2608.21755#bib.bib19)];互补学习系统解释了快速经验捕获和较慢的结构化学习为何服务于不同角色[13 (https://arxiv.org/html/2608.21755#bib.bib20),10 (https://arxiv.org/html/2608.21755#bib.bib21)];再巩固表明,回忆可以重新开启已建立的记忆进行修订[15 (https://arxiv.org/html/2608.21755#bib.bib22)]。时序上下文模型将回忆与变化的内部上下文联系起来[7 (https://arxiv.org/html/2608.21755#bib.bib23)],而认知控制理论强调目标依赖的引导行为的选择[14 (https://arxiv.org/html/2608.21755#bib.bib24)]。
表 I:功能认知启发与可测试系统承诺。这些对应关系是设计假设,而非解剖学主张。其价值在于操作性:每一行创建一个独立可审计的不变式或消融。在这个意义上,“受大脑启发”命名了记忆功能的分解,而双时态状态和来源提供了测试它所需的工程语义。
| 功能认知循环 | 情景编码 | 快速痕迹 | 系统巩固 | 情景↔图式 | 上下文重现 | 线索条件化 | 执行门控 | 任务选择性 | 再巩固更新 | 证据授权的新经验或修正 |
|---|---|---|---|---|---|---|---|---|---|
| 可审计记忆平面 | 不可变事件 | 源顺序 + 时间 | 类型化投影 | 状态 + 修订 | 双时态账本 | 有效/已知时间 | 候选发现 | 词汇 + 语义 + 类型化 | 来源闭包 | 原子依赖包 |
| 导出→实现 | 输入完整,选择性输出 | 目标权威边界。相似性提议候选;账本单独解析当前性。目标证据契约将答案构建与来源、账本代、上下文哈希、操作计划和表面契约绑定,并在相应的系统边界报告评估。 |
图 1:ECHO 概览。上层通道将功能认知循环转化为下方的可审计记忆平面;颜色区分经验、投影状态、时序权威、发现、来源和实现。实线箭头是运行时流程,虚线箭头是可测试的对应关系。反馈循环仅接受新的经验或授权的修正,绝不接受未经验证的检索结果。
### III-B 目标运行时与评估范围
图2 (https://arxiv.org/html/2608.21755#S3.F2)指定了预期的在线和异步组合。持久摄入与可选投影和索引维护解耦,目标查询路径从导出索引发现返回到双时态账本,然后再打包证据。实证研究在服务级别评估持久载体、候选发现和上下文构建路径,并通过领域级测试评估V25账本、来源闭包、操作规划和表面契约属性。结果归属于相应的评估边界。
写入/巩固 对话、感知、API事件 不可变证据相似文章
Echo-Memory:动作世界模型中记忆的受控研究
Echo-Memory 对动作条件世界模型中的记忆机制进行了受控研究,揭示了记忆结构和容量对开放域返回性能的影响显著超越回放保真度。该研究引入了一个匹配评估协议,并发现原始上下文和状态空间递归是强大的机制。
先验真相:一种用于智能体记忆的纵向评估工具,以及记忆架构排名中的任期交叉现象
本文提出了一种用于智能体记忆的纵向评估工具,通过在文本生成之前生成事实来避免标签错误和污染,并证明短期基准测试相比长期性能可能会错误地排序记忆架构。同时,它还发布了用于智能体记忆评估的开源库Veracium。
Cognis:面向对话式 AI 智能体的上下文感知记忆系统
Lyzr Cognis 推出统一开源记忆系统,融合 BM25 与 Matryoshka 向量搜索并支持版本感知写入,在 LoCoMo 与 LongMemEval 基准上实现 SOTA。
EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体
EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。
rohitg00/agentmemory
agentmemory 是一个开源的持久化记忆层,专为 AI 编程智能体(Claude Code、Cursor、Gemini CLI、Codex CLI 等)设计。它通过知识图谱、置信度评分和混合搜索技术,借助 MCP、Hooks 或 REST API,为智能体提供跨会话的长期记忆能力。该项目基于 iii 引擎构建,无需外部数据库,提供 51 个 MCP 工具。