我构建了一个智能体记忆层,每次回答都返回一个“证明树”——它知道什么、何时知道以及为什么
摘要
一个面向AI智能体的全新托管API记忆层,每次回答都返回一个证明树,包括双时态版本控制、审计追踪和哈希验证,在LongMemEval-S上达到80.2%准确率,并公开透明的基准测试结果。
我花了一段时间构建这个,想与真正运行智能体的人分享。思路是:大多数记忆层给你的智能体一个答案,而你只能选择相信。当回忆出错时,你无法看到它为何浮现出这些信息。我希望记忆能提供每个答案的“收据”——具体使用的记忆、每条记忆何时为真(双时态)、什么被取代了,以及一个哈希,让你能判断是否有任何变化。
目前可行的功能:
- pip install aurra / npm install aurra
- 双时态版本控制(查询过去任何时间点的记忆状态)
- 每条记忆的审计追踪(提取模型、来源、历史)
- 多租户隔离
- 自带LLM(BYO-LLM)——传入你自己的提供商密钥,成本仍由你承担
目前是托管API;自托管已在路线图中,尚未实现。基准测试公开,包含方法学和原始数据(LongMemEval-S平均80.2%;最弱类别33.9%,我主动披露这一点,因为整个重点就是对它能做什么和不能做什么保持诚实)。
真心希望从构建智能体的人那里得到反馈——在你的使用场景中,这个方案会在哪里失效?还缺少什么?
相似文章
大家是如何处理 AI 智能体的长期记忆 + 回放/调试问题的?
一位开发者探讨了当前 AI 智能体记忆系统的局限性,并提出了一款具有片段存储和回放调试功能的新记忆层工具,希望获得社区的验证。
我给我的智能体配备了一种记忆,它拒绝记住无法证明的事物——并能证明它删除了什么
作者为AI智能体构建了一个名为fireweed的记忆层,它使用确定性代码来验证主张与证据,防止幻觉并实现可审计、可证明的记忆删除。
rohitg00/agentmemory
agentmemory 是一个开源的持久化记忆层,专为 AI 编程智能体(Claude Code、Cursor、Gemini CLI、Codex CLI 等)设计。它通过知识图谱、置信度评分和混合搜索技术,借助 MCP、Hooks 或 REST API,为智能体提供跨会话的长期记忆能力。该项目基于 iii 引擎构建,无需外部数据库,提供 51 个 MCP 工具。
Oracle Agent Memory作为面向长周期AI智能体的企业级记忆基座
Oracle推出了Agent Memory,一种面向长周期AI智能体的数据库原生记忆基座,相比于扁平历史基线,在准确率高达93.8%的同时,token用量减少至原来的1/10.7(即减少约10.7倍)。
我们构建了基于Elasticsearch的持久化智能体记忆层,实现0.89召回率
Elasticsearch博客文章描述了构建一个持久化智能体记忆层,包含三种记忆类型(情景记忆、语义记忆、程序记忆),在QA评估中实现0.89召回率,并利用混合召回和DLS隔离实现了零租户泄漏。