你的智能体上周二相信什么?
摘要
本文探讨了智能体记忆系统中有效时间和事务时间之间的区别,认为存储这两种时间戳对于重构智能体在特定时刻所知道的信息至关重要。文章还提议设计基准测试来检验智能体的时间推理能力。
大多数智能体记忆系统可以回答:上周二什么是真实的?但能回答以下问题的系统要少得多:仅利用当时所拥有的信息,智能体上周二相信什么?这是不同的查询。假设一份合同在周一结束,但智能体在周五才得知这一变化。周一是现实世界中的边界。周五是智能体记录知识中的边界。一个时间戳无法同时表示两者,否则就会丢弃部分历史。数据库系统已经为这两个时钟命名: - 有效时间——事实在所述世界中成立的时间; - 事务时间——系统将该事实存储为当前事实的时间。对于智能体记忆来说,第二个时钟使得事件重构成为可能。没有它,一条被纠正的记忆可以告诉你当前的真相,却抹去了智能体早期的行为在当时已知信息下是否合理。这对延迟观察、追溯性纠正、矛盾来源、可复现决策,以及任何不只是询问“检索是否返回了最新事实?”的基准测试都很重要。我至少会存储: claim valid_from / valid_to recorded_from / recorded_to source / provenance 模型可以解释时间性请求,但区间逻辑和“截至”查询应在代码或数据库中运行。如果你要设计第一个用于智能体记忆的事务时间基准测试,你会测试哪种失败情形:追溯性纠正、延迟来源,还是重构智能体在做出糟糕决策时所知道的信息?
相似文章
尝试让智能体记忆跨会话持久化所学的经验
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
我曾以为智能体记忆只是存储问题。现在我不这么认为了。
一位开发者重新思考智能体记忆,认为它不仅仅是存储,而是提出了一个带有角色和激活场的活图,用以赋予过去信息适当的权威和上下文。
大家都说自己的智能体“有记忆”——那你到底是什么意思?
这篇文章讨论了AI智能体中“记忆”的模糊含义,强调了不同的解释,如上下文填充、向量数据库、用户画像和暂存区,并呼吁更清晰的定义。
每个智能体记忆系统都用召回率做基准,却几乎没人检查记忆是否仍然真实
本文认为,智能体记忆系统的评估只看召回率,而不看召回的事实是否仍然为真;并提出一个“过时正确性”(correctness under staleness)基准,结果显示向量存储在 68% 的情况下会返回过时事实。
检索记忆中的时间有效性:消除AI代理在知识演化中的过时事实错误
本文介绍了MemStrata,一种维护时间有效性的检索记忆系统,用于消除AI代理在知识演化中的过时事实错误。它在演化基准测试上优于RAG,同时保持静态召回率,使用确定性替代层而无需LLM调用。