当智能体需要改变主意时,仅追加记忆恰恰是错误的
摘要
一篇名为 TEPA 的新预印本将记忆有效性视为一等状态,当新证据与旧先例冲突时,撤销过时的先例,同时保留审计轨迹。在完全反转实验中,它优于仅追加和后写胜出,但结果尚未被独立复现。
一篇名为 TEPA 的新预印本将记忆有效性视为一等状态。当新证据与旧先例冲突时,旧记录会从活动使用中被撤销,但保留用于审计。在作者的完全反转实验中,TEPA 得分为 0.950,而仅追加和后写胜出均得分为 0.210。该结果尚未被独立复现,论文也仍报告了检索链和长上下文限制。生产实现上的改动似乎很小:每条持久记忆都会获得 `status`、`valid_from`、`superseded_by` 和 `evidence_id`。冲突会生成一次撤销和一个带有原因的替换。它不会覆盖历史,而且“最后写入”并不自动意味着“当前真相”。今天你在真实的智能体系统中是如何将记忆标记为过时的?
相似文章
开始思考“代理记忆”是错误的首要框架
作者认为“代理记忆”是错误的首要框架,因为它混淆了工作状态和持久记忆,导致调试问题。作者主张将混乱的工作状态(应过期)与具有来源和权威的严格持久记忆分开。
大多AI记忆系统是无意间只增不减,而非有意为之。后果显而易见。
本文批评AI记忆系统默认采用只增不减的机制,导致随时间推移产生冲突信号和知识管理不善,并质疑是否有人真正在解决这一问题,而不仅仅是依赖更好的嵌入技术。
STALE:LLM智能体能否识别记忆何时失效?
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。
每个智能体记忆系统都用召回率做基准,却几乎没人检查记忆是否仍然真实
本文认为,智能体记忆系统的评估只看召回率,而不看召回的事实是否仍然为真;并提出一个“过时正确性”(correctness under staleness)基准,结果显示向量存储在 68% 的情况下会返回过时事实。
在关键时刻记住:面向长周期代理的前瞻性记忆代理
本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。