@dair_ai: 来自Salesforce AI Research的关于智能体记忆的优秀论文。整体发现是你想要存储原始轨迹……
摘要
Salesforce AI Research提出为LLM智能体使用Just-in-Time Memory,存储原始轨迹并在读取时策划任务适应性载荷,在ALFWorld和WebShop等基准测试中显著优于基线方法。
查看缓存全文
缓存时间: 2026/09/26 12:59
Salesforce AI Research 发布了一篇关于智能体记忆的重磅论文。
核心发现是:应存储原始轨迹,待新任务到来时再决定从中提取信息,而非在每次任务结束后立即进行摘要总结。
即时记忆(Just-in-Time Memory)采用一种策展机制,该机制会读取已检索的轨迹数据与新任务,并为当前任务生成精简的记忆载荷。由于该载荷会立即投入应用,策展模块可直接根据任务成败进行优化训练。
在 ALFWorld、WebShop 和 tau2-bench 基准测试中,该方法分别以 16.2、16.3 和 3.9 个百分点的优势超越了最强基线。即使是未经训练的策展模块,其表现也已达到或超过任务结束时生成记忆的传统方法。
论文链接:https://academy.dair.ai/papers/just-in-time-memory-learning-to-curate-task-adaptive-memory-for-llm-agents-2609.27334…
即时记忆:为LLM智能体学习策展任务自适应记忆
来源:https://academy.dair.ai/papers/just-in-time-memory-learning-to-curate-task-adaptive-memory-for-llm-agents-2609.27334 记忆 · 智能体 与论文对话
首页预览
即时记忆:为LLM智能体学习策展任务自适应记忆
策展机制解析
Yefan Zhou, Yang Li, Zeyu Leo Liu, Semih Yavuz 与 Shafiq Joty (Salesforce AI Research) 提出了即时记忆(JitMem),该方法存储原始轨迹,仅当新任务到来时才决定提取哪些信息。
论文要点速览
核心观点
01 写时策展问题。当前主流方法在任务完成后即生成反思、工作流或技能等浓缩记忆,此时未知未来查询需求,导致信息不可逆丢失且生成单一摘要供所有后续使用。
02 读时策展机制。策展模块接收检索到的轨迹与新任务,生成针对该任务的紧凑记忆载荷。
03 直接训练信号。由于记忆载荷直接应用于当前任务,策展模块可通过即时任务成功与否进行训练,避免跨任务的延迟信用分配问题。
04 实验效果。在 ALFWorld、WebShop 和 tau2-bench 测试中,JitMem 分别以 16.2、16.3 和 3.9 个百分点的优势超越最强基线。
05 无训练策展。即使未经训练,读时策展已能与写时策展基线相媲美甚至超越,训练后效果进一步提升。
摘要智能体记忆系统通过复用过往经验提升未来表现,但现有设计多在写时策展记忆:任务完成后即把轨迹蒸馏为固定制品(如反思、工作流、技能或推理策略),再通过相似性检索。这迫使系统在未知未来查询的情况下决定存储内容,不可逆地丢弃信息并生成与查询无关的摘要以服务多种下游任务。训练此类写时策展器颇具挑战,因存储决策的价值可能在相关查询到达时(可能相隔多个任务)才显现,形成长期信用分配难题。我们转而保留原始轨迹并延迟策展至读时——即当前任务已知时。策展模块根据检索到的轨迹与新任务,合成紧凑的任务自适应记忆载荷。由于该载荷直接服务于当前任务,策展器可从即时任务成功信号中直接学习,规避了延迟效用信号和人为分组关联任务的需要。在 ALFWorld、WebShop 和 τ^2-bench 测试中,我们的即时记忆(JitMem)持续优于无记忆智能体以及基于启发式或学习机制的写时记忆方法,分别以 16.2、16.3 和 3.9 个百分点的绝对优势超越最强基线。值得注意的是,即使是未经训练的策展器也已与基线持平甚至更优,证明任务自适应读时策展本身就是性能提升的关键;策展器的训练则进一步放大了这种改进。
相似文章
@KakaluoteW45042: 现在,智能体的记忆系统都在重蹈数据工程的旧路:存储原始轨迹,定期……
作者批评当前AI智能体的记忆系统沿用旧的数据工程模式,强调了记忆中存在差距的风险,并主张在分层摘要之前使用可审计的原始轨迹。
尝试让智能体记忆跨会话持久化所学的经验
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
即时记忆:学习为LLM代理策展任务自适应记忆
本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。
@dair_ai:关于LLM智能体长期记忆的优秀论文。(收藏)粗粒度的摘要会偏移,无约束的更新会导致信息损坏,……
AtomMem 为 LLM 智能体引入了一种长期记忆系统,将原子事实作为高效记忆单元,将其组织成层次化的事件结构和时间用户画像,在 LoCoMo 基准上达到了最先进水平。
@tom_doerr: 关于短期、长期和经验性智能体记忆的精选论文 https://github.com/TsinghuaC3I/Awesome-Memory-for-Age…
一个关于智能体记忆的精选论文库,按短期、长期和经验性记忆组织,包含分类法及LLM智能体的应用场景。