@dair_ai: 来自Salesforce AI Research的关于智能体记忆的优秀论文。整体发现是你想要存储原始轨迹……

X AI KOLs Following 论文

摘要

Salesforce AI Research提出为LLM智能体使用Just-in-Time Memory,存储原始轨迹并在读取时策划任务适应性载荷,在ALFWorld和WebShop等基准测试中显著优于基线方法。

来自Salesforce AI Research的关于智能体记忆的优秀论文。 整体发现是,你应该存储原始轨迹,并在下一个任务到来时决定从中提取什么,而不是在每次运行结束时进行总结。 Just-in-Time Memory使用一个策展器,该策展器读取检索到的轨迹以及新任务,并为该任务编写一个简短的记忆载荷。由于载荷被立即使用,策展器可以基于相同任务是否成功进行训练。 在ALFWorld、WebShop和tau2-bench上,它分别以16.2、16.3和3.9个成功率点击败了最强基线。即使是未经训练的策展器也能匹配或优于在任务结束时编写的记忆。 论文:https://academy.dair.ai/papers/just-in-time-memory-learning-to-curate-task-adaptive-memory-for-llm-agents-2609.27334…
查看原文
查看缓存全文

缓存时间: 2026/09/26 12:59

Salesforce AI Research 发布了一篇关于智能体记忆的重磅论文。

核心发现是:应存储原始轨迹,待新任务到来时再决定从中提取信息,而非在每次任务结束后立即进行摘要总结。

即时记忆(Just-in-Time Memory)采用一种策展机制,该机制会读取已检索的轨迹数据与新任务,并为当前任务生成精简的记忆载荷。由于该载荷会立即投入应用,策展模块可直接根据任务成败进行优化训练。

在 ALFWorld、WebShop 和 tau2-bench 基准测试中,该方法分别以 16.2、16.3 和 3.9 个百分点的优势超越了最强基线。即使是未经训练的策展模块,其表现也已达到或超过任务结束时生成记忆的传统方法。

论文链接:https://academy.dair.ai/papers/just-in-time-memory-learning-to-curate-task-adaptive-memory-for-llm-agents-2609.27334…


即时记忆:为LLM智能体学习策展任务自适应记忆

来源:https://academy.dair.ai/papers/just-in-time-memory-learning-to-curate-task-adaptive-memory-for-llm-agents-2609.27334 记忆 · 智能体 与论文对话

首页预览

即时记忆:为LLM智能体学习策展任务自适应记忆

策展机制解析

Yefan Zhou, Yang Li, Zeyu Leo Liu, Semih Yavuz 与 Shafiq Joty (Salesforce AI Research) 提出了即时记忆(JitMem),该方法存储原始轨迹,仅当新任务到来时才决定提取哪些信息。

论文要点速览

核心观点

01 写时策展问题。当前主流方法在任务完成后即生成反思、工作流或技能等浓缩记忆,此时未知未来查询需求,导致信息不可逆丢失且生成单一摘要供所有后续使用。

02 读时策展机制。策展模块接收检索到的轨迹与新任务,生成针对该任务的紧凑记忆载荷。

03 直接训练信号。由于记忆载荷直接应用于当前任务,策展模块可通过即时任务成功与否进行训练,避免跨任务的延迟信用分配问题。

04 实验效果。在 ALFWorld、WebShop 和 tau2-bench 测试中,JitMem 分别以 16.2、16.3 和 3.9 个百分点的优势超越最强基线。

05 无训练策展。即使未经训练,读时策展已能与写时策展基线相媲美甚至超越,训练后效果进一步提升。

摘要智能体记忆系统通过复用过往经验提升未来表现,但现有设计多在写时策展记忆:任务完成后即把轨迹蒸馏为固定制品(如反思、工作流、技能或推理策略),再通过相似性检索。这迫使系统在未知未来查询的情况下决定存储内容,不可逆地丢弃信息并生成与查询无关的摘要以服务多种下游任务。训练此类写时策展器颇具挑战,因存储决策的价值可能在相关查询到达时(可能相隔多个任务)才显现,形成长期信用分配难题。我们转而保留原始轨迹并延迟策展至读时——即当前任务已知时。策展模块根据检索到的轨迹与新任务,合成紧凑的任务自适应记忆载荷。由于该载荷直接服务于当前任务,策展器可从即时任务成功信号中直接学习,规避了延迟效用信号和人为分组关联任务的需要。在 ALFWorld、WebShop 和 τ^2-bench 测试中,我们的即时记忆(JitMem)持续优于无记忆智能体以及基于启发式或学习机制的写时记忆方法,分别以 16.2、16.3 和 3.9 个百分点的绝对优势超越最强基线。值得注意的是,即使是未经训练的策展器也已与基线持平甚至更优,证明任务自适应读时策展本身就是性能提升的关键;策展器的训练则进一步放大了这种改进。

相似文章

即时记忆:学习为LLM代理策展任务自适应记忆

Hugging Face Daily Papers

本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。