超越检索:长时程智能体轨迹的查询条件复用
摘要
本文识别出检索后复用是长时程智能体记忆的瓶颈,并提出查询条件复用(QCR)——一种简单的目标绑定笔记格式,在WebArena、WorkArena和AppWorld上展示了更高的成功率和token效率。
arXiv:2608.12847v1 公告类型:新
摘要:检索可以识别出可能相关的过去轨迹,但它并没有规定在执行智能体面对用户、实体、约束或环境状态变化后,应如何利用该轨迹。我们将会话后复用(post-retrieval reuse)步骤识别为长时程轨迹记忆的一个独特瓶颈,并构建了一个评估框架,该框架在固定候选检索、目标状态、模型、解码和工具预算的同时,改变提供给智能体的支持内容。我们以查询条件复用(QCR)来实例化该框架——这是一种刻意简单的目标绑定笔记,记录可复用流程、需要恢复的绑定、适用条件和验证要求。QCR旨在检验复用假设,而非主张一种普遍偏好的记忆格式。在WebArena、WorkArena和AppWorld的2,391个目标实例中,QCR达到了62.3%的平均成功率,比完整轨迹(Full Trajectory)高10.7个百分点,同时使用的在线token减少了48.9%。摘要重排为94.8%的目标选择了可复用记忆,使最终任务成功率与oracle可复用选择器仅差1.8个百分点。按轨迹长度和源-目标绑定变化进行的分析表明,当轨迹变长或源特定值发生变化时,直接注入轨迹会失去大部分效用,而目标绑定支持则保留了更大比例的已测量收益。由此产生的框架将检索质量与将检索到的经验转化为新任务的安全、有用支持这一问题分离开来。
查看缓存全文
缓存时间: 2026/08/14 09:28
# 超越检索:面向长时程智能体轨迹的查询条件化复用
Source: https://arxiv.org/html/2608.12847
Heng Wang, Lingling Zhang, Muye Huang, Xinyu Zhang, Jiashuai Liu, Hang Yan, Rongman Xu
###### 摘要
检索可以找出可能相关的历史轨迹,但它并不能说明在执行代理面对用户、实体、约束或环境状态已经发生变化时,应如何使用该轨迹。我们将这一检索后复用步骤识别为长时程轨迹记忆中的一个独特瓶颈,并构建了一个评估框架:在候选检索、目标状态、模型、解码和工具预算固定的情况下,改变提供给代理的支持内容。我们用查询条件化复用(QCR)实例化该框架——一种刻意简洁的、绑定目标的笔记形式,包含工作流不变式、需要重新获取的绑定、适用条件以及验证护栏。QCR 用于检验复用假设,而非宣称某种普遍更优的记忆格式。在 WebArena、WorkArena 和 AppWorld 的 2,391 个目标实例上,QCR 达到了 62.3% 的平均成功率,比完整轨迹(Full Trajectory)高 10.7 个百分点,同时在线 token 使用量减少 48.9%。摘要重排为 94.8% 的目标选择了可复用的记忆,使最终任务成功率距理想的可复用选择器仅差 1.8 个百分点。按轨迹长度和源-目标绑定变化进行的分析表明,随着轨迹变长或源特定值发生变化,直接注入轨迹的大部分效用会丢失,而绑定目标的支持保留了更大份额的已测量增益。该框架将检索质量与“将检索到的经验转化为新任务中安全、有用的支持”这一问题分离开来。
## 1 引言
图 1:一个设计假设:瓶颈随记忆条目长度而变化。对于简短的事实或片段,检索到相关条目通常就能提供目标所需。长轨迹可以节省更多探索,但其在目标侧的价值取决于复用、重新绑定和执行。QCR 处理这一检索后步骤。
智能体记忆已从携带简短交互历史发展为维护外部存储、结构化记录、检索索引和学习到的记忆操作。这些系统旨在让智能体将过去的经验带入后续决策,而不是从头重新发现相同的信息或流程。近期方法使历史更易保留、组织和检索 (19 (https://arxiv.org/html/2608.12847#bib.bib20);37 (https://arxiv.org/html/2608.12847#bib.bib37);8 (https://arxiv.org/html/2608.12847#bib.bib12);2 (https://arxiv.org/html/2608.12847#bib.bib10);30 (https://arxiv.org/html/2608.12847#bib.bib31);11 (https://arxiv.org/html/2608.12847#bib.bib7);33 (https://arxiv.org/html/2608.12847#bib.bib8);14 (https://arxiv.org/html/2608.12847#bib.bib9)),而长上下文基准测试系统能否在扩展交互中恢复证据 (1 (https://arxiv.org/html/2608.12847#bib.bib1);17 (https://arxiv.org/html/2608.12847#bib.bib18);27 (https://arxiv.org/html/2608.12847#bib.bib28);23 (https://arxiv.org/html/2608.12847#bib.bib25);10 (https://arxiv.org/html/2608.12847#bib.bib14))。这些进展使历史经验变得可访问,但并未确立这些经验能帮助智能体解决当前查询。这种区别之所以重要,是因为许多记忆评估天然止步于访问:系统能否保留某一条目、为查询排序,或回答有关先前交互的问题?LongBench、LoCoMo 和 LongMemEval 使这些访问问题在长上下文和长对话中变得可测量 (1 (https://arxiv.org/html/2608.12847#bib.bib1);17 (https://arxiv.org/html/2608.12847#bib.bib18);27 (https://arxiv.org/html/2608.12847#bib.bib28))。它们是必要的测试,但为执行型智能体留下了第二个问题:一旦经验进入上下文,它是否真的改善了智能体现在必须完成的新任务?
对于简短且自包含的记忆条目,检索和复用往往几乎是同一操作。如果查询需要某个事实、局部指令或紧凑片段,返回正确条目通常就提供了下一个答案或动作所需的证据。因此,在这些场景中检索质量是记忆效用的有用代理指标。长时程任务经验则具有不同结构。一条成功的轨迹可能编码了有价值的工具工作流、决策规则和验证序列,因此它能比短事实节省多得多的探索。然而它也携带了源任务特有的用户、对象、路径、日期、观测和失败分支。找到这样一条轨迹并不能告诉智能体哪一部分可迁移、哪个绑定已经过期、或者在行动前必须重复哪些检查。这正是交互式智能体环境所针对的场景:浏览器、API 和数据库任务将许多动作与不断变化的状态耦合,并评估其最终后果 (38 (https://arxiv.org/html/2608.12847#bib.bib38);6 (https://arxiv.org/html/2608.12847#bib.bib5);24 (https://arxiv.org/html/2608.12847#bib.bib24);31 (https://arxiv.org/html/2608.12847#bib.bib33))。字面意义上的原始轨迹可能把智能体放到正确的子系统中,却同时将过时的参数应用到错误的当前对象上。
图 1 (https://arxiv.org/html/2608.12847#S1.F1) 表达了由此产生的瓶颈转移。从短事实到片段再到长轨迹,记忆条目可以承载更多原本需要智能体重复的工作。主要困难也沿记忆管线向右移动。一旦找到了相关的长轨迹,目标智能体必须提取仍然适用的流程、恢复当前的绑定、拒绝不再成立的源细节,并验证新的最终状态。检索仍然是必要的,但已不再足够。这个困难也不仅仅是上下文窗口问题。给执行者一条长原始轨迹,可能会让当前目标被旧观测和附带分支淹没;这种失败与“模型并不总是可靠地使用长上下文中相关部分”的证据一致 (15 (https://arxiv.org/html/2608.12847#bib.bib16))。基于经验的记忆方法因此从先前运行中提取反思、技能、工作流或可复用知识 (22 (https://arxiv.org/html/2608.12847#bib.bib23);35 (https://arxiv.org/html/2608.12847#bib.bib35);26 (https://arxiv.org/html/2608.12847#bib.bib27));尚不清楚的是如何评估这些提取出的支持对后续查询的价值。
这一观察改变了基本评估问题。记忆应当通过“过去经验是否改善了当前查询的求解”来判断:更高的已验证完成率、更少的不必要探索、或更低的在线成本而不丢弃必要检查。仅靠高检索分数无法回答长轨迹的这一问题。考虑一个较早的多应用工作流,用于搜索、验证和工件创建。后来的请求可能保留该工作流,但改变人员、文件、日期或环境状态。从头开始会浪费先前的运行;重放它则可能复制过期的收件人、路径或状态假设。有用的支持是面向目标的过程说明、需要恢复的绑定以及仍属必要的检查。我们将这一操作称为查询条件化复用。
这一标准将记忆效用与检索质量和源保真度区分开来。一个支持对象可以忠实保留源轨迹,却因携带过时绑定而损害目标;相反,一个过度简短摘要可能节省 token,却遗漏了防止无效动作的前提条件。因此,相关比较应保持可用历史固定,并询问对该历史的哪种使用方式能为目标智能体在其自身环境中带来最好的已验证结果。
我们引入了一个端到端设置,直接评估这一检索后操作。一个统一的冻结记忆库包含已验证的历史轨迹。对于每个目标,检索器返回候选经验,一个共享排序器在任何记忆条件运行之前选择一条记录。因此,完整轨迹(Full Trajectory)、通用摘要(Generic Summary)和 QCR 接收相同的选定经验,但以不同方式使用它。目标成功率、里程碑完成度、API 调用和在线 token 随后衡量该经验是否真正帮助了当前查询。我们的贡献是针对这一边界的问题表述和评估协议,以及 QCR 这一最小化的目标条件化支持变换。分析测试了所选记忆长度和源-目标绑定变化如何改变直接复用的效用。
## 2 相关工作
### 2.1 长上下文与面向检索的记忆
记忆系统研究存储、索引、更新和上下文交付,包括 MemGPT、MemoryBank、HippoRAG、Mem0 和 A-MEM (19 (https://arxiv.org/html/2608.12847#bib.bib20);37 (https://arxiv.org/html/2608.12847#bib.bib37);8 (https://arxiv.org/html/2608.12847#bib.bib12);2 (https://arxiv.org/html/2608.12847#bib.bib10);30 (https://arxiv.org/html/2608.12847#bib.bib31))。LongMemEval、LongBench、LoCoMo、MemBench 和 MemoryAgentBench 评估长时或增量交互中的保留与访问 (27 (https://arxiv.org/html/2608.12847#bib.bib28);1 (https://arxiv.org/html/2608.12847#bib.bib1);17 (https://arxiv.org/html/2608.12847#bib.bib18);23 (https://arxiv.org/html/2608.12847#bib.bib25);10 (https://arxiv.org/html/2608.12847#bib.bib14));RAG 提供了标准的“检索后条件化”模式 (13 (https://arxiv.org/html/2608.12847#bib.bib11)),综述则对记忆操作和表示进行了组织 (34 (https://arxiv.org/html/2608.12847#bib.bib34);7 (https://arxiv.org/html/2608.12847#bib.bib2))。Transformer-XL 和 Memorizing Transformers 使更长的访问成为可能 (3 (https://arxiv.org/html/2608.12847#bib.bib4);28 (https://arxiv.org/html/2608.12847#bib.bib29)),但更大的上下文并不保证模型会使用相关部分 (15 (https://arxiv.org/html/2608.12847#bib.bib16))。因此我们追问一个下游问题:在一条轨迹被选定之后,什么支持能让智能体在新任务上使用它?
### 2.2 轨迹与程序性经验
先前的经验可以表现为反思、技能、脚本或检索到的轨迹:Reflexion、Generative Agents、Voyager、ReAct、ExpeL、Synapse 和 Agent Workflow Memory 实例化了这些选择 (22 (https://arxiv.org/html/2608.12847#bib.bib23);20 (https://arxiv.org/html/2608.12847#bib.bib21);25 (https://arxiv.org/html/2608.12847#bib.bib26);32 (https://arxiv.org/html/2608.12847#bib.bib32);35 (https://arxiv.org/html/2608.12847#bib.bib35);36 (https://arxiv.org/html/2608.12847#bib.bib36);26 (https://arxiv.org/html/2608.12847#bib.bib27))。SAM 使用状态自适应提示,Agentic Memory 学习记忆操作,OCR-Memory 以表示为代价换取对长历史的忠实访问 (11 (https://arxiv.org/html/2608.12847#bib.bib7);33 (https://arxiv.org/html/2608.12847#bib.bib8);14 (https://arxiv.org/html/2608.12847#bib.bib9))。我们则固定候选集和选定轨迹,然后测量其表示是否会改变后续目标的结果或在线成本。
### 2.3 长时程智能体评估
AgentBench、AppWorld、WebArena、WorkArena 和 τ-bench 为多步智能体提供了交互式且可验证的设置 (16 (https://arxiv.org/html/2608.12847#bib.bib17);24 (https://arxiv.org/html/2608.12847#bib.bib24);38 (https://arxiv.org/html/2608.12847#bib.bib38);6 (https://arxiv.org/html/2608.12847#bib.bib5);31 (https://arxiv.org/html/2608.12847#bib.bib33))。Mind2Web、AndroidWorld、WebVoyager、GAIA、OSWorld 和 SWE-bench 将覆盖范围扩展到网页、移动端、多模态和软件任务 (5 (https://arxiv.org/html/2608.12847#bib.bib3);21 (https://arxiv.org/html/2608.12847#bib.bib22);9 (https://arxiv.org/html/2608.12847#bib.bib13);18 (https://arxiv.org/html/2608.12847#bib.bib19);29 (https://arxiv.org/html/2608.12847#bib.bib30);12 (https://arxiv.org/html/2608.12847#bib.bib15))。这些基准通常对孤立执行进行评分。我们的统一记忆库则允许目标在同环境和跨环境历史中搜索,同时保留其原生验证器,因此结果衡量的是先验经验是否减少了目标的工作量,而不是变成一次完全相同的重放。
## 3 任务设定:查询条件化轨迹复用
图 2 (https://arxiv.org/html/2608.12847#S3.F2) 定义了本文使用的评估单元。该单元是一个源-目标对:一条已验证的历史轨迹和一个后续任务,后者保留了可复用的流程,同时改变了执行所需的值。源不是用来重放的演示。它是一次成功交互的记录,可能包含流程、失败分支和状态检查。目标是一个新任务,具有自己的初始状态、工具反馈和验证器。只有当智能体提取出源中仍然适用的部分并重新获取不再适用的值时,记忆才有帮助。
参见图 2 的说明文字:查询条件化轨迹复用的评估流程。离线阶段,经过验证的历史 rollout 填充一个统一记忆库。绑定感知的重写会创建目标查询,其工作流相关但目标特定值更新。在线阶段,固定检索器从冻结记忆库返回历史记录,之后智能体仅针对目标环境及其自有验证器执行。比较衡量目标成功率、里程碑完成度、API 调用以及非重叠在线 token。
### 3.1 问题定义
对于目标任务 \(t\),令 \(q_{t}\) 表示其自然语言查询,\(o_{t,0}\) 为初始观测。在目标开始之前,智能体可以访问一个包含已验证历史轨迹的冻结记忆库 \(\mathcal{B}\)。固定检索器 \(R\) 为每种比较方法返回相同的前 \(k\) 条记录,
\[
Z_{t}=R(q_{t},o_{t,0},\mathcal{B}).
\]
给定 \(Z_{t}\)、目标查询和初始观测,复用机制 \(\rho\) 写出一个支持对象 \(r_{t}=\rho(Z_{t},q_{t},o_{t,0})\)。执行智能体随后从 \((q_{t},o_{t,0},r_{t})\) 生成新的目标轨迹 \(\hat{\tau}_{t}\),并获得目标自身验证器的结果。这一设置区分了两个常被混为一谈的问题:记忆库是否检索到潜在相关的历史,以及智能体能否将该历史转化为当前任务的动作计划。
目标评估奖励已验证的完成情况,并惩罚在线工作量。因此我们报告成功率或验证器分数,以及 API 调用和 token 成本。较长的或更字面的记忆表示并非天然更受青睐;它必须减少求解目标的工作量。所有方法都从相同的缓存 \(Z_{t}\) 和同一排序器选出的记录出发,因此差异不可能来自检索或源选择。它们仅在所选经验的表示和使用方式上有所不同。
### 3.2 离线记忆构建
记忆库存储情节(episodes),而非作者编写的技能或任务摘要。我们从 WebArena、WorkArena 和 AppWorld 的成功源任务执行中构建了一个统一的冻结记忆库,包含 623 条已验证的历史轨迹。智能体通过各环境的原生接口解决每个源任务,只有在该环境的检查器接受其最终状态后,一次 rollout 才会进入 \(\mathcal{B}\)。我们将所有轨迹共同索引在一个混合记忆池中,而不是按任务族或环境对记录进行分区。补充材料报告了记忆库的源基准构成和完整清单。
每条保留记录包含源指令、有序的观测与动作序列、工具调用及其参数。相似文章
先组织后检索:高效智能体的分层记忆导航
本文提出HORMA,一种分层组织与检索记忆智能体,它将智能体经历组织成类文件系统结构以实现高效检索,在减少token用量的同时提升长周期任务的性能。
面向AI智能体的长上下文窗口可寻址召回压缩
ARC通过将仅追加存储与有界引用视图分离,提高了长上下文AI智能体的检索效率和准确率,实现了近乎完美的召回率,同时降低了延迟和带宽消耗。
学习检索:面向文本到SQL智能体的双层长期记忆
本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。
在关键时刻记住:面向长周期代理的前瞻性记忆代理
本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。
QueryAgent-R1: 桥接查询生成与商品检索的电商查询推荐
QueryAgent-R1是一个智能体框架,利用强化学习和记忆抽象桥接电商中的查询生成与商品检索,在线测试中查询点击率提升2.9%,转化率提升3.1%。