回滚世界,保留反思:用于长时程LLM代理的回滚引发反思

arXiv cs.CL 论文

摘要

本文提出回滚引发反思(RIR)框架,用于长时程LLM代理,通过结合状态回滚与反思记忆来改善错误恢复和任务性能。

arXiv:2609.18304v1 公告类型:新 摘要:大型语言模型(LLM)代理通过多步骤环境交互日益处理长时程任务,然而单个错误动作可能改变后续状态和观察,导致错误随时间累积。现有方法要么纠正上下文而不修复改变的环境状态,要么恢复早期状态但丢弃有用经验,难以同时消除失败条件和避免重复过去错误。我们认为可靠的恢复应被视为回滚边界控制问题,共同确定何时干预、恢复何处以及哪些信息应在恢复后保留。基于此观点,我们提出回滚引发反思(RIR),一种统一恢复框架,它将执行恢复到选定的先前状态,同时携带从放弃轨迹中提炼的可重用知识以指导后续决策。我们进一步通过回滚深度和保留记忆上的统一算子来描述恢复,提供状态恢复和知识保留的通用视图。在三个长时程基准上的实验表明,RIR 在多个LLM骨干网络上一致提升任务性能,结构化反思记忆保留有用经验,选择性回滚实现高效恢复。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:14

# 回滚世界,保留反思:面向长时程LLM智能体的回滚诱导反射
来源:https://arxiv.org/html/2609.18304
作者:刘毅耀  
隶属机构:武汉大学网络空间安全学院 | 阿里巴巴集团  
邮箱:[[email protected]](mailto:[email protected])  
隶属机构:通讯作者  
作者:李亚亮  
隶属机构:武汉大学网络空间安全学院 | 阿里巴巴集团  
邮箱:[[email protected]](mailto:[email protected])  
作者:王恩顺  
邮箱:[[email protected]](mailto:[email protected])  
作者:吴立兵  
隶属机构:通讯作者  
邮箱:[[email protected]](mailto:[email protected])

###### 摘要

大语言模型(LLM)智能体越来越多地通过多步环境交互来处理长时程任务,但单个错误动作就可能改变后续状态和观察结果,导致错误随时间累积。现有方法要么修正上下文而不修复已改变的环境状态,要么恢复先前状态但丢弃有用经验,这使得难以同时消除故障条件并避免重复过去的错误。我们认为可靠的恢复应被视为一个回滚边界控制问题,该问题需联合确定*何时*介入、*何处*恢复以及*哪些*信息应在恢复后保留。基于此观点,我们提出了回滚诱导反射(RIR),这是一种统一的恢复框架,它将执行恢复到选定的先前状态,同时携带来自被放弃轨迹的可重用知识,以指导后续决策。我们进一步通过一个关于回滚深度和保留记忆的统一算子来描述恢复过程,为状态恢复和知识保留提供通用视角。在三个长时程基准测试上的实验表明,RIR 在多个LLM骨干网络上始终能提升任务性能,结构化反射记忆能保留有用经验,而选择性回滚则能实现高效恢复。

## 1 引言

大语言模型(LLM)智能体可以通过推理、工具使用和环境交互来解决复杂的长时程任务(Wei 等, 2022 (https://arxiv.org/html/2609.18304#bib.bib4); Yao 等, 2022 (https://arxiv.org/html/2609.18304#bib.bib5); Park 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib2))。然而,此类任务对错误动作高度敏感:一次失误就可能改变后续的状态和观察结果,导致后续决策依赖于被污染的上下文。因此,错误会随时间累积,并可能使智能体逐渐偏离有效的解决轨迹(Hao 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib18))。

现有的补救措施在两个层面上进行干预。**信息级方法**通过附加纠正反馈来指导后续决策(Madaan 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib6); Shinn 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib7); Zhao 等, 2024 (https://arxiv.org/html/2609.18304#bib.bib10); Kim 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib13)),但无法撤销错误动作已造成的环境改变,并且残留在上下文中的受污染观察结果可能与纠正建议本身相矛盾。**状态级方法**则将执行恢复到先前的检查点并丢弃错误的后续部分(Zhou 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib14); Li 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib15); Zhang 等, 2026c (https://arxiv.org/html/2609.18304#bib.bib17); Hao 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib18)),但仅恢复状态并不能确定该后续部分中哪些信息应该保留。保留过少可能使智能体重复同样的失败;过度概括一个局部失败可能错误地排除可行的替代方案。

因此,一个可靠的回滚机制必须回答三个相互关联的问题。首先,**何时回滚**:当前分支是否仍是有效的探索,还是已经开始传播错误?过早介入会限制有效探索;过晚介入则会让错误的后果累积。其次,**回滚到何处**:选择哪个检查点既能消除产生失败的条件,又能保留最多的有效进展?回溯太远会牺牲已完成的工作;不够深入则无法解决根本障碍。第三,**回滚什么**:被丢弃的后续部分中,哪些断言与执行状态一起失效,哪些应该作为知识保留下来以供下次尝试?

这些问题共同定义了回滚边界:**何时**决定是否划定边界,**何处**将其置于轨迹上,而**什么**则控制哪些信息穿越该边界。在此边界处,系统将环境及分支局部智能体上下文恢复到选定的检查点,并从活动轨迹中移除后续部分。然而,后续部分不必被整体丢弃。因恢复而失效的状态断言会被移除,而可重用的观察结果和经验教训则被提炼为反思知识,用于下次尝试。因此,回滚既是一个状态转换的机会,也是一个重构决策上下文的机会:**回滚世界,保留反思**。

基于此观点,我们提出了**回滚诱导反射(RIR)**,这是一个面向长时程LLM智能体的恢复控制框架。对于**何时**,**混合自适应回顾**结合了智能体发起的回顾和自适应计划回顾,以评估当前分支是应继续还是应恢复。对于**何处**,**由粗到细的恢复定位**首先将搜索范围缩小到因果相关的区间,然后选择一个在消除失败和保留进展之间取得平衡的检查点。对于**什么**,**回滚一致性反射记忆**将与检查点一起恢复的分支局部状态与可跨回滚保留的可重用知识区分开来。该记忆存储稳定的任务目标、可重用的环境知识、过去尝试的里程碑以及有条件的故障分析,同时刻意排除智能体的当前状态,以避免在恢复后重新引入过时的断言。

形式上,我们通过一个统一的恢复算子来描述RIR,该算子由回滚深度 \(k\) 和在恢复边界上保留的记忆 \(\mathcal{M}^+\) 参数化。我们证明了常见的纠正和回滚机制是统一算子的受限情况,因此它们诱导的恢复策略类包含在RIR的恢复空间内。这种策略类的包含关系直接引出了最优值单调性结果,在此结果下,RIR可达到的最佳任务完成概率不低于任何此类受限机制。实验上,RIR 在三个长时程基准测试和两个LLM骨干网络上始终优于有代表性的基线方法,在有限的交互预算内将平均成功率提高了高达6.57个百分点,同时保持了选择性恢复。我们的贡献如下:

- • 我们将长时程智能体任务中的轨迹污染重新定义为**回滚边界**放置问题,并确定了恢复必须解决的三个相互关联的问题:何时介入、何处恢复以及哪些信息应在回滚后保留。
- • 我们提出了**回滚诱导反射(RIR)**,它结合了自适应回顾、由粗到细的恢复定位和回滚一致性反射,以恢复执行状态,同时不丢弃来自失败分支的可重用知识。
- • 我们通过统一的恢复算子形式化了RIR,并建立了其恢复空间的通用性以及关于诱导恢复策略类的最优值单调性结果。在长时程基准测试上的实验进一步验证了其在有限交互预算下的有效性。

## 2 相关工作

LLM智能体越来越多地使用上下文管理机制,如外部记忆、经验检索和选择性上下文构建,以支持长时程交互(Yu 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib21); Chhikara 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib22); Jia 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib23); Lu 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib24))。然而,这些方法通常没有解决一旦错误动作已经改变环境后会发生什么:是否以及如何恢复执行本身(Zhang 等, 2026c (https://arxiv.org/html/2609.18304#bib.bib17); Hu 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib25); Wu 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib16))。因此,我们专注于面向回滚的恢复,并将先前的工作分为两大类。

**信息级纠正**。Self-Refine(Madaan 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib6))、AgenTracer(Zhang 等, 2026b (https://arxiv.org/html/2609.18304#bib.bib26))、Reflexion(Shinn 等, 2023 (https://arxiv.org/html/2609.18304#bib.bib7))和 ReflAct(Kim 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib13))通过反馈或反思改进后续决策,而 ExpeL(Zhao 等, 2024 (https://arxiv.org/html/2609.18304#bib.bib10))、AutoGuide(Fu 等, 2024 (https://arxiv.org/html/2609.18304#bib.bib11))和 G-Memory(Zhang 等, 2026a (https://arxiv.org/html/2609.18304#bib.bib12))跨任务重用经验。虽然有效的反馈可以改善未来行为(Huang 等, 2024 (https://arxiv.org/html/2609.18304#bib.bib8); Kamoi 等, 2024 (https://arxiv.org/html/2609.18304#bib.bib9)),但信息级纠正无法撤销错误动作已造成的环境后果,并且保留的分支局部状态断言在恢复后可能变得过时。

**状态级回滚**。GA-Rollback(Li 等, 2025 (https://arxiv.org/html/2609.18304#bib.bib15))和 WebRollback(Zhang 等, 2026c (https://arxiv.org/html/2609.18304#bib.bib17))在交互轨迹中显式恢复先前状态,而 SRC(Hao 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib18))和 DART(Yang 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib19))分别研究了用于训练数据构建和结构化可恢复性的回滚。最接近的同步工作 AgentRewind(Zhuang 等, 2026 (https://arxiv.org/html/2609.18304#bib.bib20))检查点对齐了智能体和环境状态,并在回滚时保留了文本记忆,但它主要依赖智能体发起的恢复,且未显式建模恢复后保留信息的有效性。这些方法展示了显式恢复执行状态的价值,但通常侧重于故障检测或恢复点选择,而非完整的恢复边界。

相比之下,RIR 将恢复边界本身视为一个显式控制问题:它通过联合决定*何时*恢复、*何处*恢复以及*什么*信息在回滚边界上保持有效,统一了状态恢复和上下文重构。与那些孤立处理反思或回滚的方法不同,RIR 在恢复执行的同时保留了可重用知识,并排除了因恢复而失效的状态断言。

## 3 问题形式化

我们考虑一个部分可观察的长时程交互任务 \(\mathcal{E}=(\mathcal{S}, \mathcal{A}, \mathcal{O}, P, \Omega, R_g)\),其中 \(\mathcal{S}\)、\(\mathcal{A}\) 和 \(\mathcal{O}\) 分别表示状态、动作和观察空间。环境根据 \(P(s_{t+1}|s_t, a_t)\) 演化,并通过 \(\Omega(o_{t+1}|s_{t+1})\) 发出观察结果。给定任务目标 \(g\),结果函数 \(R_g(s_T, y_T)\) 评估最终执行状态 \(s_T\) 与真实状态 \(y_T\) 之间的关系,对于可验证任务是二元的,当存在分级奖励时也可以是实值的。

在步骤 \(t\),基础智能体遵循 LLM 策略 \(a_t \sim \pi_\theta(\cdot|g, h_t, \mathcal{M})\),其中 \(\mathcal{M}\) 是持久的反射记忆,\(h_t = (o_0, a_0, \ldots, a_{t-1}, o_t)\) 是当前分支的交互历史。关键区别在于 \(h_t\) 与执行一起被检查点保存,而 \(\mathcal{M}\) 维护在检查点之外,可以携带跨恢复尝试的知识。动作空间包括最终响应、普通任务工具和一个恢复控制工具:\(\mathcal{A} = \mathcal{A}_{\mathrm{resp}} \cup \mathcal{A}_{\mathrm{tool}}\),\(\mathcal{A}_{\mathrm{tool}} = \mathcal{A}_{\mathrm{task}} \cup \{\texttt{rollback}\}\)。 \(\mathcal{A}_{\mathrm{task}}\) 中的动作与环境交互,而 \(\mathcal{A}_{\mathrm{resp}}\) 以最终响应终止该回合。\(\texttt{rollback}\) 工具则提交恢复请求,并不直接修改环境。

**回滚**。在每个可执行动作之前,系统存储一个检查点 \(C_i = (s_i, h_i)\),包含步骤 \(i\) 的环境状态和分支局部上下文。令 \(\mathcal{I}_t = \{ i \leq t \mid C_i \text{ is restorable at step } t \}\) 表示可允许的恢复点集合。对于选定的恢复点 \(r \in \mathcal{I}_t\),我们定义被恢复丢弃的轨迹为*被放弃的后续部分*:\(\tau_{r:t} = (a_r, o_{r+1}, \ldots, a_{t-1}, o_t)\)。

回滚首先从 \(\tau_{r:t}\) 中提取可重用知识以更新反射记忆,然后将环境和分支局部上下文恢复到 \((s_r, h_r)\)。随后,执行在更新后的记忆下从恢复的检查点继续。我们定义 \(k = t - r\) 为*回滚深度*。我们允许极限情况 \(k = 0\),对应于不恢复状态而只修正上下文。

**目标**。RIR 保持基础智能体的参数 \(\theta\) 不变,而是引入了一个测试时恢复控制策略 \(\Pi\)。给定智能体调用预算 \(B_{\mathrm{agent}}\) 和回滚预算 \(B_{\mathrm{rb}}\),RIR 寻求在有限交互下最大化任务成功率:

\(\max_{\Pi} \; \mathbb{E}_{\pi_\theta, \Pi, \mathcal{E}} \left[ R_g(s_T, y_T) \right] \quad \text{s.t.} \quad N_{\mathrm{agent}} \leq B_{\mathrm{agent}}, \; N_{\mathrm{rb}} \leq B_{\mathrm{rb}} \quad (1)\)

## 4 回滚诱导反射框架

### 4.1 概述

如图1(https://arxiv.org/html/2609.18304#S4.F1)所示,RIR 围绕三个相互关联的决策组织恢复:**何时**决定当前分支是否应继续,**何处**选择恢复的检查点,以及**什么**决定被放弃的后续部分中哪些信息应在回滚后保留。算法1(https://arxiv.org/html/2609.18304#alg1)总结了完整的执行循环。

在执行过程中,RIR 沿当前分支存储检查点。回顾要么由智能体恢复请求触发,要么由自适应回顾计划触发。如果判断该分支有前途,系统继续执行并调整下一次回顾间隔。否则,RIR 首先由粗到细地定位恢复检查点,然后从即将被放弃的后续部分中提炼反思知识。最后,系统恢复环境和智能体上下文,同时保留更新的反射记忆以指导新的尝试。该过程可概括为:

\(\mathcal{M}^+ = \phi(\mathcal{M}, \tau_{r:t}), \quad (s_t, h_t, \mathcal{M}) \xrightarrow{\text{rollback}} (s_r, h_r, \mathcal{M}^+)\)

相似文章

诚实说谎:理解反射性代理中的记忆虚构

Hugging Face Daily Papers

本文识别了Reflexion风格代理中的记忆虚构现象,即代理存储了错误的任务解释,并在环境重置后持续坚持错误。作者引入了反射重复率(RRR)指标来检测该现象,并提出了一种缓解方法,用程序化失败信号提取替代开放式自我诊断。

面向长期LLM代理的检索驱动记忆再巩固

arXiv cs.CL

本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。