基于关键感知自反馈重试的智能体强化学习

arXiv cs.AI 论文

摘要

PivoARL是一个自反馈重试框架,它识别LLM智能体轨迹中的关键错误回合,实现局部重试以降低交互成本并提高学习效率。在多个智能体和问答基准测试上,该方法显著优于基线方法。

arXiv:2607.03702v1 Announce Type: new 摘要: 大语言模型(LLM)智能体在长周期交互任务中展现出强大的决策能力,但仍难以有效利用失败轨迹:完全重试导致高昂的交互成本,而经验检索往往会稀释关键经验信号。为解决这一问题,我们提出PivoARL——一种用于LLM智能体经验利用的自反馈重试框架。PivoARL通过结构化反思识别关键错误回合,并仅从对应的关键状态开始局部重试,从而重用正确前缀并减少冗余交互。从信息增益的角度看,我们进一步证明关键重试将有用经验信号集中在错误边界附近,缓解了与状态无关的经验利用所导致的信号稀释。基于这一洞察,我们设计了一种关键感知的信用分配机制,奖励正确前缀同时隔离错误后缀,并通过隐式反思回报优化反思质量。我们在4个智能体任务和7个基于搜索的问答基准上进行了系统评估。结果表明,PivoARL在所有任务上的Pass@2/3均取得显著提升,平均比MetaRL提高约11.5%。此外,得益于关键回合诱导的对比偏好信号,PivoARL在超过80%的任务上持续提升Pass@1。在扫雷环境中,PivoARL比GiGPO提升超过45%,并且与完全重试方法相比,平均减少约42%的交互回合。代码位于 https://github.com/yuki-younai/PivoARL。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:35

# 基于关键感知自我反馈重试的智能体强化学习

来源:https://arxiv.org/html/2607.03702

Weiyang Guo¹,Zesheng Shi¹,Longhui Zhang¹,Zeen Zhu¹,Min Zhang¹,Jing Li¹  
¹哈尔滨工业大学(深圳)  
[email protected][email protected]

###### 摘要

大型语言模型(LLM)智能体在长周期交互任务中展现出强大的决策能力,但在有效利用失败轨迹方面仍存在困难:完全重试会带来高昂的交互成本,而经验检索则容易稀释关键经验信号。为解决这一问题,我们提出 PivoARL,一种用于LLM智能体经验利用的自我反馈重试框架。PivoARL通过结构化反思识别关键错误回合,并从对应的关键状态开始进行局部重试,从而重用正确的历史前缀并减少冗余交互。从信息增益的角度,我们进一步证明关键重试将有用的经验信号集中在错误边界附近,缓解了状态无关经验利用导致信号稀释的问题。基于这一见解,我们设计了一种关键感知的信用分配机制,奖励正确前缀同时隔离错误后缀,并通过隐式反思回报来优化反思质量。我们在4个智能体任务和7个基于搜索的QA基准上进行了系统评估。结果表明,PivoARL在所有任务的Pass@2/3上均取得显著提升,相比MetaRL平均提升约11.5%。此外,受益于关键回合带来的对比偏好信号,PivoARL在超过80%的任务上持续提升Pass@1。在扫雷环境中,PivoARL相比GiGPO提升超过45%,并且与完全重试方法相比平均减少约42%的交互回合。代码开源在 https://github.com/yuki-younai/PivoARL。

## 1 引言

大型语言模型(LLM)已从静态问答系统发展为能在多轮交互中感知、推理和行动的通用*智能体*(Yao 等人,2023;Shinn 等人,2023;Guo 等人,2025)。这些智能体能够操作模拟家庭环境(Shridhar 等人,2021)、规划多步网页浏览会话(Yao 等人,2022)、进行代码开发(Guo 等人,2026),并解决需要长周期规划和自适应决策的复杂任务。然而,由于高昂的交互成本和稀疏的奖励,训练效率仍是瓶颈(Zhang 等人,2026)。一个根本挑战依然存在:如何从过去的轨迹中有效挖掘经验以促进稳健学习?尽管在长周期智能体任务中具有潜力(Wang 等人,2025),基于经验的强化学习(RL)面临双重挑战(Wang 等人,2026c)。首先,经验利用的精度与效率之间存在权衡:静态库方法(例如 SkillsRL(Xia 等人,2026))难以适应动态任务演化,而动态范式在处理大规模经验时容易受到干扰。其次,信用分配在长周期智能体任务中仍是一个重大挑战。失败轨迹的稀疏最终反馈使得精确定位错误步骤变得困难(Jiang 等人,2026),导致负优势可能被错误地分配给正确的前缀决策。这会削弱有用经验的学习,并可能导致训练不稳定甚至能力退化(Li 等人,2026;Shi 等人,2026a)。

![图1:关键感知自我反馈重试(PivoARL)框架。智能体通过结构化自我反思识别关键错误,从关键状态开始重试并重用正确前缀,通过关键隔离的跨回合信用分配更新LLM。](图1)

在本研究中,我们提出 PivoARL,一种通用的智能体强化学习范式。该范式通过结构化反思机制识别导致任务失败的关键回合,并从这个特定状态启动有针对性的局部重试,从而最大化重用正确的历史前缀。为了优化学习过程,我们设计了跨回合前缀信用分配机制和隐式反思回报。这些组件使智能体能够从失败轨迹中深度挖掘有效信号,并最终将其转化为反思引导的高质量成功经验。从信息增益角度,我们进一步证明关键重试将有用经验信号集中在错误边界附近,有效缓解了全局反思中常见的信号稀释问题。实验结果表明,PivoARL在四个智能体环境和七个基于搜索的QA基准上均带来一致提升。在智能体任务上,PivoARL在Pass@1/2/3上相比GiGPO分别提升约10.3%、15.3%和14.7%;在基于搜索的QA任务上,相比GRPO提升约20.5%。同时,得益于关键重试的高效重用机制,PivoARL相比MetaRL减少了约44%的交互成本。我们进一步进行了详细的消融研究以量化每个组件的贡献,并分析了PivoARL在测试时和训练时的扩展行为。我们的贡献如下:

- **关键感知重试**。我们提出一种自我反馈重试机制,识别失败轨迹中最早的错误回合并从该关键状态重启,重用正确前缀以减少冗余交互并提高利用效率。
- **信息增益理论**。我们从信息增益角度分析经验学习,表明全局反思或检索经验在长轨迹中容易被稀释,而关键重试将有用指导集中在关键错误边界附近。
- **最先进的性能**。PivoARL在四个智能体环境和七个基于搜索的QA基准上提升了Pass@k,相比默认RL基线平均获得约16%的相对提升,同时展现出更强的测试时和训练时扩展能力。

## 2 预备知识

### 2.1 符号与问题设置

我们将LLM智能体交互建模为马尔可夫决策过程(Jiang 等人,2026)\(\mathcal{M}=(\mathcal{S},\mathcal{A},P,R)\)。给定一个任务 \(x \sim D\),智能体运行 \(T\) 步:在第 \(t\) 步,观察状态 \(\bm{s}_t \in \mathcal{S}\),通过策略 \(\pi_\theta(\bm{a}_t \mid \bm{s}_t)\) 生成动作 \(\bm{a}_t \in \mathcal{V}^n\)。环境提供标量奖励 \(r_t \in \mathbb{R}\),观测 \(o_t\),并转移到 \(\bm{s}_{t+1}\)。对于每个轨迹 \(\bm{\tau} = \{(\bm{s}_0, \bm{a}_0, \bm{r}_0), \ldots, (\bm{s}_{T-1}, \bm{a}_{T-1}, \bm{r}_{T-1})\}\),我们使用总回报 \(R(\tau) = \sum_{t=0}^{T-1} r_t\) 作为回合级奖励。

#### 带有经验循环的自我反馈。

除了标量奖励,历史轨迹 \(\bm{\tau}_0\) 在每一步提供丰富的反馈(例如,错误消息,状态描述),揭示了智能体*为何*成功或失败(Xiao 等人,2026)。给定初始轨迹中的交互上下文 \(\bm{c} = \sum_{t}^{T-1} \{ (a_t, o_t) \}\),智能体构建增强上下文以提取过去的经验信息:
\[
\textbf{remark} = \pi_\theta \big( \cdot \mid x, \; \{ \bm{c} \} \big) \tag{1}
\]
其中 \(\textbf{remark}\) 代表从先前尝试中获得的经验,用于下一次尝试(Shi 等人,2026b),作为新的增强任务提示 \(\bm{x}^+\)。这使得模型能够利用过去的经验来优化随后的尝试。

### 2.2 智能体强化学习

智能体强化学习(ARL)通常采用策略梯度方法(Schulman 等人,2017)来优化智能体策略 \(\pi_\theta\)。我们将智能体RL训练目标表述为:
\[
\max_{\pi_\theta} \mathbb{E}_{x \sim \mathcal{D}, \mathcal{\tau} \sim \pi_\theta(\cdot|x)} \left[ \sum_{t=0}^{T-1} A_t \right] - \beta \mathbb{D}_{\text{KL}} \left[ \pi_\theta(\cdot) \| \pi_{\text{ref}}(\cdot) \right] \tag{2}
\]
其中 \(\pi_{\text{ref}}\) 是参考LLM,\(\mathbb{D}_{\text{KL}}\) 和 \(\beta\) 分别表示KL散度及其系数。\(A_t\) 是步级优势,通常从组内的步级和回合级奖励计算得出。

## 3 方法

### 3.1 概述:PivoARL框架

![图2:MetaRL与关键感知自我反馈重试RL的对比。](图2)

先前的跨回合范式(Jiang 等人,2026)将每次重试视为从 \(s_0\) 开始的完全重启,丢弃了失败轨迹的正确前缀。我们提出**关键感知自我反馈**,重用正确前缀并从关键错误处重启。

#### 关键重试训练框架。

在PivoARL的训练中,每个试验由智能体顺序生成的 \(N\) 个回合组成:
\[
\mathcal{T} = (\tau^{(0)}, \tau^{(1)}, \dots, \tau^{(N-1)}), \quad n \in [0, N-1] \tag{3}
\]
如果 \(\tau^n\) 成功,则 rollout 过程在 \(n\) 终止。否则,智能体启动新的回合 \(\tau^{(n+1)}\)。与依赖过去经验进行完全重启的先前工作不同,我们的智能体进行反思以识别关键决策点,从而实现轨迹的部分重用。

#### 结构化反思与关键重试。

在长度为 \(T^{(n)}\) 回合的失败回合 \(\tau^{(n)}\) 之后,智能体生成一个结构化反思,包含文本备注和一个**关键回合索引** \(k^{(n)} \in [0, T^{(n)}-1]\),标识最早的错误回合。备注提供经验指导,在重试时注入原始状态:
\[
\Delta_{\text{reflect}}^{(n)} \sim \pi_\theta \bigl( \cdot \mid x, \bm{c}^n \bigr) = \bigl( k^{(n)}; \text{remark}^{(n)} \bigr). \tag{4}
\]
给定关键回合 \(k^{(n)}\),下一个回合 \(\tau^{(n+1)}\) 重用 \(\tau^{(n)}\) 的正确前缀,仅从 \(k^{(n)}\) 开始重新生成动作:
\[
\tau^{(n+1)} = \bigl( \underbrace{s_0^{(n)}, a_0^{(n)}, \ldots, s_{k^*}^{(n)}}_{\text{重用前缀}}, \underbrace{a_{k^*}^{(n+1)}, s_{k^*+1}^{(n+1)}, \ldots, a_{T^{(n+1)}-1}^{(n+1)}}_{\text{从 } k^*(\text{其中 } k^* = k^{(n)}) \text{ 重新生成}} \bigr). \tag{5}
\]
其中 \(T^{(n+1)}\) 是新回合的长度。这减少了每次重试的生成开销,从 \(T^{(n+1)}\) 个 token 降到 \(T^{(n+1)} - k^{(n)}\) 个 token,同时保留了正确的决策历史作为上下文。

### 3.2 关键感知信用分配

![图3:经验指导的信息增益(IG)分析。(a) 每轮IG密度:我们的方法将IG集中在高信号回合。(b) 信号质量:峰值IG和高IG回合的百分比。(c) 随时间累积IG:显示我们的方法在回合k处有一个特征性跳跃。](图3)

#### 具有关键隔离的信用分配。

为了在回合内和回合间传播信用,我们将信用回报 \(G_t^{(n)}\) 分解为回合内回报 \(g_t^{(n)}\) 和回合间回报:
\[
g_t^{(n)} = \sum_{l=t}^{T^{(n)}-1} \gamma_{\text{step}}^{l-t} \, r_l^{(n)}, \qquad G_t^{(n)} = g_t^{(n)} + \sum_{m=n+1}^{N-1} \gamma_{\text{traj}}^{m-n} \, g_0^{(m)}. \tag{6}
\]
其中 \(\gamma_{\text{step}}\) 和 \(\gamma_{\text{traj}}\) 分别是回合内和回合间的折扣因子。然而,在关键设置中直接应用此方法会让错误步骤(\(t \geq k^{*(n)}\))从成功重试中获得正回报,奖励了导致失败的错误。我们引入关键信用隔离,在 \(k^{*(n)}\) 处划分步骤:
\[
G_t^{(n)} = \begin{cases}
g_t^{(n)} + \gamma_{\text{traj}} \cdot G_0^{(n+1)}, & t < k^{*(n)}, \\
g_t^{(n)}, & t \geq k^{*(n)}.
\end{cases} \tag{7}
\]
对于重用前缀 \(t < k^{*(n)}\),他们因提供成功的基础而获得来自成功重试的正回报。对于错误后缀 \(t \geq k^{*(n)}\),优势仅基于当前回合的回报计算,将他们的贡献与未来的成功隔离。这种结构化隔离防止由于后期成功而错误地确认失败决策,确保错误步骤受到正确的负惩罚。

#### 隐式反思回报。

为了提高反思质量,我们引入一个辅助奖励项,训练智能体从全局视角评估其反思,而非仅依赖局部结果。我们定义隐式反思回报 \(R_{\text{impl}}\),惩罚不准确的反思:
\[
R_{\text{impl}}^{(n)} = - \mathbb{I}(\text{错误识别错误}) \cdot \lambda_{\text{incorrect}} \cdot \frac{1}{R_{\text{total}}^{(n)} + \epsilon}, \tag{8}
\]
其中 \(\mathbb{I}(\cdot)\) 是指示函数。识别错误包括:(1)关键回合 \(k^{(n)}\) 在真正错误之前,导致前缀包含错误逻辑;(2)关键回合在真正错误之后,未能重用正确的决策前缀;(3)虽然关键回合识别正确,但未能在指定关键状态下实现成功重试。由于最终成功是关键感知经验学习的核心信号,我们应用更强的正则化来防止错误的关键定位:
\[
\mathcal{L}_{\text{ref}} = \mathbb{E}_{\tau \in \mathcal{T}} \left[ - \alpha \cdot R_{\text{impl}}^{(n)} \right], \tag{9}
\]
其中 \(\alpha\) 是反思损失系数。

### 3.3 信息增益分析

在本节中,我们提供形式化信息增益(IG)分析,解释为什么关键感知重试优于状态无关的全局经验利用。

#### 信息增益的效率稀释。

考虑一个长度为 \(T\) 回合的轨迹和外部经验指导 \(e\)(例如,反思或检索到的演示)。在回合 \(t\) 处,由 \(e\) 提供的信息增益定义为:
\[
\mathrm{IG}(e, t) = \mathbb{E}_{a_t^* \sim \pi_{\theta}} \left[ \log \frac{\pi_{\theta}(a_t^* \mid s_t, e)}{\pi_{\theta}(a_t^* \mid s_t)} \right], \tag{10}
\]
其中 \(a_t^*\) 是回合 \(t\) 处导致成功的关键动作。让 \(\rho(e) = \frac{1}{T} |\{t: \mathrm{IG}(e, t) > \delta\}|\) 表示指导 \(e\) 的有效信号密度。对于状态无关的指导——无论是跨所有回合重用的固定反思 \(\Delta\),还是从有限记忆库中检索到的经验 \(e^*\)——每轮IG满足 \(\mathrm{IG}(e, t) = O(1/T)\),从而当 \(T\) 增长时 \(\rho(e) \to 0\)。证明和详细的案例分析在附录 E.1 中提供。

#### 通过关键重试集中信息增益。

通过识别错误边界 \(k^*\) 并在关键回合应用特定状态指导,我们的机制集中了信息增益:
\[
\mathrm{IG}(e, t) \approx \begin{cases}
\mathrm{IG}_{\text{high}}, & t \geq k^*, \\
0, & t < k^*.
\end{cases} \tag{11}
\]
设 \(\mathrm{IG}(e, t) > \delta\) 的回合集合为 \(S\)。对于状态无关经验,我们有 \(|S| = O(1)\),因此 \(\rho(e) \to 0\)。对于关键感知经验,\(|S| = T - k^* = O(1)\),从而 \(\rho(e) = \Omega(1)\)。这确保经验信号集中在最关键的决策点,缓解了全局方法中常见的长轨迹稀释问题。取对数并使用 \(\log(1+x) \approx x\) 对于小 \(x\):
\[
\mathrm{IG}(\Delta, t) \approx \frac{c}{T \cdot \pi_{\theta}(a_t^* \mid s_t)} = O(1/T) \quad \forall t. \tag{17}
\]
随着 \(T\) 增长,\(\mathrm{IG}(\Delta, t) < \delta\) 对于所有 \(t\) 成立,因此 \(\rho(\Delta) \to 0\)。

**跨试验噪声积累。**考虑重试 \(n\) 时积累的上下文:
\[
H^{(n)} = (\tau^{(0)}, \Delta^{(0)}...
\]
(后续内容涉及具体证明案例,因篇幅限制未完全展示,但翻译遵循原文数学和逻辑结构。)

相似文章

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

Self-Distilled Agentic Reinforcement Learning

Hugging Face Daily Papers

SDAR通过将自蒸馏与Sigmoid门控相结合,有选择地增强正向令牌级引导,同时减轻负面教师拒绝的影响,从而增强多轮智能体训练,在多个基准测试中相较于GRPO取得了显著提升。

自我审查强化学习(SRRL):跨回合记忆与策略蒸馏

arXiv cs.LG

本文介绍了一种名为自我审查强化学习(SRRL)的训练框架,该框架在强化学习回合中嵌入自我审查步骤,利用跨回合记忆和选择性策略蒸馏,将稀疏的环境反馈转化为行为改进。在GSM8K上的评估表明,SRRL在Qwen 3-4B和OLMo-3-7B模型上均优于使用GRPO的标准RLVR方法。