EDGE:用于智能体强化学习中引导探索的经验蒸馏

arXiv cs.CL 论文

摘要

EDGE 提出一种框架,通过经验蒸馏引导智能体强化学习中的探索,提升了在 ALFWorld 和 WebShop 等任务上的表现。

arXiv:2608.21946v1 公告类型:新 摘要:基于结果目标的强化学习(如 GRPO)使基于 LLM 的智能体能够解决复杂的长期任务,但交互轨迹中嵌入的可复用探索模式在一次策略更新后往往被丢弃。现有经验增强方法在推理时检索历史指导,但它们在应用经验时未考虑策略的演变能力,并创建了对外部检索的持久依赖。我们提出 EDGE(体验蒸馏引导探索),一个将检索到的经验视为临时训练时脚手架的框架,并逐步将其益处内化到参数化策略中。具体而言,EDGE 将每个 rollout 组划分为有经验条件和无经验轨迹,以估计并仅接纳正向边际收益,无需额外采样,然后通过反向 KL 目标在自身经验支持上将诱导行为蒸馏到基础策略中。一个协同进化的经验库进一步从新兴故障模式中合成指导,并在策略演变时修剪过时条目。在 ALFWorld 和 WebShop 上,EDGE 在 7B 规模下相比 GRPO 提高了 8.3 和 12.5 个百分点,并在推理时移除外部经验时保留了 96.0% 的脚手架性能。代码可在 https://github.com/xvolcano02/EDGE 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:22

# EDGE:面向智能体强化学习中引导探索的经验蒸馏  
来源:https://arxiv.org/html/2608.21946  
Can Xie所属机构:\[5pt\] 中国科学院大学人工智能学院所属机构:中国科学院自动化研究所  
Yuyi Zhou所属机构:中国科学院自动化研究所所属机构:中国科学院大学前沿交叉科学学院  
Wen Yang所属机构:\[5pt\] 中国科学院大学人工智能学院所属机构:中国科学院自动化研究所  
Ziyi Zhang所属机构:中国科学院自动化研究所所属机构:中国科学院大学前沿交叉科学学院  
Siyao Song, Yingzhuo Deng, Shuo Ren, Jiajun Zhang11footnotemark:1致谢:通讯作者所属机构:\[5pt\] 中国科学院大学人工智能学院所属机构:\[5pt\] 中国科学院大学人工智能学院所属机构:\[5pt\] 中国科学院大学人工智能学院所属机构:中国科学院自动化研究所所属机构:中国科学院自动化研究所所属机构:中国科学院自动化研究所所属机构:中国科学院自动化研究所所属机构:武汉人工智能研究院  
\{xiecan2024,shuo.ren\}@ia.ac.cn, [email protected]  

###### 摘要  
基于结果目标(如GRPO)的强化学习使基于大语言模型的智能体能够解决复杂的长周期任务,但交互轨迹中可复用的探索模式在单次策略更新后往往被大量丢弃。现有的经验增强方法在推理时检索历史指导信息,但其应用方式未考虑策略能力的动态演变,并对外部检索产生持续依赖。我们提出EDGE(面向引导探索的经验蒸馏),该框架将检索到的经验视为临时训练脚手架,并逐步将其效益内化到参数化策略中。具体而言,EDGE将每次展开组划分为经验条件化轨迹与无经验轨迹,无需额外采样即可估计并仅采纳正向边际增益,随后通过学生策略自身经验支持上的逆KL目标将诱导行为蒸馏到基础策略中。一个协同演化的经验库能从新兴故障模式中合成指导信息,并随着策略演进裁剪过时条目。在ALFWorld和WebShop任务中,EDGE在7B规模下相比GRPO分别提升8.3和12.5个成功率百分点,且在推理时移除外部经验后仍能保留96.0%的脚手架性能。代码已在https://github.com/xvolcano02/EDGE公开。  
参见图注图1:EDGE框架概述。\(a\) 经验引导的探索脚手架使用对比展开来估计检索经验的边际增益Δe\\Delta\_{e}。\(b\) 增益门控蒸馏仅在Δe>0\\Delta\_{e}>0时将有益脚手架行为内化到基础策略中。\(c\) 经验库通过故障驱动扩展和基于效用的裁剪与策略协同演化,最终形成部署时无需检索的策略。  

## 1引言  
基于结果目标(如GRPO(24 (https://arxiv.org/html/2608.21946#bib.bib7))的强化学习(RL)已成为基于大语言模型智能体的标准后训练范式,这些智能体通过多轮交互进行推理、规划和行动(38 (https://arxiv.org/html/2608.21946#bib.bib12); 25 (https://arxiv.org/html/2608.21946#bib.bib13); 37 (https://arxiv.org/html/2608.21946#bib.bib5); 26 (https://arxiv.org/html/2608.21946#bib.bib6); 9 (https://arxiv.org/html/2608.21946#bib.bib1); 31 (https://arxiv.org/html/2608.21946#bib.bib2); 11 (https://arxiv.org/html/2608.21946#bib.bib3))。然而当前的智能体强化学习对其自身经验的利用效率低下。单次展开可能包含可复用的模式——有效的任务分解、恢复策略、死胡同规避,但一旦轨迹对策略更新贡献了标量优势值,这些模式就大多被丢弃。因此,智能体必须从头开始重新发现它们,这在稀疏奖励、长周期的环境中(也是智能体强化学习最需要的场景)尤其是一种高昂的失败模式。越来越多的研究通过在推理时用外部经验增强智能体来解决这种低效问题,例如情景反思(25 (https://arxiv.org/html/2608.21946#bib.bib13); 45 (https://arxiv.org/html/2608.21946#bib.bib14))、持久记忆(4 (https://arxiv.org/html/2608.21946#bib.bib17); 8 (https://arxiv.org/html/2608.21946#bib.bib28))或技能库(34 (https://arxiv.org/html/2608.21946#bib.bib18); 13 (https://arxiv.org/html/2608.21946#bib.bib19))。尽管有效,但随着训练进行,这些方法暴露出两个结构性局限:  
经验效用本质上依赖于策略:对训练不足策略的加速指导,一旦相应行为被内化,就可能变得冗余——甚至有害,但大多数方法无条件地应用经验或通过静态启发式方法进行过滤。此外,如果智能体在部署时必须检索经验,其部分能力就存在于上下文窗口而非模型参数中,导致持续的标记开销和对检索噪声的敏感性。111这些并非假设性问题:在我们的实验中,朴素的记忆增强(如EvolveR, GRPO+Mem0)导致性能远低于原始GRPO,证实无过滤的经验注入是不可靠的。  

这些观察表明,智能体强化学习中的经验复用应被视为动态生命周期过程而非静态检索机制。外部经验可先作为临时训练时脚手架引导探索,然后通过将其有效行为效应巩固到无经验策略中来加以利用,最终当其效用消失时退役。在此视角下,经验复用成为一个脚手架到参数的学习问题,而非检索与提示的增强问题。  

本文将这一思想实例化为EDGE(面向引导探索的经验蒸馏),该框架将检索到的经验从持久的推理时记忆转化为动态验证的训练时脚手架。EDGE通过三个核心机制使用在线边际增益估计来决定经验何时应引导探索、蒸馏到策略中或随策略演进退役。首先,**经验引导的探索脚手架**将每次GRPO展开组划分为经验条件化和无经验轨迹,在无需额外环境采样的情况下估计检索经验的边际增益,仅保留正增益实例。其次,**增益门控的特权蒸馏**作为利用步骤,通过在学生策略自身经验支持上计算的逆KL散度,将特权上下文诱导的行为转移到标准策略,仅在估计增益为正时激活以避免负迁移。最后,**经验库演化与管理**使经验库在整个训练过程中与策略协同演进:新经验通过故障模式分析合成,而过时条目则基于跟踪的效用进行裁剪,使脚手架与智能体不断发展的能力保持对齐。  

在ALFWorld(26 (https://arxiv.org/html/2608.21946#bib.bib6))和WebShop(37 (https://arxiv.org/html/2608.21946#bib.bib5))上,EDGE持续优于无技能RL和先前的经验增强方法,在探索密集型子任务(如加热、冷却、Pick2)上获得最大增益。当推理时不提供外部经验时,EDGE保留了96.0%的脚手架性能——而SkillRL为82.9%,EMPO2为92.3%——这证实了有效的探索先验已被吸收到参数化策略中。  

我们的贡献如下:  
- 我们识别了经验增强智能体强化学习的两种失败模式——策略依赖的经验效用和持续的推理时检索依赖——并将经验复用重构为动态的脚手架到参数转换。  
- 我们引入了经验引导的探索脚手架,通过划分展开组来估计每个检索经验在当前策略下的边际价值,且无需额外的环境采样。  
- 我们提出了增益门控的特权蒸馏,通过学生策略自身经验支持上的逆KL将脚手架诱导行为内化,由估计的边际增益门控以防止负迁移,以及一个协同演化的经验库,根据策略演进的需求进行扩展和裁剪。  
- 在ALFWorld和WebShop上的实验证明,EDGE在提升任务性能和训练效率的同时,实现了无需外部经验检索的稳健部署。  

## 2预备知识  
我们将基于大语言模型智能体的多轮决策过程形式化为部分可观测马尔可夫决策过程(POMDP)(12 (https://arxiv.org/html/2608.21946#bib.bib9))⟨S,A,O,T,R⟩\\langle\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{O\},\\mathcal\{T\},\\mathcal\{R\}\\rangle。观测空间O\\mathcal\{O\}由环境发出的自然语言字符串组成,动作空间A\\mathcal\{A\}包括策略πθ\\pi\_{\\theta}自回归生成的标记序列。给定任务指令x,智能体通过一系列轮次与环境交互:在步骤t,它接收观测ot∈Oo\_{t}\\in\\mathcal\{O\}并根据 at∼πθ(⋅∣x,ht,ot), a\_{t}\\sim\\pi\_{\\theta}(\\cdot\\mid x,h\_{t},o\_{t}) (1) 产生动作at∈A a\_{t}\\in\\mathcal\{A\},其中ht=(o1,a1,...,ot−1,at−1) h\_{t}=(o\_{1},a\_{1},\\ldots,o\_{t\-1},a\_{t\-1})是交互历史。一个情节在任务完成或达到最大步骤限制时终止,产生稀疏二元奖励R⁡(τ)∈{0,1} R(\\tau)\\in\\\{0,1\\\}和完整轨迹 τ=(x,o1,a1,...,oT,aT,R⁡(τ)). \\tau=(x,\\;o\_{1},a\_{1},\\;\\ldots,\\;o\_{T},a\_{T},\\;R(\\tau)) (2)。  

我们基于组相对策略优化(GRPO)(24 (https://arxiv.org/html/2608.21946#bib.bib7))构建,该算法为每个任务采样一组G条平行轨迹{τi}i=1G \\\{\\tau\_{i\}\\\}\_{i=1\}^\{G\},并计算组归一化优势值: Âi=R⁡(τi)−mean⁡({R⁡(τj)}j=1G)std⁡({R⁡(τj)}j=1G). \\hat\{A\}\_{i}=\\frac\{R(\\tau\_{i\})\-\\mathrm\{mean\}(\\\{R(\\tau\_{j\})\\\}\_{j=1\}^\{G\})\}\{\\mathrm\{std\}(\\\{R(\\tau\_{j\})\\\}\_{j=1\}^\{G\})\}. (3) 策略通过最大化带KL正则化的裁剪替代目标进行更新: LRL(θ)=−E[1G∑i=1G1|τi|∑t=1|τi|(min(ρi,tÂi, \\displaystyle\\mathcal\{L\}\_{\\text\{RL\}\}(\\theta)=\-\\mathbb\{E\}\\\!\\Bigg\[\\frac\{1\}\{G\}\\sum\_\{i=1\}^\{G\}\\frac\{1\}\{|\\tau\_{i\}|\}\\sum\_\{t=1\}^\{|\\tau\_{i\}|}\Big(\\min\\\!\\big(\\rho\_{i,t\}\\,\\hat\{A\}\_{i\},\\;clip(ρi,t,−ε,+ε)Âi)−βDKL(πθ∥πref)\)\], \\displaystyle\\mathrm\{clip\}(\\rho\_{i,t\},1\\\!\-\\\!\\epsilon,1\\\!\+\\\!\\epsilon)\\,\\hat\{A\}\_{i\}\\big\)\-\\beta\\,D\_{\\mathrm\{KL\}\}(\\pi\_{\\theta\}\\\|\\pi\_{\\text\{ref\}\})\\big\)\\Big\)\\Bigg\], (4) 其中ρi,t=πθ(at∣x,ht,ot)/πθold(at∣x,ht,ot) \\rho\_{i,t}=\\pi\_{\\theta}(a\_{t}\\mid x,h\_{t},o\_{t})\\,/\\,\\pi\_{\\theta\_{\\text\{old\}\}}(a\_{t}\\mid x,h\_{t},o\_{t}) 是重要性采样比率,πref \\pi\_{\\text\{ref\}\}是参考策略,β控制KL惩罚强度。通过对比每组内的结果,GRPO将θ导向成功的动作序列,而无需学习价值函数。然而,在稀疏奖励、部分可观测的环境中,无引导的探索通常产生很少或没有成功轨迹的组,导致优势估计信息不足——这是我们在下一节中要解决的局限性。  

## 3方法:EDGE  
我们提出EDGE(面向引导探索的经验蒸馏),这是一个迭代增强基于大语言模型智能体多轮推理能力的框架(图1 (https://arxiv.org/html/2608.21946#S0.F1))。我们方法的核心是将检索到的外部经验视为临时训练时脚手架,而非静态的推理时提示——后者会扩大上下文窗口并造成持续的检索依赖。智能体首先在特权访问经验的条件下进行探索,然后仅将经验证有益的行为蒸馏到自身参数中,因此部署后的策略无需外部脚手架。  

3.1节 (https://arxiv.org/html/2608.21946#S3.SS1)介绍经验引导的探索脚手架,3.2节 (https://arxiv.org/html/2608.21946#S3.SS2)详述增益门控的特权蒸馏机制,3.3节 (https://arxiv.org/html/2608.21946#S3.SS3)描述经验库演化与管理策略。  

### 3.1经验引导的探索脚手架  
为在典型智能体任务的稀疏奖励、部分可观测环境中提供探索引导,EDGE在标准GRPO展开组内引入了受控的信息不对称。给定任务指令x和经验库E\\mathcal\{E\},我们通过嵌入相似性检索与任务指令和初始环境观测最相关的top-m条经验,并选择得分最高的条目e∈E e\\in\\mathcal\{E\}。回想GRPO为每个任务采样一组G条平行轨迹来估计相对优势(公式(3 (https://arxiv.org/html/2608.21946#S2.E3)))。我们将此组划分为两个相等的子集,而不添加额外展开:  
- •教师展开(TT\\mathcal\{T\}^\{\\mathsf\{T\}\}, G/2条轨迹):基于特权上下文 cT=x⊕ec^\{\\mathsf\{T\}\}=x\\oplus e 条件化,其中⊕表示在统一聊天模板下的连接。  
- •学生展开(TS\\mathcal\{T\}^\{\\mathsf\{S\}\}, G/2条轨迹):仅基于标准上下文 cS=xc^\{\\mathsf\{S\}\}=x 条件化。  

由于两个子集共享相同的策略πθ\\pi\_{\\theta},仅在是否可见检索经验上存在差异,因此任何性能差距都可归因于e提供的信息优势。我们通过瞬时边际增益量化这一差距: Δe=1|TT|∑τ∈TTR⁡(τ)−1|TS|∑τ∈TSR⁡(τ), \\Delta\_{e\}\\;=\\;\\frac\{1\}\{|\\mathcal\{T\}^\{\\mathsf\{T\}\}|\}\\sum\_{\\tau\\in\\mathcal\{T\}^\{\\mathsf\{T\}\}}R(\\tau)\\;\-\\;\\frac\{1\}\{|\\mathcal\{T\}^\{\\mathsf\{S\}\}|\}\\sum\_{\\tau\\in\\mathcal\{T\}^\{\\mathsf\{S\}\}}R(\\tau), (5) 其中R⁡(τ) R(\\tau)是第2节中定义的二元结果奖励。正的Δe\\Delta\_{e}表明该经验提供了超越智能体当前能力的有用指导;非正值表示其冗余或有害。此估计门控蒸馏目标(§3.2 (https://arxiv.org/html/2608.21946#S3.SS2))并驱动经验库更新(§3.3 (https://arxiv.org/html/2608.21946#S3.SS3))。  

除了门控蒸馏,Δe\\Delta\_{e}还控制哪些展开进入RL损失本身。当Δe>0\\Delta\_{e}>0时,优势值(公式(3 (https://arxiv.org/html/2608.21946#S2.E3)))在所有G条轨迹上计算。因此,合并的基线反映了在无经验指导下可达到的性能水平。

相似文章

从动作引导中学习智能体策略

arXiv cs.CL

本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。

通过经验驱动的自适应引导实现代理工具的鲁棒使用

arXiv cs.AI

本文介绍了ExpG,一种构建和优化自适应引导的机制,该机制捕捉每个工具的能力边界和最佳实践,使代理能够在多样化的运行时条件下更鲁棒地使用工具。实验表明,在工具选择、工具调用和响应生成方面取得了持续改进,使较小的代理能够超越未使用ExpG的较大代理。

基于智能体经验的高效样本学习

Hugging Face Daily Papers

提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。