@dair_ai: 新论文:让LLM智能体获得经验,同时改进权重并保持可读性。智能体经验…

X AI KOLs Following 论文

摘要

JERP 提出了一种方法,让LLM智能体从相同的交互轨迹中联合学习可解释的自然语言规则并更新策略参数,在AlfWorld和WebShop上提升了性能,同时保持了可检查性。

关于让LLM智能体获得经验的新论文,该经验同时改善权重并保持可读性。 智能体经验方法分为两大阵营。外化的自然语言规则保持可解释性,但会与策略脱节。参数更新具有泛化能力,但在稀疏奖励下只能做出微弱的局部修正。 JERP 从同一轨迹流中同时运行两者,在决策时检索与任务相关的规则,并在每个回合结束后,优化策略的同时,根据参考成功轨迹修订规则池。 其概念上的收获是吸收动态。稳定且反复有用的行为会随着时间的推移内化到权重中,而规则池则负责处理新的局部修正。可解释性与泛化性的平衡变成了一个可调节的旋钮,而非架构选择。 为什么这很重要? 团队希望智能体既能改进又能保持可检查性。这是一个从相同轨迹中同时获得两者的简洁模板。在AlfWorld和WebShop上取得了收益。 Paper: https://arxiv.org/abs/2606.27136 在我们的学院学习构建有效的AI智能体:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/06/26 20:16

关于为LLM智能体提供既改进权重又保持可读性的经验的新论文。

智能体经验方法分为两大阵营。外部化的自然语言规则保持可解释性,但会与策略脱节。参数更新泛化能力强,但在稀疏奖励下只能做微弱的局部修正。

JERP 从同一轨迹流出发,在决策时检索任务相关规则,并在每个回合结束后,既优化策略,又通过与参考成功轨迹对比来修订规则池。

其概念上的收获在于吸收动态。稳定且反复有用的行为会随着时间被内化到权重中,而规则池则处理新的局部修正。可解释性与泛化之间的平衡从架构选择变成了一个可调旋钮。

它为什么重要?

团队希望智能体既能改进又能保持可检查性。这是一个从同一轨迹中获得两者的干净模板。在 AlfWorld 和 WebShop 上取得了增益。

论文: https://arxiv.org/abs/2606.27136

在我们的学院学习如何构建高效 AI 智能体: https://academy.dair.ai


大语言模型智能体的经验规则与策略联合学习

来源: https://arxiv.org/html/2606.27136

摘要

对于在多步交互环境中的 LLM 智能体,一个关键挑战是有效利用累积的交互经验。现有工作通常将这种经验的两种用途分开:将其作为自然语言规则保留在模型外部以便后续提示,或使用轨迹和反馈来更新模型参数。前者易于解释,但可能随着策略演化而脱节;后者更广泛地改进了策略,但在稀疏奖励设置下对局部错误的修正有限。我们提出了大语言模型智能体的经验规则与策略联合学习(JERP),该方法从相同的交互轨迹中更新长期经验规则池和策略。在决策时,JERP 检索任务相关规则,并将其与交互历史一起作为智能体的条件。在每个回合结束后,它使用收集到的轨迹来优化策略,并通过将当前展开与参考成功轨迹进行比较来修订规则池。这种耦合使得规则池与演化的策略保持一致,同时允许稳定且有效的行为逐渐被吸收到模型自身中。在 AlfWorld 和 WebShop 上的实验表明,JERP 在复杂交互任务的决策性能上取得了持续的提升。

I. 引言

大语言模型(LLM)已成为通用智能体的自然基础,因为它们结合了广泛的世界知识与强大的上下文学习和语言推理能力[14 (https://arxiv.org/html/2606.27136#bib.bib15)]。然而,在网页导航[10 (https://arxiv.org/html/2606.27136#bib.bib83)]、具身交互[30 (https://arxiv.org/html/2606.27136#bib.bib12),8 (https://arxiv.org/html/2606.27136#bib.bib13)]和工具使用[27 (https://arxiv.org/html/2606.27136#bib.bib32)]等场景中,解决任务很少仅仅依赖于产生一个正确的响应。智能体通常需要探索、从错误中恢复,并在多步过程中调整策略才能成功。在这种情况下,一个重要的问题是智能体如何在交互过程中积累经验,并利用这些经验在未来任务中做出更好的决策[6 (https://arxiv.org/html/2606.27136#bib.bib18),3 (https://arxiv.org/html/2606.27136#bib.bib17)]。

现有方法大多以两种方式之一利用交互经验。一种工作将过去的经验转化为可重用的自然语言知识,包括反思文本[19 (https://arxiv.org/html/2606.27136#bib.bib19)]、指导规则[31 (https://arxiv.org/html/2606.27136#bib.bib20),5 (https://arxiv.org/html/2606.27136#bib.bib44)]和操作手册[2 (https://arxiv.org/html/2606.27136#bib.bib45)]。在这些方法中,经验被外部化为一种可以存储、检索和修订的形式,然后作为额外上下文反馈给智能体。另一种工作则直接使用轨迹和环境反馈来更新模型参数,旨在改进智能体在未来任务中的策略[3 (https://arxiv.org/html/2606.27136#bib.bib17)]。

经验的这两种用途各有其局限性。检索到的规则可以快速解决重复出现的局部错误,通过提醒智能体任务前提条件或纠正持续的动作偏差[19 (https://arxiv.org/html/2606.27136#bib.bib19),31 (https://arxiv.org/html/2606.27136#bib.bib20),5 (https://arxiv.org/html/2606.27136#bib.bib44),2 (https://arxiv.org/html/2606.27136#bib.bib45),9 (https://arxiv.org/html/2606.27136#bib.bib46)]。但规则自身不会执行:它们只有在当前模型能够正确理解和应用时才有帮助。当策略在训练过程中变化时,规则也可能变得陈旧,曾经有用的规则可能逐渐失去价值,甚至产生误导[26 (https://arxiv.org/html/2606.27136#bib.bib63)]。参数更新可以更全局地改善行为,但在复杂交互任务中反馈通常很稀疏。因此,一些局部但重要的错误可能无法及时暴露以得到及时和有针对性的修正[3 (https://arxiv.org/html/2606.27136#bib.bib17),4 (https://arxiv.org/html/2606.27136#bib.bib59)]。

因此,我们研究是否可以用相同的交互数据同时支持显式规则更新和策略优化。我们提出了大语言模型智能体的经验规则与策略联合学习(JERP),它维护一个动态更新的长期经验规则池,并在每个回合中将其与交互历史一起作为决策上下文。当回合结束时,生成的轨迹被用于两个目的:优化模型参数,以及通过将当前行为与参考成功轨迹比较来更新规则池。这使得规则池能够与策略共同演化,同时逐渐将稳定且反复验证的行为吸收到模型内部。

参见图示(a)提示优化范式 参见图示(b)模型参数优化范式 参见图示(c)JERP范式

图1: JERP 与两种基本范式的比较。

II. 相关工作

II-A 通过提示工程重用经验

重用交互经验的一种常见方式是将其存储在模型外部,并在后续回合中作为上下文反馈。一些方法在试错后保留反馈或中间摘要。例如,Reflexion[19 (https://arxiv.org/html/2606.27136#bib.bib19)]将失败后的自然语言反思写入情节记忆,以指导未来尝试。Generative Agents[13 (https://arxiv.org/html/2606.27136#bib.bib36)]、MemoryBank[33 (https://arxiv.org/html/2606.27136#bib.bib56)]和MemGPT[12 (https://arxiv.org/html/2606.27136#bib.bib84)]研究了如何在更长时间跨度内保留、维护和检索此类记忆。其他研究将交互经验提炼为可重用的技能、规则或手册。例如,Voyager[24 (https://arxiv.org/html/2606.27136#bib.bib57)]通过不断扩大的代码技能库积累经验并在任务间迁移。ExpeL[31 (https://arxiv.org/html/2606.27136#bib.bib20)]、AutoGuide[5 (https://arxiv.org/html/2606.27136#bib.bib44)]和AutoManual[2 (https://arxiv.org/html/2606.27136#bib.bib45)]将多任务试错经验提炼为可重用的自然语言指令,用于后续任务中的上下文指导。

除了反思式记忆,先前工作还从历史交互中归纳了工具使用模式[16 (https://arxiv.org/html/2606.27136#bib.bib35)]、工作流程[25 (https://arxiv.org/html/2606.27136#bib.bib85)]和可重用技能[32 (https://arxiv.org/html/2606.27136#bib.bib86)],并通过知识库[22 (https://arxiv.org/html/2606.27136#bib.bib87)]、反思记忆[21 (https://arxiv.org/html/2606.27136#bib.bib88)]和经验回放[9 (https://arxiv.org/html/2606.27136#bib.bib46)]探索了经验知识的长期使用。这些研究表明,当经验以可重用形式组织时,存储的经验可以改善后续决策。然而,它们大多将规则重用和参数学习视为独立过程,未解答当使用规则的策略也在变化时,规则池应如何维护。

II-B 通过强化学习微调进行 LLM 策略优化

另一条工作线直接使用交互经验更新策略,将轨迹、反馈或偏好转化为优化信号。通过强化学习微调和紧密相关的偏好优化方法,这些信号被用于更新模型,使改进的行为编码在其参数中[3 (https://arxiv.org/html/2606.27136#bib.bib17)]。早期的代表性工作如 InstructGPT[11 (https://arxiv.org/html/2606.27136#bib.bib21)]采用了包括监督微调、奖励模型训练和 PPO 优化的三阶段流程,证明了来自人类反馈的强化学习可以显著改善指令遵循和输出质量。

后续研究探索了如何更稳定高效地对 LLM 进行强化学习微调[23 (https://arxiv.org/html/2606.27136#bib.bib47)]。除了基于 PPO 的方法,GRPO[17 (https://arxiv.org/html/2606.27136#bib.bib50)]通过比较同一组内样本估计优势,减少了对单独价值模型和相关内存开销的需求。DPO[15 (https://arxiv.org/html/2606.27136#bib.bib24)]将来自人类反馈的强化学习重写为更简单的直接偏好优化目标。DMPO[18 (https://arxiv.org/html/2606.27136#bib.bib89)]将偏好优化扩展到多轮智能体任务。对于长视界交互型智能体任务,GiGPO[4 (https://arxiv.org/html/2606.27136#bib.bib59)]提出了一种层次化组策略优化方法,结合回合级和步骤级相对优势估计,以缓解稀疏奖励和细粒度信用分配问题。这些方法通过参数更新改进了策略,但它们不维护一个可以检查、修订并在后续交互中重用的显式规则池。

III. 问题定义与基本范式

我们考虑交互任务,其中 LLM 智能体必须在多步过程中从部分观测中选择动作。除了产生动作的策略参数外,智能体还使用从提示中检索到的外部经验规则。本节定义了由此产生的规则增强交互过程,并介绍了 JERP 两个部分采用的两种基本范式,即基于提示的规则学习和组相对策略优化。

III-A 部分可观测马尔可夫决策过程

令 D\mathcal{D} 表示任务实例空间,每个实例 d∈Dd\in\mathcal{D} 从分布 p(d)p\left(d\right) 中抽取。对于固定的任务实例,智能体与环境交互,直到任务终止或步骤预算耗尽。由于智能体接收的是观测而非完整环境状态,我们将交互建模为部分可观测马尔可夫决策过程 (POMDP),写作

E=(S,A,O,P,Ω,R,γ,T),\mathcal{E}=\left(\mathcal{S},\mathcal{A},\mathcal{O},P,\Omega,R,\gamma,T\right),(1)其中 S\mathcal{S}、A\mathcal{A} 和 O\mathcal{O} 分别为状态、动作和观测空间;P(st+1∣st,at)P\left(s_{t+1}\mid s_{t},a_{t}\right) 和 Ω(ot+1∣st+1,at)\Omega\left(o_{t+1}\mid s_{t+1},a_{t}\right) 为转移函数和观测函数;R(st,at)R\left(s_{t},a_{t}\right) 为奖励函数;γ∈[0,1)\gamma\in\left[0,1\right) 为折扣因子;T 为最大交互步数。在步 ttt 时,sts_{t} 是隐藏的环境状态,oto_{t} 是智能体可观测到的信息,ata_{t} 是执行的动作。

由于不能直接观测到真实状态,策略必须基于交互历史而非 sts_{t} 进行条件化。我们将步 t 时的历史写为

ht=(o0,a0,o1,…,at−1,ot),h_{t}=\left(o_{0},a_{0},o_{1},\dots,a_{t-1},o_{t}\right),(2)其中 o0o_{0} 包含初始任务描述。

JERP 与标准 POMDP 策略的不同之处在于,提示中还包含可重用的经验。对于任务实例 ddd,我们维护一个长期经验规则池 K(d){\mathcal{K}}\left(d\right),并用 K={K(d)}\mathcal{K}=\{{\mathcal{K}}\left(d\right)\} 表示此类池的集合。在回合开始前,从 K(d){\mathcal{K}}\left(d\right) 中选择一个大小受控的子集作为工作规则集 K~(d)\widetilde{\mathcal{K}}\left(d\right)。因此,策略并非仅基于历史动作。其决策上下文结合了任务、观测到的交互历史和当前检索到的规则。

在步 t 时的输入提示为

xt=(d,ht,K~(d))。x_{t}=\left(d,h_{t},\widetilde{\mathcal{K}}\left(d\right)\right)。(3)参数化策略随后通过下式采样动作

at∼πθ(⋅∣xt)。a_{t}\sim\pi_{\theta}\left(\cdot\mid x_{t}\right)。(4)执行 ata_{t} 后,环境返回奖励 rt=R(st,at)r_{t}=R\left(s_{t},a_{t}\right)、下一观测 ot+1o_{t+1} 和终止指示符 zt+1∈{0,1}z_{t+1}\in\{0,1\}。对于完整轨迹 τ\tau,折扣回报为

G(τ)=∑t=0T−1γtrt。G\left(\tau\right)=\sum_{t=0}^{T-1}\gamma^{t}r_{t}。(5)

因此学习问题不仅仅是找到更好的策略参数。规则池也会影响轨迹分布,因为它们在每个动作之前进入提示。我们将训练目标定义为对 θ\theta 和 K\mathcal{K} 两者

J(θ,K)=Ed∼p(d)[Eτ∼pθ(τ∣d,K)[G(τ)]],J\left(\theta,\mathcal{K}\right)=\mathbb{E}_{d\sim p\left(d\right)}\Bigl[\mathbb{E}_{\tau\sim p_{\theta}\left(\tau\mid d,\mathcal{K}\right)}\bigl[G\left(\tau\right)\bigr]\Bigr],(6)其中 pθ(τ∣d,K)p_{\theta}\left(\tau\mid d,\mathcal{K}\right) 是在从当前规则池中选择工作规则时由 πθ\pi_{\theta} 诱导的轨迹分布。这种表示使耦合关系显式化。改变 θ\theta 会改变智能体解释提示的方式,而改变 K\mathcal{K} 会改变相同策略所依据的提示。

III-B 基于提示的经验规则学习

使用经验的一种方式是将其保留在模型外部。给定来自相关任务的轨迹样本 {e1,e2,…,eN}\left\{e_{1},e_{2},\dots,e_{N}\right\},先前的基于提示的方法要求 LLM 总结可重用的行为指导,并将结果存储为自然语言规则。抽象地,

K=ExtractRules({ei}i=1N)。\mathcal{K}=\operatorname{ExtractRules}\bigl(\{e_{i}\}_{i=1}^{N}\bigr)。(7)

这种范式之所以有用,是因为存储的经验保持可检查和可编辑,并且可以在不改变模型参数的情况下进行修订。其局限性对于我们的设置同样重要。规则集只有通过当前策略的阅读和应用能力才有效。如果策略在训练过程中演化而规则保持静态,两者可能变得不匹配。这促使将规则维护作为训练过程的一部分,而

相似文章

重访DAgger:大语言模型智能体时代的新探索

Hugging Face Daily Papers

本文重新审视了数据集聚合(DAgger)方法在训练长周期大语言模型智能体中的应用,证明了在回合级别上对教师与学生的策略进行插值能够有效缓解协变量偏移,并在SWE-bench Verified等软件工程基准测试中优于现有方法。