重新思考自我进化语言模型智能体中的经验利用

arXiv cs.CL 论文

摘要

本文介绍了 ExpWeaver 框架,该框架优化了自我进化语言模型智能体在运行时决策过程中如何利用过往经验。研究表明,基于推理不确定性选择性调用经验,能在多种环境和模型中提升性能。

arXiv:2605.07164v1 公告类型:新论文 摘要:自我进化智能体通过积累和重用过往交互中的经验来不断改进。现有工作主要集中在经验的构建、表示和更新上,而较少关注在运行时决策过程中应如何使用这些经验。因此,大多数智能体依赖于僵化的使用策略,要么仅在初始化时注入经验,要么在每一步都注入经验,而没有考虑当前决策是否需要这些经验。本文将经验利用作为自我进化智能体的一个关键设计维度进行研究。我们探讨智能体是否可以通过将经验的使用与决策过程交织,使得经验仅在需要额外指导时才被调用。为了研究这一问题,我们提出了 ExpWeaver,这是一种轻量级的实现方式,它保持经验构建不变,仅通过将在推理过程中将经验作为可选资源暴露出来,从而修改运行时的利用方式。在四个代表性框架、七种大语言模型(LLM)主干模型以及三种类型的环境中,ExpWeaver 在不同的利用策略中始终取得最佳性能。强化学习实验进一步表明,这种行为可以通过训练得到增强。使用模式分析、因果消融研究和基于熵的分析显示,ExpWeaver 使智能体能够在有利的决策点以及更高的推理不确定性下选择性调用经验。总体而言,我们的研究结果表明,我们需要将研究重点从单纯研究*存储什么*经验,转向理解经验应*如何*以及*何时*进入决策过程。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:51

# 重新思考自进化语言模型代理中的经验利用

来源: https://arxiv.org/html/2605.07164  
赵伟祥1, 王英硕1, 张一晨1, 赵艳艳1, 张宇1, 吴杨2, 涂丹丹2, 秦兵1, 刘挺1  
1哈尔滨工业大学, 2华为技术有限公司  
\{wxzhao,yswang,yczhang,yyzhao\}@ir\.hit\.edu\.cn

###### 摘要

自进化代理通过积累和重用过去交互中的经验来不断提升自身。现有工作主要关注经验的构建、表示和更新方式,而较少关注在运行时决策过程中应如何使用经验。因此,大多数代理依赖于僵化的使用策略,要么仅在初始化时注入经验,要么在每一步都注入经验,而不考虑当前决策是否真正需要这些经验。本文将经验利用作为自进化代理的一个关键设计维度进行研究。我们提出一个问题:代理是否能从将经验使用与决策过程交织中获益,从而仅在需要额外指导时才调用经验?为了探讨这一问题,我们引入了 ExpWeaver,这是一种轻量级实例化方法,它保持经验构建不变,仅通过修改运行时利用方式,将经验作为推理过程中的可选资源暴露出来。在四个代表性框架、七种大语言模型(LLM)骨干网络以及三类环境中,ExpWeaver 在不同利用策略中 consistently 取得了最佳性能。强化学习实验进一步表明,这种行为可以通过训练得到增强。使用模式分析、因果消融分析和基于熵的分析显示,ExpWeaver 使代理能够在有益的决策点且在高推理不确定性下选择性地调用经验。总体而言,我们的研究结果表明,应将研究重点从仅仅关注*存储什么*经验,转向理解经验*如何*以及*何时*进入决策过程。

## 1 引言

自进化代理的出现标志着自主系统发展中的一个关键里程碑,这些系统具备持续学习和自适应行为的能力 (Zhao et al., 2024b; Dou et al., 2025; Fan et al., 2025)。随着我们进入“经验时代”(Silver and Sutton, 2025),学习越来越多地由代理自身的交互历史驱动,这一范式为构建能够在开放环境中稳健运行的系统提供了巨大潜力 (Hu, 2025; Lin et al., 2026)。

从宏观角度来看,自进化代理通过持续收集、存储和重用与环境交互中获得的经验来指导未来决策 (Gao et al., 2025; Cai et al., 2025; Bell et al., 2025)。这一过程可以自然地分解为两个阶段:构建经验库以及在决策过程中利用该库。现有研究 overwhelmingly 集中于前者,大量努力致力于设计多样的经验表示形式,如提炼的洞察 (Zhang et al., 2025a; Ouyang et al., 2025)、可重用技能 (Wang et al., 2024; Xia et al., 2026) 或可执行工作流 (Wang et al., 2025)。相比之下,关于运行时应如何使用经验的问题仍相对缺乏探索。

参见图 1 说明:自进化代理中不同经验利用策略的图示。(a) 仅初始化:经验在开始时一次性注入,并在整个决策过程中保持静态。(b) 始终开启:无论是否有必要,经验都在每一步 indiscriminately(不加区分地)注入。(c) ExpWeave:经验利用与决策过程交织,允许代理在推理过程中决定何时检索和使用经验。

在实践中,如图 1(a) 和 (b) 概念性所示,现有代理依赖于僵化的经验使用方案。一些方法遵循*仅初始化*策略,即经验仅在任务执行开始时注入一次 (Zhao et al., 2024a);另一些则采用*始终开启*策略,即检索到的经验在每一个决策步骤不加区分地注入 (Wang et al., 2025)。尽管这些策略简单且易于实现,但它们隐含地假设经验在整个任务中全局有用,或在每一步均匀有用。然而,它们并未区分当前决策是否真正需要经验。这留下了一个根本性的问题:经验在代理的运行时决策过程中应扮演什么角色?

这一空白促使我们重新审视经验在自进化代理中的作用。在人类认知中,经验并非作为静态的背景知识使用,而是与决策紧密耦合:当面临不确定性、模糊性或增高的认知控制需求时,个体会有选择地应用相关记忆 (Shiffrin and Schneider, 1977; Botvinick et al., 2001)。认知神经科学进一步表明,记忆检索是根据任务需求主动调节的,前额叶皮层在目标导向行为中门控对存储知识的访问 (Tomita et al., 1999; Anderson et al., 2004; Bausch et al., 2026)。受此机制启发,我们假设:*如果代理能同样将经验利用与其决策过程耦合,使经验仅在需要时被调用,他们可能会更有效地利用积累的经验。*

为了检验这一假设,我们提出了 **ExpWeaver**,一种轻量级范式,将经验利用交织到代理的决策过程中。ExpWeaver 并非旨在改变经验的构建、表示或更新方式。相反,它在使用端提供最小干预:经验在推理过程中作为可选资源提供。具体而言,ExpWeaver 扩展了自进化代理中广泛采用的 ReAct 风格 (Yao et al., 2023) 决策范式,其中决策通过迭代的*推理→动作*步骤做出。如图 1(c) 所示,ExpWeaver 引入了一个统一循环:*推理→(可选经验利用)→动作*。在这个循环中,代理仅在推理过程中确定需要额外指导时才检索相关经验。这种设计使我们能够系统地研究:调节经验使用,而非改进经验表示,是否是自进化代理中缺失的关键因素。

为此,我们将 ExpWeaver 集成到四个具有多样经验形式的代表性框架中,涵盖单代理 (Ouyang et al., 2025; Wang et al., 2025; Xia et al., 2026) 和多代理设置 (Zhang et al., 2025a),并将其与遵循仅初始化或始终开启方案的原始经验使用策略进行比较。遵循这些框架的原始评估设置,我们在七种 LLM 骨干网络和三种类型的环境(包括具身交互、网页导航和知识密集型问答)中评估了不同的经验利用策略。在这些设置中,ExpWeaver 在不修改现有经验构建管道的情况下, consistently 优于相应的原始框架。这些结果支持我们的核心假设:除了经验的构建和表示方式外,决策过程中经验的使用方式也是自进化代理的关键因素 (§4.2)。

我们进一步研究将经验利用与决策交织是否仅仅是推理时的提示效果,还是可以通过学习加强的能力 (§4.3)。为此,我们将 ExpWeaver 纳入代理强化学习中,其中经验既作为推理时的上下文,也作为策略优化的信号 (Wu et al., 2025; Zhai et al., 2025; Xia et al., 2026)。在 Qwen3-4B 和 Qwen3-14B (Yang et al., 2025a) 上的实验,使用 GRPO (Shao et al., 2024) 训练,显示 ExpWeaver 在不同经验利用策略中 consistently 取得最佳性能。这表明,在决策中交织经验利用是一种可学习的能力,可以通过训练进一步增强。

为了进一步了解将经验利用与决策交织为代理带来了什么,我们进行了一系列分析,揭示了 ExpWeaver 的行为和机制。首先,ExpWeaver 引发了非均匀的经验利用模式:代理在 demanding 任务和轨迹的关键阶段更频繁地调用经验,而不是在所有步骤中均匀使用 (§5.1)。其次,有针对性的消融实验表明,这种模式并非偶然,而是具有因果上的益处。移除 ExpWeaver 选定位置的经验会导致性能一致下降,而随机经验利用未能产生可比的增长,表明经验的有效性 critically 依赖于其被调用的时机 (§5.2)。最后,我们提供了机制性证据,表明 ExpWeaver 倾向于在与较高不确定性相关的决策点调用经验,这反映在代理推理过程中 token 级熵的增加 (§5.3)。

总之,这些发现表明,将经验利用与决策耦合使代理能够根据决策难度自适应地调节经验使用。总体而言,我们的研究结果表明,有效的自进化不仅依赖于积累更好的经验,还依赖于调节经验如何进入决策过程。本研究强调了经验利用作为未来自进化代理的关键设计维度,将焦点从仅仅存储经验转向理解经验应*如何*以及*何时*被使用。

## 2 相关工作

现有关于经验驱动的自进化代理的工作可以从两个角度广泛讨论:经验构建和经验利用。

*经验构建*研究代理应如何表示、存储和更新过去的交互。大量工作集中于从离线数据集或在线交互中构建外部经验库。离线方法从收集的轨迹中预构建可重用的经验,并在推理期间保持记忆固定 (Li and Qiu, 2023; Yang et al., 2023; Zhong et al., 2024; Zhao et al., 2024a; Fu et al., 2024; Zhou et al., 2025; Yang et al., 2025b)。在线方法进一步允许经验库在部署过程中进化,使代理能够通过交互积累、检索和细化经验 (Chen et al., 2024; Zhang et al., 2025b; Suzgun et al., 2025; Ouyang et al., 2025)。诸如 ReasoningBank 等代表性系统不断从最近的 episode 中提炼推理模式,而 G-Memory 将在线记忆积累扩展到多代理设置 (Ouyang et al., 2025; Zhang et al., 2025a)。这些研究产生了多样的经验形式,包括提炼的洞察、技能、工作流和原始轨迹。

相比之下,*经验利用*涉及已构建的经验应如何进入代理的运行时决策过程。这一方面仍相对缺乏探索。最近的并行研究开始探索更自适应的经验使用,如终身代理中的主动检索 (Cai et al., 2026) 和网页代理中的自我触发经验寻求 (Zhang et al., 2026)。然而,由于这些工作引入了其自身的经验表示和构建管道,经验利用的影响与经验形成方式的变化交织在一起,使得难以干净地隔离*如何*使用经验的效果。

我们的工作则从更高视角重新思考自进化代理中经验的作用:经验不应仅仅作为静态的辅助上下文,而应作为决策的主动组成部分。为了隔离这一问题,我们保持现有的经验构建、表示和更新管道不变,仅修改运行时利用方式。这使我们能够识别经验利用为一个关键设计维度,表明有效的自进化不仅取决于存储什么经验,还取决于经验如何以及何时进入决策过程。

## 3 在决策中交织经验利用

在本节中,我们首先将经验驱动的自进化表述为一个由经验构建和经验利用组成的两阶段过程 (§3.1)。然后,我们介绍 ExpWeaver,这是一种轻量级干预措施,将经验利用与代理的推理过程交织,使我们能够检验经验是否可以在决策过程中需要时被调用 (§3.2)。最后,我们将这一表述扩展到代理强化学习,以研究这种使用行为是否可以作为可学习的能力进一步优化 (§3.3)。

### 3.1 预备知识

我们研究自进化代理,其中行为适应是通过积累和重用过去的交互而实现的,且不修改模型参数 (Gao et al., 2025)。这一过程包括两个阶段:构建...

相似文章

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,

PACE: 双时间尺度自进化小语言模型智能体

arXiv cs.LG

PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。