基于保留集选择的递归自我进化智能体

arXiv cs.AI 论文

摘要

介绍RSEA,一种利用三层自然语言状态和保留集选择门防止退化的LLM智能体递归自我进化方法。在四个基准测试中评估,结果表明上下文进化依赖于基准,且严格的选择门对可靠性至关重要。

arXiv:2606.28374v1 公告类型:新 摘要:LLM 智能体无需权重更新,通过进化自然语言工件(如反思、工作流、剧本、速查表或优化提示)来条件化冻结策略,从而持续改进。此类方法通常被报道为在单一基准测试中取得胜利。我们进行公平比较,揭示出更清晰的图景。我们介绍RSEA,一种递归自我进化智能体,携带紧凑的三层自然语言状态:命令式策略、可复用技能和程序化剧本。在世代更迭中,RSEA根据自身轨迹重写所有三层,并使用严格的保留集选择门(keep-better gate),仅当候选者在不相交的保留集上不发生退化时才提交。 在四个多样化基准(ALFWorld、GAIA、(τ)-bench、WebShop)和六个忠实基线(ReAct、Reflexion、GEPA、AWM、ACE、Dynamic Cheatsheet)上,全部使用同一共享本地骨干网络进行评估,我们发现三个主要结果。首先,没有工件能普遍获胜。RSEA是ALFWorld上最强的单次方法,达到69.3%,而ReAct为64.6%(McNemar检验,p=0.015),在重试情况下达到79.4%,为总体最佳。然而,以AWM为代表的具体工作流归纳在强骨干工具使用任务上表现最佳。其次,无防护的上下文进化方差大且不安全。Dynamic Cheatsheet在线整理上下文但无保留集门,在ALFWorld上接近最佳(70.7%),但在WebShop上崩溃,得分0.14,而ReAct得分为0.43。第三,RSEA严格的保留集选择使递归自我进化单调安全:在任何基准上均未显著低于基础智能体,当进化上下文有害时回退到普通ReAct。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# 递归自演化智能体:基于留出选择机制

资料来源:https://arxiv.org/html/2606.28374

阮国强  阮国文  武保罗  
莫纳什大学信息技术学院  
\{michael\.nguyen, quoc\.nguyen, paul\.vuong\}@monash\.edu

###### 摘要

LLM 智能体日益通过演化自然语言产物(反思、工作流、操作手册、速查表或优化提示)来改进自身,而*无需*权重更新——这些产物会调节冻结的策略。这类方法通常被报道为在它们所帮助的单一基准测试上取得胜利。我们以对等比较的方式研究它们,揭示了一幅更清晰的图景。我们提出了 RSEA(递归自演化智能体),它携带一个紧凑的*三层自然语言状态*——包括命令式*策略*、可复用*技能*以及过程性*行动方案*——并在多代演化中根据自身轨迹重写全部三层,仅当候选方案在不相交的留出分割上不出现退化时才予以提交(*严格保持更好*门控)。在四个不同的基准测试(ALFWorld、GAIA、τ-bench、WebShop)和六个忠实基线(ReAct、Reflexion、GEPA、AWM、ACE、Dynamic Cheatsheet)上,全部共享同一个本地主干模型,我们发现:(i) *没有哪种产物能普遍获胜*——RSEA 是 ALFWorld 上最强的单次方法(69.3% vs. ReAct 64.6%,McNemar p=0.015;带重试为 79.4%,总体最佳),而具体工作流归纳方法(AWM)在强主干工具使用任务上表现最佳;(ii) 无保护的上下文演化是*高方差且不安全的*——Dynamic Cheatsheet 在线整理上下文但没有留出门控,在 ALFWorld 上接近最佳(70.7%),却在 WebShop 上*崩溃*(得分 0.14 vs. ReAct 0.43);(iii) RSEA 的严格留出选择正是使递归自演化变得*单调安全*的关键:它在任何基准测试上都不会显著低于基础智能体,当演化上下文会造成损害时会退化为标准 ReAct。受控消融实验表明,演化状态的每一层都有帮助,而去除留出选择会导致严重的过拟合(样本内完美得分,但测试成绩下降33分)。我们认为上下文演化的可靠性更多来自*选择门控*而非产物本身,并公开全部实验框架、六个基线的复现实现以及预注册的声明文件。

## 1 引言

构建自我改进的 LLM 智能体的一个核心范式是调整*上下文*而非权重:策略被冻结,而演化中的自然语言产物(累积的反思、诱导的工作流、整理的剧本、在线速查表或优化后的系统提示)在推理时被注入。上下文调整具有具体优势:它可解释、可审计,在运行时整合新知识,跨模型版本迁移,并且随着长上下文推理和 KV 缓存复用,部署成本日益降低。

尽管进展迅速,但这些方法几乎总是*孤立地*被评估:单一基准测试、弱或不匹配的基线、以及不同方法间变化的主干模型或解码预算。这使得它们的*相对*优势以及关键性的*失败模式*难以解读。当我们在同一个主干模型上、横跨四个不同的智能体基准测试重新运行六种代表性方法时,出现了两个令人不安的事实。首先,*哪种*产物有帮助是基准测试相关的:在一个基准测试上名列前茅的方法在另一个上可能表现平平甚至有害。其次,更重要的是,演化上下文*并非免费的午餐*。我们将失败模式称为*上下文干扰*:注入的产物会削弱原本有能力的基策略。上下文干扰并非假设——在我们的研究中,一种无保护的在线方法(Dynamic Cheatsheet)从 ALFWorld 上的接近最佳(70.7%)变为 WebShop 上的得分 0.136,而 ReAct 基线为 0.429,这种灾难性退化完全是由它添加的上下文引起的。我们认为,上下文演化的可靠性更多来自决定是否提交产物的*选择门控*,而非产物本身。

一个提交任何产出内容的演化循环会继承自身重写的方差;一个仅在改变能提升*留出*性能时才会提交改变的循环,其表现不会比完全不演化更差。我们将这个门控作为方法的设计核心,而非事后考虑。具体来说,我们提出了 RSEA(递归自演化智能体)。RSEA 携带一个紧凑的三层自然语言状态——*策略*(命令式前言)、*技能*(可复用子程序)和*行动方案*(从成功案例中提炼的规程)——并在多代演化中:(i) 在当前状态下对小规模演化池进行 rollout,(ii) 根据生成的轨迹*重写全部三层*,(iii) 仅当候选方案在不相交的验证分割上不出现退化时才提交,仅在*严格*改进时更新冻结的最佳状态。只有冻结的最佳状态会在留出的测试分割上运行,因此没有信息泄露。RSEA_R 将这种冻结的先验注入到每个任务的循环中。

**贡献。**
1. 提出了一种以*严格留出保持更好*门控为中心的跨任务 NL 自演化框架,使操作变得*单调安全*(§4)。
2. 在共享实验框架上忠实地、使用单一主干模型重新实现了六个经典和近期基线(§5)。
3. 进行了一项包含四个基准测试、多种子统计和配对检验的研究,得出诚实的适用范围而非普遍胜利的断言(§6–7)。
4. 通过受控消融实验,分离了每个状态层的贡献,并量化了去除留出选择的代价(§8)。

**关键发现。**
(a) 在 ALFWorld 上(134 个任务 × 5 种子,7B 模型),单次演化先验显著优于 ReAct、GEPA 和 AWM,而 RSEA_R 总体最佳(79.4%)。
(b) 在强主干工具使用基准上,没有任何 NL 产物占主导地位;RSEA 与 ReAct 统计上持平(且从未显著更差),而 AWM 的具体工作流是唯一能带来持续小幅提升的方法。
(c) 没有留出门控的方法方差大,可能导致灾难性退化;RSEA 的严格门控将“上下文演化”从抛硬币变成了单调安全的操作。
(d) 消融实验表明,演化状态的每一层都有帮助(这些层重叠而非严格互补),而去除留出选择会导致演化池过拟合(样本内 100%,测试成绩下降33分)。

![图1:没有任何上下文演化产物能普遍获胜,无保护的演化不安全。共享主干模型上四个基准测试的单次方法(ALFWorld 7B;GAIA/τ-bench/WebShop 30B)。RSEA(红色)是 ALFWorld 上最强的单次方法,在其他基准上从未显著低于 ReAct(灰色);AWM 在工具使用任务上最佳;而 Dynamic Cheatsheet(在线整理上下文,*无*留出门控)在 ALFWorld 上接近最佳,却在 WebShop 上*崩溃*(0.14 vs. ReAct 0.43)。RSEA 的严格留出门控正是使演化单调安全的关键。]

## 2 相关工作

### LLM 智能体进行推理与行动。
一种标准的配方是将自由形式推理与工具/环境动作交织:ReAct(Yao 等,2023b)将思维链与行动结合,并通过深思熟虑的搜索(Yao 等,2023a)、自我批评与修改(Madaan 等,2023)、学习工具使用(Schick 等,2023)以及在具身或开放世界中的扎根规划(Huang 等,2022;Wang 等,2023)进一步细化。近期工作强化了推理基础——多视角、符号学扎根的逻辑推理(Zhang 等,2025e)、“系统2”视觉-语言-动作策略(Song 等,2025;Fang 等,2025)以及用于控制的时空思维链(Zeng 等,2025a)——同时认知架构和综述性研究将这些部分组织为记忆、规划和动作模块(Sumers 等,2024;Wang 等,2024a;Park 等,2023;Yang 等,2026a)。RSEA 保持此循环*不变*,仅通过演化的自然语言状态介入,将上下文的贡献与框架分离。

### 工具使用智能体与工具学习。
大量研究探讨智能体如何选择和组合工具(Qu 等,2025b):通过自主交互掌握工具(Qu 等,2025a)、用于工具集成推理的细粒度监督(Qu 等,2026)、基于相似性/依赖性的经验网络进行多工具选择(Zhang 等,2025f)、工具调用错误下的自我批评(Huang 等,2025)、树搜索工具规划(Yang 等,2026b)、GUI 接地(Lian 等,2025)以及智能体文本到 SQL(Li 等,2026b;Su,2026)。最接近的是*测试时工具演化*,它在推理时调整智能体的工具集(Lu 等,2026)。RSEA 是互补的:它不是演化工具集,而是在固定的动作/工具接口上演化自然语言*策略*,而我们的 τ-bench/WebShop 结果解释了为什么在某些情况下 NL 策略在已有详细工具 API 的基础上附加价值有限。

### 提示与上下文优化。
第二条工作线是优化提示本身:离散指令搜索(Zhou 等,2023)、LLM 作为优化器的循环(Yang 等,2024)、带有编译提示/演示优化的声明式流水线(Khattab 等,2024;Opsahl-Ong 等,2024)、进化搜索(Fernando 等,2023)以及反射性遗传-帕累托演化(Agrawal 等,2025);提示也被认为对表面形式极其脆弱(Cai 等,2025)。这些方法优化*单一*扁平产物,通常将选择视为实现细节。我们则固定产物族系,并展示留出选择的*严格性*——而非优化器的复杂性——决定了演化是有益还是有害。

### 自演化与自我改进智能体。
最接近的精神是智能体从自身经验中改进。除了上下文,还包括从自生成数据中引导推理(Zelikman 等,2022)以及搜索智能体代码/拓扑(Hu 等,2024)。在智能体循环内部,近期方法通过归因感知变异和多样性感知选择自我演化工具使用策略(Yang 等,2026c)、在分层 RL 中演化内在技能(Li 等,2026d)、从自监督信号中自我改进统一多模态模型(Han 等,2026)以及演化任务特定原型(Zhu 等,2025b)。RSEA 共享自演化目标,但故意保持权重冻结、基于 NL 状态,并且——与大多数方法不同——将*严格留出选择门控*置于中心,我们的消融和迁移结果将其确定为安全性的决定性因素。

### 用于 LLM 智能体的强化学习。
并行的工作线使用 RL 训练智能体/推理器:面向长周期智能体的可验证元推理奖励(Zhang 等,2026c)、推理重排序智能体(Zhang 等,2025a)以及用于上下文完整性的 RL(Lan 等,2025a)。一个反复出现的问题是优化信号的设计以及在可验证奖励下的*多样性崩溃*(Li 等,2025b),通过散度选择(Li 等,2025b)、奖励置信度校正(Li 等,2026c)、带先验的偏好优化(Lan 等,2025b)以及内在自我反思(Li 等,2025c)来解决。我们的权重冻结方法避免了 RL 的成本和不稳定性,同时仍然通过重写/选择循环利用执行反馈。

### 智能体记忆、经验学习与过拟合。
最接近 RSEA 产物的是积累可复用 NL 经验的方法:ExpeL(Zhao 等,2024)、Agent Workflow Memory(Wang 等,2024b)、Agentic Context Engineering(Zhang 等,2025c)、Dynamic Cheatsheet(Suzgun 等,2025)以及带有显式存储的记忆增强智能体(Packer 等,2023;Zeng 等,2025b)。来自相邻领域的两个失败模式激发了我们的选择优先观点:*灾难性遗忘/崩溃*,在持续学习中研究(Chen 和 Zeng,2025),并观察到逻辑推理崩溃(Zhang 等,2026a);以及经典的*过拟合*,通过难度感知重加权和对抗鲁棒性来控制(Zhou 等,2022, 2024b, 2024a)。RSEA 的严格留出门控正是一种防止演化上下文过拟合或崩溃的机制,我们通过实验证明了这一点。

### 基准测试、多智能体系统与更广阔视野。
我们特意在多样化的任务集上评估:具身文本家庭(Shridhar 等,2021)、扎根式网络购物(Yao 等,2022)、开放式助手(Mialon 等,2023)、工具-智能体-用户交互(Yao 等,2024)、交互式编码(Trivedi 等,2024)以及多模态深度研究(Zeng 等,2026)。

相似文章

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

arXiv cs.CL

Introduces ERSkill, a retrieval-centric framework for self-evolving, skill-guided adaptive memory access in LLM agents. It co-evolves retrieval skills and a routing policy, substantially outperforming strong baselines across agent memory benchmarks.

通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化

Hugging Face Daily Papers

# 论文页面 - 通过世界知识探索训练LLM智能体实现自发、无奖励的自我进化 来源:[https://huggingface.co/papers/2604.18131](https://huggingface.co/papers/2604.18131) ## 摘要 具备内在元进化能力的智能体通过在没有外部监督的情况下自主生成的世界知识,在网页导航任务中展现出更优的性能。如今大多数智能体通过遵循人类定义的奖励和规则来``自我进化''。然而,

SEAL: 智能体与学习环境的协同共演化

arXiv cs.CL

SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。