SEAL: 智能体与学习环境的协同共演化
摘要
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。
arXiv:2605.24426v1 公告类型:新
摘要:大型语言模型(LLM)智能体通过交互不断改进,然而大多数自我演化方法仅单独调整策略或学习环境。我们将这一结构性缺陷称为\emph{智能体-环境错配}:在训练过程中,智能体的能力边界发生变化,而提供监督的环境却保持静态或仅与智能体暴露的失败弱耦合。我们提出了SEAL,一个用于交互式工具使用智能体的闭环协同演化框架。SEAL在可执行验证下收集在策略轨迹,将失败展开诊断生成回合级失败标签,并利用这些诊断作为环境侧适应和模型侧策略优化的共享信号。环境通过暴露更清晰的工具可供性线索、约束信息和恢复导向反馈来演化其训练时的学习接口,同时策略通过诊断引导的优势重加权进行更新。在分布内和分布外多轮工具使用评估上的大量实验表明,SEAL改善了低资源智能体学习:仅用400个训练样本,它在三个骨干模型上取得了+8.25到+26.25的平均分提升,并展现出正向的分布外迁移。这些结果证明了联合调整学习器及其训练时学习基底对于鲁棒自我改进LLM智能体的价值。
查看缓存全文
缓存时间: 2026/05/26 09:02
# SEAL:智能体与学习环境的协同共进化
来源:https://arxiv.org/html/2605.24426
Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu\\affiliationmark🖂 通讯作者 ()\\
\affiliationmark1 蚂蚁集团 \\
\affiliationmark2 西湖大学 \\
\affiliationmark3 密歇根大学安娜堡分校 \\
\affiliationmark4 中国科学技术大学
###### 摘要
大语言模型(LLM)智能体越来越多地通过交互而非静态监督来提升自身能力。然而,大多数自我进化方法要么单独调整策略(policy),要么单独调整学习环境,这导致了一个结构性缺陷:当智能体的能力边界在训练过程中发生变化时,提供监督的环境通常保持静态,或与智能体暴露的失败弱相关。我们将这种不匹配称为**智能体-环境对齐失衡**。我们提出 SEAL,一个用于交互式工具使用智能体的闭环共进化框架。SEAL 在可执行验证下收集在线策略轨迹,将失败的交互诊断到回合级标签,并将这些诊断作为环境侧适应和模型侧策略优化的共享信号。具体来说,训练时的学习界面会进化,以暴露更清晰的工具功能提示、约束信息和面向恢复的反馈,同时策略通过诊断导向的优势重新加权进行更新。在分布内和分布外的多轮工具使用评估中,SEAL 一贯提高了低资源智能体学习的效果:仅用 400 个训练样本,就在三个骨干模型上取得了 +8.25 到 +26.25 的平均点增益,并展现出正向的分布外迁移能力。这些结果表明,联合调整学习者和其训练时的学习底物是实现更鲁棒的自我改进 LLM 智能体的实用路径。
## 1 引言
大语言模型(LLM)智能体近期在推理、规划和工具使用方面展现出了强大能力,推动了需要多步决策、多模态推理和外部行动执行的交互式任务的发展 [yao2022react, schick2023toolformer, shinn2023reflexion, chen2026omnivideo, yu2026dual]。近期工作进一步通过强化学习、工具使用后训练、智能体数据生成和多模态数据进化来改进这些智能体 [qian2025toolrl, wei2026agentic, hu2025agentgen, gao2026counterfactual]。这些进展背后一个日益增长的趋势是**通过交互进行自我进化**:智能体通过收集交互轨迹、接收反馈,并通过反思、强化学习、自生成监督或视觉技能记忆等迭代改进自身行为 [wang2023voyager, zhai2025agentevolver, lin2025se, sun2025seagent, wang2026atlasva]。该范式将交互反馈转化为可重复使用的监督源,提供了一条超越静态离线训练的可扩展路径。
#### 实际动机。
这一承诺在现实工具使用场景中尤为重要。在这些场景中,智能体必须通过多轮接口操作,满足严格的执行约束,并从部分失败中恢复 [li2023api, xie2024osworld, liu2025agent, yin2026glove, peng2026tool, yang2026evotool]。在此类环境中,改进不仅取决于策略如何优化,还取决于训练时环境在策略变化过程中暴露了哪些学习信号。然而,当前的自我进化智能体通常只调整这一交互循环中的一侧。
#### 两种单侧适应模式。
大多数现有方法遵循两条路径之一。
(i) **模型中心进化**。这些方法通过交互重放、自我反思、奖励优化或后训练更新来改进策略 [huang2025r, yuan2025agent, wang2025ragen, xiang2026systematic]。虽然有效,但它们通常针对一个基本固定的学习环境来优化智能体,使得学习信号依赖于当前策略自身的交互分布。在具有稀疏奖励的长周期交互环境中,这种自指涉的交互分布可能导致策略诱导的探索偏差、不稳定的恢复和低效的信用分配 [shridhar2020alfworld]。
(ii) **环境中心进化**。这些方法调整课程、任务分布、合成指令或交互体验。它们认识到智能体能力不仅受优化影响,还受训练过程中暴露的经验影响。然而,当这种适应没有基于当前智能体的可执行失败(它能解决什么、它在哪些方面反复失败、为什么失败)时,进化后的环境可能与学习者的实际需求弱相关。此类方法可以增加多样性或难度,但如果没有可执行失败作为基础,它们可能仍然无法针对当前限制智能体表现的能力差距 [bengio2009curriculum, lu2025don, yang2026coevolve, hao2026failure]。
#### 共享的闭环瓶颈。
这两种适应模式看似不同,但它们暴露了相同的结构性问题:训练时的学习环境未能跟踪智能体不断变化的能力边界,因此提供的信号过于静态、针对性弱或信息不足。我们将这种不匹配称为**智能体-环境对齐失衡**。重要的是,我们所说的“环境”指的是训练时的学习底物——包括任务暴露、观察接口、行动约束和恢复反馈——而不是对评估基准、工具语义或可执行验证器的更改。一个具体例子可以说明这个问题。当工具调用失败是因为智能体使用了城市名称而需要机场代码时,固定环境可能只返回一个通用的执行错误。这种反馈告诉智能体轨迹失败了,但并未说明失败是由于缺少先决条件的查找、使用了无效的参数类型、还是在出错后未能恢复。结果,策略只收到了微弱的诊断监督,未来的轨迹也是在同样信息不足的条件下收集的。

#### 我们的方法。
受此观察启发,我们提出 **SEAL**,一个用于交互式工具使用智能体的闭环共进化框架。SEAL 使用基于验证器的故障诊断作为训练双方的共享信号:它通过模式提示、约束信息和面向恢复的反馈来进化训练时的交互界面,并根据诊断效用重新加权策略梯度更新。这使得**能力感知**的环境适应成为可能:不是依赖通用难度缩放或盲目数据扩充,而是根据当前策略的重复失败来调整训练接口,从而生成信息更丰富的交互,同时保持基准协议不变。在低资源多轮工具使用设置上的大量实验验证了这种设计的有效性。我们的贡献有三方面:
- • 我们识别出**智能体-环境对齐失衡**:当智能体的能力边界在训练过程中改变时,学习环境往往保持静态或与智能体暴露的失败弱相关。
- • 我们引入 **SEAL**,它使用基于验证器的故障诊断来共同进化训练时的学习界面并指导策略优化。
- • 我们证明 SEAL 改进了**低资源**多轮工具使用学习,仅用 400 个训练样本就在三个骨干模型上取得了高达 +26.25 的平均点增益,并展示了向保留设置的积极迁移。
## 2 相关工作
### 2.1 模型侧自我改进
先前工作表明,LLM 智能体可以通过重复交互而非仅静态提示来改进。基于递归技能学习、自我巩固、反思提示适应、基于记忆的改进和通过交互反馈进行强化学习的方法主要优化智能体本身 [xia2026skillrl, yu2026self, agrawal2025gepa, zweiger2025selfadapting]。从这个意义上说,它们主要是**以模型为中心**的:经验被内化到策略、提示、记忆或技能库中,而训练时的学习环境通常保持固定。SEAL 是互补的:它不仅利用失败轨迹进行模型侧改进,还将其作为基于验证器的证据来调整未来轨迹收集的环境。
### 2.2 环境侧适应
另一条工作线调整学习者在训练过程中接触的内容。课程学习、自动课程设计、合成指令生成、任务进化以及工具或技能构建重塑了训练分布或接口 [matiisen2019teacher, portelas2020automatic, wang2023selfinstruct, xu2024evolinstruct, cai2023large, qian2023creator, yuan2023craft]。然而,大多数此类方法在任务多样性、难度或覆盖层面操作。相比之下,SEAL 执行**基于失败条件**的环境适应:基于验证器的诊断决定了哪些功能提示、约束信息、恢复反馈和训练时信号被暴露出来,以针对当前策略的能力差距。
### 2.3 交互环境与共进化
用于工具使用、函数调用、网页导航、操作系统控制、具身模拟和软件工程的交互式基准暴露了现实智能体学习核心的多轮依赖性、执行约束、稀疏奖励和恢复动态 [patil2025berkeley, li2023api, zhou2023webarena, liu2023agentbench, jimenez2023swe]。近期工作也研究了环境设计与智能体-环境共进化 [xiagentgym, zhang2025autoenv, guo2025genenv]。SEAL 最接近这一视角,但在更严格的协议下:它保持基准任务、工具语义和可执行验证器固定,仅以基于失败条件、基于验证器的方式调整训练时的学习界面。
## 3 方法论
我们提出 **SEAL**,一个用于共同进化工具使用策略及其训练时学习环境的框架。
**关键思想。** 与其将环境视为仅返回稀疏标量奖励的固定执行器,SEAL 在训练期间暴露一个基于验证器的诊断接口,将失败的交互转化为关于智能体当前能力差距的结构化证据,同时保持工具语义、任务标签、奖励和评估验证器不变。
**适应范围。** 这里,“环境”不仅包括可执行工具后端,还包括策略观察工具模式、执行反馈和恢复信号的学习界面。因此,SEAL 将环境进化限制在此接口层以保持基准公平。相同的诊断驱动学习循环的两侧:它们通过工具功能提示、面向恢复的反馈和能力特定提示来调整训练时的界面,并通过诊断导向的优势重新加权来调节策略优化。图 2 总结了这一共进化过程。

### 3.1 问题形式化
我们将交互式工具使用形式化为一个部分可观察决策过程:
M = ⟨S, A, O, T, O_E, H, S_goal⟩, (1)
其中 S 是隐藏状态空间,A 是动作空间,O 是观察空间,T 是转移函数,O_E 是观察函数,H 是时间范围,S_goal 表示目标状态。在工具使用环境中,动作包括自然语言响应和基于工具集 F 的可执行工具调用,而观察包括对话上下文、工具输出和执行错误。给定指令 q ~ D,策略 π_θ 与可执行环境 E 交互并产生轨迹 τ = {(u_i, a_i, o_i)}_(i=1)^T ~ P_E(·|q, π_θ), T ≤ H, (2) 其中 u_i 表示对话上下文,a_i 是模型动作,o_i 是环境观察。可执行验证器 V 提供终端二进制奖励:r(τ) = V(τ, q, E) ∈ {0, 1}。 (3) 标准 RL 最大化期望验证器成功率:J(π_θ) = E_(q~D, τ~P_E(·|q, π_θ)) [r(τ)]。 (4)
这个标量奖励指示轨迹是否成功,但不指示为何失败。因此,SEAL 将训练时反馈增强为 (r(τ), Z(τ)),其中 Z(τ) 表示从可执行交互迹中提取的结构化失败诊断。验证器奖励、工具语义和评估协议保持不变。
### 3.2 基于验证器的故障诊断
对于每个轨迹 τ,SEAL 生成轮次级的诊断标签 Z(τ) = {z_1, ..., z_T}, z_i ∈ Z, (5) 其中每个 z_i 表示第 i 轮的主要结果或失败模式。诊断基于可执行证据而非自由形式的模型批评:SEAL 使用解析器检查、工具模式验证、执行错误、可观察的状态转移和验证器比较来识别无效或缺失的工具调用、参数或状态不匹配、恢复失败以及最终响应不匹配。我们将诊断函数写为 z_i = Ψ(a_i, ξ_i, s_(i-1), s_i, F), (6) 其中 a_i 是模型动作,ξ_i 是第 i 轮可用的可执行证据,s_(i-1) 和 s_i 是动作前后的状态(可用时),F 是可用的工具集。操作上,Ψ 是一个确定性的基于规则的分类器,作用于可执行迹,优先处理直接可执行失败而非下游验证器级别的失败。完整的标签分类法和决策规则在附录 C 中提供。重要的是,诊断不修改基准奖励:r(τ) = V(τ, q, E), Z(τ) = Ψ(τ, E, V)。 (7) 因此,失败的轨迹在原始验证器下仍然获得零奖励;标签仅添加训练时结构用于界面进化和策略优化。
### 3.3 学习界面进化
SEAL 仅进化**训练时的学习界面**,而不进化基准验证器、工具签名、工具输出或任务标签。令 o_i 表示第 i 轮的原始观察。SEAL 构建一个增强的训练时观察 õ_i = Ω_t(o_i, F, H_t相似文章
SEAL: 智能体与学习环境的协同共进化
SEAL 是一个用于交互式工具使用智能体的闭环共进化框架,通过利用在线策略轨迹和回合级诊断同步策略与环境更新,解决了智能体-环境不匹配问题。
SEAGym: 自进化LLM代理的评估环境
SEAGym是一个新的评估环境,用于自进化LLM代理,它衡量代理框架在训练、验证、测试、重放和成本记录上的更新,提供关于进化过程的互补信号。
CoEvolve:通过智能体-数据互进化训练LLM智能体
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。
从受训者到训练者:LLM为多智能体推理强化学习设计的训练环境
本文介绍了LLM-as-Environment-Engineer框架,该框架使LLM能够为多智能体推理任务中的强化学习设计自己的训练环境,实现自我改进训练,其性能超越更大的专有模型。
SEIF:用于指令遵循的自我演化强化学习
本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。