SEAL: 智能体与学习环境的协同共进化
摘要
SEAL 是一个用于交互式工具使用智能体的闭环共进化框架,通过利用在线策略轨迹和回合级诊断同步策略与环境更新,解决了智能体-环境不匹配问题。
查看缓存全文
缓存时间: 2026/05/26 06:42
论文页面 - SEAL: 智能体与学习环境的协同共进化
Source: https://huggingface.co/papers/2605.24426 大型语言模型智能体越来越多地通过交互而非静态监督来改进。然而,大多数自进化方法要么单独调整策略,要么单独调整学习环境。随着智能体的能力前沿在训练过程中发生变化,提供监督的环境往往保持静态,或仅与智能体暴露的失败弱耦合。我们将这种不匹配称为智能体-环境错位。
SEAL是一个面向交互式工具使用智能体的闭环共进化框架。它在可执行验证下收集在线策略轨迹,将失败的回滚诊断成回合级标签,并利用这些诊断作为学习接口进化和模型端策略优化的共享信号。仅使用400个训练样本,SEAL就在三个骨干网络上一贯获得了+8.25至+26.25的平均分数提升,并展现出正向的分布外迁移。
相似文章
SEAL: 智能体与学习环境的协同共演化
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。
SEAGym: 自进化LLM代理的评估环境
SEAGym是一个新的评估环境,用于自进化LLM代理,它衡量代理框架在训练、验证、测试、重放和成本记录上的更新,提供关于进化过程的互补信号。
具有随时有效证书的自演化代理
本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。
SEED: 面向智能体强化学习的自进化在线策略蒸馏
提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。
自我对弈遇上技能进化:能提问、求解并记忆的自进化搜索代理
本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。