SEAL: 智能体与学习环境的协同共进化

Hugging Face Daily Papers 论文

摘要

SEAL 是一个用于交互式工具使用智能体的闭环共进化框架,通过利用在线策略轨迹和回合级诊断同步策略与环境更新,解决了智能体-环境不匹配问题。

大语言模型(LLM)智能体通过交互不断得到改进,然而大多数自我进化方法要么单独调整策略,要么单独调整学习环境。我们将这种结构性问题称为“智能体-环境不匹配”:智能体的能力边界在训练过程中发生变化,而提供监督的环境却保持静态,或仅与智能体暴露出的失败弱耦合。我们提出了 SEAL,一个用于交互式工具使用智能体的闭环共进化框架。SEAL 在可执行验证下收集在线策略轨迹,将失败的回合诊断为回合级失败标签,并将这些诊断作为环境和模型侧策略优化的共享信号。环境通过暴露更清晰的工具功能提示、约束信息和面向恢复的反馈来进化其训练时的学习界面,而策略则通过诊断引导的优势重新加权进行更新。在分布内和分布外多轮工具使用评估上的大量实验表明,SEAL 改进了低资源智能体学习:仅用 400 个训练样本,就在三个骨干网络上获得了 +8.25 到 +26.25 的平均分提升,并展现出积极的分布外迁移。这些结果证明了联合调整学习器及其训练时学习基底对于鲁棒自改进 LLM 智能体的价值。
查看原文
查看缓存全文

缓存时间: 2026/05/26 06:42

论文页面 - SEAL: 智能体与学习环境的协同共进化

Source: https://huggingface.co/papers/2605.24426 大型语言模型智能体越来越多地通过交互而非静态监督来改进。然而,大多数自进化方法要么单独调整策略,要么单独调整学习环境。随着智能体的能力前沿在训练过程中发生变化,提供监督的环境往往保持静态,或仅与智能体暴露的失败弱耦合。我们将这种不匹配称为智能体-环境错位。

SEAL是一个面向交互式工具使用智能体的闭环共进化框架。它在可执行验证下收集在线策略轨迹,将失败的回滚诊断成回合级标签,并利用这些诊断作为学习接口进化和模型端策略优化的共享信号。仅使用400个训练样本,SEAL就在三个骨干网络上一贯获得了+8.25至+26.25的平均分数提升,并展现出正向的分布外迁移。

相似文章

SEAL: 智能体与学习环境的协同共演化

arXiv cs.CL

SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。

SEAGym: 自进化LLM代理的评估环境

arXiv cs.AI

SEAGym是一个新的评估环境,用于自进化LLM代理,它衡量代理框架在训练、验证、测试、重放和成本记录上的更新,提供关于进化过程的互补信号。

具有随时有效证书的自演化代理

arXiv cs.AI

本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。