终端代理的环境演化

Hugging Face Daily Papers 论文

摘要

本文提出环境演化方法,以离线方式逐步增加终端代理的任务难度,从而增强持续学习信号,并提升在Terminal-Bench 2.1等基准测试上的性能。

扩展交互式和可验证的环境对于训练终端代理至关重要。随着前沿模型能力增强,从零合成的环境变得不那么具有挑战性,因此提供的学习信号有限。最近的共同演化方法根据展开过程中暴露的弱点,在模型的可学习前沿附近迭代合成环境。然而,它们对在线展开的依赖限制了泛化能力,并随着模型变强而限制了持续学习信号的提供。本文提出环境演化,以离线方式逐步增加环境难度,并在训练期间按代调度演化环境,以提供持续学习信号。我们从多轮学习目标推导出影响环境难度的三个演化方向,并通过循环工程化的多代理框架沿这些方向实现演化。使用Hy4 preview、Claude Opus 5和GPT-5.6 Sol进行的定量展开实验表明,环境演化持续产生更困难的环境。我们通过简单的长期强化学习训练在Qwen3.6-27B和Qwen3.6-35B-A3B上验证了其有效性,在Terminal-Bench 2.1上分别将性能提高了14.4和18.0个百分点。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:57

论文页面 - 终端代理的环境演化

来源:https://huggingface.co/papers/2609.04128 作者:

,

,

,

,

,

,

,

,

,

,

摘要

环境演化通过离策略方式逐步增加任务难度,为终端代理提供持续的学习信号,从而通过多代理协作机制提升基准性能。

扩展交互式和可验证的环境对于训练终端代理至关重要。随着前沿模型能力的增强,从零合成环境带来的挑战性降低,因而提供的学习信号有限。近期的协同演化方法基于策略执行过程中暴露的弱点,在模型可学习边界附近迭代合成环境。然而,这些方法依赖于在线策略执行,这限制了泛化能力,并且在模型变强时无法持续提供学习信号。本文提出环境演化,通过离策略方式逐步提高环境难度,并在训练过程中逐代调度演化环境的生成,以提供持续的学习信号。我们从多轮学习目标中推导出影响环境难度的三个演化方向,然后通过工程化的循环多代理协作机制沿这些方向实现演化。使用Hy4预览版、Claude Opus 5和GPT-5.6 Sol进行的定量实验表明,环境演化能够持续生成更具挑战性的环境。我们通过简单的长周期强化学习训练,在Qwen3.6-27B和Qwen3.6-35B-A3B上验证了其有效性,使其在Terminal-Bench 2.1上的性能分别提升了14.4和18.0个百分点。

查看arXiv页面 (https://arxiv.org/abs/2609.04128)查看PDF (https://arxiv.org/pdf/2609.04128)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04128)

在你的代理中获取此论文:

hf papers read 2609\.04128

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2609.04128以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2609.04128以从此页面链接。

引用此论文的Space0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2609.04128以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。

ECHO: 终端代理免费学习世界模型

Hugging Face Daily Papers

ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。