终端代理的环境演化
摘要
本文提出环境演化方法,以离线方式逐步增加终端代理的任务难度,从而增强持续学习信号,并提升在Terminal-Bench 2.1等基准测试上的性能。
查看缓存全文
缓存时间: 2026/09/04 03:57
论文页面 - 终端代理的环境演化
来源:https://huggingface.co/papers/2609.04128 作者:
,
,
,
,
,
,
,
,
,
,
摘要
环境演化通过离策略方式逐步增加任务难度,为终端代理提供持续的学习信号,从而通过多代理协作机制提升基准性能。
扩展交互式和可验证的环境对于训练终端代理至关重要。随着前沿模型能力的增强,从零合成环境带来的挑战性降低,因而提供的学习信号有限。近期的协同演化方法基于策略执行过程中暴露的弱点,在模型可学习边界附近迭代合成环境。然而,这些方法依赖于在线策略执行,这限制了泛化能力,并且在模型变强时无法持续提供学习信号。本文提出环境演化,通过离策略方式逐步提高环境难度,并在训练过程中逐代调度演化环境的生成,以提供持续的学习信号。我们从多轮学习目标中推导出影响环境难度的三个演化方向,然后通过工程化的循环多代理协作机制沿这些方向实现演化。使用Hy4预览版、Claude Opus 5和GPT-5.6 Sol进行的定量实验表明,环境演化能够持续生成更具挑战性的环境。我们通过简单的长周期强化学习训练,在Qwen3.6-27B和Qwen3.6-35B-A3B上验证了其有效性,使其在Terminal-Bench 2.1上的性能分别提升了14.4和18.0个百分点。
查看arXiv页面 (https://arxiv.org/abs/2609.04128)查看PDF (https://arxiv.org/pdf/2609.04128)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04128)
在你的代理中获取此论文:
hf papers read 2609\.04128
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2609.04128以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2609.04128以从此页面链接。
引用此论文的Space0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2609.04128以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
Terminal-World: 通过智能体技能扩展终端代理环境
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
ECHO: 终端代理免费学习世界模型
ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
智能体优化器能否实现累积提升?——基于 Terminal-Bench 2.0 的持续学习评估
本文在 Terminal-Bench 2.0 上引入了一个两阶段持续学习评估,用以检验智能体优化方法的增益在递归应用时是否能够累积。结果发现,只有包含回归控制的 RELAI-VCL 方法实现了累积性改进。