标签
来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。
本文提出环境演化方法,以离线方式逐步增加终端代理的任务难度,从而增强持续学习信号,并提升在Terminal-Bench 2.1等基准测试上的性能。
本文综述探讨了在命令行环境中运行的AI代理,提出一个框架,通过终端介导执行的视角,统一软件工程和其他领域的研究。
Envs-FORGE是一种提示策略,用于为强化学习智能体合成训练环境,将验证器奖励转换为每个种子操作,以提高在SWE-bench和Terminal-Bench等基准测试上的性能。
CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。
本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。
CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。
Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
TACO 是一个自我演化的框架,可自动发现并优化长周期终端智能体的上下文压缩规则。
TACO 提出了一种自我演化压缩框架,可自动学习压缩冗余的终端交互历史,在 TerminalBench 及其他代码智能体基准上将 token 开销降低约 10%,准确率提升 1–4%。