基于Docker化环境的大规模终端智能体轨迹生成

arXiv cs.CL 论文

摘要

TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。

arXiv:2602.01244v3 公告类型:替换 摘要:训练用于终端任务的智能体模型严重依赖于高质量的终端轨迹,这些轨迹需捕获跨不同领域的真实长程交互。然而,大规模构建此类数据仍面临两大关键挑战:\textbf{\emph{可执行性}},因为每个实例都需要一个合适且通常不同的Docker环境;以及\textbf{\emph{可验证性}},因为异构的任务输出无法进行统一标准化的验证。为解决这些挑战,我们提出\textbf{TerminalTraj},这是一个可扩展的流水线,它(i)过滤高质量代码仓库以构建Docker化执行环境,(ii)生成与Docker对齐的任务实例,以及(iii)合成带有可执行验证代码的智能体轨迹。使用TerminalTraj,我们策划了32K个Docker镜像,并在八个领域生成了50,733条经过验证的终端轨迹。基于Qwen2.5-Coder主干网络在此数据上训练的模型在TerminalBench(TB)上取得了一致的性能提升,相较于各自的主干网络,在TB~1.0上提升高达20\%,在TB~2.0上提升10\%。值得注意的是,\textbf{TerminalTraj-32B}在参数少于100B的模型中表现强劲,在TB~1.0上达到35.30\%,在TB~2.0上达到22.00\%,并展示了改进的测试时扩展行为。所有代码和数据均可在 https://github.com/Wusiwei0410/TerminalTraj 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:38

# 基于 Docker 环境的大规模终端代理轨迹生成
来源: https://arxiv.org/abs/2602.01244
作者: Siwei Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+S), Yizhi Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y), Yuyang Song (https://arxiv.org/search/cs?searchtype=author&query=Song,+Y), Wei Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+W), Yang Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), Riza Batista\-Navarro (https://arxiv.org/search/cs?searchtype=author&query=Batista-Navarro,+R), Xian Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+X), Mingjie Tang (https://arxiv.org/search/cs?searchtype=author&query=Tang,+M), Bryan Dai (https://arxiv.org/search/cs?searchtype=author&query=Dai,+B), Jian Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+J), Chenghua Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+C)

查看 PDF (https://arxiv.org/pdf/2602.01244)

> **摘要:** 训练用于终端任务的代理模型,关键在于高质量的终端轨迹,这些轨迹必须捕捉跨多个领域的真实长程交互。然而,大规模构建此类数据仍面临挑战,主要源于两个关键需求:**可执行性** —— 每个实例都需要一个合适且往往不同的 Docker 环境;以及**可验证性** —— 因为异构任务输出无法进行统一、标准化的验证。为解决这些问题,我们提出 **TerminalTraj**,一个可扩展的流水线,它能够(i)筛选高质量仓库以构建 Docker 化的执行环境,(ii)生成与 Docker 对齐的任务实例,以及(iii)合成带有可执行验证代码的代理轨迹。利用 TerminalTraj,我们整理了 32K 个 Docker 镜像,并生成了覆盖八个领域的 50,733 条验证后的终端轨迹。基于 Qwen2.5-Coder 主干网络训练得到的模型在 TerminalBench(TB)上持续表现出性能提升,在 TB~1.0 上最高提升 20%,在 TB~2.0 上最高提升 10%。值得注意的是,**TerminalTraj-32B** 在参数少于 100B 的模型中取得了强劲性能,在 TB~1.0 上达到 35.30%,在 TB~2.0 上达到 22.00%,并展现出改进的测试时扩展行为。所有代码和数据均可在以下链接获取:this https URL (https://github.com/Wusiwei0410/TerminalTraj)。

## 提交历史

来自:Siwei Wu [查看电子邮件 (https://arxiv.org/show-email/871455cb/2602.01244)] **[\[v1\]](https://arxiv.org/abs/2602.01244v1)** 2026 年 2 月 1 日(周日)14:09:23 UTC(878 KB) **[\[v2\]](https://arxiv.org/abs/2602.01244v2)** 2026 年 2 月 3 日(周二)14:03:32 UTC(878 KB) **\[v3\]** 2026 年 7 月 17 日(周五)09:43:10 UTC(881 KB)

相似文章

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。

是什么使交互轨迹对训练终端智能体有效?

arXiv cs.AI

本文研究了什么使交互轨迹对训练基于终端的AI智能体有效,介绍了Terminal-Lego流程,并揭示了一个教学悖论:较弱的智能体可以产生更好的训练数据。研究发现,环境基础监督(而非教师性能)是学生泛化能力的关键。