基于Docker化环境的大规模终端智能体轨迹生成
摘要
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
arXiv:2602.01244v3 公告类型:替换
摘要:训练用于终端任务的智能体模型严重依赖于高质量的终端轨迹,这些轨迹需捕获跨不同领域的真实长程交互。然而,大规模构建此类数据仍面临两大关键挑战:\textbf{\emph{可执行性}},因为每个实例都需要一个合适且通常不同的Docker环境;以及\textbf{\emph{可验证性}},因为异构的任务输出无法进行统一标准化的验证。为解决这些挑战,我们提出\textbf{TerminalTraj},这是一个可扩展的流水线,它(i)过滤高质量代码仓库以构建Docker化执行环境,(ii)生成与Docker对齐的任务实例,以及(iii)合成带有可执行验证代码的智能体轨迹。使用TerminalTraj,我们策划了32K个Docker镜像,并在八个领域生成了50,733条经过验证的终端轨迹。基于Qwen2.5-Coder主干网络在此数据上训练的模型在TerminalBench(TB)上取得了一致的性能提升,相较于各自的主干网络,在TB~1.0上提升高达20\%,在TB~2.0上提升10\%。值得注意的是,\textbf{TerminalTraj-32B}在参数少于100B的模型中表现强劲,在TB~1.0上达到35.30\%,在TB~2.0上达到22.00\%,并展示了改进的测试时扩展行为。所有代码和数据均可在 https://github.com/Wusiwei0410/TerminalTraj 获取。
查看缓存全文
缓存时间: 2026/07/20 09:38
# 基于 Docker 环境的大规模终端代理轨迹生成 来源: https://arxiv.org/abs/2602.01244 作者: Siwei Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+S), Yizhi Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y), Yuyang Song (https://arxiv.org/search/cs?searchtype=author&query=Song,+Y), Wei Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+W), Yang Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y), Riza Batista\-Navarro (https://arxiv.org/search/cs?searchtype=author&query=Batista-Navarro,+R), Xian Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+X), Mingjie Tang (https://arxiv.org/search/cs?searchtype=author&query=Tang,+M), Bryan Dai (https://arxiv.org/search/cs?searchtype=author&query=Dai,+B), Jian Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+J), Chenghua Lin (https://arxiv.org/search/cs?searchtype=author&query=Lin,+C) 查看 PDF (https://arxiv.org/pdf/2602.01244) > **摘要:** 训练用于终端任务的代理模型,关键在于高质量的终端轨迹,这些轨迹必须捕捉跨多个领域的真实长程交互。然而,大规模构建此类数据仍面临挑战,主要源于两个关键需求:**可执行性** —— 每个实例都需要一个合适且往往不同的 Docker 环境;以及**可验证性** —— 因为异构任务输出无法进行统一、标准化的验证。为解决这些问题,我们提出 **TerminalTraj**,一个可扩展的流水线,它能够(i)筛选高质量仓库以构建 Docker 化的执行环境,(ii)生成与 Docker 对齐的任务实例,以及(iii)合成带有可执行验证代码的代理轨迹。利用 TerminalTraj,我们整理了 32K 个 Docker 镜像,并生成了覆盖八个领域的 50,733 条验证后的终端轨迹。基于 Qwen2.5-Coder 主干网络训练得到的模型在 TerminalBench(TB)上持续表现出性能提升,在 TB~1.0 上最高提升 20%,在 TB~2.0 上最高提升 10%。值得注意的是,**TerminalTraj-32B** 在参数少于 100B 的模型中取得了强劲性能,在 TB~1.0 上达到 35.30%,在 TB~2.0 上达到 22.00%,并展现出改进的测试时扩展行为。所有代码和数据均可在以下链接获取:this https URL (https://github.com/Wusiwei0410/TerminalTraj)。 ## 提交历史 来自:Siwei Wu [查看电子邮件 (https://arxiv.org/show-email/871455cb/2602.01244)] **[\[v1\]](https://arxiv.org/abs/2602.01244v1)** 2026 年 2 月 1 日(周日)14:09:23 UTC(878 KB) **[\[v2\]](https://arxiv.org/abs/2602.01244v2)** 2026 年 2 月 3 日(周二)14:03:32 UTC(878 KB) **\[v3\]** 2026 年 7 月 17 日(周五)09:43:10 UTC(881 KB)
相似文章
Terminal-World: 通过智能体技能扩展终端代理环境
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
是什么使交互轨迹对训练终端智能体有效?
本文研究了什么使交互轨迹对训练基于终端的AI智能体有效,介绍了Terminal-Lego流程,并揭示了一个教学悖论:较弱的智能体可以产生更好的训练数据。研究发现,环境基础监督(而非教师性能)是学生泛化能力的关键。
TrajGenAgent:一种用于人类移动轨迹生成的分层LLM智能体
TrajGenAgent提出了一种分层LLM智能体框架,将宏观活动规划与微观时空实例化解耦,用于无需微调即可生成逼真的人类移动轨迹。它还引入了一种基于异常检测的评估方法,用于行为保真度。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。