Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
摘要
Terminal-Universe 是一个框架,它从智能体轨迹中重建可执行工作空间,以合成多样化的训练任务,并通过监督微调提升 AI 智能体的后训练性能。
查看缓存全文
缓存时间: 2026/09/04 03:57
论文页面 - Terminal-Universe:将智能体轨迹转化为可扩展的终端环境
来源:https://huggingface.co/papers/2609.04148 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Terminal-Universe 从智能体轨迹中重构可执行工作空间,以合成多样化的训练任务,并通过监督微调提升训练后性能。
随着基于终端的代码智能体日益普及,智能体轨迹已大规模积累,而真实可执行的环境仍然稀缺。然而,环境才是智能体训练后阶段真正需要的:每个环境可以重新查询生成多个可验证任务并提供执行反馈,而轨迹只是单一的冻结示例。我们并非从零开始生成环境,而是观察到现有轨迹中的工具执行历史暴露了其运行环境的结构和内容,从而使得从轨迹本身重构这些环境成为可能。因此,我们引入了 Terminal-Universe 框架,它将每个轨迹转化为可复用环境,并通过探索该环境来合成新任务和持续交互。具体而言,Terminal-Universe 重放轨迹中记录的文件操作,在智能体修改文件之前恢复每个文件,从而得到一个部分工作空间;随后,一个补全智能体提供缺失的文件和依赖项。在恢复的工作空间上,我们既重构了原始意图任务,也合成了全新的任务。此外,我们还沿着两个互补的轴扩展任务:广度和深度。在广度方面,我们挖掘相关环境之间的定向依赖关系,并合成跨越多个代码库的跨工作空间查询(https://huggingface.co/papers?q=cross-workspace%20queries),这与开发者在实际开发中的常规操作一致。在深度方面,我们将初始的单轮查询扩展为多轮会话(https://huggingface.co/papers?q=multi-round%20session),通过用户智能体捕捉迭代式的用户反馈和需求细化过程。应用于公开的智能体终端轨迹(https://huggingface.co/papers?q=terminal%20agent%20trajectories)后,Terminal-Universe 生成了 37.3k 个任务充分的环境。在此语料库上对 Qwen3.5-27B 进行监督微调(https://huggingface.co/papers?q=Supervised%20fine-tuning),使其在 Terminal-Bench 2.1 上的单轮性能提升了 11.9 个点,在 EvoCode-Bench v2 MT@4 上的多轮性能提升了 13.8 个点。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04148) 查看 PDF (https://arxiv.org/pdf/2609.04148) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.04148)
在你的智能体中获取此论文:
hf papers read 2609\.04148
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.04148 以从本页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.04148 以从本页面链接。
引用此论文的空间 0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.04148 以从本页面链接。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
基于Docker化环境的大规模终端智能体轨迹生成
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
Terminal-World: 通过智能体技能扩展终端代理环境
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
CLI-Universe:面向终端代理的可验证任务合成引擎
CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
是什么使交互轨迹对训练终端智能体有效?
本文研究了什么使交互轨迹对训练基于终端的AI智能体有效,介绍了Terminal-Lego流程,并揭示了一个教学悖论:较弱的智能体可以产生更好的训练数据。研究发现,环境基础监督(而非教师性能)是学生泛化能力的关键。