LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境

Hugging Face Daily Papers 论文

摘要

LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。

掌握终端环境需要语言智能体具备多步规划、基于反馈的执行以及动态状态适应能力。然而,目前训练此类智能体受限于依赖从外部仓库抓取的数据,这限制了领域多样性、环境可控性以及针对特定能力缺陷的定向能力。我们提出了 LiteCoder-Terminal-Gen,一种零依赖的合成管道,能够根据领域规范自主生成可执行且可验证的终端训练环境。利用该框架,我们构建了两个大规模资源:LiteCoder-Terminal-SFT,包含10个领域的11,255条专家轨迹;以及LiteCoder-Terminal-RL,包含602个可验证环境,用于轨迹级偏好优化。在SFT数据集上对Qwen系列模型进行监督微调,得到的智能体显著超越了基础版本。值得注意的是,我们的32B变体在Terminal Bench 1.0、2.0和Pro上分别达到了29.06%、18.54%和34.00%的pass@1。此外,在RL环境上应用直接多轮偏好优化(DMPO)进一步带来了性能提升。这些结果系统地证明了完全合成且可执行的环境为掌握复杂的真实世界命令行工作流提供了可扩展且可验证的监督信号。
查看原文
查看缓存全文

缓存时间: 2026/05/29 02:59

论文页面 - LiteCoder-Terminal:扩展长程终端环境以学习语言智能体

来源:https://huggingface.co/papers/2605.29559

摘要

LiteCoder-Terminal-Gen 通过合成、可执行的终端环境,实现了语言智能体的可扩展训练,其性能超越传统方法。

掌握终端环境 (https://huggingface.co/papers?q=terminal%20environments) 需要语言智能体 (https://huggingface.co/papers?q=language%20agents) 具备多步规划 (https://huggingface.co/papers?q=multi-step%20planning)、基于反馈的执行 (https://huggingface.co/papers?q=feedback-grounded%20execution) 以及动态状态适应 (https://huggingface.co/papers?q=dynamic%20state%20adaptation) 能力。然而,当前训练此类智能体受限于对外部抓取仓库的依赖,这限制了领域多样性、环境可控性以及针对特定能力缺陷的定位。我们提出 LiteCoder-Terminal-Gen,一个零依赖合成流水线 (https://huggingface.co/papers?q=zero-dependency%20synthesis%20pipeline),能够直接从领域规范自主生成可执行且可验证的终端训练环境。利用该框架,我们构建了两个大规模资源:LiteCoder-Terminal-SFT,包含跨越10个领域的11,255条专家轨迹 (https://huggingface.co/papers?q=expert%20trajectories);以及 LiteCoder-Terminal-RL,包含602个可验证环境,用于轨迹级偏好优化 (https://huggingface.co/papers?q=trajectory-level%20preference%20optimization)。

对 Qwen 系列模型在我们的 SFT 数据集上进行监督微调 (https://huggingface.co/papers?q=Supervised%20fine-tuning) 后,生成的智能体显著超越了其基础版本。值得注意的是,我们的 32B 变体在 Terminal Bench 1.0、2.0 和 Pro 上分别达到了 29.06%、18.54% 和 34.00% 的 pass@1。此外,在我们的 RL 环境中应用直接多轮偏好优化 (https://huggingface.co/papers?q=Direct%20Multi-turn%20Preference%20Optimization) (DMPO (https://huggingface.co/papers?q=DMPO)) 还可获得额外的性能提升。这些结果系统性地表明,完全合成的可执行环境为掌握复杂的真实世界命令行工作流 (https://huggingface.co/papers?q=command-line%20workflows) 提供了可扩展且可验证的监督信号。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29559)查看 PDF (https://arxiv.org/pdf/2605.29559)GitHub (https://github.com/icip-cas/LiteCoder)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29559)

在您的智能体中获取此论文:

hf papers read 2605\.29559

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型2

Lite-Coder/LiteCoder-Terminal-4b-sft 4B• 更新于约1小时前 • 125 (https://huggingface.co/Lite-Coder/LiteCoder-Terminal-4b-sft)

Lite-Coder/LiteCoder-Terminal-30b-a3b-sft 31B• 更新于约1小时前 • 40 (https://huggingface.co/Lite-Coder/LiteCoder-Terminal-30b-a3b-sft)

引用此论文的数据集2

Lite-Coder/LiteCoder-Terminal-RL-preview 更新于约1小时前 • 1.23k • 3 (https://huggingface.co/datasets/Lite-Coder/LiteCoder-Terminal-RL-preview)

Lite-Coder/LiteCoder-Terminal-SFT 更新于约1小时前 • 363 • 1 (https://huggingface.co/datasets/Lite-Coder/LiteCoder-Terminal-SFT)

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.29559 即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。

Tmax:一种简单的终端智能体配方

Hugging Face Daily Papers

Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。