LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
摘要
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
查看缓存全文
缓存时间: 2026/05/29 02:59
论文页面 - LiteCoder-Terminal:扩展长程终端环境以学习语言智能体
来源:https://huggingface.co/papers/2605.29559
摘要
LiteCoder-Terminal-Gen 通过合成、可执行的终端环境,实现了语言智能体的可扩展训练,其性能超越传统方法。
掌握终端环境 (https://huggingface.co/papers?q=terminal%20environments) 需要语言智能体 (https://huggingface.co/papers?q=language%20agents) 具备多步规划 (https://huggingface.co/papers?q=multi-step%20planning)、基于反馈的执行 (https://huggingface.co/papers?q=feedback-grounded%20execution) 以及动态状态适应 (https://huggingface.co/papers?q=dynamic%20state%20adaptation) 能力。然而,当前训练此类智能体受限于对外部抓取仓库的依赖,这限制了领域多样性、环境可控性以及针对特定能力缺陷的定位。我们提出 LiteCoder-Terminal-Gen,一个零依赖合成流水线 (https://huggingface.co/papers?q=zero-dependency%20synthesis%20pipeline),能够直接从领域规范自主生成可执行且可验证的终端训练环境。利用该框架,我们构建了两个大规模资源:LiteCoder-Terminal-SFT,包含跨越10个领域的11,255条专家轨迹 (https://huggingface.co/papers?q=expert%20trajectories);以及 LiteCoder-Terminal-RL,包含602个可验证环境,用于轨迹级偏好优化 (https://huggingface.co/papers?q=trajectory-level%20preference%20optimization)。
对 Qwen 系列模型在我们的 SFT 数据集上进行监督微调 (https://huggingface.co/papers?q=Supervised%20fine-tuning) 后,生成的智能体显著超越了其基础版本。值得注意的是,我们的 32B 变体在 Terminal Bench 1.0、2.0 和 Pro 上分别达到了 29.06%、18.54% 和 34.00% 的 pass@1。此外,在我们的 RL 环境中应用直接多轮偏好优化 (https://huggingface.co/papers?q=Direct%20Multi-turn%20Preference%20Optimization) (DMPO (https://huggingface.co/papers?q=DMPO)) 还可获得额外的性能提升。这些结果系统性地表明,完全合成的可执行环境为掌握复杂的真实世界命令行工作流 (https://huggingface.co/papers?q=command-line%20workflows) 提供了可扩展且可验证的监督信号。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29559)查看 PDF (https://arxiv.org/pdf/2605.29559)GitHub (https://github.com/icip-cas/LiteCoder)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29559)
在您的智能体中获取此论文:
hf papers read 2605\.29559
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型2
Lite-Coder/LiteCoder-Terminal-4b-sft 4B• 更新于约1小时前 • 125 (https://huggingface.co/Lite-Coder/LiteCoder-Terminal-4b-sft)
Lite-Coder/LiteCoder-Terminal-30b-a3b-sft 31B• 更新于约1小时前 • 40 (https://huggingface.co/Lite-Coder/LiteCoder-Terminal-30b-a3b-sft)
引用此论文的数据集2
Lite-Coder/LiteCoder-Terminal-RL-preview 更新于约1小时前 • 1.23k • 3 (https://huggingface.co/datasets/Lite-Coder/LiteCoder-Terminal-RL-preview)
Lite-Coder/LiteCoder-Terminal-SFT 更新于约1小时前 • 363 • 1 (https://huggingface.co/datasets/Lite-Coder/LiteCoder-Terminal-SFT)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.29559 即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Terminal-World: 通过智能体技能扩展终端代理环境
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
基于Docker化环境的大规模终端智能体轨迹生成
TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。
Tmax:一种简单的终端智能体配方
Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。
@hamishivi: 和朋友一起训练了一些终端代理!介绍 Tmax,开放强化学习终端代理模型。在默认设置下和……
介绍 Tmax,开放强化学习终端代理模型,其在终端使用上超越了先前的开放工作。所有数据、权重和运行结果均将公开发布。