T1:面向长期任务的终端智能体强化学习
摘要
T1 是一个拥有122B参数的混合专家模型,通过强化学习训练用于长期终端任务,在Terminal-Bench 2.1等基准测试中达到了最先进的结果,并超越了GPT-5.4和GLM-5.1等模型。
查看缓存全文
缓存时间: 2026/09/11 02:14
论文页面 - T1: 面向长期任务的终端智能体强化学习
来源:https://huggingface.co/papers/2609.11042 发布于 9月10日
·
由 https://huggingface.co/TberiusJunyao 提交
Junyao (https://huggingface.co/TberiusJunyao) 于 9月10日
摘要
T1 是一个通过强化学习训练的 122B 参数混合专家模型,旨在云沙箱中执行长期终端任务,通过稳定的演员-评论家优化和分布外训练实现了最先进的结果。
智能体的应用正转向编码和科学发现等长期任务,其中终端任务尤为重要。我们介绍了 T1,这是一个通过强化学习训练的总参数为 122B 的混合专家模型,在云沙箱中操作真实 shell,每个任务可执行多达 300 多个工具调用轮次,并通过执行每个任务自身的验证器获得奖励。我们提供了一套完整的方案:首先,进行积极的预热启动以稳定演员-评论家训练,使用密集的过程奖励,根据通过验证器的绝对数量对轨迹进行评分。其次,通过 TITO 构建实现稳定优化,基于采样的精确令牌标识符进行训练,并在轮次边界进行漂移修复,以及采用路由回放重放,在每个 MoE 层记录采样器的逐令牌专家选择,并在训练期间回放。第三,使用完全分布外的训练语料库:独立的种子和与 Terminal-Bench 2.1 不重叠的合成任务,确保性能提升反映了真实的能力迁移而非基准过拟合。综合来看,TITO 和路由回放重放将训练到推理的对数概率差从 0.021 降至 0.013,并在损失区域实现了完全对齐的零令牌漂移。在 Terminal-Bench 2.1 上,我们的后训练流程将初始基础模型的通过率从 43.8% 提升至 T1 的 64.0%。在长期终端基准测试中,T1 达到了 27.9%,超越了 GPT-5.4 和 GLM-5.1。
查看 arXiv 页面 (https://arxiv.org/abs/2609.11042) 查看 PDF (https://arxiv.org/pdf/2609.11042) 项目页面 (https://jyyang26.github.io/t1/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.11042)
在你的智能体中获取此论文:
hf papers read 2609.11042
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
TberiusJunyao/T1-122B-A10B 图文转文本• 125B• 更新于约 1 小时前 • 26 • 1 (https://huggingface.co/TberiusJunyao/T1-122B-A10B)
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.11042 以从此页面链接它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2609.11042 以从此页面链接它。
包含此论文的收藏 1
相似文章
Tmax:一种简单的终端智能体配方
Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。
在长时间终端任务上测试智能体 (GitHub Repo)
长时域终端基准 (LHTB) 是一个包含46项任务的基准,用于评估LLM智能体在数百步的持续终端工作中的表现。结果显示,即使是最好的模型也只能解决约28%的任务。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
@hamishivi: 和朋友一起训练了一些终端代理!介绍 Tmax,开放强化学习终端代理模型。在默认设置下和……
介绍 Tmax,开放强化学习终端代理模型,其在终端使用上超越了先前的开放工作。所有数据、权重和运行结果均将公开发布。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。