T1:面向长期任务的终端智能体强化学习

Hugging Face Daily Papers 论文

摘要

T1 是一个拥有122B参数的混合专家模型,通过强化学习训练用于长期终端任务,在Terminal-Bench 2.1等基准测试中达到了最先进的结果,并超越了GPT-5.4和GLM-5.1等模型。

智能体的使用正转向长期任务,如编程和科学发现,其中终端任务尤为重要。我们介绍了T1,一个总参数为122B的混合专家模型,通过强化学习训练,在云沙箱中操作真实shell,每个任务最多执行300多次工具调用,并通过执行每个任务自己的验证器进行奖励。我们提供了一个全面的方案:首先,通过激进的热启动来稳定演员-评论家训练,使用密集的过程奖励根据通过验证器的绝对数量对轨迹进行评分。其次,通过TITO构建实现稳定优化,训练在确切的采样令牌标识符上,并在回合边界进行漂移修复,以及展开路由重放,记录采样器在每个MoE层的每令牌专家选择并在训练期间重放它们。第三,完全分布外训练语料库:孤立的种子和与Terminal-Bench 2.1不相交的合成任务确保了增益反映了真实的能力转移,而不是基准过拟合。总的来说,TITO和R3将训练到推理的对数概率差异从0.021降低到0.013,并且在损失区域实现了精确对齐的零令牌漂移。在Terminal-Bench 2.1上,我们的后训练流水线将初始基础模型从43.8%提升到T1的64.0%解决率。在长期终端基准测试上,T1达到了27.9%,并超越了GPT-5.4和GLM-5.1。
查看原文
查看缓存全文

缓存时间: 2026/09/11 02:14

论文页面 - T1: 面向长期任务的终端智能体强化学习

来源:https://huggingface.co/papers/2609.11042 发布于 9月10日

·

由 https://huggingface.co/TberiusJunyao 提交

Junyao (https://huggingface.co/TberiusJunyao) 于 9月10日

摘要

T1 是一个通过强化学习训练的 122B 参数混合专家模型,旨在云沙箱中执行长期终端任务,通过稳定的演员-评论家优化和分布外训练实现了最先进的结果。

智能体的应用正转向编码和科学发现等长期任务,其中终端任务尤为重要。我们介绍了 T1,这是一个通过强化学习训练的总参数为 122B 的混合专家模型,在云沙箱中操作真实 shell,每个任务可执行多达 300 多个工具调用轮次,并通过执行每个任务自身的验证器获得奖励。我们提供了一套完整的方案:首先,进行积极的预热启动以稳定演员-评论家训练,使用密集的过程奖励,根据通过验证器的绝对数量对轨迹进行评分。其次,通过 TITO 构建实现稳定优化,基于采样的精确令牌标识符进行训练,并在轮次边界进行漂移修复,以及采用路由回放重放,在每个 MoE 层记录采样器的逐令牌专家选择,并在训练期间回放。第三,使用完全分布外的训练语料库:独立的种子和与 Terminal-Bench 2.1 不重叠的合成任务,确保性能提升反映了真实的能力迁移而非基准过拟合。综合来看,TITO 和路由回放重放将训练到推理的对数概率差从 0.021 降至 0.013,并在损失区域实现了完全对齐的零令牌漂移。在 Terminal-Bench 2.1 上,我们的后训练流程将初始基础模型的通过率从 43.8% 提升至 T1 的 64.0%。在长期终端基准测试中,T1 达到了 27.9%,超越了 GPT-5.4 和 GLM-5.1。

查看 arXiv 页面 (https://arxiv.org/abs/2609.11042) 查看 PDF (https://arxiv.org/pdf/2609.11042) 项目页面 (https://jyyang26.github.io/t1/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.11042)

在你的智能体中获取此论文:

hf papers read 2609.11042

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 1

TberiusJunyao/T1-122B-A10B 图文转文本• 125B• 更新于约 1 小时前 • 26 • 1 (https://huggingface.co/TberiusJunyao/T1-122B-A10B)

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.11042 以从此页面链接它。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2609.11042 以从此页面链接它。

包含此论文的收藏 1

相似文章

Tmax:一种简单的终端智能体配方

Hugging Face Daily Papers

Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。