Tmax:一种简单的终端智能体配方
摘要
Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。
查看缓存全文
缓存时间: 2026/06/23 05:40
论文页面 - Tmax: 终端智能体的简单配方
来源:https://huggingface.co/papers/2606.23321
摘要
一种针对终端智能体的新型强化学习训练方法,通过简化配方和扩展数据集实现了卓越性能,能够在比先前方法更少的参数下进行有效训练。
终端智能体迅速成为语言模型(https://huggingface.co/papers?q=language%20models)(LM)最流行的下游应用。尽管它们很普遍,但学术界对基于强化学习训练这类模型的研究相对较少,这很可能是因为基准测试难度大、数据缺乏以及缺乏简单的基线配方。我们提出了 Tmax,这是迄今为止最强大的开源终端智能体(https://huggingface.co/papers?q=terminal%20agents)强化学习配方,使开源数据配方更接近前沿水平。尽管方法简单,我们的配方仅用 9B 参数就在 Terminal-Bench 2.0(https://huggingface.co/papers?q=Terminal-Bench%202.0)上取得了 27% 的成绩,超越了先前工作中更大的模型。具体来说,我们使用一种新颖的分类法生成数据,结合了难度控制(https://huggingface.co/papers?q=difficulty%20control)、角色设定(https://huggingface.co/papers?q=personas)和验证器多样化(https://huggingface.co/papers?q=verifier%20diversification),这使得我们能够廉价地生成大量用于 RL 和 SFT 训练(https://huggingface.co/papers?q=SFT%20training)的终端环境。我们开源了终端数据集,其大小是先前发布的终端智能体数据集的 2.5 倍以上。然后,我们使用该数据通过一个简单的、仅基于结果的配方(https://huggingface.co/papers?q=outcome-only%20recipe)训练开放权重的模型。我们发布数据、模型和代码,作为未来终端智能体(https://huggingface.co/papers?q=terminal%20agents)开放学术研究的强基线,网址为 https://github.com/hamishivi/tmax。
查看 arXiv 页面(https://arxiv.org/abs/2606.23321)查看 PDF(https://arxiv.org/pdf/2606.23321)项目页面(https://wai-org.com/blog/tmax/)GitHub(https://github.com/hamishivi/tmax)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.23321)
引用本论文的模型12
allenai/tmax-27b 2.65M• 更新于约2小时前 • 4 (https://huggingface.co/allenai/tmax-27b)
allenai/tmax-9b 9B• 更新于约2小时前 • 3 (https://huggingface.co/allenai/tmax-9b)
allenai/qwen35-9b-openthoughts 9B• 更新于约2小时前 • 4 • 2 (https://huggingface.co/allenai/qwen35-9b-openthoughts)
allenai/tmax-2b 2B• 更新于约2小时前 • 1 (https://huggingface.co/allenai/tmax-2b)
浏览引用本论文的12个模型 (https://huggingface.co/models?other=arxiv:2606.23321)## 引用本论文的数据集11
allenai/tmax-15k-open-instruct 更新于约2小时前 • 14 • 1 (https://huggingface.co/datasets/allenai/tmax-15k-open-instruct)
allenai/tmax-sft 更新于约2小时前 • 6 (https://huggingface.co/datasets/allenai/tmax-sft)
allenai/TMax-15K 查看器• 更新于约2小时前 • 14.6k • 2 • 2 (https://huggingface.co/datasets/allenai/TMax-15K)
allenai/open-instruct-endless-terminals 更新于约2小时前 • 1 (https://huggingface.co/datasets/allenai/open-instruct-endless-terminals)
浏览引用本论文的11个数据集 (https://huggingface.co/datasets?other=arxiv:2606.23321)### 引用本论文的Space0
没有链接本论文的Space
请在Space的README.md中引用 arxiv.org/abs/2606.23321 以从本页面链接它。
包含本论文的收藏0
没有包含本论文的收藏
请将本论文添加到收藏(https://huggingface.co/new-collection)中以从本页面链接它。
相似文章
TMax:终端智能体的简易方案
TMax 提供了一种在终端环境中构建AI智能体的简单方法,结合实用的设计原则,实现高效的命令行自动化。
T1:面向长期任务的终端智能体强化学习
T1 是一个拥有122B参数的混合专家模型,通过强化学习训练用于长期终端任务,在Terminal-Bench 2.1等基准测试中达到了最先进的结果,并超越了GPT-5.4和GLM-5.1等模型。
@hamishivi: 和朋友一起训练了一些终端代理!介绍 Tmax,开放强化学习终端代理模型。在默认设置下和……
介绍 Tmax,开放强化学习终端代理模型,其在终端使用上超越了先前的开放工作。所有数据、权重和运行结果均将公开发布。
@Suhail:这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!
Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。