@Suhail:这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!

X AI KOLs Following 模型

摘要

Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。

这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!
查看原文
查看缓存全文

缓存时间: 2026/06/28 12:00

这是一篇关于用强化学习进行后训练LLM的非常好的入门文章。整个配方和数据都是开源的。强烈推荐!

Hamish Ivison @ ICML (@hamishivi): 和朋友们一起训练了一些终端代理!

介绍Tmax,开源的RL终端代理模型。在默认设置和较短(65k)token预算下,Tmax在终端使用方面优于以往的开源工作。我们正在公开发布所有数据+权重+回放样本!

相似文章

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。

Tmax:一种简单的终端智能体配方

Hugging Face Daily Papers

Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。