@Suhail:这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!
摘要
Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。
这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!
查看缓存全文
缓存时间: 2026/06/28 12:00
这是一篇关于用强化学习进行后训练LLM的非常好的入门文章。整个配方和数据都是开源的。强烈推荐!
Hamish Ivison @ ICML (@hamishivi): 和朋友们一起训练了一些终端代理!
介绍Tmax,开源的RL终端代理模型。在默认设置和较短(65k)token预算下,Tmax在终端使用方面优于以往的开源工作。我们正在公开发布所有数据+权重+回放样本!
相似文章
@hamishivi: 和朋友一起训练了一些终端代理!介绍 Tmax,开放强化学习终端代理模型。在默认设置下和……
介绍 Tmax,开放强化学习终端代理模型,其在终端使用上超越了先前的开放工作。所有数据、权重和运行结果均将公开发布。
@adithya_s_k: [必读] 我不知道这怎么会逃过我的注意。这可能是最好的开源端到端后训练…
一个开源的端到端后训练配方,涵盖SFT、RL和测试时扩展,包括模型、数据集和代码。
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
Tmax:一种简单的终端智能体配方
Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。
Show HN:我通过强化学习训练了一个智能体,它再用强化学习训练模型(花费 –$1.3k)
一位开发者构建了一个管道,其中经过强化学习训练的AI智能体创建并提交针对小模型的强化学习训练任务,并根据智能体的表现给予奖励。该项目完全开源,并展示了向保留任务的迁移能力。