@maximelabonne:如此酷炫的协作,非常开心看到这类训练方案被开源 ❤️ 在所有 harness 上训练 LFM2.5-2.6B!
摘要
Maximilien Labonne 强调了一份开源指南,介绍如何在 Claude Code、Codex 和 OpenCode 等真实 agent harness 中使用强化学习训练模型,使得任何模型(如 LFM2.5-2.6B)都能在任何 harness 上针对任意任务集进行训练。
查看缓存全文
缓存时间: 2026/10/02 04:34
太酷的合作了,非常高兴看到这样的教程被开源 ❤️
用 RL 把 LFM2.5-2.6B 在所有 harness 上训练一遍吧!
Adithya S K (@adithya_s_k): 1/ 很激动能发布这份《多 harness RL 终极指南》
同一个模型在每个 agent harness 中的行为都不一样。所以我们构建了一种开源方式,可以在人们真正在用的 harness 内部——比如 Claude Code、Codex 和 OpenCode——用 RL 训练任意模型处理任意任务集,无需
相似文章
多 harness 强化学习终极指南
Hugging Face 的 post-training 团队发布了一份详细指南,介绍了如何在多种 coding harness 中训练开源模型,使用了 TRL 等开源库以及用于 RL 环境的 Harbor 框架,为在任意开源模型上最大化性能提供了一套方法。
@billxbf: 很高兴发布 Polar,这是我们用于真实世界工具集的智能体强化学习部署基础设施。无论是 Codex、Claude Code、OpenClaw、Herm…
Polar 是一种智能体强化学习部署基础设施,允许将真实世界的工具集直接用作训练环境,无需修改代码,支持 Codex、Claude Code、OpenClaw 和 Hermes 等模型。
@DirhousssiAmine:TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。你现在可以使用 harn…
TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。
@Suhail:这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!
Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。
@SergioPaniego:前沿智能体之所以如此出色,部分原因是模型在与其一同交付的同一框架内进行了训练。很高兴看到这…
Sergio Paniego 强调,前沿智能体的性能得益于模型在其部署框架内进行训练。NVIDIA AI 的新工作“Polar: Agentic RL on Any Harness at Scale”能够将 Codex、Claude Code、Qwen Code 或 Pi 等框架转化为强化学习训练环境,而无需修改其内部结构。