@maximelabonne:如此酷炫的协作,非常开心看到这类训练方案被开源 ❤️ 在所有 harness 上训练 LFM2.5-2.6B!

X AI KOLs Timeline 新闻

摘要

Maximilien Labonne 强调了一份开源指南,介绍如何在 Claude Code、Codex 和 OpenCode 等真实 agent harness 中使用强化学习训练模型,使得任何模型(如 LFM2.5-2.6B)都能在任何 harness 上针对任意任务集进行训练。

如此酷炫的协作,非常开心看到这类训练方案被开源 ❤️ 在所有 harness 上训练 LFM2.5-2.6B!
查看原文
查看缓存全文

缓存时间: 2026/10/02 04:34

太酷的合作了,非常高兴看到这样的教程被开源 ❤️

用 RL 把 LFM2.5-2.6B 在所有 harness 上训练一遍吧!

Adithya S K (@adithya_s_k): 1/ 很激动能发布这份《多 harness RL 终极指南》

同一个模型在每个 agent harness 中的行为都不一样。所以我们构建了一种开源方式,可以在人们真正在用的 harness 内部——比如 Claude Code、Codex 和 OpenCode——用 RL 训练任意模型处理任意任务集,无需

相似文章

多 harness 强化学习终极指南

Reddit r/LocalLLaMA

Hugging Face 的 post-training 团队发布了一份详细指南,介绍了如何在多种 coding harness 中训练开源模型,使用了 TRL 等开源库以及用于 RL 环境的 Harbor 框架,为在任意开源模型上最大化性能提供了一套方法。