@DirhousssiAmine:TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。你现在可以使用 harn…
摘要
TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。
查看缓存全文
缓存时间: 2026/08/06 16:45
🚀🚀 TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在智能体框架上进行训练。
你现在可以使用像 opencode 这样的框架进行训练。
🧵 https://t.co/Sqp7G8qii8
TRL 现在通过 OpenEnv 集成,开箱即用地支持在智能体框架上进行训练。
你现在可以使用像 opencode 这样的框架进行训练。
该框架在 OpenEnv 会话中运行。OpenEnv 部署了一个透明代理,转发其 vLLM 调用,并记录每一轮的 token ID 和 logprobs。 完成后,TRL 根据消息重建样本并执行 GRPO。
完整可运行示例:基于 DeepCoder 问题数据集的独立本地子进程沙箱。已在 Qwen3-8B 上验证。
http://github.com/huggingface/trl/blob/main/examples/scripts/openenv/opencode.py…
PR 详情:
相似文章
OpenForgeRL:在任何环境中训练基于框架的原生智能体
OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。
@adithya_s_k: 现在,您只需几行代码即可使用 TRL 在 OpenReward 提供的 350+ 个强化学习环境上进行训练
OpenReward 和 TRL 现在支持在超过 350 个强化学习环境中进行训练,只需极少代码。
@SergioPaniego: https://x.com/SergioPaniego/status/2067270222671741360
OpenReward环境现在可以直接通过单个OpenRewardSpec集成到TRL的GRPOTrainer中,从而能够针对一系列RL环境进行零代码粘合训练。该集成处于实验阶段,是让环境和智能体RL成为TRL一等公民的更广泛努力的一部分。
@billxbf: 很高兴发布 Polar,这是我们用于真实世界工具集的智能体强化学习部署基础设施。无论是 Codex、Claude Code、OpenClaw、Herm…
Polar 是一种智能体强化学习部署基础设施,允许将真实世界的工具集直接用作训练环境,无需修改代码,支持 Codex、Claude Code、OpenClaw 和 Hermes 等模型。
@SergioPaniego:前沿智能体之所以如此出色,部分原因是模型在与其一同交付的同一框架内进行了训练。很高兴看到这…
Sergio Paniego 强调,前沿智能体的性能得益于模型在其部署框架内进行训练。NVIDIA AI 的新工作“Polar: Agentic RL on Any Harness at Scale”能够将 Codex、Claude Code、Qwen Code 或 Pi 等框架转化为强化学习训练环境,而无需修改其内部结构。