@DirhousssiAmine:TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。你现在可以使用 harn…

X AI KOLs Following 工具

摘要

TRL 现在通过 OpenEnv 集成开箱即用地支持在 agent harness 上进行训练,支持使用 opencode 等 harness 进行训练。

🚀🚀 TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在 agent harness 上进行训练。 你现在可以使用 opencode 等 harness 进行训练。 🧵 https://t.co/Sqp7G8qii8
查看原文
查看缓存全文

缓存时间: 2026/08/06 16:45

🚀🚀 TRL 现在通过我们的 OpenEnv 集成,开箱即用地支持在智能体框架上进行训练。

你现在可以使用像 opencode 这样的框架进行训练。

🧵 https://t.co/Sqp7G8qii8

TRL 现在通过 OpenEnv 集成,开箱即用地支持在智能体框架上进行训练。

你现在可以使用像 opencode 这样的框架进行训练。

该框架在 OpenEnv 会话中运行。OpenEnv 部署了一个透明代理,转发其 vLLM 调用,并记录每一轮的 token ID 和 logprobs。 完成后,TRL 根据消息重建样本并执行 GRPO。

完整可运行示例:基于 DeepCoder 问题数据集的独立本地子进程沙箱。已在 Qwen3-8B 上验证。

http://github.com/huggingface/trl/blob/main/examples/scripts/openenv/opencode.py…

PR 详情:

相似文章

OpenForgeRL:在任何环境中训练基于框架的原生智能体

Hugging Face Daily Papers

OpenForgeRL 是一个开源框架,用于在各种环境中端到端训练基于框架的AI智能体。它通过轻量级代理和Kubernetes编排器,实现了在任何框架上大规模进行强化学习。该框架在智能体基准测试中取得了优异的结果,并表明强化学习能提高智能体的可靠性。

@SergioPaniego: https://x.com/SergioPaniego/status/2067270222671741360

X AI KOLs Timeline

OpenReward环境现在可以直接通过单个OpenRewardSpec集成到TRL的GRPOTrainer中,从而能够针对一系列RL环境进行零代码粘合训练。该集成处于实验阶段,是让环境和智能体RL成为TRL一等公民的更广泛努力的一部分。