标签
Vincent Weisser 宣布发布超过365,000个开放的、基于代理的强化学习环境,适用于软件工程、终端和搜索代理。
Prime Intellect 发布超过36.5万个强化学习智能体任务,涵盖SWE、终端和搜索任务,通过单一API和指令即可访问。
本文介绍了RLVP(Reward the Outcome, Penalize the Path),一种强化学习方法,它使用可验证的路径违规惩罚和结果奖励,在实现高任务成功率的同时达到接近零的约束违规,提升了实际代理环境中的样本效率。
Qwen-AgentWorld 引入了适用于智能体环境的语言世界模型,涵盖七个领域,并具备长链思维推理能力。该工作包含一个新基准 AgentWorldBench,并且表明世界建模能够提升下游智能体的性能。
一篇关于面向大型语言模型的智能体环境工程的全面综述,涵盖环境建模、合成、评估与应用,重点聚焦于智能体与环境的协同演化。
OpenEnv,一个用于创建和部署隔离执行环境以进行智能体强化学习训练的框架,已迁移到 Hugging Face,现在由一个包括 Meta-PyTorch、NVIDIA 等的委员会管理。