EnvACE:通过世界预演内化环境动态以实现智能体强化学习
摘要
EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - EnvACE:通过世界预演内化环境动力学以实现智能体强化学习
来源:https://huggingface.co/papers/2608.06197 发布于 8月6日
·
提交者 https://huggingface.co/xuzishan
3 于 8月7日
作者:
,
,
,
,
,
,
,
,
,
,
摘要
训练大型语言模型智能体进行长时程工具使用,通常依赖于与真实或合成的可执行环境的交互——这些环境的构建和验证成本高昂——或者依赖于难以落地(ground)的外部模拟器。我们提出了 EnvACE,一种智能体强化学习方法,在训练期间用世界预演(world rehearsal)替代外部环境交互。该策略在行动与预演之间交替:它首先生成一个工具调用,然后扮演环境角色,产生该行动所引发的响应,并让后续决策基于预演出的响应。两种角色通过任务成功奖励进行端到端联合优化。通过世界预演,策略将行动与其环境响应之间的关系内化到其参数中,从而得到一个直接支持决策的智能体世界模型。在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 取得了强劲且可迁移的性能,在整体评估中优于环境扩展基线。受控研究进一步表明,世界预演在不同模型规模下均能持续改善策略学习。在测试时,内化的世界模型使智能体能够在执行承诺动作之前进行私有预演,从而在中等预演预算下、无需额外外部交互即可获得进一步提升。我们的研究结果确立了世界预演作为一条超越外部环境约束来扩展 LLM 智能体训练的新路径。我们的代码公开于 https://github.com/Within-yao/EnvACE。
查看 arXiv 页面 · 查看 PDF · 项目页面 · GitHub3 · 添加到收藏
在你的智能体中获取此论文:
hf papers read 2608.06197
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏,即可从本页链接到该收藏。
相似文章
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
AEM:用于多轮智能体强化学习的自适应熵调制
本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。
MetaResearcher:在对抗性虚拟环境中通过自我反思强化学习扩展深度研究
MetaResearcher 提出了一种框架,用于在对抗性虚拟环境中通过自我反思强化学习训练深度研究智能体,解决了静态环境和仅事实检索任务的局限性。
超越静态评估:构建用于可扩展智能体强化学习的仿真环境
介绍AgenticAI-Supervisor,一个基于API和UI驱动的仿真环境,用于LLM智能体的可扩展强化学习,通过可验证的执行结果和奖励塑造来缓解奖励破解。
Ecom-RLVE:面向电商对话代理的自适应可验证环境
Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。