EnvACE:通过世界预演内化环境动态以实现智能体强化学习
摘要
EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - EnvACE:通过世界预演内化环境动力学以实现智能体强化学习
来源:https://huggingface.co/papers/2608.06197 发布于 8月6日
·
提交者 https://huggingface.co/xuzishan
3 于 8月7日
作者:
,
,
,
,
,
,
,
,
,
,
摘要
训练大型语言模型智能体进行长时程工具使用,通常依赖于与真实或合成的可执行环境的交互——这些环境的构建和验证成本高昂——或者依赖于难以落地(ground)的外部模拟器。我们提出了 EnvACE,一种智能体强化学习方法,在训练期间用世界预演(world rehearsal)替代外部环境交互。该策略在行动与预演之间交替:它首先生成一个工具调用,然后扮演环境角色,产生该行动所引发的响应,并让后续决策基于预演出的响应。两种角色通过任务成功奖励进行端到端联合优化。通过世界预演,策略将行动与其环境响应之间的关系内化到其参数中,从而得到一个直接支持决策的智能体世界模型。在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 取得了强劲且可迁移的性能,在整体评估中优于环境扩展基线。受控研究进一步表明,世界预演在不同模型规模下均能持续改善策略学习。在测试时,内化的世界模型使智能体能够在执行承诺动作之前进行私有预演,从而在中等预演预算下、无需额外外部交互即可获得进一步提升。我们的研究结果确立了世界预演作为一条超越外部环境约束来扩展 LLM 智能体训练的新路径。我们的代码公开于 https://github.com/Within-yao/EnvACE。
查看 arXiv 页面 · 查看 PDF · 项目页面 · GitHub3 · 添加到收藏
在你的智能体中获取此论文:
hf papers read 2608.06197
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏,即可从本页链接到该收藏。
相似文章
EnvHarness: 唤醒静态世界以用于智能体学习
EnvHarness 引入了一个可编程层,用于动态重塑静态环境以进行强化学习,通过 EnvRigger 自动针对弱点来提升智能体性能。
EnvCraft: 在Agentic RL中为Claw-like Agent合成可执行环境
EnvCraft是一个自动化框架,用于合成可执行环境,以解决Agentic RL训练中的稀缺性问题,并在使用Qwen模型的claw-like和通用工具使用基准测试中展示了显著的性能提升。
Envs-FORGE:面向智能体强化学习的前沿优化奖励导向环境合成
Envs-FORGE是一种提示策略,用于为强化学习智能体合成训练环境,将验证器奖励转换为每个种子操作,以提高在SWE-bench和Terminal-Bench等基准测试上的性能。
EnvFactory:通过可执行环境合成与鲁棒强化学习扩展工具使用智能体
EnvFactory 自动化创建可执行工具环境和自然的多轮轨迹,用于训练具有智能体强化学习能力的大语言模型,在使用比先前工作更少的环境下,在 BFCLv3 和 MCP-Atlas 等基准测试上取得了优异性能。
EDGE:用于智能体强化学习中引导探索的经验蒸馏
EDGE 提出一种框架,通过经验蒸馏引导智能体强化学习中的探索,提升了在 ALFWorld 和 WebShop 等任务上的表现。