EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Hugging Face Daily Papers 论文

摘要

EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。

训练大型语言模型智能体进行长程工具使用通常依赖于与真实或合成的可执行环境的交互,这些环境的构建和验证成本高昂,或者依赖于难以与实际环境对应的外部模拟器。我们提出了 EnvACE,一种智能体强化学习方法,用世界预演替代训练期间与外部环境的交互。策略在行动与预演之间交替:它首先生成工具调用,然后扮演环境角色,生成该行动所引发的响应,并基于预演的响应来决定后续决策。这两种角色使用任务成功奖励进行端到端联合优化。通过世界预演,策略在其参数中内化了动作与环境响应之间的关系,形成一种直接支持决策的智能体世界模型。在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 取得了强劲且可迁移的性能,在整体评估中优于环境扩展类基线。对照研究进一步表明,世界预演在不同模型规模上都能持续提升策略学习效果。在测试时,内化的世界模型使得在正式执行前可以进行私有预演,在适度的预演预算下无需额外的外部交互即可带来进一步收益。我们的发现确立了世界预演作为一条新路径,使 LLM 智能体训练能够突破外部环境的约束进行扩展。我们的代码公开在 https://github.com/Within-yao/EnvACE。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - EnvACE:通过世界预演内化环境动力学以实现智能体强化学习

来源:https://huggingface.co/papers/2608.06197 发布于 8月6日

·

提交者 https://huggingface.co/xuzishan

3 于 8月7日

作者:

摘要

训练大型语言模型智能体进行长时程工具使用,通常依赖于与真实或合成的可执行环境的交互——这些环境的构建和验证成本高昂——或者依赖于难以落地(ground)的外部模拟器。我们提出了 EnvACE,一种智能体强化学习方法,在训练期间用世界预演(world rehearsal)替代外部环境交互。该策略在行动与预演之间交替:它首先生成一个工具调用,然后扮演环境角色,产生该行动所引发的响应,并让后续决策基于预演出的响应。两种角色通过任务成功奖励进行端到端联合优化。通过世界预演,策略将行动与其环境响应之间的关系内化到其参数中,从而得到一个直接支持决策的智能体世界模型。在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上,EnvACE 取得了强劲且可迁移的性能,在整体评估中优于环境扩展基线。受控研究进一步表明,世界预演在不同模型规模下均能持续改善策略学习。在测试时,内化的世界模型使智能体能够在执行承诺动作之前进行私有预演,从而在中等预演预算下、无需额外外部交互即可获得进一步提升。我们的研究结果确立了世界预演作为一条超越外部环境约束来扩展 LLM 智能体训练的新路径。我们的代码公开于 https://github.com/Within-yao/EnvACE。

查看 arXiv 页面 · 查看 PDF · 项目页面 · GitHub3 · 添加到收藏

在你的智能体中获取此论文:

hf papers read 2608.06197

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.06197,即可从本页链接到该 Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏,即可从本页链接到该收藏。

相似文章

AEM:用于多轮智能体强化学习的自适应熵调制

Hugging Face Daily Papers

本文介绍了AEM,这是一种用于智能体强化学习的无监督方法,通过在响应级别自适应调整熵动态来改善探索与利用之间的平衡。通过在ALFWorld和SWE-bench等基准测试上展示性能提升,该方法将不确定性估计与动作粒度对齐。

Ecom-RLVE:面向电商对话代理的自适应可验证环境

Hugging Face Blog

Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。