@jeongminby98858: 新论文发布 论文: https://arxiv.org/abs/2608.20634 项目: https://minstar.github.io/AgentMercury/index.html… h…

X AI KOLs Timeline 论文

摘要

一篇新的研究论文介绍了 AgentMercury,这是一个可扩展的框架,用于从商业场景合成可执行环境,从而提升代理在各种基准测试中的训练性能。

新论文发布 论文: https://arxiv.org/abs/2608.20634 项目: https://minstar.github.io/AgentMercury/index.html… huggingface: https://huggingface.co/collections/Minbyul/agentmercury…
查看原文
查看缓存全文

缓存时间: 2026/08/24 15:55

新论文发布: https://arxiv.org/abs/2608.20634 项目主页: https://minstar.github.io/AgentMercury/index.html… HuggingFace: https://huggingface.co/collections/Minbyul/agentmercury…


AgentMercury:您的代理可大规模为商业场景合成可验证环境

来源:https://arxiv.org/html/2608.20634 Chanwoong Yoon隶属机构:马萨诸塞大学阿默斯特分校邮箱:[email protected]

摘要

智能体通过与环境交互来学习行动,但训练所用的环境通常是手工构建或围绕预定义任务与基准进行合成的。这种以任务为中心的范式难以扩展出反映真实且动态演化工作流的环境——这些环境中,多样化的任务可以从底层世界中自然涌现。我们推出AgentMercury,一个可扩展框架,用于从高层次商业场景合成可执行环境。AgentMercury并非为特定任务构建环境,而是首先实例化一个包含实体、服务、工具、状态及可执行跨服务不变量的持久化世界,随后多样化任务与交互轨迹可从该世界中涌现。我们构建了覆盖14个行业、50个国家的4,783个可执行环境,并将其作为强化学习的训练基底。尽管生成时未针对评估基准,但基于这些商业环境训练的策略模型在企业工作流及涵盖推理、编程、科学计算和工具使用的域外基准上均取得显著提升。实验表明,Qwen3.5-4B在经过AgentMercury环境训练后,在EnterpriseOps-GYM上的表现从12.3提升至15.7,在AIME26上从45.9提升至56.0。我们进一步证明构建过程本身可被学习:在构建轨迹上微调Qwen3.5-35B-A3B,将可执行世界的创建成功率从3.3%提升至83.3%(针对保留商业场景)。这些结果表明,基于场景的环境能提供超越基准特定训练的实用且可泛化的学习信号,而环境构建本身也可成为可学习能力。我们公开了合成环境与任务、构建代码及训练后的策略模型,以支持关于可扩展环境生成与智能体学习的进一步研究。¹¹¹通讯作者:Minbyul Jeong

1引言

现代智能体系统通过行动与世界建模的互补能力来学习与环境交互²³ (https://arxiv.org/html/2608.20634#bib.bib19)。策略模型学习在给定当前状态下如何选择动作,而世界模型则预测环境如何对这些动作作出响应³⁴ (https://arxiv.org/html/2608.20634#bib.bib27); 10 (https://arxiv.org/html/2608.20634#bib.bib13); 50 (https://arxiv.org/html/2608.20634#bib.bib14)。这些能力共同定义了智能体行动、观察并推理其环境的交互循环⁴⁶ (https://arxiv.org/html/2608.20634#bib.bib18)。然而该循环通常假设世界已预先存在:环境的实体、服务、工具、状态与转移结构在智能体开始学习前即已确定。我们认为,这使得第三个角色在很大程度上处于学习循环之外:构建世界本身。如图2 (https://arxiv.org/html/2608.20634#S3.F2)所示,我们区分三种角色:(1) 决定存在何种世界的星球角色;(2) 决定智能体在该世界中行为的策略π;(3) 建模世界响应方式的世界模型W。尽管近期工作在策略学习与世界建模方面取得显著进展,但环境仍普遍被视为预定义产物,其实体、服务、初始状态与转移结构在智能体学习前即已指定³³ (https://arxiv.org/html/2608.20634#bib.bib34); 43 (https://arxiv.org/html/2608.20634#bib.bib33); 39 (https://arxiv.org/html/2608.20634#bib.bib35); 8 (https://arxiv.org/html/2608.20634#bib.bib12); 50 (https://arxiv.org/html/2608.20634#bib.bib14)。这使得一个关键问题在很大程度上仍处于学习循环之外:我们如何系统地构建智能体学习与运行的可执行世界?

环境很少作为独立世界被构建;它们通常围绕智能体需解决的任务进行设计。手工构建的环境为特定领域或任务指定实体、工具、状态与转移逻辑³² (https://arxiv.org/html/2608.20634#bib.bib26); 49 (https://arxiv.org/html/2608.20634#bib.bib40); 41 (https://arxiv.org/html/2608.20634#bib.bib39); 9 (https://arxiv.org/html/2608.20634#bib.bib38),而合成环境通常根据任务描述、用户指令或评估规范生成¹⁹ (https://arxiv.org/html/2608.20634#bib.bib36); 8 (https://arxiv.org/html/2608.20634#bib.bib12); 50 (https://arxiv.org/html/2608.20634#bib.bib14); 35 (https://arxiv.org/html/2608.20634#bib.bib11)。这种以任务为中心的范式使研究者能高效构建用于训练和评估智能体的可控环境,并推动了日益强大的基准的快速发展¹⁶ (https://arxiv.org/html/2608.20634#bib.bib10); 17 (https://arxiv.org/html/2608.20634#bib.bib8); 22 (https://arxiv.org/html/2608.20634#bib.bib9)。然而,它也将世界的构建与定义或评估该世界的任务相耦合。因此,所得环境通常针对使特定任务可执行或可衡量进行优化,而非代表可自然涌现多样化任务的更广泛场景⁴ (https://arxiv.org/html/2608.20634#bib.bib20)。因此,增加任务数量未必能增加底层世界的多样性³⁹ (https://arxiv.org/html/2608.20634#bib.bib35),而扩展基准覆盖范围也不能直接提供具有更丰富状态与行为的交互式环境可扩展空间⁸ (https://arxiv.org/html/2608.20634#bib.bib12)。

现实世界的智能体应用¹³ (https://arxiv.org/html/2608.20634#bib.bib25); 44 (https://arxiv.org/html/2608.20634#bib.bib37)则需要捕获持续工作流复杂性的环境,例如SWE⁷ (https://arxiv.org/html/2608.20634#bib.bib31)和Tau风格领域² (https://arxiv.org/html/2608.20634#bib.bib2); 31 (https://arxiv.org/html/2608.20634#bib.bib45)所代表的环境。在此类设定中,任务很少是独立于其周围上下文而定义的孤立目标,而是源于涉及用户意图、持久化状态、软件服务及多系统交互的动态工作流²⁶ (https://arxiv.org/html/2608.20634#bib.bib15); 18 (https://arxiv.org/html/2608.20634#bib.bib24); 1 (https://arxiv.org/html/2608.20634#bib.bib3); 40 (https://arxiv.org/html/2608.20634#bib.bib6); 48 (https://arxiv.org/html/2608.20634#bib.bib7)。因此,一个足够丰富的世界无需在构建时明确指定每个任务,即可支持多种不同任务与交互轨迹³ (https://arxiv.org/html/2608.20634#bib.bib16); 36 (https://arxiv.org/html/2608.20634#bib.bib17)。这推动了从以任务为中心的环境构建基于场景的世界生成⁴⁷ (https://arxiv.org/html/2608.20634#bib.bib5); 35 (https://arxiv.org/html/2608.20634#bib.bib11)的范式转变——高层次场景作为可执行世界及其可能任务的源泉。然而,实现此范式不仅需要生成任务描述或静态初始状态。生成的世界必须忠实实例化实体、服务、工具、状态表示、转移逻辑及管理场景的世界级不变量。商业工作流为此表述提供了自然场景,因为它结合了结构化操作流程与用户、软件系统、工具间多样交互及动态持久化状态。

图1:AgentMercury大规模合成多样化、可扩展且可验证的商业环境。(a) 合成环境覆盖14个行业和50个国家,包含4,783个环境,并对敏感信息进行匿名化处理以防止幻觉生成。(b) 与现有智能体环境³⁸ (https://arxiv.org/html/2608.20634#bib.bib4); 40 (https://arxiv.org/html/2608.20634#bib.bib6); 31 (https://arxiv.org/html/2608.20634#bib.bib45); 8 (https://arxiv.org/html/2608.20634#bib.bib12)在环境规模与多服务深度上的比较;AgentMercury兼具大规模与多服务深度。(c) 每个环境包含丰富的有状态结构,包括多个服务、工具、状态表及执行基于SQL的验证器以强制跨服务约束。基于此观点,我们推出AgentMercury,一个用于从高层次商业场景创作可执行环境的可扩展框架。AgentMercury并非始于单个任务,而是将场景视为构建可执行世界的规范。星球角色首先实例化世界,包括其实体、服务、工具、持久化状态、转移动态与世界级不变量。所生成的世界随后可在相同底层工作流下涌现多样化任务与轨迹,同时保持有状态和跨服务交互的一致性。特别地,世界级不变量被呈现为可执行的验证条件,而非硬编码为转移规则,使同一世界可支持不同任务,同时为评估其结果提供确定性信号。世界构建、任务实例化与智能体交互之间的分离,使环境能够独立于任何特定基准任务生成,并在训练与评估中重复使用。

所得环境集合表明,基于场景的构建可超越孤立任务实例进行扩展。如图1 (https://arxiv.org/html/2608.20634#S1.F1)所示,AgentMercury合成了覆盖14个行业、50个国家的4,783个可执行环境。与先前工作³⁸ (https://arxiv.org/html/2608.20634#bib.bib4); 40 (https://arxiv.org/html/2608.20634#bib.bib6); 31 (https://arxiv.org/html/2608.20634#bib.bib45); 8 (https://arxiv.org/html/2608.20634#bib.bib12)相比,我们的合成环境与任务在规模上具有竞争力,同时提供了显著更丰富的多服务与有状态交互。每个环境包含持久化状态、多个服务与工具,以及可通过交互验证的可执行跨服务约束。此构建过程并非围绕单个任务定义环境,而是创建持久化世界,多样化任务与交互轨迹可从中涌现。因此,所得集合为在独立于目标评估任务的世界中训练智能体提供了广泛基础。

我们首先探究这些基于场景的环境能否作为策略学习的有效训练基底。我们直接在AgentMercury合成的环境中通过强化学习训练策略模型,且未围绕目标基准任务构建训练环境。在这些世界中,策略必须与持久化状态交互、使用可用工具并满足底层商业场景引发的约束。随着训练进行,所得策略在这些可执行任务上提升了奖励值,更重要的是,在未用于构建训练环境的既定基准上也获得了提升。我们观察到在企业工作流及涵盖推理、编程、科学计算、知识与工具使用的域外基准上均有增益。这些结果表明,扩展基于场景的世界多样性,可提供超越训练期间所用特定任务的学习信号。

我们进而探究构建过程本身能否成为可学习能力。AgentMercury公开了将高层次商业场景转化为可执行世界的中间构建轨迹,包括实体、服务、持久化状态、转移逻辑与验证条件的变更。这些轨迹为学习可执行世界的构建与修改提供了结构化监督。利用此监督,我们微调策略模型以创作来自未见商业场景的可执行世界。所得模型在保留的创作任务上成功率显著提升,表明环境构建不仅是学习循环外执行的工程过程,其本身也可通过AgentMercury生成的构建轨迹来学习。这指向一个可扩展循环:基于场景的世界为智能体提供训练信号,而构建过程为扩展可用世界空间提供可学习接口。

总而言之,我们的贡献如下:(1) 我们推出AgentMercury,一个用于基于场景的可执行环境合成的可扩展框架,将智能体世界的构建显式作为智能体-环境系统中的星球角色。(2) 我们构建并公开了覆盖14个行业、50个国家的4,783个可执行商业环境,包含持久化状态、多服务交互与可执行跨服务约束,为强化学习提供可复用基底。(3) 我们证明在这些环境中训练的策略在企业工作流与广泛的域外基准(涵盖推理、编程、科学计算、知识与工具使用)上均有所提升,尽管训练环境的构建独立于目标评估任务。(4) 我们展示AgentMercury生成的构建轨迹本身可为环境创作提供有效监督。基于这些轨迹的微调使模型能够从高层次商业场景构建可执行世界,表明世界构建可成为可学习能力。(5) 我们公开合成环境、商业场景与任务指令、构建代码差异及训练后的策略模型,以促进关于可扩展环境生成与智能体学习的进一步研究。

2预备知识

策略模型。

策略模型指定智能体在环境中的行动方式。在每个时间步t,策略π将智能体可用信息映射为动作分布:

a_t∼π(⋅∣h_t) (1)

其中h_t表示截至时间步t智能体可用的交互历史。在完全可观测设定下,h_t可简化为当前状态s_t;但在本文考虑的部分可观测环境中,底层状态并未直接暴露给智能体。因此,策略决定了智能体在给定世界中如何行动,但未决定构成该世界的实体、服务或转移机制³⁴ (https://arxiv.org/html/2608.20634#bib.bib27)。

世界模型。

世界模型提供环境如何响应智能体行动而演化的预测性表示¹⁰ (https://arxiv.org/html/2608.20634#bib.bib13); 11 (https://arxiv.org/html/2608.20634#bib.bib23); 12 (https://arxiv.org/html/2608.20634#bib.bib22)。给定交互历史与动作,世界模型预测

相似文章

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua