@rohanpaul_ai:你的代理训练环境应该和评估集一样吗?AgentMercury说不,并且展示了从…构建的世界能更广泛地迁移。
摘要
AgentMercury表明,在基于纯文本描述生成的模拟商业环境中训练AI代理,即使训练环境与评估基准无关,也能有效迁移到评估基准。该系统通过在构建轨迹上进行微调提升了性能。
查看缓存全文
缓存时间: 2026/08/28 03:34
你的智能体训练环境是否应与评估集一致?
AgentMercury 的答案是否定的,并证明了从商业场景构建的世界具有更强的迁移能力。
在一个与你的基准测试毫无关联的虚拟公司中训练智能体,它依然能在你的基准测试中表现得更出色。
AgentMercury 基于简洁的商业描述,生成了 4,783 家模拟公司,每家公司都拥有独立的服务、工具和数据库,并从中提取训练任务。
构建这些世界的过程本身也具有可学习性。一个模型最初仅能针对 30 份未见过的商业简介中的 3.3% 构建出有效公司,但在基于构建轨迹进行微调后,这一比例达到了 83.3%,性能与 Claude Opus 4.8 相当。
– arxiv.org/abs/2608.20634
标题:“AgentMercury:你的智能体可以大规模合成用于商业场景的可验证环境”
相似文章
AgentMercury:您的代理能大规模合成业务场景的可验证环境
AgentMercury 引入了一个可扩展框架,用于从业务场景中合成可验证环境,使强化学习代理能够提升在企业工作流和域外基准测试中的性能。
训练需要可信的世界:用于智能体学习的验证合成网络环境
本文介绍了一个构建验证合成网络环境的框架,以改进网络智能体的训练,展示了在基准测试中增强的性能和可迁移性。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
@chl260: 你的代理不是瓶颈,环境才是。一旦代理超越冻结的基准,它们就不再具有教学意义了……
该文章主张冻结的基准在AI代理开发中不够用,建议从改进代理转向驾驭环境。
@jeongminby98858: 新论文发布 论文: https://arxiv.org/abs/2608.20634 项目: https://minstar.github.io/AgentMercury/index.html… h…
一篇新的研究论文介绍了 AgentMercury,这是一个可扩展的框架,用于从商业场景合成可执行环境,从而提升代理在各种基准测试中的训练性能。