@rohanpaul_ai:你的代理训练环境应该和评估集一样吗?AgentMercury说不,并且展示了从…构建的世界能更广泛地迁移。

X AI KOLs Following 论文

摘要

AgentMercury表明,在基于纯文本描述生成的模拟商业环境中训练AI代理,即使训练环境与评估基准无关,也能有效迁移到评估基准。该系统通过在构建轨迹上进行微调提升了性能。

你的代理训练环境应该和评估集一样吗? AgentMercury说不,并且展示了从商业场景构建的世界能更广泛地迁移。 在一个与你的基准无关的虚假公司内训练代理,它仍然能在你的基准上表现更好。 AgentMercury从纯文本商业描述中生成了4,783个模拟公司,每个公司都有自己的服务、工具和数据库,然后从中提取训练任务。 构建这些世界也被证明是可学习的。一个模型在30个未见简报中只有3.3%的概率创建有效公司,但在构建轨迹上微调后达到83.3%,与Claude Opus 4.8相匹配。 – arxiv.org/abs/2608.20634 标题:"AgentMercury:你的代理可以大规模为商业场景合成可验证的环境"
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:34

你的智能体训练环境是否应与评估集一致?

AgentMercury 的答案是否定的,并证明了从商业场景构建的世界具有更强的迁移能力。

在一个与你的基准测试毫无关联的虚拟公司中训练智能体,它依然能在你的基准测试中表现得更出色。

AgentMercury 基于简洁的商业描述,生成了 4,783 家模拟公司,每家公司都拥有独立的服务、工具和数据库,并从中提取训练任务。

构建这些世界的过程本身也具有可学习性。一个模型最初仅能针对 30 份未见过的商业简介中的 3.3% 构建出有效公司,但在基于构建轨迹进行微调后,这一比例达到了 83.3%,性能与 Claude Opus 4.8 相当。

– arxiv.org/abs/2608.20634

标题:“AgentMercury:你的智能体可以大规模合成用于商业场景的可验证环境”

相似文章

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua