Echoverse:大规模训练计算机使用代理的深度演进环境
摘要
Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Echoverse:用于大规模训练计算机使用智能体的深度演化环境
来源:https://huggingface.co/papers/2607.28074 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
计算机使用智能体(computer-use agents)通过其行为所改变的结果来学习,因此训练这样的智能体需要能够让其操作、破坏并重置的应用程序。最关键的应用程序通常受登录限制且具有状态,因此合成环境便充当了它们的替身。近期的流水线能够批量生成此类环境,这使瓶颈从“环境中存在多少”转移到“每个环境内部是什么”。我们发现,其收益来自三个属性:环境携带多少行为深度(behavioural depth)、是否针对智能体实际失败的交互,以及是否能随模型一同改进。我们提出了 Echoverse,它将规范编译为有状态应用程序,其任务根据应用程序自身的数据库进行评分;同时构建了一个协同进化(co-evolution)循环,对每次已评分的推演(rollout)进行双重利用:既作为对环境、其任务及其验证器的修复,也作为模型的训练信号。在十二个这样的环境上训练后,一个 9B 模型在十四个评估划分上从 36.5% 提升到 67.1%,与教授它的更大规模前沿模型仅差 14 个百分点。我们逐一考察每个属性。在相同领域上,浅层环境将实站准确率(live-site accuracy)压到基础模型之下(80.0 降至 75.0),而深层环境则将其提升(80.0 升至 85.0,48.0 升至 65.0);跨多种渲染方式深入训练一种界面控件,其能力可迁移到未见的控件族以及开放互联网上;而修复单个环境就能使在该环境上训练的模型从 16.2% 提升到 38.5%。同样的世界也可用作强化学习环境,其中将基于事实的验证器与密集的逐步评判器相结合的奖励,将未见数据上的得分从 58.8% 提升到 68.0%。我们发布了四个环境作为基准,包括其应用程序、种子数据和基于事实的评分器。代码:https://aka.ms/echoverse
查看 arXiv 页面 (https://arxiv.org/abs/2607.28074)查看 PDF (https://arxiv.org/pdf/2607.28074)GitHub2 (https://github.com/microsoft/Echoverse)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28074)
在你的代理中获取这篇论文:
hf papers read 2607.28074
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型链接到该论文
在模型的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。
引用该论文的数据集 0
没有数据集链接到该论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。
引用该论文的 Spaces 0
没有 Space 链接到该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。
包含该论文的收藏集 0
没有收藏集包含该论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…
微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。
ECHO: 终端代理免费学习世界模型
ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。
@Vtrivedy10:基于人类反馈的合成环境生成——智能体作为一次性评估/环境生成器表现不佳,因为它们……
一条推文,介绍来自 langchain-ai/langchain-skills 的 eval-engineering 技能,该技能利用人类反馈为智能体评估生成对齐的环境、测试框架(harness)和任务。它解释了工作流程,并提供了该开源工具的安装说明。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
EnvScaler:通过程序综合为LLM智能体扩展工具交互环境
EnvScaler是一个自动化框架,通过程序综合为LLM智能体扩展工具交互环境,创建了191个多样化环境和7K个场景,以提升智能体在多轮、多工具交互任务上的性能。