Echoverse:大规模训练计算机使用代理的深度演进环境

Hugging Face Daily Papers 论文

摘要

Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。

计算机使用代理从自身行为带来的变化中学习,因此训练这类代理需要可供其操作、破坏并重置的应用程序。最重要的应用程序通常需要登录且具有状态,因此合成环境便充当了它们的替代品。近期的流程能够批量生成此类环境,这使得瓶颈从“有多少环境”转移到“每个环境内部包含什么”。我们发现,收益来自三个属性:环境具有多大的行为深度、是否针对代理实际失败的操作,以及是否能随模型一起改进。我们提出了 Echoverse,它将规格编译为有状态的应用程序,其任务根据应用程序自身的数据库进行评分;同时采用一个共同进化循环,每次对带评分的运行轨迹进行两遍读取:一遍作为对环境、任务及其验证器的修复,另一遍作为模型的训练信号。在十二个这样的环境上训练后,一个 9B 模型在十四个评估子集上的准确率从 36.5% 提升至 67.1%,与教导它的、规模大得多的前沿模型仅相差十四个百分点。我们依次考察了每个属性。在相同领域上,浅层环境将真实站点准确率压低到基础模型之下(80.0 到 75.0),而深层环境则将其提高(80.0 到 85.0,以及 48.0 到 65.0);在多种呈现形式中深度练习一个界面控件,可以迁移到未参与训练的控件族和开放网络;而修复单个环境能使在其上训练的模型从 16.2% 提升到 38.5%。同样的世界也可用作强化学习环境,其中将具有实际依据的验证器与密集的逐步评判器相结合的奖励,将留出数据上的得分从 58.8% 提升至 68.0%。我们发布了四个环境作为基准,包含其应用程序、种子数据和具有实际依据的评分器。代码:https://aka.ms/echoverse
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Echoverse:用于大规模训练计算机使用智能体的深度演化环境

来源:https://huggingface.co/papers/2607.28074 作者:

摘要

计算机使用智能体(computer-use agents)通过其行为所改变的结果来学习,因此训练这样的智能体需要能够让其操作、破坏并重置的应用程序。最关键的应用程序通常受登录限制且具有状态,因此合成环境便充当了它们的替身。近期的流水线能够批量生成此类环境,这使瓶颈从“环境中存在多少”转移到“每个环境内部是什么”。我们发现,其收益来自三个属性:环境携带多少行为深度(behavioural depth)、是否针对智能体实际失败的交互,以及是否能随模型一同改进。我们提出了 Echoverse,它将规范编译为有状态应用程序,其任务根据应用程序自身的数据库进行评分;同时构建了一个协同进化(co-evolution)循环,对每次已评分的推演(rollout)进行双重利用:既作为对环境、其任务及其验证器的修复,也作为模型的训练信号。在十二个这样的环境上训练后,一个 9B 模型在十四个评估划分上从 36.5% 提升到 67.1%,与教授它的更大规模前沿模型仅差 14 个百分点。我们逐一考察每个属性。在相同领域上,浅层环境将实站准确率(live-site accuracy)压到基础模型之下(80.0 降至 75.0),而深层环境则将其提升(80.0 升至 85.0,48.0 升至 65.0);跨多种渲染方式深入训练一种界面控件,其能力可迁移到未见的控件族以及开放互联网上;而修复单个环境就能使在该环境上训练的模型从 16.2% 提升到 38.5%。同样的世界也可用作强化学习环境,其中将基于事实的验证器与密集的逐步评判器相结合的奖励,将未见数据上的得分从 58.8% 提升到 68.0%。我们发布了四个环境作为基准,包括其应用程序、种子数据和基于事实的评分器。代码:https://aka.ms/echoverse

查看 arXiv 页面 (https://arxiv.org/abs/2607.28074)查看 PDF (https://arxiv.org/pdf/2607.28074)GitHub2 (https://github.com/microsoft/Echoverse)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28074)

在你的代理中获取这篇论文:

hf papers read 2607.28074

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型链接到该论文

在模型的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。

引用该论文的数据集 0

没有数据集链接到该论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。

引用该论文的 Spaces 0

没有 Space 链接到该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.28074,即可在页面上链接该论文。

包含该论文的收藏集 0

没有收藏集包含该论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

@MSFTResearch:计算机操作AI代理在处理电子邮件和客户支持等多步骤工作流时表现不佳。Echoverse 在真实环…

X AI KOLs Timeline

微软研究院推出了 Echoverse,这是一组用于训练计算机操作代理的深度、不断进化的环境。一个9B模型在这些环境上训练后,其基线分数几乎翻倍,与GPT-5.4仅差14分。这表明高保真模拟以及模型、世界和验证器的共同进化显著提高了代理在多步骤工作流上的表现。

ECHO: 终端代理免费学习世界模型

Hugging Face Daily Papers

ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua