ERPBench:企业软件中计算机使用代理的基于状态的评估范式
摘要
ERPBench 引入了一个基准,用于评估仅基于截图的计算机使用代理在实时 ERP 系统上的表现,表明强大的通用 GUI 性能无法转移到企业可靠性,并包含一个具有人工批准的生产工具,以实现安全部署。
arXiv:2609.17885v1 Announce Type: new
摘要:通过截图和模拟操作运行的计算机使用代理正在快速发展,但其评估仍然局限于通用桌面和网络任务。企业资源规划(ERP)系统运行着全球组织的财务、采购、库存和客户业务,为计算机使用代理提出了独特挑战:密集的界面、协调的多步骤交互,以及改变持久业务记录而非仅在屏幕上显示的错误。现有的企业基准依赖于专有平台或此类软件的模拟近似。我们引入了 ERPBench,这是一个在实时且可重现的 ERP 系统上评估仅基于截图代理的基准,并根据其数据库中的真实值对每个任务进行评分。除了基准,我们还提供了一个生产级工具,该工具将代理操作置于人工批准之后以实现安全部署,ERPBench 可自主运行。通过评估六个闭源和开源代理,我们证明了强大的通用 GUI 性能无法转移到企业可靠性。即使代理访问正确的表单并保存,存储的记录也经常是错误的:一些代理在高达 85% 的运行中保存,但仅在 3% 的情况下写入正确的值。我们进一步描述了企业工作流程特有的失败模式。
查看缓存全文
缓存时间: 2026/09/17 09:27
# 面向企业软件的计算机使用代理:基于状态的评估范式
来源:https://arxiv.org/html/2609.17885
## ERPBench:面向企业软件的计算机使用代理基于状态评估范式
致谢:© 2026 埃森哲。保留所有权利。
Kratika Bhagtani\*, Kusha Sridhar\*, Maziyar Baran Pouyan, Yuying Zhao, Eugene Siow††致谢:\*这些作者贡献均等。
###### 摘要
通过截图和模拟操作运行的计算机使用代理正在快速发展,但其评估仍主要局限于通用桌面和网页任务。企业资源规划系统运行着全球众多组织的财务、采购、库存和客户业务,对计算机使用代理提出了独特挑战:界面密集、需要协调多步骤交互,以及错误会修改持久业务记录而不仅仅是显示在屏幕上。现有的企业基准测试依赖于专有平台或此类软件的模拟近似。我们推出了ERPBench,这是一个在活且可重现的ERP系统上评估纯截图代理的基准,并根据数据库中的真实值对每个任务进行评分。除基准测试外,我们还呈现了一个生产级运行框架,该框架为安全部署设置了人工审批关卡以控制代理操作;ERPBench则自主运行该框架。通过评估六个闭源和开源代理,我们证明了强大的通用GUI性能并不等同于企业可靠性。即使代理成功导航到正确的表单并保存,存储的记录也常常是错误的:一些代理在高达85%的运行中保存成功,但写入正确值的比例可能低至3%。我们进一步刻画了企业工作流特有的故障模式。
###### 索引术语:
计算机使用代理、代理安全、企业软件、人机协同、ERP
††地址:埃森哲高级AI中心
\{kratika\.bhagtani, k\.sridhara\.murthy, maziyar\.baran\.pouyan, yuying\.d\.zhao, eugene\.siow\}@accenture\.com
## 1 引言
多模态大语言模型的进展催生了能够直接操作图形用户界面的*计算机使用代理*,它们通过截图和模拟鼠标键盘动作进行操作\[1 (https://arxiv.org/html/2609.17885#bib.bib1),2 (https://arxiv.org/html/2609.17885#bib.bib2),3 (https://arxiv.org/html/2609.17885#bib.bib3),4 (https://arxiv.org/html/2609.17885#bib.bib4)\]。在OSWorld\[5 (https://arxiv.org/html/2609.17885#bib.bib5)\]、WindowsAgentArena\[6 (https://arxiv.org/html/2609.17885#bib.bib6)\]和WebArena\[7 (https://arxiv.org/html/2609.17885#bib.bib7)\]等通用桌面和网页基准测试中,计算机使用代理的表现已接近或超过人类水平,表明通用GUI交互正变得易于处理。然而,这种进展并不必然适用于企业软件。诸如ERP和客户关系管理系统,涵盖财务、采购和库存等,在工作流结构和故障成本上与消费类应用存在根本性差异。在此类系统中,视觉上看似合理的交互是不够的:代理可能导航到正确的屏幕,点击预期的控件,并观察到真实的成功确认信息,但业务记录却未改变或出现错误。这种确认反映的是界面接受了操作,而非预定值进入了数据库:屏幕上输入的值可能从未与其似乎要填充的字段绑定,因此持久化的是过时、空缺或错误的数据。此类故障仅从截图可能无法发现,但会传播到下游的运营和财务流程中。
现有的GUI基准测试主要针对通用桌面和网页环境\[5 (https://arxiv.org/html/2609.17885#bib.bib5),6 (https://arxiv.org/html/2609.17885#bib.bib6),7 (https://arxiv.org/html/2609.17885#bib.bib7)\],而近期的企业基准测试使用专有平台或模拟的企业环境\[8 (https://arxiv.org/html/2609.17885#bib.bib8),9 (https://arxiv.org/html/2609.17885#bib.bib9),10 (https://arxiv.org/html/2609.17885#bib.bib10)\]。这些局限性促使我们提出一种能够衡量持久业务状态并在工作流中定位故障的评估范式。
我们将此范式称为*基于状态的评估*,并在ERPBench中实现。ERPBench构建于一个活体、自托管的ERPNext\[11 (https://arxiv.org/html/2609.17885#bib.bib11)\]实例之上,ERPNext是一个涵盖财务、采购、库存和客户管理的开源ERP系统。代理仅凭截图操作,而每个任务都根据数据库中的真实值进行评分,将基于执行的状态验证\[7 (https://arxiv.org/html/2609.17885#bib.bib7),5 (https://arxiv.org/html/2609.17885#bib.bib5)\]扩展至持久业务记录。这揭示了任务级指标可能掩盖的企业特有故障模式,包括陷入不可恢复交互循环的代理。
表1:与现有计算机使用代理基准测试的对比。ITSM = IT服务管理;CRM = 客户关系管理;ERP = 企业资源规划;A11y = 无障碍树;DOM = 文档对象模型;API = 应用程序编程接口。∼ = 部分(SCUBA:难度标签、里程碑奖励;非结构化层级或固定阶段评分)。*开放/可复现* = 环境可自托管,无需专有账户或许可。*需要结构化访问*下的✓是限制而非特性:此类输入有助于状态锚定,但假设了遗留的纯像素系统未暴露的A11y/DOM/API钩子。此前没有基准满足所有行;ERPBench是唯一将它们全部组合起来的基准。
| 属性 | OSWorld | WinArena | WorkArena | SCUBA | CRMArena-Pro | UI-CUBE | ERPBench(我们的) |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| **领域** | 通用 | 通用 | 企业 | 企业 | 企业 | 企业 | 企业 |
| **子领域** | OS | OS | IT服务管理 | CRM | CRM | 混合 | ERP |
| **平台** | Ubuntu | Windows | ServiceNow | Salesforce | Salesforce | 网页模拟 | ERPNext |
| **不同任务数** | 369 | 154 | 3360 | 192 | 2630(150次运行) | | |
| **纯像素输入** | × | × | × | ✓ | × | × | ✓ |
| **需要结构化访问** | ✓(A11y) | ✓(A11y) | ✓(A11y+DOM) | × | ✓(文本/API) | ✓(DOM) | × |
| **活体、非模拟应用** | ✓ | ✓ | ✓ | ✓ | ✓ | × | ✓ |
| **开放/可复现** | ✓ | × | × | × | × | ✓ | ✓ |
| **数据库验证的真实值** | × | × | × | ✓ | ✓ | × | ✓ |
| **人类基线** | ✓ | ✓ | × | × | × | ✓ | ✓ |
| **任务复杂度层级** | × | × | × | ∼ | × | ✓ | ✓ |
| **阶段式评分** | × | × | × | ∼ | × | × | ✓ |
| **正式的故障分类法** | × | × | × | × | × | × | ✓ |
ERPBench运行在我们提供的一个生产级框架上。在部署中,它为安全的企业使用\[2 (https://arxiv.org/html/2609.17885#bib.bib2)\]设置,将每个代理操作置于人工审批关卡之后。为进行基准测试,同一框架自主运行,用自动批准器替代人工审核。我们在涵盖单字段编辑、多字段记录创建和多屏幕链式工作流的任务上评估了六个闭源和开源计算机使用代理\[2 (https://arxiv.org/html/2609.17885#bib.bib2),1 (https://arxiv.org/html/2609.17885#bib.bib1),4 (https://arxiv.org/html/2609.17885#bib.bib4),12 (https://arxiv.org/html/2609.17885#bib.bib12),13 (https://arxiv.org/html/2609.17885#bib.bib13)\]。我们证明了高超的表面GUI能力并不等同于企业可靠性:成功导航的代理常在交互或提交阶段失败,即使是最强大的专有模型也表现出现有方法无法捕捉的企业特有故障。我们的贡献有三方面:(1) ERPBench,首个在活体、公开可复现的企业系统上实现像素级、基于状态评估的企业计算机使用代理基准测试,在开源ERP\[11 (https://arxiv.org/html/2609.17885#bib.bib11)\]上对纯截图代理进行数据库字段级别的评分。(2) 一个具有人机协同安全关卡的生产级框架,自主运行以对与生产部署相同的系统进行基准测试。(3) 首次系统性地分析企业特有的计算机使用代理故障,表明交互级评估高估了企业可靠性,并定位了代理出错的具体环节。
## 2 相关工作
计算机使用代理的评估沿着四个方向发展:通用GUI基准测试、企业计算机使用评估、代理安全性和计算机使用代理系统。
**通用GUI基准测试:** 最近的基准测试建立了标准化环境,用于评估在桌面和网页应用中的计算机使用代理。OSWorld\[5 (https://arxiv.org/html/2609.17885#bib.bib5)\]在真实桌面环境的开放式任务上评估多模态代理,而WindowsAgentArena\[6 (https://arxiv.org/html/2609.17885#bib.bib6)\]将评估扩展到Windows。WebArena\[7 (https://arxiv.org/html/2609.17885#bib.bib7)\]提供真实的网页环境,并根据底层环境状态而非渲染页面评估任务完成情况。总体而言,这些基准测试确立了交互和执行成功作为通用GUI代理的主要评估范式,但未对具有持久性、领域特定业务状态的企业应用进行建模。ERPBench建立在WebArena\[7 (https://arxiv.org/html/2609.17885#bib.bib7)\]的基于执行验证原则之上,但将其扩展至可在数据库字段级别验证的、持久性的关系型业务记录。
**企业计算机使用评估:** 一些近期的基准测试将计算机使用评估扩展到企业工作流。WorkArena\[14 (https://arxiv.org/html/2609.17885#bib.bib14)\]在ServiceNow的知识工作任务上评估网页代理,而SCUBA\[8 (https://arxiv.org/html/2609.17885#bib.bib8)\]使用应用程序API进行二进制和基于里程碑的评分,在Salesforce CRM工作流上评估计算机使用代理。CRMArena-Pro\[9 (https://arxiv.org/html/2609.17885#bib.bib9)\]在多样化的CRM工作流上评估LLM代理,但使用基于文本的交互而非截图驱动的GUI控制。EntWorld\[15 (https://arxiv.org/html/2609.17885#bib.bib15)\]在六个基于Docker的开源业务应用程序上评估企业GUI代理,使用基于SQL的确定性验证和模式驱动的任务生成。然而,EntWorld在截图之外还暴露了无障碍树,并未将运行分解为固定阶段或定义正式的故障分类法。UI-CUBE\[10 (https://arxiv.org/html/2609.17885#bib.bib10)\]与我们的工作尤为接近,它认为仅任务准确性不足以评估企业就绪性,并引入了跨企业工作流的运行可靠性评估。然而,UI-CUBE在模拟的网页应用上评估代理,在截图之外暴露DOM信息,并根据应用程序状态快照验证结果。相反,ERPBench在活体、自托管的ERP部署上评估纯截图代理,并将正确性锚定在持久性的数据库字段中。此外,ERPBench将执行分解为固定阶段,并引入了正式的故障分类法来定位企业代理失败的具体环节。
**代理安全性与人工监督:** 将计算机使用代理部署到企业系统中也引发了安全问题,因为GUI操作可能修改或不可逆地提交业务状态。先前的研究探讨了*人机协同*审批、自动化意图验证和代理安全意识作为控制风险操作的机制\[16 (https://arxiv.org/html/2609.17885#bib.bib16),17 (https://arxiv.org/html/2609.17885#bib.bib17),18 (https://arxiv.org/html/2609.17885#bib.bib18),19 (https://arxiv.org/html/2609.17885#bib.bib19)\]。这些工作主要评估安全机制或代理端的风险意识。相反,ERPBench将风险分级审批关卡整合到面向生产的执行框架中,并在基准测试期间自主运行相同基础设施,从而在预期用于部署的控制措施下评估企业可靠性。
**计算机使用代理系统:** 最近的系统包括Claude和OpenAI的计算机使用功能、OpenCUA、UI-TARS、Holo3-35B-A3B以及与OmniParser配对的Qwen3-VL,展示了基于截图进行计算机交互的不同方法,涵盖了从原生计算机使用能力和GUI专门训练到显式视觉元素解析的范围\[2 (https://arxiv.org/html/2609.17885#bib.bib2),3 (https://arxiv.org/html/2609.17885#bib.bib3),4 (https://arxiv.org/html/2609.17885#bib.bib4),1 (https://arxiv.org/html/2609.17885#bib.bib1),12 (https://arxiv.org/html/2609.17885#bib.bib12),20 (https://arxiv.org/html/2609.17885#bib.bib20),13 (https://arxiv.org/html/2609.17885#bib.bib13)\]。ERPBench将这些方法中的代表性系统作为基准测试对象;其贡献与这些模型开发工作相辅相成,专注于评估此类代理执行持久企业操作的可靠性,而非改进GUI锚定本身。
表1 (https://arxiv.org/html/2609.17885#S1.T1)从观察模态、部署方式、锚定方式和评分方式等维度对ERPBench与这些基准测试进行了定位。在上述四个方向中,此处比较的基准测试属于两个:通用GUI方向(OSWorld, WindowsAgentArena)和企业计算机使用评估方向(WorkArena, SCUBA, CRMArena-Pro, UI-CUBE);代理安全性和计算机使用代理系统方向则包含安全研究和代理模型,而非基准测试。ERPBench推进了企业计算机使用评估方向。ERPBench是唯一结合了纯像素观察(无需无障碍树、DOM或API)、活体且可自托管的应用程序、数据库验证的真实值、人类基线、任务复杂度层级、阶段式评分和正式故障分类法的基准测试;此前的每个基准测试仅满足其中一个子集。
## 3 ERPBench
ERPBench在本地部署于Docker的ERPNext(一个开源ERP系统)上评估计算机使用代理(图1 (https://arxiv.org/html/2609.17885#S3.F1))。代理像人一样通过浏览器驱动ERPNext:Chromium在虚拟显示(Xvfb)上渲染应用程序,并通过noVNC流传输。在每一步,代理仅观察该显示的1280×720截图,并通过模拟鼠标和键盘输入在像素坐标上操作。没有为感知或控制暴露DOM或无障碍树。这种像素输入、坐标输出的通道,模拟了代理在远程桌面或VDI部署后运行企业软件的方式,这种场景下没有API或无障碍钩子可用,这正是ERPBench构建所要评估的环境。本节其余部分描述ERPBench的四个组件:任务套件(第3.1节 (https://arxiv.org/html/2609.17885#S3.SS1))、在ERPNext上运行代理的框架(第3.2节 (https://arxiv.org/html/2609.17885#S3.SS2))、对每次运行评分的评分器(第3.3节 (https://arxiv.org/html/2609.17885#S3.SS3))以及人类基线(第3.4节 (https://arxiv.org/html/2609.17885#S3.SS4))。
图1:ERPBench系统概览,比较了两种框架配置:(A) 生产计算机使用代理框架。展示了来自不同计算机使用代理大脑的拟议操作如何通过Flask有限状态机观察器过渡到风险分类器。有风险或不可逆的操作(如删除记录)需要明确的人工批准才能在浏览器中执行。(B) 评估模式。用一个以200毫秒间隔轮询的自动批准器替代人工审核器。执行后状态由数据库评分器、部分(阶段)评分器和日志评分器处理。
图2:ERPBench框架用户界面:显示了实时操作员(人工)界面,分为四个功能面板:1 实时ERPNext应用:仅流式截图的工作空间。2 计划工作流操作日志:记相似文章
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。
ComponentBench: 诊断计算机使用代理中的组件级故障
ComponentBench 引入了一个基准和诊断管道,用于评估计算机使用代理在现代网页用户界面中的组件级交互,通过关注现实、短暂的交互来诊断跨模型的故障,从而填补当前评估方法的空白。
SaaS-Bench:计算机使用代理能否利用真实世界的SaaS解决专业工作流程?
SaaS-Bench是一个新的基准测试,基于23个可部署的SaaS系统,覆盖六个专业领域,包含106个长周期任务,用于评估计算机使用代理。实验表明,即使是最强的模型,端到端完成任务的比例也不足4%,凸显了当前代理能力的显著限制。
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
MyPCBench:面向个人智能计算机使用代理的基准测试
MyPCBench 在模拟的 Linux 桌面环境中,通过真实世界的网络应用评估作为个人助手的计算机使用代理,结果显示 Claude Opus 4.6 的任务完成率最高,达到 55.4%,但在涉及多个应用和长时间操作的任务上仍存在困难。