Workflow-GYM:面向真实世界专业领域中计算机使用代理任务的长期评估
摘要
Workflow-GYM 是一个用于评估 AI 代理在专业领域中长期 GUI 任务的基准。实验表明,即使是最先进的模型也仅能达到约 30% 的成功率,揭示了重大挑战。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - Workflow-GYM:迈向真实世界专业领域中计算机使用代理任务的长期评估
来源:https://huggingface.co/papers/2606.11042 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
当前的 AI 代理在长期的专业 GUI 工作流程中表现不佳,由于工作流程一致性和领域特定软件理解方面的问题,成功率极低。
近年来,AI 代理正快速朝着处理日益复杂、真实的现实世界任务迈进。然而,现有的基准测试很少评估代理是否能够操作图形用户界面,以跨多个领域完成长期、高价值的专业工作流程。当前的 GUI 基准测试仍然主要专注于通用软件、相对简单的应用和短时间范围的任务,导致我们对于现代代理能否遵循用户指令、自主操作领域专用专业软件并以端到端方式完成具有经济价值的工作几乎一无所知。为了弥补这一差距,我们引入了 Workflow-GYM,这是一个以专业领域和专用软件环境为核心的长期 GUI 任务基准测试。通过对最先进模型进行大量实验,我们发现即使是最强的模型也仅能达到略高于 30% 的成功率,这突显出专业的长期 GUI 工作流程对于当前的 GUI 代理仍然极具挑战性。进一步的分析揭示,当前代理难以维持长期工作流程的一致性,经常出现工作流程阶段遗漏、错误传播、目标漂移以及对专业软件环境理解不足等问题。我们的发现为当前代理系统的局限性提供了重要见解,并为下一代 GUI 代理研究指明了关键方向。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11042)
查看 PDF (https://arxiv.org/pdf/2606.11042)
项目页面 (https://workflow-gym.github.io/)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11042)
在你的代理中获取这篇论文:
hf papers read 2606.11042
没有最新的命令行客户端?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接该论文
在模型的 README.md 中引用 arxiv.org/abs/2606.11042 即可从此页面链接。
引用该论文的数据集0
没有数据集链接该论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.11042 即可从此页面链接。
引用该论文的 Space0
没有 Space 链接该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.11042 即可从此页面链接。
包含该论文的收藏集0
没有收藏集包含该论文
将这篇论文添加到收藏集中即可从此页面链接。
相似文章
CUA-Gym: 为计算机使用代理扩展可验证的训练环境与任务
CUA-Gym 引入了一个可扩展的流水线,用于为计算机使用代理生成可验证的训练环境和任务,从而解决数据稀缺问题。由此产生的数据集和模型在OSWorld-Verified和WebArena等基准测试上取得了强劲的性能。
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。
StartupBench: 基准测试:针对市场验证的端到端工作流程的通用代理
StartupBench 引入了一个基准,用于评估通用AI代理在真实世界创业工作流程中的表现,揭示顶级模型仅能完成约30%的任务,原因在于复杂指令遵循和领域特定专业知识方面的不足。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。