SimuWoB: 模拟真实世界移动应用以实现快速且逼真的GUI智能体基准测试

Hugging Face Daily Papers 论文

摘要

SimuWoB是一个合成基准测试,包含120个具有挑战性的移动GUI智能体任务,使用高保真虚拟环境并自动生成奖励。实验表明,当前智能体的平均成功率仅为27.92%,在长时程任务上降至17.82%,表明在复杂场景中存在显著弱点。

由大型语言模型驱动的移动GUI智能体发展迅速,迫切需要真实且全面的评估。现有基准测试优先考虑可重复性,但由于在真实应用上构建奖励的难度,通常局限于开源应用或文件操作任务,导致基准测试设置与实际使用之间存在差距。此外,大多数基准测试侧重于基本的定位与导航,对复杂、长时程交互的覆盖有限。为解决这些局限,我们提出了SimuWoB,一个完全合成的移动GUI智能体基准测试,包含120个涵盖多种类型和难度级别的挑战性任务。我们构建了一个鲁棒的虚拟环境生成框架,能够合成高保真任务和环境,并自动为每个任务提供有效奖励。每个环境都作为无需后端的网页通过URL部署,从而实现高效且可重复的评估。我们在多个最先进的移动GUI智能体上进行了全面实验。平均成功率仅为27.92%,在长时程任务上降至17.82%,这揭示了当前智能体在复杂场景下的显著弱点。与真实示例任务的评估结果比较表明,基于我们合成环境的智能体评估具有良好的泛化性。我们还提供了跨关键能力维度的诊断性见解,并讨论了对未来移动GUI智能体发展的启示。
查看原文
查看缓存全文

缓存时间: 2026/05/26 10:43

Paper page - SimuWoB:为快速且忠实评估 GUI 智能体而模拟真实世界移动应用

来源:https://huggingface.co/papers/2605.25160

摘要

本文介绍了一个面向移动 GUI 智能体 (https://huggingface.co/papers?q=Mobile%20GUI%20agents) 的合成基准,包含 120 项具有挑战性的任务,其特点是高保真虚拟环境与自动奖励生成,揭示了当前智能体在复杂长程交互 (https://huggingface.co/papers?q=long-horizon%20interactions) 上的显著局限性。

由大语言模型 (https://huggingface.co/papers?q=large%20language%20models) 驱动的移动 GUI 智能体 (https://huggingface.co/papers?q=Mobile%20GUI%20agents) 发展迅速,亟需真实且全面的评估。现有基准优先考虑可复现性,但通常局限于开源应用或文件操作类任务,因为在真实应用中构建奖励困难,导致基准设置与实际使用之间存在差距。此外,多数基准聚焦于基础定位与导航,对复杂长程交互 (https://huggingface.co/papers?q=long-horizon%20interactions) 的覆盖有限。为弥补这些不足,我们提出 SimuWoB——一个面向移动 GUI 智能体 (https://huggingface.co/papers?q=mobile%20GUI%20agents) 的全合成基准 (https://huggingface.co/papers?q=synthetic%20benchmark),包含 120 项横跨多种类型与难度级别的挑战性任务。我们构建了一个鲁棒的虚拟环境生成 (https://huggingface.co/papers?q=virtual%20environment%20generation) 框架,用于合成高保真任务 (https://huggingface.co/papers?q=high-fidelity%20tasks) 与环境,并为每个任务自动提供有效奖励。每个环境以无后端网页形式部署,可通过 URL 访问,支持高效且可复现的评估。我们对多个最先进的移动 GUI 智能体 (https://huggingface.co/papers?q=mobile%20GUI%20agents) 进行了全面实验 (https://huggingface.co/papers?q=comprehensive%20experiments)。平均成功率仅为 27.92%,在长程任务上降至 17.82%,揭示了当前智能体在复杂场景下的重大缺陷。与真实世界样本任务的评估结果对比表明,基于我们合成环境的智能体评估具有良好的泛化能力。我们还提供了跨关键能力维度的诊断性见解 (https://huggingface.co/papers?q=diagnostic%20insights),并讨论了其对未来移动 GUI 智能体开发的启示。

查看 arXiv 页面 (https://arxiv.org/abs/2605.25160)查看 PDF (https://arxiv.org/pdf/2605.25160)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.25160)

在您的智能体中获取此论文:

hf papers read 2605\.25160

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加至收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

iOSWorld:个性化智能手机代理的基准测试

Hugging Face Daily Papers

介绍了iOSWorld,一个交互式原生iOS模拟器基准测试,具有跨26个应用的持久用户身份,旨在通过133个难度递增的任务评估个性化移动代理的能力。