SimuWoB: 模拟真实世界移动应用以实现快速且逼真的GUI智能体基准测试
摘要
SimuWoB是一个合成基准测试,包含120个具有挑战性的移动GUI智能体任务,使用高保真虚拟环境并自动生成奖励。实验表明,当前智能体的平均成功率仅为27.92%,在长时程任务上降至17.82%,表明在复杂场景中存在显著弱点。
查看缓存全文
缓存时间: 2026/05/26 10:43
Paper page - SimuWoB:为快速且忠实评估 GUI 智能体而模拟真实世界移动应用
来源:https://huggingface.co/papers/2605.25160
摘要
本文介绍了一个面向移动 GUI 智能体 (https://huggingface.co/papers?q=Mobile%20GUI%20agents) 的合成基准,包含 120 项具有挑战性的任务,其特点是高保真虚拟环境与自动奖励生成,揭示了当前智能体在复杂长程交互 (https://huggingface.co/papers?q=long-horizon%20interactions) 上的显著局限性。
由大语言模型 (https://huggingface.co/papers?q=large%20language%20models) 驱动的移动 GUI 智能体 (https://huggingface.co/papers?q=Mobile%20GUI%20agents) 发展迅速,亟需真实且全面的评估。现有基准优先考虑可复现性,但通常局限于开源应用或文件操作类任务,因为在真实应用中构建奖励困难,导致基准设置与实际使用之间存在差距。此外,多数基准聚焦于基础定位与导航,对复杂长程交互 (https://huggingface.co/papers?q=long-horizon%20interactions) 的覆盖有限。为弥补这些不足,我们提出 SimuWoB——一个面向移动 GUI 智能体 (https://huggingface.co/papers?q=mobile%20GUI%20agents) 的全合成基准 (https://huggingface.co/papers?q=synthetic%20benchmark),包含 120 项横跨多种类型与难度级别的挑战性任务。我们构建了一个鲁棒的虚拟环境生成 (https://huggingface.co/papers?q=virtual%20environment%20generation) 框架,用于合成高保真任务 (https://huggingface.co/papers?q=high-fidelity%20tasks) 与环境,并为每个任务自动提供有效奖励。每个环境以无后端网页形式部署,可通过 URL 访问,支持高效且可复现的评估。我们对多个最先进的移动 GUI 智能体 (https://huggingface.co/papers?q=mobile%20GUI%20agents) 进行了全面实验 (https://huggingface.co/papers?q=comprehensive%20experiments)。平均成功率仅为 27.92%,在长程任务上降至 17.82%,揭示了当前智能体在复杂场景下的重大缺陷。与真实世界样本任务的评估结果对比表明,基于我们合成环境的智能体评估具有良好的泛化能力。我们还提供了跨关键能力维度的诊断性见解 (https://huggingface.co/papers?q=diagnostic%20insights),并讨论了其对未来移动 GUI 智能体开发的启示。
查看 arXiv 页面 (https://arxiv.org/abs/2605.25160)查看 PDF (https://arxiv.org/pdf/2605.25160)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.25160)
在您的智能体中获取此论文:
hf papers read 2605\.25160
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.25160 即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加至收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。
OmniGUI:在全方位模态智能手机环境中对GUI智能体进行基准测试
OmniGUI引入了一个针对GUI智能体的步骤级基准测试,该测试整合了静态图像、同步音频和视频片段,以模拟真实的智能手机交互。评估显示,当前模型在处理时序和听觉输入方面存在困难,凸显了对全方位模态能力的需求。
iOSWorld:个性化智能手机代理的基准测试
介绍了iOSWorld,一个交互式原生iOS模拟器基准测试,具有跨26个应用的持久用户身份,旨在通过133个难度递增的任务评估个性化移动代理的能力。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。