OmniGUI:在全方位模态智能手机环境中对GUI智能体进行基准测试
摘要
OmniGUI引入了一个针对GUI智能体的步骤级基准测试,该测试整合了静态图像、同步音频和视频片段,以模拟真实的智能手机交互。评估显示,当前模型在处理时序和听觉输入方面存在困难,凸显了对全方位模态能力的需求。
查看缓存全文
缓存时间: 2026/05/20 02:36
论文页面 - OmniGUI:全模态智能手机环境下的GUI智能体基准测试
来源:https://huggingface.co/papers/2605.18758
摘要
OmniGUI 提出了一种新颖的多模态基准测试,用于评估GUI智能体,该基准测试融合了同步的音频、视频和图像输入,以更好地模拟真实的智能手机交互。
当前的图形用户界面(GUI)智能体基准测试主要依赖静态截图。然而,现实世界的智能手机交互往往要求智能体处理瞬时的音频线索和与之紧密耦合的时态视频动态。为弥补这一差距,我们引入了 OmniGUI,这是首个旨在全模态智能手机环境中评估GUI智能体的步骤级基准测试。OmniGUI 在每个动作步骤提供连续的、交错的多模态输入,包含静态图像、同步音频和视频片段。该数据集包含 29 个应用程序中的 709 个专家演示回合(2,579 个动作步骤),并系统地标注了客观的多模态依赖等级。由于专门的全模态 GUI 智能体框架目前仍处于起步阶段,我们选择了能够原生处理交错输入的基座全模态模型作为初始基准的智能体代理。我们的实证评估表明,尽管当前模型在视觉静态任务上表现出色,但在需要同步时间和听觉信号的环境中,其动作预测性能显著下降。此外,消融研究隔离了特定的操作瓶颈,尤其是处理与任务无关的环境噪声时的跨模态干扰。完整的数据集、评估流程和基准提示已包含在补充材料中。项目页面:https://omni-gui.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2605.18758)查看 PDF (https://arxiv.org/pdf/2605.18758)项目页面 (https://omni-gui.github.io/)GitHub2 (https://github.com/omni-gui/OmniGUI)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18758)
在你的智能体中获取本论文:
hf papers read 2605.18758
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
暂无模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.18758 以便在此页面进行链接。
引用本论文的数据集1
OmniGUI/OmniGUI 查看器•更新于31分钟前 • 2.61k • 6.21k • 2 (https://huggingface.co/datasets/OmniGUI/OmniGUI)
引用本论文的 Spaces0
暂无 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.18758 以便在此页面进行链接。
包含本论文的收藏集0
暂无收藏集包含本论文
请将本论文添加到收藏集 (https://huggingface.co/new-collection) 以便在此页面进行链接。
相似文章
SimuWoB: 模拟真实世界移动应用以实现快速且逼真的GUI智能体基准测试
SimuWoB是一个合成基准测试,包含120个具有挑战性的移动GUI智能体任务,使用高保真虚拟环境并自动生成奖励。实验表明,当前智能体的平均成功率仅为27.92%,在长时程任务上降至17.82%,表明在复杂场景中存在显著弱点。
OmniInteract:面向实时全模态助手的真实世界流式交互基准测试
OmniInteract 提出了一个面向实时全模态大语言模型的流式基准测试,评估在线音视频处理能力,要求具备时间定位和交互式响应。实验表明,当前模型表现不佳,最佳整体 IA-QTF1 分数仅为 0.368。
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。
Omni-Persona:对全模态个性化进行系统性基准测试与改进
本文介绍了 Omni-Persona,这是首个涵盖文本、图像和音频的全模态个性化综合基准测试。该基准包含 Persona Modality Graph(角色模态图)以及用于评估接地(grounding)行为的新指标 Calibrated Accuracy(校准准确率)。