PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟
摘要
本文介绍PAGER,一种拓扑感知智能体,弥合了点精确GUI控制中的语义-执行鸿沟,在全新PAGE Bench上实现比基线高4.1倍的任务成功率。
查看缓存全文
缓存时间: 2026/05/18 02:23
论文页面 - PAGER:弥合点精确几何GUI控制中的语义-执行差距
来源:https://huggingface.co/papers/2605.15963
摘要
面向GUI agent的高级视觉-语言模型在需要点级精度和几何意识的精度敏感任务中面临挑战,一种拓扑感知的agent通过结构化规划和像素级执行来提升任务成功率。
大型视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)极大地推进了GUI agent(https://huggingface.co/papers?q=GUI%20agents)的发展,使其能够在网页、移动和桌面界面上进行可执行交互。然而,这些进展在很大程度上依赖于一种宽松的区域容忍范式,即同一组件内的许多邻近像素仍然是有效的。精确的几何构造打破了这一假设:动作必须落在连续画布空间中的点上,而不是容忍区域。由于几何基元(https://huggingface.co/papers?q=geometric%20primitives)具有本体依赖关系,一个局部坐标错误可能导致级联拓扑故障,从而扭曲下游对象并使最终构造无效。我们将这种机制识别为精度敏感的GUI任务,要求点级精度、几何感知验证以及对依赖驱动错误传播的鲁棒性。为了对其基准测试,我们引入了PAGE Bench,包含4,906个问题和超过224K个过程监督的像素级GUI动作。我们进一步提出了PAGER,一种拓扑感知的agent(https://huggingface.co/papers?q=topology-aware%20agent),将构造分解为依赖结构规划(https://huggingface.co/papers?q=dependency-structured%20planning)和像素级执行(https://huggingface.co/papers?q=pixel-level%20execution)。像素级监督微调(https://huggingface.co/papers?q=supervised%20tuning)建立了可执行的动作语法,而精度对齐的强化学习(https://huggingface.co/papers?q=reinforcement%20learning)通过状态条件几何反馈缓解了卷展引起的暴露偏差(https://huggingface.co/papers?q=exposure%20bias)。实验揭示了一个显著的语义-执行差距(Semantic-Execution Gap)(https://huggingface.co/papers?q=Semantic-Execution%20Gap):通用多模态模型可以超过88%的动作类型精度,但任务成功率仍低于6%。PAGER弥合了这一差距,相较于评估中最强的通用基线,实现了4.1倍的任务成功提升,并将步骤成功率从GUI专用agent的低于9%提高到超过62%,为点精确GUI控制建立了新的最先进水平。
查看arXiv页面(https://arxiv.org/abs/2605.15963)查看PDF(https://arxiv.org/pdf/2605.15963)项目页面(https://openraiser.github.io/Pager-webpage/)GitHub1(https://github.com/OpenRaiser/Pager)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15963)
在您的agent中获取此论文:
hf papers read 2605\.15963
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
没有模型链接本论文
请在模型README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。
引用本论文的数据集0
没有数据集链接本论文
请在数据集README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。
引用本论文的Spaces0
没有Space链接本论文
请在Space README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。
包含本论文的集合0
没有集合包含本论文
将此论文添加到集合(https://huggingface.co/new-collection)中,以便从此页面链接。
相似文章
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。
SeerGuard:基于世界模型预测的移动GUI代理安全框架
介绍了SeerGuard,一个针对移动GUI代理的后果感知安全框架,该框架使用安全增强的世界模型在执行前评估风险,提高了安全-效用分数。
从策略错误中恢复:鲁棒GUI代理的基准测试与轨迹合成
引入GUI-RobustEval(一个用于GUI代理错误恢复的基准)和鲁棒性驱动轨迹合成(RoTS)以生成训练数据,在OSWorld上达到当前最佳性能。
GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。
重新审视机器人操作中的关节部件感知
本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。