PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Hugging Face Daily Papers 论文

摘要

本文介绍PAGER,一种拓扑感知智能体,弥合了点精确GUI控制中的语义-执行鸿沟,在全新PAGE Bench上实现比基线高4.1倍的任务成功率。

大型视觉-语言模型显著推动了GUI智能体的发展,使其能够在网页、移动和桌面界面中执行交互。然而,这些进展很大程度上依赖于一种宽容的区域容忍范式,即同一组件内的许多相邻像素仍然有效。精确几何构造打破了这一假设:动作必须落在连续画布空间的点上,而非容忍区域内。由于几何基元存在本体依赖关系,局部坐标误差可能引发级联的拓扑失效,从而扭曲下游对象并使最终构造无效。我们将此场景定义为精度敏感的GUI任务,需要点级精度、几何感知验证以及对依赖驱动错误传播的鲁棒性。为了对其进行基准测试,我们引入了PAGE Bench,包含4,906个问题以及超过224K个过程监督的像素级GUI动作。我们进一步提出PAGER,一种拓扑感知智能体,将构造分解为依赖结构化的规划与像素级执行。基于像素的监督微调建立了可执行的动作语法,而精度对齐的强化学习通过状态条件几何反馈缓解了rollout带来的曝光偏差。实验揭示了显著的语义-执行鸿沟:通用多模态模型的动作类型准确率可超过88%,但任务成功率仍低于6%。PAGER弥合了这一鸿沟,在任务成功率上比最强评估通用基线高出4.1倍,并将步骤成功率从GUI专用智能体的不足9%提升至超过62%,为点精确GUI控制确立了新的最先进水平。
查看原文
查看缓存全文

缓存时间: 2026/05/18 02:23

论文页面 - PAGER:弥合点精确几何GUI控制中的语义-执行差距

来源:https://huggingface.co/papers/2605.15963

摘要

面向GUI agent的高级视觉-语言模型在需要点级精度和几何意识的精度敏感任务中面临挑战,一种拓扑感知的agent通过结构化规划和像素级执行来提升任务成功率。

大型视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)极大地推进了GUI agent(https://huggingface.co/papers?q=GUI%20agents)的发展,使其能够在网页、移动和桌面界面上进行可执行交互。然而,这些进展在很大程度上依赖于一种宽松的区域容忍范式,即同一组件内的许多邻近像素仍然是有效的。精确的几何构造打破了这一假设:动作必须落在连续画布空间中的点上,而不是容忍区域。由于几何基元(https://huggingface.co/papers?q=geometric%20primitives)具有本体依赖关系,一个局部坐标错误可能导致级联拓扑故障,从而扭曲下游对象并使最终构造无效。我们将这种机制识别为精度敏感的GUI任务,要求点级精度、几何感知验证以及对依赖驱动错误传播的鲁棒性。为了对其基准测试,我们引入了PAGE Bench,包含4,906个问题和超过224K个过程监督的像素级GUI动作。我们进一步提出了PAGER,一种拓扑感知的agent(https://huggingface.co/papers?q=topology-aware%20agent),将构造分解为依赖结构规划(https://huggingface.co/papers?q=dependency-structured%20planning)和像素级执行(https://huggingface.co/papers?q=pixel-level%20execution)。像素级监督微调(https://huggingface.co/papers?q=supervised%20tuning)建立了可执行的动作语法,而精度对齐的强化学习(https://huggingface.co/papers?q=reinforcement%20learning)通过状态条件几何反馈缓解了卷展引起的暴露偏差(https://huggingface.co/papers?q=exposure%20bias)。实验揭示了一个显著的语义-执行差距(Semantic-Execution Gap)(https://huggingface.co/papers?q=Semantic-Execution%20Gap):通用多模态模型可以超过88%的动作类型精度,但任务成功率仍低于6%。PAGER弥合了这一差距,相较于评估中最强的通用基线,实现了4.1倍的任务成功提升,并将步骤成功率从GUI专用agent的低于9%提高到超过62%,为点精确GUI控制建立了新的最先进水平。

查看arXiv页面(https://arxiv.org/abs/2605.15963)查看PDF(https://arxiv.org/pdf/2605.15963)项目页面(https://openraiser.github.io/Pager-webpage/)GitHub1(https://github.com/OpenRaiser/Pager)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15963)

在您的agent中获取此论文:

hf papers read 2605\.15963

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

没有模型链接本论文

请在模型README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。

引用本论文的数据集0

没有数据集链接本论文

请在数据集README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。

引用本论文的Spaces0

没有Space链接本论文

请在Space README.md中引用arxiv.org/abs/2605.15963,以便从此页面链接。

包含本论文的集合0

没有集合包含本论文

将此论文添加到集合(https://huggingface.co/new-collection)中,以便从此页面链接。

相似文章

重新审视机器人操作中的关节部件感知

Hugging Face Daily Papers

本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。