GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

arXiv cs.CL 论文

摘要

本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。

arXiv:2608.21832v1 公告类型:新 摘要:计算机使用代理在截图中基于自然语言指令定位界面元素,然而现有基准并未隔离模型是否将关系语言绑定到正确元素。我们引入了GUI-Primitives,这是一个包含994项对比指令对的基准,覆盖图形用户界面中的七种空间关系(左/右、上/下、包含、对齐、邻近、列表顺序、遮挡)。每个对保持截图和锚点固定,同时改变关系表达式,因此正确目标在两个指定候选之间移动。五位标注者验证了一个196项子集($\kappa = 0.94$ 健全性;$\kappa = 0.79$ 目标选择)。十九个视觉-语言模型最多达到 $32\%$ 的严格点框准确率。由于模型输出无约束坐标,我们根据每个预测落入的候选区域进行分类。预测在 $60-92\%$ 的项目中落在两个候选区域之外。在落入候选区域的前提下,目标选择在水平位置、垂直位置、邻近和列表顺序上达到0.82-0.90,但在包含和遮挡上与0.50无显著差异:大多数失败反映了候选定位而非关系理解。在十个模型中,基准准确率与ScreenSpot-Pro准确率相关(Spearman $\rho = +0.74$),这是在此样本规模下的探索性关联。标记两个指定候选可将选择准确率提高35至57个百分点,这是一个提供候选集而非可部署方法的神谕诊断。我们发布了基准、预测和代码。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:19

# GUI-Primitives:诊断视觉语言GUI定位中的空间推理失败  
来源:https://arxiv.org/html/2608.21832  
Md Abrar Jahin  
Md Rizwan Parvez  
南加州大学 USC 信息科学研究所 卡塔尔计算研究中心 (QCRI)  
[email protected] [email protected]  

###### 摘要  
计算机使用代理在截图中定位自然语言指令以找到界面元素,但现有基准测试并未隔离模型是否能将关系语言与正确元素绑定。我们引入了GUI-Primitives,一个包含994个项目的基准,专注于图形用户界面中七种空间关系(左/右、上/下、包含、对齐、邻近、列表顺序、遮挡)的对比指令对。每对保持截图和锚点固定,同时改变关系表达,因此正确目标会在两个指定候选项之间移动。五位标注者验证了一个196项目的子集(κ=0.94用于格式正确性;κ=0.79用于目标选择)。十九个视觉语言模型最多达到32%的严格点在框内准确率。由于模型输出无约束坐标,我们根据预测落入的候选区域对每个预测进行分类。在60-92%的项目上,预测落在两个候选区域之外。在落入候选区域的前提下,水平位置、垂直位置、邻近性和列表顺序的选择准确率达到0.82-0.90,但包含和遮挡的准确率与0.50无显著差异:大多数失败反映的是候选定位而非关系理解。在十个模型中,基准准确率与ScreenSpot-Pro准确率相关(Spearman ρ=+0.74),在此样本量下这是一种探索性关联。标记两个指定候选项使选择准确率提高35-57个百分点,这是一种提供候选集而非可部署方法的预言诊断。我们发布了基准、预测和代码。  
$\dagger$$\dagger$ 脚注:通讯作者  

## 1 引言  
一类新的*计算机使用代理*现在可以读取截图,决定做什么,并输出点击坐标或按键(27 (https://arxiv.org/html/2608.21832#bib.bib1); 2 (https://arxiv.org/html/2608.21832#bib.bib2); 18 (https://arxiv.org/html/2608.21832#bib.bib12); 4 (https://arxiv.org/html/2608.21832#bib.bib20); 24 (https://arxiv.org/html/2608.21832#bib.bib21); 21 (https://arxiv.org/html/2608.21832#bib.bib25))。这些代理正开始部署;它们的首要任务,在任何代理循环之前,与人打开窗口时的任务相同:阅读屏幕,找到正确的控件,并将指针放在正确的位置。我们称此为*GUI定位*,越来越多的文献显示,前沿视觉语言模型在此任务上仍落后于人类(10 (https://arxiv.org/html/2608.21832#bib.bib3); 31 (https://arxiv.org/html/2608.21832#bib.bib24))。  
一个自然的问题随之而来。如果我们剥离代理,仅要求现代VLM处理GUI定位所需的基本空间推理:在Save的右侧、Layers面板内、菜单中的第三项,它能成功吗?现有基准测试并未隔离这项技能。端到端基准如OSWorld(27 (https://arxiv.org/html/2608.21832#bib.bib1))将定位与规划和动作结合;粗粒度基准如ScreenSpot(2 (https://arxiv.org/html/2608.21832#bib.bib2))和ScreenSpot-Pro(10 (https://arxiv.org/html/2608.21832#bib.bib3))测量点击是否落在目标框内,但未按空间原语分离失败。因此,当代理点击错误按钮时,我们尚不清楚*哪项*基本技能出现了问题。  
我们用一个受控的诊断来弥合这一差距。GUI-Primitives是一个包含994个对比对问题的基准,覆盖GUI截图中的七种空间关系。每个问题配有一个双胞胎,保持截图和锚点固定,并改变关系表达(左↔右、内↔外等),因此正确目标会移动到另一个指定的候选项。在497对中的253对中,周围的指令模板也在词汇上变化(动词、中心名词、锚点引用);这种变化与关系术语不混淆(附录J.2 (https://arxiv.org/html/2608.21832#A10.SS2))。这种设计改编自语言学评估中的最小对传统(11 (https://arxiv.org/html/2608.21832#bib.bib14); 14 (https://arxiv.org/html/2608.21832#bib.bib15); 7 (https://arxiv.org/html/2608.21832#bib.bib4)),控制了截图特定显著性和固定答案偏好:一个总是点击最显著或中心元素的模型在一个双胞胎上得分正确,在另一个上得分错误。  
我们评估了19个视觉语言模型,涵盖开源和专有系统。五位标注者独立验证了一个196项目的子集(Fleiss κ=0.94用于格式正确性),并在96.9%的保留项目上选择了与指令一致的候选项;这是标注者在两项候选项任务上的目标选择准确率,而非模型匹配的定位分数。评估产生了三个主要发现。  
最强的模型Claude Opus 4.7在人类清理子集上达到31%的严格点在框内准确率。在七种原语中的四种(包含、遮挡、对齐、邻近性)上,我们测试的每个模型都低于两项候选参考水平0.50。候选级分析(§5.3 (https://arxiv.org/html/2608.21832#S5.SS3))表明,这种低于参考的准确率主要归因于预测落在两个候选区域之外,而非选择对比元素。在来自UI-Vision(16 (https://arxiv.org/html/2608.21832#bib.bib19))的真实桌面截图上,准确率更低,候选级分析将其主要归因于预测落在两个候选区域之外(96.2%的真实子集预测)而非关系错误。  
对一致性低于独立响应预期的值,因为载体模板变化和候选外预测也导致了这种依赖性;因此,需要候选级分析(§5.3 (https://arxiv.org/html/2608.21832#S5.SS3))来解释它。然而,诊断不仅是一个问题陈述。产生了三个结果。  
首先,基准跟踪下游性能。在我们也运行ScreenSpot-Pro的十个模型中,GUI-Primitives准确率与定位准确率相关,Spearman ρ=+0.74(p=0.015)。相关性在GUI-Primitives的真实截图和合成切片上稳定。在n=15,810个模型-项目对上的项目级逻辑回归证实了这种关联(伪R²=0.40);我们保守地报告它。  
其次,我们测试了三种无需训练的干预:Set-of-Mark (SoM) 提示(30 (https://arxiv.org/html/2608.21832#bib.bib9))、原语感知思维链(CoT)和激活引导(8 (https://arxiv.org/html/2608.21832#bib.bib10); 19 (https://arxiv.org/html/2608.21832#bib.bib11))。标记两个指定候选项(预言两项候选诊断)将选择准确率提高35-57个百分点,将GPT-5从30%提升到87%,OS-Atlas从10%提升到52%;CoT和激活引导未带来显著提升。由于干预提供了基线任务要求模型定位的候选集,它是候选区分能力的上限,而非可部署方法(§8 (https://arxiv.org/html/2608.21832#S8))。  
第三,三个快捷控制(空白画布、打乱指令、重度模糊)按预期降低了基于定位基准的准确率;模糊控制产生显著但低于阈值的下降,CoT和激活引导的负面结果与SoM的正面结果一起报告。  
我们做出了四个贡献。首先,我们引入了GUI-Primitives,一个包含994个项目的对比对诊断基准,覆盖GUI截图中的七种空间关系,以及一个经五标注者验证的196项目核心(κ=0.94)。其次,我们评估了来自五个系列的19个模型,并将主要失败定位到候选定位上——预测落在两个候选区域之外的项目占60-92%,关系词错误仅限于包含和遮挡,与人类表现存在65点的差距。第三,我们显示原语能力与ScreenSpot-Pro上的下游GUI定位相关(Spearman ρ=+0.74, p=0.015)。第四,我们发现SoM在开放和封闭模型间迁移,将GPT-5提升57点,而CoT提示和激活引导则没有;我们发布了GUI-Primitives、所有模型预测和分析代码。  
参见标题  
图 1:GUI-Primitives数据集构建流程。两个来源语料库:来自UI-Vision的真实桌面截图和来自我们程序渲染器的受控合成刺激,输入到每个原语的最小对挖掘器,通过自动质量门,由五标注者人工验证通过(Fleiss κ=0.94),并作为994项目基准发布。阶段颜色遵循本文通篇使用的原语调色板。  

## 2 相关工作  

#### GUI定位与计算机使用代理。近期一系列工作针对操作真实软件的代理。OSWorld(27 (https://arxiv.org/html/2608.21832#bib.bib1))提供了一个真实的Linux和Windows虚拟机环境,包含369个任务的基于执行的评分;后续的人工验证版本关闭了模糊任务(28 (https://arxiv.org/html/2608.21832#bib.bib32))。ScreenSpot(2 (https://arxiv.org/html/2608.21832#bib.bib2))和ScreenSpot-Pro(10 (https://arxiv.org/html/2608.21832#bib.bib3))孤立地测量像素级定位,后者针对高分辨率专业软件;MMBench-GUI(22 (https://arxiv.org/html/2608.21832#bib.bib26))增加了分层多平台评估。在截图上训练的定位模型包括SeeClick、OS-Atlas(25 (https://arxiv.org/html/2608.21832#bib.bib13))、UI-TARS(18 (https://arxiv.org/html/2608.21832#bib.bib12))、UGround(4 (https://arxiv.org/html/2608.21832#bib.bib20))、Aria-UI(32 (https://arxiv.org/html/2608.21832#bib.bib22))、GUI-Actor(24 (https://arxiv.org/html/2608.21832#bib.bib21))、Jedi(26 (https://arxiv.org/html/2608.21832#bib.bib23))、OpenCUA(21 (https://arxiv.org/html/2608.21832#bib.bib25))以及测试时缩放代理GTA1(31 (https://arxiv.org/html/2608.21832#bib.bib24))。在精神上最接近的是,GUI-Cursor(33 (https://arxiv.org/html/2608.21832#bib.bib27))在强化学习下探测基于光标的代理的空间推理,Beyond Semantics(17 (https://arxiv.org/html/2608.21832#bib.bib30))认为大型视觉token范数抑制位置编码,这是我们失败的机制候选。这些工作询问模型是否成功点击或如何训练它们;我们询问它们失败时缺乏哪些基本空间技能。  

#### 视觉语言模型中的空间推理。一些基准测试揭示VLM即使在自然图像上也难以处理空间关系。What's-Up(7 (https://arxiv.org/html/2608.21832#bib.bib4))使用受控的最小对表明,尽管字幕准确率很高,对比型VLM在处理左/右和上/下方面表现不佳。VSR(12 (https://arxiv.org/html/2608.21832#bib.bib8))编目了自然图像中的66种空间关系;BLINK(3 (https://arxiv.org/html/2608.21832#bib.bib5))捆绑了14个感知原语,发现即使是GPT-4V也远低于人类;CV-Bench(20 (https://arxiv.org/html/2608.21832#bib.bib6))显示2D/3D空间原语受视觉编码器限制。SpatialVLM(1 (https://arxiv.org/html/2608.21832#bib.bib7))通过在合成3D定位数据上协同训练来解决这些差距。RocketScience(5 (https://arxiv.org/html/2608.21832#bib.bib33))使用对比对将物体定位与空间推理解耦,发现只有顶尖推理模型成功。GUI-Primitives将这种受控方法扩展到GUI截图,其中视觉先验截然不同:到处是文本标签、近乎相同的图标、密集的布局。  

#### 最小对评估。最小对起源于心理语言学评估(11 (https://arxiv.org/html/2608.21832#bib.bib14); 14 (https://arxiv.org/html/2608.21832#bib.bib15)),其中单个词汇或句法编辑创建一个对比,其消歧需要理解而非表面统计。What's-Up将此设计引入视觉语言。我们采用相同的逻辑用于GUI截图,并添加对一致性(7 (https://arxiv.org/html/2608.21832#bib.bib4))作为关系失败的内部诊断(§5.5 (https://arxiv.org/html/2608.21832#S5.SS5))。  

#### 推理时干预。SoM提示(30 (https://arxiv.org/html/2608.21832#bib.bib9))在视觉区域上叠加编号标记,使模型命名标记而非回归坐标。SoM-LLaVA(29 (https://arxiv.org/html/2608.21832#bib.bib31))表明开源MLLM需要显式的SoM训练数据才能匹配封闭模型。视觉提示现在是GUI代理栈中的标准工具,最近出现了无需训练的缩放和模态感知变体:DiMo-GUI(23 (https://arxiv.org/html/2608.21832#bib.bib28))解耦文本和图标模态并应用测试时缩放;RegionFocus(13 (https://arxiv.org/html/2608.21832#bib.bib29))通过迭代放大焦点区域,在Qwen2.5-VL-72B骨干上达到ScreenSpot-Pro的61.6%。激活和注意力引导,包括8 (https://arxiv.org/html/2608.21832#bib.bib10)的定位头方法和SteerVLM框架(19 (https://arxiv.org/html/2608.21832#bib.bib11)),在推理时修改模型内部而不更新权重。我们测试了每个家族的一个代表。  

## 3 GUI-Primitives基准  
GUI-Primitives的设计目的只有一个:询问视觉语言模型是否具备GUI定位所需的七种基本空间技能中的每一种。基于此目的产生了三个设计选择:七种原语(§3.1 (https://arxiv.org/html/2608.21832#S3.SS1))、最小对构建(§3.2 (https://arxiv.org/html/2608.21832#S3.SS2))和人工验证协议(§3.4 (https://arxiv.org/html/2608.21832#S3.SS4))。完整的构建流程如图1(https://arxiv.org/html/2608.21832#S1.F1)所示。  

### 3.1 七种基本原语  
我们选择了明确、在日常GUI语言中常见且可分解的原语。表1(https://arxiv.org/html/2608.21832#S3.T1)列出了所有七种原语及其关系词和随机水平。原语分为三组。*基数方向*涵盖水平和垂直相对位置。*拓扑*涵盖包含(在面板内或外)。*布局*涵盖对齐(共享一行或一列)、邻近性(几个元素中哪个最近)、列表顺序(菜单中的第三项)和遮挡(可见或被弹出窗口部分覆盖)。  
#### 为什么是这七种?  
我们要求每种原语在短用户指令中词汇上可实现,可通过单个关系表达式改变分离为对比对,并且是组合GUI关系的基本构建块。这七种共同覆盖了先前自然图像工作编目的四大类:基数方向、拓扑、序数性和布局距离(12 (https://arxiv.org/html/2608.21832#bib.bib8); 7 (https://arxiv.org/html/2608.21832#bib.bib4); 5 (https://arxiv.org/html/2608.21832#bib.bib33))。我们不声称覆盖每种空间关系。

相似文章

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

DRS-GUI: 动态区域搜索实现免训练GUI定位

arXiv cs.AI

DRS-GUI提出了一种免训练的动态区域搜索框架用于GUI定位,通过轻量级UI感知器模拟人类感知行为,并结合蒙特卡洛树搜索逐步定位与指令相关的元素。实验表明,在ScreenSpot-Pro上,通用和GUI专用多模态大语言模型的定位性能提升了14%。

SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。

在紧凑世界模型中空间关系的接地:指令泄露与无目标动态修复

arXiv cs.AI

本文识别了在用于空间关系的目标条件紧凑世界模型中的一种混淆因素——'指令泄露',即模型通过转录指令而非真正接地关系来达到高精度。作者提出了一种检测协议和修复方法,该方法从动态中移除目标并监督读取路径,从而恢复真正的接地。