AQuaUI:基于自适应四叉树的GUI代理视觉令牌减少方法

arXiv cs.AI 论文

摘要

AQuaUI是一种无需训练、推理时即用的GUI代理模型令牌减少方法,利用自适应四叉树降低截图中的空间冗余,实现了高达13.22%的加速和29.52%的视觉令牌减少,同时保留了99.06%的性能。

arXiv:2605.19260v1 公告类型:新 摘要:大型多模态模型(LMMs)近期已成为GUI代理模型有前景的基础架构,在每次迭代步骤中,高分辨率的GUI截图被引入提示。然而,这些截图表现出高度非均匀的空间信息密度:大面积区域可能携带很少信息且视觉上均匀,而关键文本和图标则需要高视觉保真度。现有方法要么需要额外训练,要么依赖基于注意力的令牌压缩,忽视了GUI截图的结构化布局和空间冗余。为填补这一空白,本文提出AquaUI,一种无需训练、推理时即用的GUI代理模型令牌减少方法,利用截图中非均匀的信息密度。AQuaUI在每个截图输入上构建自适应四叉树,并在每个四叉树叶节点保留一个代表性的合并令牌。AQuaUI在整个流程中保留所保留令牌的空间位置,以确保所有位置编码阶段保持一致。为进一步提高多步GUI交互中的时间一致性,我们提出了一种条件四叉树算法,利用同一请求中连续截图之间的连续性。具体而言,该算法以之前的四叉树为参考来优化当前四叉树,有助于在静态或轻微移动的GUI状态下保留细粒度区域。我们将AQuaUI实现于最先进的GUI代理模型,并在标准定位和导航基准上进行实验。AQuaUI在精度-效率权衡上始终优于先前基线。值得注意的是,在GUI-Owl-1.5-32B-Instruct上,AQuaUI实现了高达13.22%的加速和29.52%的视觉令牌减少,同时保留了全令牌性能的99.06%,表明GUI截图的空间冗余可以在推理时无需重新训练即可利用。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:28

# 基于自适应四叉树的GUI代理视觉令牌减少方法
来源:https://arxiv.org/html/2605.19260
Yuankai Li 加州大学戴维斯分校 ykali@ucdavis\.edu &Tinghui Zhu 加州大学戴维斯分校 thuzhu@ucdavis\.edu &Ha Min Son 加州大学戴维斯分校 hmson@ucdavis\.edu &Zhe Zhao 加州大学戴维斯分校 zao@ucdavis\.edu &Xin Liu 加州大学戴维斯分校 xinliu@ucdavis\.edu &Muhao Chen 加州大学戴维斯分校 muhchen@ucdavis\.edu

###### 摘要

大型多模态模型(LMMs)最近成为图形用户界面(GUI)代理模型的有前景的骨干网络,其中高分辨率GUI截图在每个迭代步骤中都被引入提示。然而,这些截图表现出高度非均匀的空间信息密度:大区域可能携带很少信息且视觉上同质,而关键文本和图标可能需要高视觉保真度。现有解决该问题的方法要么需要额外训练,要么依赖基于注意力的令牌压缩,忽略了GUI截图的结构化布局和空间冗余。为填补这一空白,本文提出AQuaUI,一种无需训练的推理时令牌减少方法,适用于GUI代理模型,利用截图中的非均匀信息密度。AQuaUI在每个截图输入上构建自适应四叉树,并在四叉树的每个叶子节点保留一个代表性的合并令牌。AQuaUI在整个管道中保留保留令牌的空间位置,以确保所有位置编码阶段保持一致。为进一步提高多步GUI交互中的时间一致性,我们提出一种条件四叉树算法,利用同一请求中连续截图之间的连续性。具体来说,它使用先前的四叉树作为参考来细化当前四叉树,帮助在静态或轻微移动的GUI状态中保留细粒度区域。我们在最先进的GUI代理模型上实现AQuaUI,并在标准定位和导航基准上进行实验。AQuaUI在准确率-效率权衡上持续优于先前基线。值得注意的是,在GUI-Owl-1\.5-32B-Instruct上,AQuaUI实现了高达13\.22%的加速和29\.52%更少的视觉令牌,同时保留了99\.06%的全令牌性能,表明GUI截图的空间冗余可以在推理时无需重新训练即可利用。

## 1 引言

随着大型多模态模型(LMMs)的快速发展,当前最先进的模型已具备理解和导航图形用户界面(GUI)中复杂UI元素的能力。结合自主代理领域的研究进展,这导致了各种旨在解释用户指令并自主执行复杂任务的GUI代理的出现。因此,GUI代理已成为代理型AI的新研究焦点。

早期的GUI代理通常采用结合文本表示(如无障碍树或HTML)与视觉信息的混合方式\[8 (https://arxiv.org/html/2605.19260#bib.bib14),38 (https://arxiv.org/html/2605.19260#bib.bib15),27 (https://arxiv.org/html/2605.19260#bib.bib26),19 (https://arxiv.org/html/2605.19260#bib.bib30)\]。然而,此类系统往往面临跨平台适应性挑战,需要频繁进行任务特定优化。针对这些限制,直接以截图作为输入的原生GUI代理模型\[33 (https://arxiv.org/html/2605.19260#bib.bib32),1 (https://arxiv.org/html/2605.19260#bib.bib27),16 (https://arxiv.org/html/2605.19260#bib.bib29)\]因在主流GUI代理基准\[31 (https://arxiv.org/html/2605.19260#bib.bib12),25 (https://arxiv.org/html/2605.19260#bib.bib11)\]上表现出的竞争力而日益流行。截图提供了理解GUI的自然视角,并在无障碍树缺失时提供了统一解决方案。端到端设计还提供了以数据为中心的观点,使模型性能能够通过数据扩展和迭代反馈得到提升。

此类GUI代理模型通常需要在每个交互步骤处理高分辨率截图,即使使用合并和修补技术,也会产生大量视觉令牌。例如,典型Pixel 6手机截图分辨率为2400×\times1080,使用Qwen3-VL\[2 (https://arxiv.org/html/2605.19260#bib.bib33)\]处理时,可产生约3000个令牌。这显著增加了计算成本,并限制了上下文窗口内可保留的对话历史量。因此,令牌压缩对GUI代理变得日益重要,因为它可以降低推理成本、提高吞吐量并支持更长的交互历史。

近期研究观察到,GUI截图包含的低信息区域远多于自然图像,同时表现出更简单、更规则的空间结构\[10 (https://arxiv.org/html/2605.19260#bib.bib5),16 (https://arxiv.org/html/2605.19260#bib.bib29)\]。先前视觉语言模型(VLMs)中的令牌压缩工作主要针对自然图像,因此不太适合GUI图像\[5 (https://arxiv.org/html/2605.19260#bib.bib38),12 (https://arxiv.org/html/2605.19260#bib.bib39),36 (https://arxiv.org/html/2605.19260#bib.bib8)\]。其他关注GUI图像的工作将令牌减少方法作为GUI代理模型训练的一部分\[16 (https://arxiv.org/html/2605.19260#bib.bib29),22 (https://arxiv.org/html/2605.19260#bib.bib40)\],但尚不清楚这些方法能否直接应用于任意GUI代理模型而无需训练。

为填补这一空白,我们提出AQuaUI,一个无需训练的框架,可轻松应用于任何下游LMM。我们使用四叉树\[11 (https://arxiv.org/html/2605.19260#bib.bib35)\]在选择令牌发送到文本变换器之前进行选择。管道流程如图\~1 (https://arxiv.org/html/2605.19260#S1.F1)所示。

我们在定位基准(包括UI-Vision\[21 (https://arxiv.org/html/2605.19260#bib.bib31)\], ScreenSpot-Pro, ScreenSpot-V2\[13 (https://arxiv.org/html/2605.19260#bib.bib13)\], OSWorld-G\[31 (https://arxiv.org/html/2605.19260#bib.bib12)\]和MMBench-GUI\[29 (https://arxiv.org/html/2605.19260#bib.bib19)\])上评估了AQuaUI。对于导航评估,我们采用AndroidWorld\[25 (https://arxiv.org/html/2605.19260#bib.bib11)\]和AndroidControl\[14 (https://arxiv.org/html/2605.19260#bib.bib3)\]。AQuaUI在准确率-延迟权衡上优于先前基线,尤其对于更大模型。在Qwen3-VL模型上,AQuaUI可压缩30%的视觉令牌而不损害整体性能。

总之,本文的主要贡献可总结如下:

- • 我们提出AQuaUI,一种无需训练的推理时视觉令牌减少方法,利用自适应四叉树挖掘GUI截图的结构化布局。
- • 我们引入条件四叉树算法,利用同一请求中的先前截图,在静态或轻微移动的截图中保留细粒度分区。
- • 我们在多种最先进GUI代理模型上实现AQuaUI,并在标准GUI定位和导航基准上评估,展示了优于先前基线的准确率-效率权衡。

参见标题

图1:AQuaUI完整管道概览。给定GUI截图,AQuaUI首先构建自适应四叉树以捕捉UI布局。对于四叉树中的每个叶节点,只保留一个代表性令牌,其余丢弃。这些代表性令牌连同其位置信息被发送到语言模型以生成最终输出。此外,我们设计了一种条件四叉树细化算法,在构建四叉树时重用先前截图以保持令牌一致性。
## 2 相关工作

### 2\.1 GUI代理

近期关于GUI代理的工作在骨干模型规模和支持平台范围上迅速扩展。UI-TARS\[24 (https://arxiv.org/html/2605.19260#bib.bib7)\]和GUI-Owl\[35 (https://arxiv.org/html/2605.19260#bib.bib1)\]在屏幕定位轨迹上训练LMM,而UI-Voyager\[17 (https://arxiv.org/html/2605.19260#bib.bib2)\], MAI UI\[37 (https://arxiv.org/html/2605.19260#bib.bib10)\]和ClawGUI\[26 (https://arxiv.org/html/2605.19260#bib.bib44)\]探索了规划、多代理协作和工具使用等互补方向。尽管存在各种差异,这些系统共享一个服务瓶颈:每个交互步骤引入的高分辨率截图,其视觉令牌可能主导预填充延迟、注意力成本和KV缓存内存。

最近几种方法认识到UI截图需要专门处理。ShowUI\[16 (https://arxiv.org/html/2605.19260#bib.bib29)\]利用UI结构规律性减少视觉令牌,而FocusUI\[22 (https://arxiv.org/html/2605.19260#bib.bib40)\]选择与指令相关的UI补丁并引入位置感知策略以减轻位置连续性的损失。这些方法强调了空间结构对UI定位的重要性,但它们的主要结果是在模型特定的训练设置中获得的。相比之下,AQuaUI针对现成模型的免训练部署。

### 2\.2 LMM的压缩方法

令牌剪枝。一系列广泛的工作通过估计令牌重要性(基于注意力和相似性)来减少视觉令牌数量。FastV\[5 (https://arxiv.org/html/2605.19260#bib.bib38)\]在深层使用语言流的注意力剪枝视觉令牌;G-Prune\[12 (https://arxiv.org/html/2605.19260#bib.bib39)\]通过图传播建模令牌重要性;SimIgnore\[36 (https://arxiv.org/html/2605.19260#bib.bib8)\]利用跨模态相似性丢弃冗余补丁。近期通用剪枝器如HiPrune\[18 (https://arxiv.org/html/2605.19260#bib.bib21)\]和VisionZip\[34 (https://arxiv.org/html/2605.19260#bib.bib22)\]进一步改进了免训练视觉令牌减少。这些方法主要将减少视为令牌重要性估计问题。GUI截图引入了一种不同情况:低注意力令牌可能仍然重要,因为它们定义了标签或坐标上下文。同样重要的是,这些方法依赖显式计算注意力图,这可能给FlashAttention\[7 (https://arxiv.org/html/2605.19260#bib.bib23)\]或KV缓存管理增加额外复杂性。

KV缓存压缩。另一条工作线在令牌进入变换器后压缩KV缓存。SnapKV\[15 (https://arxiv.org/html/2605.19260#bib.bib34)\]使用观察窗口的注意力选择KV条目,而PyramidKV\[4 (https://arxiv.org/html/2605.19260#bib.bib4)\]在不同层分配不同缓存预算。后续方法通过多样性项、预RoPE分数或混合策略改进了选择\[3 (https://arxiv.org/html/2605.19260#bib.bib17),20 (https://arxiv.org/html/2605.19260#bib.bib16)\]。GUI KV\[10 (https://arxiv.org/html/2605.19260#bib.bib5)\]专门基于GUI截图计算KV缓存的空间和时间评分。这些技术与AQuaUI基本正交:它们减少视觉令牌编码后的内存和解码成本,而AQuaUI在计算KV缓存之前减少视觉令牌序列本身。

## 3 方法

在本节中,我们在第\~3\.1 (https://arxiv.org/html/2605.19260#S3.SS1)节形式化问题,然后在第\~3\.2 (https://arxiv.org/html/2605.19260#S3.SS2)节介绍AQuaUI的基本令牌减少方法。使用先前图像构建条件四叉树在第\~3\.3 (https://arxiv.org/html/2605.19260#S3.SS3)节讨论。

### 3\.1 任务定义

在每个步骤tt,GUI代理接收截图sts\_\{t\}和包含用户指令及交互历史的文本提示ptp\_\{t\}。原生GUI代理模型生成响应和动作\(rt,at\)=M\(pt,\{si\}i=0t\)\(r\_\{t\},a\_\{t\}\)=\mathcal\{M\}\(p\_\{t\},\\{s\_\{i\}\\}\_\{i=0\}^\{t\}\)。每个截图sts\_\{t\}通过视觉编码器编码为视觉令牌序列tokvis\text\{tok\}\_\{\text\{vis\}\},并与文本令牌toktext\text\{tok\}\_\{\text\{text\}\}共同处理。目标是找到一组不同的令牌集tokcomp\text\{tok\}\_\{\text\{comp\}\},其长度\|tokcomp\|<\|tokvis\|\|\text\{tok\}\_\{\text\{comp\}\}\|<\|\text\{tok\}\_\{\text\{vis\}\}\|,同时保持任务性能。

### 3\.2 自适应四叉树令牌化

对于GUI截图,信息分布特别不均匀\[16 (https://arxiv.org/html/2605.19260#bib.bib29)\],我们提出一种受先前工作启发的四叉树算法\[11 (https://arxiv.org/html/2605.19260#bib.bib35),6 (https://arxiv.org/html/2605.19260#bib.bib37)\]。四叉树是一种层次化数据结构,递归地将表面划分为四个象限,直到满足停止条件。在图像处理中,四叉树被广泛用作紧凑的图像表示:同质区域由大叶子表示,而视觉复杂的区域递归地划分为更小的单元格。这一特性使得四叉树特别适用于具有大背景面板、边距以及包含文本和图标的紧密小区域的GUI截图。因此,四叉树可以自适应地根据截图的信息密度进行划分,对冗余区域使用粗叶子,对细节丰富的区域使用细叶子。

基于这一观察,AQuaUI首先构建一个自适应四叉树,然后将其叶子用作自适应视觉令牌单元,我们如下所述。详细算法和实现在附录\~A (https://arxiv.org/html/2605.19260#A1)中讨论。

##### 网格对齐与边界处理

由于GUI截图的尺寸不一定是2的幂(这是应用四叉树的先决条件),AQuaUI首先将图像分解为两部分:一个可由大小为C×CC\times C的方形块平铺的中心区域,以及不能包含在此块布局中的边界边距,这些边距保持不变。然后AQuaUI在每个块内独立运行自适应四叉树。

##### 分割标准

对于大小为wn×hnw\_\{n\}\times h\_\{n\}的四叉树节点nn,默认分割标准是面积加权的灰度方差s\(n\)=wnhn⋅Var\(grey\(n\)\)s\(n\)=w\_\{n\}h\_\{n\}\cdot\operatorname\{Var\}\(\operatorname\{grey\}\(n\)\),我们递归分割直到s\(n\)≤1000⋅αs\(n\)\leq 1000\cdot\alpha。

实现还支持基于梯度的标准,其中评分函数ss给出节点nn的梯度最大幅度,这在边缘提供更强信号的情况下可能有用。我们将在第\~5\.2 (https://arxiv.org/html/2605.19260#S5.SS2)节讨论不同标准的选择。

##### 代表性令牌选择

对于每个最终叶子,AQuaUI选择代表性令牌块。默认情况下,如果叶子跨越从x0x\_\{0\}到x1x\_\{1\}和y0y\_\{0\}到y1y\_\{1\}的块坐标,则中心块\(x′=⌊x0+x12⌋,y′=⌊y0+y12⌋\)\(x^\{\prime\}=\lfloor\frac\{x\_\{0\}+x\_\{1\}\}\{2\}\rfloor,\quad y^\{\prime\}=\lfloor\frac\{y\_\{0\}+y\_\{1\}\}\{2\}\rfloor\)被选中。

### 3\.3 条件四叉树构建

GUI轨迹通常包含几乎相同的相邻截图。页面可能保持静态,菜单可能弹出,或滚动操作可能将内容移动几个令牌块。如果每个截图独立压缩,后面的帧可能丢弃先前帧中保留的细节,这可能削弱推理和定位能力。

AQuaUI引入了一种条件四叉树机制,从同一请求中的有序图像推断历史。它是一种启发式算

相似文章

ReVision:通过时间视觉冗余缩减扩展计算机使用智能体

arXiv cs.CL

本文介绍了 ReVision,一种通过从连续屏幕截图中移除冗余视觉块来减少计算机使用智能体 token 使用量的方法。研究表明,这种效率提升使得智能体能够处理更长的轨迹,并在 OSWorld 等基准测试中提高性能。

UI-TARS-2 技术报告:通过多轮强化学习推进图形用户界面代理

Papers with Code Trending

UI-TARS-2 是一款原生以图形用户界面为中心的代理模型,解决了数据可扩展性、多轮强化学习以及环境稳定性等挑战,在图形用户界面基准测试中取得了领先成果(Online-Mind2Web 88.2 分,OSWorld 47.5 分,WindowsAgentArena 50.6 分,AndroidWorld 73.3 分),优于 Claude 和 OpenAI 代理模型。