StepReflect:面向移动GUI智能体的结构化UI转换反思

arXiv cs.AI 论文

摘要

StepReflect将移动智能体的逐步GUI反思重构为监督式结构化预测,在AndroidWorld上实现了比GPT-5.2更高的转换准确率,同时降低了API成本。

arXiv:2608.05587v1 公告类型:新 摘要:自主移动GUI智能体需要准确的行动反思,以实现可靠的长期执行。现有方法依赖每次行动后的开放式多模态推理,成本高昂且与GUI状态转换的结构化特性不匹配。我们提出StepReflect,将逐步GUI反思建模为基于显式转换规范和配对视觉证据的监督式结构化预测。StepReflect通过分阶段流程进行训练,结合了监督微调、师生蒸馏以及偏好和奖励驱动的优化。离线状态下,生成的8B模型在AndroidWorld上实现了82.16%的转换级准确率,在同一结构化输入下比零样本GPT-5.2高出11.83个百分点。在线状态下,在M3A、Agent-SAMA、MAI-UI-8B和Seed-2.0-Pro中,StepReflect在四种智能体配置中的三种中实现了更高的任务成功率,并在第四种配置中与GPT-5.2反思智能体的成功任务数相差不超过一个。同时,在所有四种配置中,相比基于GPT的反思,StepReflect降低了付费API费用。这些结果确立了StepReflect作为重复前沿模型反思的实际且可本地部署的替代方案,适用于长期移动GUI智能体。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# StepReflect:面向移动 GUI 智能体的结构化 UI 转换反思

来源:https://arxiv.org/html/2608.05587

###### 摘要

自主移动 GUI 智能体需要准确的行动反思,才能在长时间跨度的执行中保持可靠。现有方法在每次行动后依赖开放式多模态推理,这不仅成本高昂,而且与 GUI 状态转换的结构化特性并不匹配。我们提出 StepReflect,将逐步 GUI 反思形式化为一种监督式结构化预测问题,其条件基于显式的转换规范以及配对的视觉证据。StepReflect 通过一个分阶段训练流程进行训练,该流程结合了监督微调、师生蒸馏以及基于偏好和奖励的精细化优化。在离线场景下,所得到的 8B 模型在 AndroidWorld 上达到 82.16% 的转换级准确率,在相同结构化输入条件下,比零样本 GPT-5.2 高出 11.83 个百分点。在在线场景下,在 M3A、Agent-SAMA、MAI-UI-8B 和 Seed-2.0-Pro 四套智能体配置中,StepReflect 在三个配置中取得了更高的任务成功率,并在第四个配置中与 GPT-5.2 Reflection Agent 的差距保持在 1 个成功任务以内。同时,在所有四个配置中,与基于 GPT 的反思相比,StepReflect 都降低了付费 API 开销。这些结果确立了 StepReflect 作为一种实用、可本地部署的替代方案,可替代针对长跨度移动 GUI 智能体的重复前沿模型反思。

## 1 引言

在视觉-语言模型(VLM)时代,操作图形用户界面(GUI)的自主移动智能体正在改变用户与智能手机互动的方式(Yao et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib1);Wang et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib2))。通过视觉感知以及与点击、轻触和按键等低层操作的交互,这些智能体可以自动化复杂用户工作流,而无需依赖预定义脚本或特定平台的 API。近期 VLM 的进展使得移动 GUI 智能体能够在日益复杂的环境中感知和行动(Zheng et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib3);Hong et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib4))。AppAgent(Zhang et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib5))、Mobile-Agent-E(Wang et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib6))和 CogAgent(Hong et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib4))等智能体在感知和高层规划方面展示了实质性进展,但可靠的长跨度执行仍然依赖于准确评估每个行动的结果。

然而,实现可靠的长跨度执行仍然具有挑战性。给定一个任务(如订餐或打车),GUI 智能体必须跨多个屏幕执行一系列 GUI 操作,以达到预期结果。一个关键挑战是行动反思。在每一步,智能体必须评估已执行的操作是否产生了预期的界面转换。在长轨迹中,即使是微小的反思错误也可能累积,使智能体从错误状态继续执行并最终失败。现有 GUI 智能体通过开放式多模态推理来解决这一挑战(Wang et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib6);Dai et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib36);Lu et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib37))。在每一步,智能体都会查询大型 VLM,以评估当前界面是否符合预期。尽管 GUI 交互遵循结构化、可预测的状态转换(Guo et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib9)),这种做法仍然将反思视为一个通用推理问题。因此,反思既复杂又昂贵,并且难以扩展到每一步都需要反思的长跨度任务。更广泛地说,这反映了近期针对长跨度智能体所发现的局限性:当前系统从根本上仍然是“反应式”的(Chen 2026 (https://arxiv.org/html/2608.05587#bib.bib45);Guo et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib9)),其推理中缺乏显式结构、持久状态和执行落地反馈。

GUI 转换的结构化特性与反思的非结构化处理之间的这种不匹配,促使我们重新定义该问题。我们不把反思视为开放式多模态推理,而是将状态感知直接引入反思任务:GUI 行动反思被形式化为一个关于 UI 状态转换的监督式结构化预测问题,其中反思被简化为判断观察到的 UI 转换是否与当前任务上下文中的行动预期效果一致。我们提出 **StepReflect**,一个紧凑的学习式反射器,用于判断已执行的 GUI 操作是否产生了预期的 UI 转换。它以智能体提供的转换规范为条件,结合配对的 BEFORE/AFTER 视觉证据,并返回结构化反思结果。作为独立模块,StepReflect 可以集成到不同的智能体框架中,而无需修改其规划或行动生成策略。

我们使用两个移动智能体基准 SPA-Bench(Chen et al. 2025b (https://arxiv.org/html/2608.05587#bib.bib32))和 Mobile-Eval-E(Wang et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib6))训练 StepReflect,并在 AndroidWorld(Rawles et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib11))和 MobileWorld(Quyu Kong and others 2025 (https://arxiv.org/html/2608.05587#bib.bib42))上分别在离线和在线设置下进行评估。

在*离线*设置下,我们评估了 1,082 个人工验证的 UI 转换上的反思准确率。StepReflect 使用 Qwen3-VL-8B(Bai and others 2025 (https://arxiv.org/html/2608.05587#bib.bib28))达到 82.16% 的转换级准确率,在相同结构化输入条件下,分别比零样本 GPT-4o(66.17%)和 GPT-5.2(70.33%)高出 15.99 和 11.83 个百分点。在*在线*设置下,我们将 StepReflect 集成到 AndroidWorld 上的两个智能体框架(M3A(Rawles et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib11))、Agent-SAMA(Guo et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib9)))以及 MobileWorld 上的两个框架(MAI-UI-8B(Hanzhang Zhou and others 2025 (https://arxiv.org/html/2608.05587#bib.bib43))、Seed-2.0-Pro(ByteDance Seed 2026 (https://arxiv.org/html/2608.05587#bib.bib44)))中。在这些集成中,StepReflect 在三个框架(M3A、MAI-UI-8B 和 Seed-2.0-Pro)上较相应基线的端到端任务成功率有所提高,同时通过本地推理消除了付费反射器 API 调用。对于 Agent-SAMA,其多智能体 FSM 已经包含一个专门的状态感知 Reflection Agent,StepReflect 达到 55.56% 的任务成功率,而原始反射器为 58.33%,同时降低了付费 API 成本。这种模式表明,当宿主智能体尚未包含紧密耦合的反思机制时,学习式状态感知反思最为有益;而在替换原有机制时,则提供了成本-准确率权衡。

总体而言,这些结果表明,结构化的学习式反思可以作为一种实用、可本地部署的替代方案,替代跨异构移动智能体的重复前沿模型反思。我们的贡献总结如下:

- **在 UI 转换层面进行监督式结构化反思。**我们将逐步 GUI 行动反思形式化为对 UI 转换的监督式预测。据我们所知,这是首个联合使用显式符号前置/后置条件、有界轨迹以及 BEFORE/AFTER 视觉证据来评估已执行行动的学习式移动 GUI 反思公式。
- **StepReflect:一个可跨智能体框架迁移的轻量级学习式反射器。**StepReflect 将状态感知的转换反思封装到单个 8B VLM 中,该模型同时输出二元决策和结构化理由。我们展示了将其集成到四个异构智能体框架中,而无需重新训练其规划或行动生成策略。
- **针对反思错误不对称性校准的分阶段训练流程。**我们设计了一个分阶段优化流程,包括监督微调、师生蒸馏以及基于偏好和奖励的精细化优化,明确针对长跨度执行中错误拒绝的代价不对称性,并同时诱导结构化理由和校准的决策行为。
- **跨基准和跨框架的实证评估。**StepReflect 在 AndroidWorld 上达到 82.16% 的转换级准确率,在相同结构化输入条件下,比零样本 GPT-5.2 高出 11.83 个百分点。在线场景下,它在所评估的四个框架中的三个上提高了报告的任务成功率。对于 Agent-SAMA,其多智能体 FSM 已通过专用 Reflection Agent 和智能体间协调提供了框架级状态感知,StepReflect 提供了有利的成本-准确率权衡,在将付费 API 成本降低的同时,与原始反射器的差距保持在 2.77 个百分点以内。

## 2 相关工作

**提升 GUI 智能体效率。**长跨度 GUI 交互使推理成本和延迟成为重要关注点。现有工作通过提示词和智能体配置优化(Spiess et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib24);Zhou et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib23))、缓存和预取(Huang et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib35);Pan et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib25))以及用于候选行动选择的轻量级模型(Dai et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib36))来减少这种开销。这些方法主要优化规划、推理复用或行动前选择,而 StepReflect 则针对反复出现的行动后决策,即判断实际发生的 UI 转换是否符合智能体的预期。

**面向 GUI 智能体的领域专用模型。**紧凑型 GUI 模型已通过轨迹生成和强化学习(Ye et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib26);Lu et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib37))、基于截图的定位(Cheng et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib39);Du et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib40))以及执行前批评(Wanyan et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib38))开发。Agent-SAMA(Guo et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib9))是最接近的框架级先驱:它将应用执行表示为具有预测下一状态描述和显式前置/后置条件的 FSM,并使用提示式 MLLM Reflection Agent 将这些预期与观察到的屏幕进行比较。StepReflect 保留了这种转换级语义,但将反思隔离为监督式学习问题,将其实例化为专用的 8B 模型,并通过框架特定适配器连接到异构宿主智能体。

**面向智能体的学习式反思。**先前工作通过提示、过程奖励建模和知识蒸馏研究反思(Shinn et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib13);Madaan et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib14);Lightman et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib15);Hinton et al. 2015 (https://arxiv.org/html/2608.05587#bib.bib16);Ho et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib17);Hsieh et al. 2023 (https://arxiv.org/html/2608.05587#bib.bib18);Qu et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib10))。数字智能体评估器涵盖从提示式轨迹和步骤级评估(Pan et al. 2024 (https://arxiv.org/html/2608.05587#bib.bib46))到用于行动或任务进展的学习式过程奖励模型(Chae et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib47);Chen et al. 2025a (https://arxiv.org/html/2608.05587#bib.bib49))。GUI-Reflection(Wu et al. 2025 (https://arxiv.org/html/2608.05587#bib.bib48))和 VisCritic(Qian 2026 (https://arxiv.org/html/2608.05587#bib.bib50))从行动后视觉证据中学习行动验证,而 Task-State Representation(Zheng et al. 2026 (https://arxiv.org/html/2608.05587#bib.bib51))提供了一种免训练的转换感知封装。与这些方法不同,StepReflect 联合以智能体提供的转换规范(包括行动意图和显式前置/后置条件)、配对的 BEFORE/AFTER 证据以及有界的同一子目标历史为条件。它将该规范条件下的行动后决策实现为一个独立的学习式模块,该模块同时返回反思判定和结构化理由。

## 3 StepReflect

对于 GUI 智能体而言,一个任务 τ 是一个自然语言目标,需要一系列 GUI 交互(例如“使用特定应用购买一些商品”)。我们将 τ 分解为子目标 {g_k},其中每个 g_k 描述完成任务过程中的一个中间里程碑。在步骤 t,智能体通过在 UI 状态 s_t 中执行行动 a_t 来完成当前子目标,并到达新的 UI 状态 s_{t+1}。我们将 (s_t, a_t, s_{t+1}) 称为 UI 转换。转换反思旨在判断观察到的转换 s_t → s_{t+1} 是否与 a_t 在当前子目标和任务上下文下的预期效果一致。

### 3.1 问题定义

参照说明 图1:StepReflect 概览。给定智能体提供的转换规范、有界的同一子目标历史以及配对的 BEFORE/AFTER 截图,StepReflect 预测已执行行动是否产生了预期 UI 转换,并返回结构化理由。

StepReflect 解决自主移动 GUI 智能体中的*GUI 转换反思*问题。图1 (https://arxiv.org/html/2608.05587#S3.F1) 提供了 StepReflect 的示意图。在 GUI 智能体执行行动 a_t 后,StepReflect 观察产生的 UI 状态 s_{t+1},并评估从 s_t 到 s_{t+1} 的转换是否与 a_t 的*预期效果*一致,该预期效果由智能体的行动描述和当前任务状态指定。StepReflect 评估与所提供的预期是否一致;它不判断该预期本身是否正确。

大多数现有 GUI 智能体通过向大型云端 VLM 发送多模态推理查询来反思转换,这带来高延迟和成本,且随轨迹长度增长难以扩展。相比之下,我们将 GUI 反思重新形式化为一个*监督式、结构化的转换预测问题*,避免开放式推理,并允许使用中小型 VLM 进行高效反思。

形式上,在步骤 t,反射器接收行动前状态 s_t ∈ S 和行动后状态 s_{t+1} ∈ S 的符号表示。这些表示包含简洁的屏幕描述以及可用的前置/后置条件字段。反射器还接收截图对 I_t = (I_t^{before}, I_t^{after}) ∈ I,它提供了已实现转换的视觉证据。给定输入元组 x_t = (s_t, a_t, s_{t+1}, h_t, I_t),其中 h_t ∈ H 是当前子目标内最近转换的有界历史,GUI 转换反思被定义为学习 f_θ: S × A × S × H × I → {0,1} × R。二元输出预测观察到的从 s_t 到 s_{t+1} 的转换是否一致(待续……)

相似文章

MIRAGE:具备隐式推理与生成式世界模型的移动智能体

arXiv cs.AI

MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。