基于步级后果推理与聚合的移动代理自动化轨迹评估
摘要
本文介绍了CRATE,一个使用步级后果推理来评估移动代理的两阶段框架,在AndroidWorld和MobileRisk等基准测试上取得了高F1分数。
查看缓存全文
缓存时间: 2026/08/24 04:25
# 通过步级后果推理与聚合实现移动智能体的自动轨迹评估 来源:https://arxiv.org/html/2608.20797 彭帅 (单位:中国移动九天研究院,同等贡献,通讯作者:[[email protected]](mailto:[email protected])) 高子敬 (单位:中国移动九天研究院,同等贡献,通讯作者:[[email protected]](mailto:[email protected])) 庄本辉 袁波 冯俊兰 ###### 摘要 评估语言引导的移动智能体,最近已从基于规则的方法转向基于模型的方法,以实现可扩展且自动化的评估。然而,现有的整体评估范式一次性处理整个轨迹,导致严重的上下文过载。此外,它们主要关注任务完成,而忽视了操作安全性。为解决这些局限性,我们引入了 CRATE,这是一个新颖的两阶段视觉语言模型裁判框架,用于移动智能体的自动评估,兼容开源和闭源模型。利用步级后果推理机制,CRATE 在每一步独立提取任务相关的视觉线索,并推断动作条件下的状态变化。生成的步级文本证据随后通过轨迹级聚合进行综合,以提供基于证据的任务完成评估。基于此评估方案,我们进一步将 CRATE 扩展为 CRATE-S,用于操作安全评估。大量实验证实了 CRATE 和 CRATE-S 的有效性和鲁棒性。在 Qwen2.5-VL-72B-Instruct 的驱动下,CRATE 在 AndroidWorld 上实现了 0.833 的 F1 分数(比 SPA-Bench 高出 20%),而 CRATE-S 在 MobileRisk 上达到了 0.697 的 F1 分数,显示出与基准真实值的强一致性。代码可在 https://anonymous.4open.science/r/CRATE-D580 获取。 ## 1 引言 移动智能体(11 (https://arxiv.org/html/2608.20797#bib.bib19);20 (https://arxiv.org/html/2608.20797#bib.bib23);8 (https://arxiv.org/html/2608.20797#bib.bib22))的快速发展正在重塑人机交互,这产生了对可靠评估的迫切需求。从根本上说,此类评估必须确定一系列图形用户界面观察和动作是否满足自然语言指令中指定的条件。虽然现有方法主要关注评估智能体的任务完成性能,但人们日益认识到安全性和可信度同样关键(15 (https://arxiv.org/html/2608.20797#bib.bib20))。对这两个维度进行严格评估不仅有助于全面理解智能体能力,还能指导系统开发迈向实际就绪(19 (https://arxiv.org/html/2608.20797#bib.bib17);26 (https://arxiv.org/html/2608.20797#bib.bib18);17 (https://arxiv.org/html/2608.20797#bib.bib21))。 参见图注 图1:CRATE 和 CRATE-S 概览。该框架将长时间轨迹分解为独立的步级后果推理,随后进行轨迹级聚合,减少上下文过载,并实现对任务完成和操作安全的可靠评估。 移动智能体评估方法通常包括离线和在线范式。离线评估(9 (https://arxiv.org/html/2608.20797#bib.bib24);7 (https://arxiv.org/html/2608.20797#bib.bib8))直接将智能体预测与真实值进行比较,无需环境交互。虽然直接且可重现,但这种范式无法适应多种有效的执行路径。相反,在线评估评估执行后果。在此范式内,基于规则的方法需要为特定任务规则进行大量人工工程(13 (https://arxiv.org/html/2608.20797#bib.bib10);22 (https://arxiv.org/html/2608.20797#bib.bib6)),因此泛化能力差,而基于模型的方法利用视觉语言模型 (VLMs) 来自动化在线评估并提高可扩展性(3 (https://arxiv.org/html/2608.20797#bib.bib12);2 (https://arxiv.org/html/2608.20797#bib.bib11))。然而,现有的基于模型的方法通常采用“一体化”方案,在单次处理中处理整个轨迹。这导致严重的上下文过载,并严重依赖具有巨大上下文窗口的专有闭源模型。这些局限性提出了一个关键问题:我们如何才能利用明确的文本证据进行可靠的自动评估?在本工作中,我们引入了 CRATE(用于轨迹评估的后果推理与聚合),这是一个新颖的 VLM 裁判框架,用于评估移动智能体的任务完成。为克服上述限制,CRATE 采用两阶段方案:(i) 步级后果推理,通过状态转换建模提取视觉线索并推断动作后果,将视觉轨迹压缩为文本摘要;(ii) 轨迹级聚合,整合此步级证据以做出基于证据的判断。这种步到轨迹的压缩显著提高了上下文密度,从而减轻了 VLM 的认知负担,并使其能与中等规模的开源模型兼容。通过定制提示设计,我们进一步将此方案扩展为 CRATE-S,用于操作安全评估,实现步级和轨迹级的操作风险检测。CRATE 和 CRATE-S 的整体框架如图1 (https://arxiv.org/html/2608.20797#S1.F1) 所示。 为验证提出的 CRATE 和 CRATE-S 框架,我们在两个任务完成基准和一个操作安全基准上进行了全面实验,使用开源和闭源 VLM 作为评估器。利用开源的 Qwen2.5-VL-72B-Instruct,CRATE 在 AndroidWorld 和我们自建的 CRATEBench 上,针对真实值的 F1 分数均超过 0.8,优于竞争方法如 SPA-Bench(3 (https://arxiv.org/html/2608.20797#bib.bib12)) 和 A3(2 (https://arxiv.org/html/2608.20797#bib.bib11))。在操作安全评估方面,CRATE-S 在 MobileRisk 上达到了约 0.7 的 F1 分数,超过了先前的方法(16 (https://arxiv.org/html/2608.20797#bib.bib9))。消融研究进一步支持了所提出的两阶段评估方案的合理性和有效性。此外,我们利用 CRATE 对八个代表性移动智能体的任务完成能力进行基准测试,所得结果与预期的性能趋势一致。主要贡献如下:(i) CRATE 框架:我们引入了 CRATE,一个用于评估移动智能体任务完成的新颖 VLM 裁判框架。通过将评估分解为步级推理和轨迹级聚合,它减轻了上下文过载,并使中等规模的开源 VLM 能够提供准确的评估。(ii) 安全感知扩展 (CRATE-S):我们将此范式扩展为 CRATE-S,用于自动化操作安全评估,提供轨迹级风险评估和细粒度的步级风险定位。(iii) 跨模拟器和真实设备轨迹的实证验证和基准分析表明,CRATE 和 CRATE-S 在多个基准上与真实值的对齐度有所提高,表明了所提评估方案的有效性和潜在可泛化性。 ## 2 相关工作 ### 2.1 评估方法论 | 评估方法 | 方法类型 | 任务完成 | 操作安全 | 人工标注 | 新任务可扩展性 | |---|---|---|---|---|---| | AITW(14 (https://arxiv.org/html/2608.20797#bib.bib26)) | 真实值比较 | ✓ | ✗ | 真实值 | 低 | | GUI-Odyssey(9 (https://arxiv.org/html/2608.20797#bib.bib24)) | 真实值比较 | ✓ | ✗ | 真实值 | 低 | | AndroidControl(7 (https://arxiv.org/html/2608.20797#bib.bib8)) | 真实值比较 | ✓ | ✗ | 真实值 | 低 | | AndroidWorld(13 (https://arxiv.org/html/2608.20797#bib.bib10)) | 基于规则 | ✓ | ✗ | 特定任务规则 | 低 | | SPA-Bench(3 (https://arxiv.org/html/2608.20797#bib.bib12)) | 基于模型 | ✓ | ✗ | 关键组件 | 中 | | A3(2 (https://arxiv.org/html/2608.20797#bib.bib11)) | 基于模型 | ✓ | ✗ | 必要状态 | 中 | | MLA-Trust(24 (https://arxiv.org/html/2608.20797#bib.bib7)) | 基于规则 | ✗ | ✓ | 特定任务规则 | 低 | | OS-Sentinel(16 (https://arxiv.org/html/2608.20797#bib.bib9)) | 混合(规则+模型) | ✗ | ✓ | 统一规则 | 高 | | MobileSafetyBench(6 (https://arxiv.org/html/2608.20797#bib.bib25)) | 基于规则 | ✓ | ✓ | 特定任务规则 | 低 | | **本工作** | **基于模型** | **✓** | **✓** | **-** | **高** | 表1:将所提评估方案与现有基准采用的评估方法进行对比分析(GT:真实值)。新任务可扩展性指评估先前未见任务的能力。 移动智能体的评估已从静态真实值比较转向动态交互评估。如表1 (https://arxiv.org/html/2608.20797#S2.T1) 所示,早期工作(4 (https://arxiv.org/html/2608.20797#bib.bib1);14 (https://arxiv.org/html/2608.20797#bib.bib26);9 (https://arxiv.org/html/2608.20797#bib.bib24);7 (https://arxiv.org/html/2608.20797#bib.bib8))通过直接将预测与人工标注的真实值进行比较来对智能体进行基准测试。虽然可重现,但这些方法会惩罚同样有效的替代执行路径(5 (https://arxiv.org/html/2608.20797#bib.bib27))。为评估动态环境中的交互后果,后续研究转向硬编码验证规则(13 (https://arxiv.org/html/2608.20797#bib.bib10);22 (https://arxiv.org/html/2608.20797#bib.bib6))。然而,所需的特定任务规则需要详尽的人工工程,并限制了跨平台的可扩展性。最近,该领域转向基于模型的评估,提供了更好的灵活性和自动化。SPA-Bench 在过滤关键进展组件后使用 VLM 评估任务成功(3 (https://arxiv.org/html/2608.20797#bib.bib12)),而 A3(2 (https://arxiv.org/html/2608.20797#bib.bib11)) 采用滑动窗口机制提示 VLM 验证预先生成的必要状态。虽然现有的基于模型的方法比基于规则的方法提供了更高的通用性,但它们经常依赖辅助的里程碑标注来锚定判断。此外,这些方法通常要求 VLM 评估器在单次处理中处理整个长而纠缠的轨迹或其片段,这对评估器的上下文窗口大小和长上下文推理能力都提出了很高的要求。相比之下,我们的 CRATE 通过将评估解耦为细粒度、无标注的步级推理和轨迹级聚合,区别于这些范式。 ### 2.2 操作安全评估 随着智能体能力增强并在真实世界环境中部署,操作安全已成为一个关键的评估维度。近期研究开始评估智能体在整个交互过程中拒绝恶意指令、避免高风险操作、抵御对抗性操纵和保护用户隐私的能力(15 (https://arxiv.org/html/2608.20797#bib.bib20))。MobileSafetyBench(6 (https://arxiv.org/html/2608.20797#bib.bib25)) 和 MLA-Trust(24 (https://arxiv.org/html/2608.20797#bib.bib7)) 通过在沙盒化的 Android 环境中监控智能体行为来评估操作安全,依赖于人工指定的规则集进行动态安全评估。OS-Sentinel(16 (https://arxiv.org/html/2608.20797#bib.bib9)) 是一个最近提出的混合框架,它将基于规则的统一验证器与基于 VLM 的上下文判断相结合,用于操作安全评估。然而,它仍然依赖手工规则,缺乏针对基于模型评估的精心设计。我们将 CRATE 扩展为 CRATE-S,在保留细粒度风险定位的同时,实现完全自动化、可泛化的操作安全评估。 ## 3 方法论 参见图注 图2:CRATE 评估示例。左:输入轨迹;中:步级推理,独立提取视觉线索并推断动作后果;右:轨迹级聚合,根据步级证据和最终截图验证任务完成条件。 ### 3.1 CRATE CRATE 采用简单而有效的两阶段评估方案,包括 (i) 新颖的步级后果推理和 (ii) 轨迹级聚合。整体评估过程如图2 (https://arxiv.org/html/2608.20797#S3.F2) 中的示例所示。为简洁起见,我们将一个操作轨迹表示为 𝒯=(𝐼,𝑆,𝐴)。𝐼 是任务的文本描述。𝐴={𝑎₁,𝑎₂,...,𝑎𝑛} 是动作序列。𝑆={𝑠₀,𝑠₁,...,𝑠𝑛} 是截图序列,其中 𝑠₀ 表示初始截图,𝑠ᵢ 是执行动作 𝑎ᵢ 后的截图 (对于 𝑖>0)。 #### 3.1.1 步级后果推理 受人类审慎推理启发,我们引入步级后果推理机制,通过明确捕捉当前状态、推理状态转换和推断动作引起的后果,实现对每个执行步骤的细粒度分析。给定轨迹 𝒯,我们首先将其分解为一系列独立的步对 (𝑠ᵢ₋₁, 𝑎ᵢ),其中 𝑠ᵢ₋₁ 表示动作前的屏幕状态,𝑎ᵢ 表示执行的动作。每个对连同任务描述 𝐼 一起独立输入 VLM 评估器,根据公式 (1 (https://arxiv.org/html/2608.20797#S3.E1)) 生成结构化的*步级证据* (𝑐ᵢ, 𝑒ᵢ): (𝑐ᵢ, 𝑒ᵢ) = VLM(𝑠ᵢ₋₁, 𝑎ᵢ, 𝐼 | 𝑝ₛ), 𝑖 ∈ {1,...,𝑛}, (1) 其中 𝑐ᵢ 代表与任务完成相关的视觉线索的文本描述,𝑒ᵢ 代表推断的动作效果的文本描述,𝑝ₛ 是用于步级后果推理的 CRATE 提示(提供于附录 A.1 (https://arxiv.org/html/2608.20797#A1.SS1))。通过利用 VLMs 的内在世界模型能力,CRATE 直接从动作前的屏幕和动作对 (𝑠ᵢ₋₁, 𝑎ᵢ) 推断动作效果,而非标准三元组 (𝑠ᵢ₋₁, 𝑎ᵢ, 𝑠ᵢ)。这种表述消除了冗余的跨状态计算,同时保留了动作后果推理能力。此外,由于每个步对 (𝑠ᵢ₋₁, 𝑎ᵢ) 都是独立评估的,此阶段天然支持批量推理以加速。除了效率,步级后果推理还作为语义压缩机制。通过关注单个步骤,它有效地过滤了截图中的视觉噪声,同时提炼出与评估相关的紧凑步级证据。这种压缩确保后续的聚合阶段接收到紧凑的表示。 #### 3.1.2 轨迹级聚合 步级后果推理之后,CRATE 执行轨迹级聚合以产生基于证据的判断。如公式 (2 (https://arxiv.org/html/2608.20797#S3.E2)) 所示,VLM 评估器被提示使用 𝑝ₜ(提供于附录 A.2 (https://arxiv.org/html/2608.20797#A1.SS2))来整合所有步级证据 {(𝑐ᵢ, 𝑒ᵢ)}ᵢ₌₁ⁿ、任务描述 𝐼 以及最终截图 𝑠ₙ。评估器首先列出 𝐼 中明确陈述的所有必要条件,然后验证每个条件是否满足,最终产生二元任务完成判断 𝑜 ∈ {0,1}。 𝑜 = VLM({(𝑐ᵢ, 𝑒ᵢ)}ᵢ₌₁ⁿ, 𝐼, 𝑠ₙ | 𝑝ₜ).
相似文章
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
评估智能体非常困难
本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。
TRACE:面向长周期智能体安全的轨迹风险感知压缩方法
本文提出 TRACE,一种面向长周期 LLM 智能体的轨迹级安全检测方法,通过将完整轨迹证据压缩为潜在状态,更好地聚合分散的风险信号,在多个基准上达到最先进的准确率。
迈向虚拟细胞中的自主机制推理
本文介绍了VCR-Agent,一个多智能体框架,通过结构化形式化和VC-TRACES数据集生成并验证机制性解释,从而增强大型语言模型在生物学研究中的应用。该方法通过虚拟细胞中的验证性机制推理,提高了基因表达预测的事实准确性。
AndroidReality: How Far Are Mobile Agents from the Real World?
Introduces AndroidReality, a perturbation-based framework for evaluating and improving the robustness of mobile agents, with a taxonomy of real-world interface perturbations and a training-free Test-Time Introspective Recovery (TTIR) mechanism.