移动智能体评估中的 LLM 评判器基准测试
摘要
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。
arXiv:2608.11434v1 公告类型:新
摘要:移动智能体基准越来越多地依赖基于 LLM 的评判器来评估任务完成情况,但这些评判器在移动智能体轨迹上的可靠性在很大程度上仍未得到检验。我们引入了 MobileJudgeBench,一个用于系统评估移动智能体轨迹上 LLM 作为评判器方法的基准。该基准包含 931 条人工标注轨迹,涵盖 6 个移动智能体基准、4 个智能体模型和 68 个应用。我们评估了 6 种评判器方法(五种改编自 SPA-Bench、A3 的两种模式、AndroidArena 和 AgentRewardBench,外加我们设计的一个简单基线),并使用了多个 LLM 后端。实验揭示了三个关键发现。第一,带有采样屏幕截图的简单基线评判器与专用方法相比具有竞争力,且常常表现更好,这表明更复杂的评判器流程并不能持续提升评判质量;在有竞争力的方法中,LLM 主干是主要驱动因素。第二,基准质量指标能够可靠地预测真实场景中评判器的实用性:这些指标既与评估时的智能体排名保真度相关,也与评判器作为在线策略强化学习奖励信号时的下游性能相关。第三,跨两个 LLM 后端的失败分析揭示了定性上相反的失败特征,一个偏保守,另一个偏宽松,这与主干网络的精确率-召回率特性有关。
查看缓存全文
缓存时间: 2026/08/13 15:26
# 移动智能体评估中的 LLM 评判器基准测试 Source: https://arxiv.org/html/2608.11434 Li Gu, Zhixiang Chi — Affiliation: Mila – Québec AI Institute, Concordia University, University of Toronto Zhi Liu, Seyed Mehdi Ayyoubzadeh — Affiliation: Shanghai University, McMaster University Yuanhao Yu — Affiliation: Shanghai University, McMaster University Yang Wang ###### 摘要 移动智能体基准测试越来越依赖基于 LLM 的评判器来评估任务完成情况,然而这些评判器在移动智能体轨迹上的可靠性在很大程度上仍未得到检验。我们提出了 **MobileJudgeBench**,一个用于系统评估移动智能体轨迹上 LLM-as-judge 方法的基准测试。该基准包含 931 条人工标注轨迹,覆盖 6 个移动智能体基准测试、4 个智能体模型和 68 个应用。我们评估了 6 种评判方法(五种改编自 SPA-Bench、A3 的两种模式、AndroidArena 和 AgentRewardBench,外加一个我们设计的简单基线)在多个 LLM 后端上的表现。实验揭示了三个关键发现。第一,一个使用采样截图的简单基线评判器与专门构建的方法具有竞争力,甚至常常超越它们,这表明更复杂的评判流程并不能持续提升评判质量;在具有竞争力的方法中,LLM 主干是主要驱动力。第二,基准质量指标能够可靠地预测真实世界中的评判器效用:它们既与用于评估的智能体排名保真度相关,也与评判器作为在线策略强化学习奖励信号时的下游性能相关。第三,跨两个 LLM 后端的失败分析揭示了性质相反的失败模式,一个保守,另一个宽松,这与后端的精确率-召回率特征有关。 ## 1 引言 使用 LLM 来评判其他模型的输出,已成为大规模 AI 任务中人工评估的可扩展替代方案(44 (https://arxiv.org/html/2608.11434#bib.bib1);14 (https://arxiv.org/html/2608.11434#bib.bib2))。在代表用户操作智能手机的自主移动智能体领域,基于 LLM 的评判器扮演着双重角色:它们既是衡量智能体在真实 Android 任务上进展的基准测试中的 *评估器*(32 (https://arxiv.org/html/2608.11434#bib.bib15);6 (https://arxiv.org/html/2608.11434#bib.bib16);5 (https://arxiv.org/html/2608.11434#bib.bib17);40 (https://arxiv.org/html/2608.11434#bib.bib18);19 (https://arxiv.org/html/2608.11434#bib.bib20);42 (https://arxiv.org/html/2608.11434#bib.bib19)),也越来越多地充当强化学习(RL)训练的 *奖励信号*(2 (https://arxiv.org/html/2608.11434#bib.bib30);29 (https://arxiv.org/html/2608.11434#bib.bib31);41 (https://arxiv.org/html/2608.11434#bib.bib32))。评判移动智能体轨迹尤其具有挑战性:它需要跨过涵盖各种应用和交互模式的长轨迹,解释多模态证据(截图序列、UI 元素树和已执行动作)。这使得评判质量不仅对衡量进展至关重要,也对推动进展至关重要。虽然一些基准测试提供了基于规则的状态检查器(32 (https://arxiv.org/html/2608.11434#bib.bib15);42 (https://arxiv.org/html/2608.11434#bib.bib19)),但这些检查器需要针对每个任务进行工程化,并且难以扩展到新任务或新应用。因此,基准测试越来越多地采用基于 LLM 的评判器,无论是通过粗到细的截图匹配(6 (https://arxiv.org/html/2608.11434#bib.bib16))、关键状态分解(5 (https://arxiv.org/html/2608.11434#bib.bib17)),还是直接的 LLM 判断(40 (https://arxiv.org/html/2608.11434#bib.bib18))。然而,这些基于 LLM 的评估器在移动智能体轨迹上的可靠性尚未得到系统检验。研究人员选择一个基准测试,采用其内置评判器,然后报告数字,而不质疑评估本身。这带来两个问题。首先,不可靠的评判器会产生嘈杂的排行榜:一个在 10-15% 的轨迹上分类错误的评判器就可能导致智能体排名发生显著变化(§5.2.1 (https://arxiv.org/html/2608.11434#S5.SS2.SSS1))。其次,当评判器充当 RL 训练的奖励信号时,奖励中的错误会直接污染学习过程(10 (https://arxiv.org/html/2608.11434#bib.bib35);15 (https://arxiv.org/html/2608.11434#bib.bib36))。然而,对于移动智能体,既没有确定不可靠的程度,也没有确定哪些质量指标(例如准确率、精确率、召回率)对这些下游应用最为重要。在这项工作中,我们提出了 **MobileJudgeBench**,据我们所知,这是第一个在移动智能体轨迹上评估 LLM-as-judge 方法的基准测试(图1 (https://arxiv.org/html/2608.11434#S1.F1))。我们从 6 个已建立的移动智能体基准测试中收集了 931 条轨迹,这些轨迹由 4 个不同的智能体模型在 68 个应用上生成,并获得了具有多标注者冗余的人类专家标注。利用该基准,我们评估了 6 种评判方法(五种改编自 SPA-Bench、A3 的两种模式、AndroidArena 和 AgentRewardBench,外加一个我们为受控消融设计的简单基线)在多个 LLM 后端上的表现。至关重要的是,我们超越了衡量评判器的内在准确率:我们验证了我们的基准指标能够预测评判器在智能体评估和 RL 训练中的真实效用。我们的贡献如下: 1. 1. **面向移动智能体的评判器基准测试。** 我们构建了一个包含 931 条人工标注轨迹的数据集,覆盖 6 个基准测试、4 个智能体和 68 个应用,并附带一个统一的评估框架,使用分类和排名指标标准化评判器评估(§3 (https://arxiv.org/html/2608.11434#S3))。 2. 2. **评判方法的系统评估。** 我们评估了 5 个 LLM 后端上的 6 种评判方法,结果表明没有任何单一方法占主导地位,评判准确率在很大程度上取决于方法和 LLM 主干(§5.1 (https://arxiv.org/html/2608.11434#S5.SS1))。 3. 3. **带消融研究的简单基线评判器。** 我们设计了一个精简的评判器,其表现与专门构建的方法相当或更优(最高可达 90.9% 的准确率)。对截图数量、图像分辨率、UI 元数据和智能体推理的消融实验表明,截图数量是主要的设计变量,而其他输入的影响很小(§4.2 (https://arxiv.org/html/2608.11434#S4.SS2),§5.1 (https://arxiv.org/html/2608.11434#S5.SS1))。 4. 4. **基准指标可预测真实世界中的评判器效用。** 我们通过两个下游应用验证了我们的基准。对于 *评估*,元相关分析表明评判质量指标能够可靠地预测智能体排名保真度和成功率估计精度。对于 *训练*,在线策略 RL 实验表明,我们基准上的评判质量会延续到下游智能体性能(§5.2 (https://arxiv.org/html/2608.11434#S5.SS2))。 5. 5. **失败模式分析。** 我们分析了几乎所有评判方法都会出错的硬核失败案例,揭示了不同 LLM 后端产生性质相反的失败模式,一个保守(以假阴性为主),另一个宽松(以假阳性为主),并具有不同的根因分类(§5.3 (https://arxiv.org/html/2608.11434#S5.SS3))。 参见说明 图 1:MobileJudgeBench 概览。我们从 931 条人工标注的移动智能体轨迹构建评判器基准,覆盖 6 个基准测试(左,§3 (https://arxiv.org/html/2608.11434#S3)),在 5 个后端上评估 6 种 LLM-as-judge 方法(中,§5.1 (https://arxiv.org/html/2608.11434#S5.SS1)),并验证基准指标能够预测评判器在智能体评估(§5.2.1 (https://arxiv.org/html/2608.11434#S5.SS2.SSS1))和在线策略训练(§5.2.2 (https://arxiv.org/html/2608.11434#S5.SS2.SSS2))中的效用,辅以根因失败分析(§5.3 (https://arxiv.org/html/2608.11434#S5.SS3))(右)。 ## 2 相关工作 **LLM-as-a-judge。** 使用 LLM 作为替代评估器由 MT-Bench 和 Chatbot Arena(44 (https://arxiv.org/html/2608.11434#bib.bib1))推广开来,其中 GPT-4 在聊天评估中与人类偏好的一致性超过 80%。后续工作发现了 LLM 评判器中的系统性偏差,包括位置偏差、冗长偏差和自我偏好(14 (https://arxiv.org/html/2608.11434#bib.bib2);21 (https://arxiv.org/html/2608.11434#bib.bib3)),并研究了评判器的可靠性(16 (https://arxiv.org/html/2608.11434#bib.bib5))、通过偏好泄漏造成的污染(20 (https://arxiv.org/html/2608.11434#bib.bib6))以及微调专用评判模型(47 (https://arxiv.org/html/2608.11434#bib.bib7);24 (https://arxiv.org/html/2608.11434#bib.bib8))。48 (https://arxiv.org/html/2608.11434#bib.bib4) 将该范式扩展到 Agent-as-a-Judge,为评估器赋予智能体能力。这一领域的工作主要集中在评估文本输出(例如聊天回复、代码)上。在移动智能体领域,LLM 评判器必须处理具有交错截图、动作和 UI 状态的多步骤轨迹,如 SPA-Bench(6 (https://arxiv.org/html/2608.11434#bib.bib16))、A3(5 (https://arxiv.org/html/2608.11434#bib.bib17))和 AndroidArena(40 (https://arxiv.org/html/2608.11434#bib.bib18))中的方法所示。 **移动和 GUI 智能体基准测试。** 移动智能体评估领域因基准测试的不同而碎片化,这些基准在任务设计、环境和评估方法上各不相同。AndroidWorld(32 (https://arxiv.org/html/2608.11434#bib.bib15))提供程序化的、基于状态的成功检查;B-MoCA(19 (https://arxiv.org/html/2608.11434#bib.bib20))使用基于规则的检测器测试跨设备配置的泛化能力;SPA-Bench(6 (https://arxiv.org/html/2608.11434#bib.bib16))使用 MLLM 验证进行粗到细的截图匹配;A3(5 (https://arxiv.org/html/2608.11434#bib.bib17))采用关键状态分解;AndroidArena(40 (https://arxiv.org/html/2608.11434#bib.bib18))使用直接的 GPT-4 判断;AndroidLab(42 (https://arxiv.org/html/2608.11434#bib.bib19))通过 UI 树匹配验证子目标完成情况。在桌面和网页方面,OSWorld(39 (https://arxiv.org/html/2608.11434#bib.bib21))、WebArena(46 (https://arxiv.org/html/2608.11434#bib.bib22))、VisualWebArena(17 (https://arxiv.org/html/2608.11434#bib.bib23))和 Mind2Web(9 (https://arxiv.org/html/2608.11434#bib.bib24))提供了互补的评估环境。大规模数据集如 Android-in-the-Wild(33 (https://arxiv.org/html/2608.11434#bib.bib25))和 AndroidControl(22 (https://arxiv.org/html/2608.11434#bib.bib26))提供训练数据。虽然基于规则的检查器在其支持的任务上天然可靠,但许多基准测试(从 SPA-Bench 到 AndroidDaily(37 (https://arxiv.org/html/2608.11434#bib.bib42)))所依赖的基于 LLM 的评判器尚未针对人类真值进行系统验证。 **智能体轨迹的自动评估。** AgentRewardBench(23 (https://arxiv.org/html/2608.11434#bib.bib9))是直接相关的工作:它在 5 个网页基准测试的 1,302 条网页智能体轨迹上对 LLM 评判器进行基准测试,评估的评判方法包括 AER(28 (https://arxiv.org/html/2608.11434#bib.bib10))和 NNetNav(25 (https://arxiv.org/html/2608.11434#bib.bib38))。关于移动评估的并行工作包括 AutoEval(38 (https://arxiv.org/html/2608.11434#bib.bib11)),它将 AndroidLab 的任务分解为预期成功状态。WebJudge(43 (https://arxiv.org/html/2608.11434#bib.bib12))为网页智能体轨迹训练了一个专门的 7B 评判模型。更近期的方法超越了被动的截图检查:VAGEN(7 (https://arxiv.org/html/2608.11434#bib.bib13))和 ProRe(8 (https://arxiv.org/html/2608.11434#bib.bib14))引入了主动验证,即评判器主动与环境交互以收集证据,而 AJ-Bench(35 (https://arxiv.org/html/2608.11434#bib.bib41))则在搜索、数据系统和桌面 GUI 任务上评估这类环境感知型评判器。我们的工作与 AgentRewardBench 有三个关键区别:我们专注于移动智能体及其独特的观察类型和碎片化的基准生态系统;我们将来自 4 个现有智能体基准的评判方法整合到统一评估中;我们实证地将评判质量与下游在线策略训练性能联系起来,这是现有智能体评判基准未探索的联系(附录B (https://arxiv.org/html/2608.11434#A2))。 **用于智能体训练的奖励建模。** 使用学习或基于模型的奖励进行训练源于 RLHF(27 (https://arxiv.org/html/2608.11434#bib.bib27)),并已通过 DPO(31 (https://arxiv.org/html/2608.11434#bib.bib28))和 RLAIF(4 (https://arxiv.org/html/2608.11434#bib.bib29))得到扩展。在智能体领域,DigiRL(2 (https://arxiv.org/html/2608.11434#bib.bib30))证明了 VLM 评估器可以作为设备控制智能体 RL 训练的奖励信号,相较于监督微调取得了显著改进。WebRL(29 (https://arxiv.org/html/2608.11434#bib.bib31))表明奖励模型质量对网页智能体训练至关重要。对于移动智能体,MobileRL(41 (https://arxiv.org/html/2608.11434#bib.bib32))和 MobileGUI-RL(36 (https://arxiv.org/html/2608.11434#bib.bib33))将在线 RL 与各种奖励信号结合使用。RewardBench(18 (https://arxiv.org/html/2608.11434#bib.bib34))为奖励模型提供了一个通用基准,但不涵盖特定于智能体的评估。奖励模型过度优化的缩放定律(10 (https://arxiv.org/html/2608.11434#bib.bib35))确定,不完美的奖励模型会导致可预测的性能退化。与这一系列工作相关,我们实证衡量了基准上的评判质量指标是否能预测下游智能体训练性能。 ## 3 评判器基准构建 MobileJudgeBench 包含来自 6 个已建立基准的 931 条人工标注移动智能体轨迹,由 4 个智能体模型在 289 个独特任务和 68 个真实 Android 应用上生成。我们在下面描述数据收集、标注过程和评估框架。 ### 3.1 任务和轨迹收集 **任务来源。** 我们从 6 个移动智能体基准(表1 (https://arxiv.org/html/2608.11434#S3.T1))中选择任务,这些基准共同代表了主要的评估范式:程序化状态检查(AndroidWorld、B-MoCA)、截图匹配(SPA-Bench)、关键状态分解(A3)、直接 LLM 判断(AndroidArena)和子目标匹配(AndroidLab)。 **智能体模型和轨迹格式。** 我们使用 4 个智能体生成轨迹:GPT-5-mini 和 Qwen2.5-VL-72B(通过 M3A(32 (https://arxiv.org/html/2608.11434#bib.bib15)))、UI-TARS-72B(30 (https://arxiv.org/html/2608.11434#bib.bib37))以及 Llama-3.3-70B(13 (https://arxiv.org/html/2608.11434#bib.bib40))(通过 T3A)。每个智能体尝试每个任务,每个任务最多产生 4 条轨迹。每条轨迹是每一步记录的(截图、动作、UI 树、智能体推理)元组序列,以统一格式存储。 表 1:基准统计。任务是独特的任务定义;轨迹包括每个任务最多 4 次智能体运行。应用总数不包括 SPA-Bench 中的跨应用任务类别;某些应用出现在多个基准中。 ### 3.2 人工标注 我们招募了 9 名研究生标注者,为每条轨迹标注二元成功判断(成功/失败)。每条轨迹由 2-4 名标注者使用自定义标注平台(附录A (https://arxiv.org/html/2608.11434#A1))独立标注,该平台提供轨迹视频播放、逐步截图检查和结构化标注表单。标注者会审阅任务指令、截图、动作和智能体推理。Av
相似文章
JudgeArena:可复现的LLM裁判评估统一框架
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
SkillTV-Bench:评估裁判在技能增强型智能体执行中的表现基准
介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。
@akshay_pachaar: 如果你使用LLM作为评判,这篇内容就是为你准备的。(请收藏)大多数团队通过调用一个前沿…
详细介绍了一种训练小型LLM评判器来评估智能体输出的方法,取代了昂贵的前沿模型,并附带一个用于部署的Claude Code插件。