MobilePA-Bench:基准测试移动规划智能体在复杂真实世界任务上的表现

Hugging Face Daily Papers 论文

摘要

MobilePA-Bench是一个交互式基准测试,旨在评估移动规划智能体在复杂真实世界任务上的表现,重点考察工具调用、子智能体协作、记忆使用和运行时约束下的技能调用。

随着端侧LLM智能体逐渐演变为个人副驾驶,移动操作系统已成为这一范式的关键试验场,因此严格的能力评估至关重要。然而,现有的基准测试分为两大阵营,各自存在关键盲点:以图形界面为中心的基准测试测试表层屏幕操控,却忽略了后台工具使用和长视野规划;而静态函数-calling基准测试依赖于与真实运行时约束脱节的离线API匹配。为了弥合这一差距,我们提出了MobilePA-Bench,这是一个交互式、有状态且以工具为中心的基准测试,用于评估移动规划智能体的工具调用和规划能力。MobilePA-Bench运行在一个可执行沙箱上,该沙箱维护实时应用数据库并返回结构化反馈,涵盖13个功能领域和212个现实移动工具。除了基本工具使用外,它还从三个高级维度评估中央规划智能体:(1)~子智能体协作---分解复杂任务并将专门工作委派给有能力的子智能体;(2)~记忆使用---回想存储的记忆、用户档案和过去偏好以解决隐式请求;以及(3)~技能使用---调用预打包的组合技能,而不是从头规划每一步。大量实验表明,当前前沿LLM在移动环境中仍不可靠:性能在严格的工具排序、权限限制和意外运行时错误下急剧下降。通过将交互式函数调用沙箱与基于证据的验证相结合,MobilePA-Bench既是实用的诊断基准,也是智能体强化学习的交互基础---加速了可靠移动智能体的开发。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:35

论文页面 - MobilePA-Bench:在复杂真实任务中评估移动规划智能体的基准测试

来源:https://huggingface.co/papers/2608.23035

摘要

MobilePA-Bench是一个交互式沙盒基准测试,用于评估移动规划智能体在实际运行时约束下的工具调用、子智能体协作、记忆使用和复合技能调用能力。

随着设备端大型语言模型智能体逐步演进为个人助手,移动操作系统已成为检验这一范式的关键平台,因此严格的能力评估至关重要。然而现有基准测试分为两类,各自存在关键缺陷:以图形界面为中心的基准测试仅评估表层屏幕操作,忽略了后台工具使用与长程规划;而静态函数调用基准测试依赖离线API匹配,与真实运行时约束脱节。为填补这一空白,我们提出MobilePA-Bench——一个交互式、有状态且以工具为核心的基准测试,专门评估移动规划智能体的工具调用(https://huggingface.co/papers?q=tool-calling)与规划能力(https://huggingface.co/papers?q=mobile%20planning%20agents)。MobilePA-Bench运行于可执行沙盒(https://huggingface.co/papers?q=executable%20sandbox)之上,该沙盒维护着实时应用数据库并返回结构化反馈,涵盖13个功能领域和212个现实移动工具。除基础工具使用外,它还从三个高阶维度评估中央规划智能体:(1)子智能体协作(https://huggingface.co/papers?q=Sub-agent%20Collaboration)——分解复杂任务并将专项工作委托给具备能力的子智能体;(2)记忆使用(https://huggingface.co/papers?q=Memory%20Usage)——调用存储的记忆、用户画像及历史偏好以处理隐式请求;(3)技能使用(https://huggingface.co/papers?q=Skill%20Usage)——调用预封装的复合技能(https://huggingface.co/papers?q=composite%20skills)而非从头规划每个步骤。大量实验表明,当前前沿大型语言模型(https://huggingface.co/papers?q=LLMs)在移动场景中仍不可靠:在严格工具顺序、权限限制和意外运行时错误下性能急剧下降。通过将交互式函数调用沙盒(https://huggingface.co/papers?q=function-calling%20sandbox)与基于证据的验证相结合,MobilePA-Bench既是实用的诊断基准,也是智能体强化学习(https://huggingface.co/papers?q=reinforcement%20learning)的交互基础——推动可靠移动智能体的开发进程。

查看arXiv页面 (https://arxiv.org/abs/2608.23035)查看PDF (https://arxiv.org/pdf/2608.23035)项目页面 (https://tongyi-mai.github.io/MobilePA-Bench/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23035)

在您的智能体中获取此论文:

hf papers read 2608.23035

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无关联此论文的模型

在模型README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。

引用本文的数据集0

无关联此论文的数据集

在数据集README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。

引用本文的空间0

无关联此论文的空间

在空间README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。

包含本文的收藏夹0

无包含此论文的收藏夹

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面建立链接。

相似文章