MobilePA-Bench:基准测试移动规划智能体在复杂真实世界任务上的表现
摘要
MobilePA-Bench是一个交互式基准测试,旨在评估移动规划智能体在复杂真实世界任务上的表现,重点考察工具调用、子智能体协作、记忆使用和运行时约束下的技能调用。
查看缓存全文
缓存时间: 2026/08/25 08:35
论文页面 - MobilePA-Bench:在复杂真实任务中评估移动规划智能体的基准测试
来源:https://huggingface.co/papers/2608.23035
摘要
MobilePA-Bench是一个交互式沙盒基准测试,用于评估移动规划智能体在实际运行时约束下的工具调用、子智能体协作、记忆使用和复合技能调用能力。
随着设备端大型语言模型智能体逐步演进为个人助手,移动操作系统已成为检验这一范式的关键平台,因此严格的能力评估至关重要。然而现有基准测试分为两类,各自存在关键缺陷:以图形界面为中心的基准测试仅评估表层屏幕操作,忽略了后台工具使用与长程规划;而静态函数调用基准测试依赖离线API匹配,与真实运行时约束脱节。为填补这一空白,我们提出MobilePA-Bench——一个交互式、有状态且以工具为核心的基准测试,专门评估移动规划智能体的工具调用(https://huggingface.co/papers?q=tool-calling)与规划能力(https://huggingface.co/papers?q=mobile%20planning%20agents)。MobilePA-Bench运行于可执行沙盒(https://huggingface.co/papers?q=executable%20sandbox)之上,该沙盒维护着实时应用数据库并返回结构化反馈,涵盖13个功能领域和212个现实移动工具。除基础工具使用外,它还从三个高阶维度评估中央规划智能体:(1)子智能体协作(https://huggingface.co/papers?q=Sub-agent%20Collaboration)——分解复杂任务并将专项工作委托给具备能力的子智能体;(2)记忆使用(https://huggingface.co/papers?q=Memory%20Usage)——调用存储的记忆、用户画像及历史偏好以处理隐式请求;(3)技能使用(https://huggingface.co/papers?q=Skill%20Usage)——调用预封装的复合技能(https://huggingface.co/papers?q=composite%20skills)而非从头规划每个步骤。大量实验表明,当前前沿大型语言模型(https://huggingface.co/papers?q=LLMs)在移动场景中仍不可靠:在严格工具顺序、权限限制和意外运行时错误下性能急剧下降。通过将交互式函数调用沙盒(https://huggingface.co/papers?q=function-calling%20sandbox)与基于证据的验证相结合,MobilePA-Bench既是实用的诊断基准,也是智能体强化学习(https://huggingface.co/papers?q=reinforcement%20learning)的交互基础——推动可靠移动智能体的开发进程。
查看arXiv页面 (https://arxiv.org/abs/2608.23035)查看PDF (https://arxiv.org/pdf/2608.23035)项目页面 (https://tongyi-mai.github.io/MobilePA-Bench/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23035)
在您的智能体中获取此论文:
hf papers read 2608.23035
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无关联此论文的模型
在模型README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。
引用本文的数据集0
无关联此论文的数据集
在数据集README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。
引用本文的空间0
无关联此论文的空间
在空间README.md中引用arxiv.org/abs/2608.23035以从此页面建立链接。
包含本文的收藏夹0
无包含此论文的收藏夹
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
DuMateBench: 评估复杂真实世界工作流中的自主代理
DuMateBench 引入了一个源于匿名化用户会话的基准测试,用于评估复杂真实世界工作流中的自主代理,测试在环境复杂性如不足、不稳定性和噪声下的性能。
MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
AdvPlan-Bench:结构化规划生成智能体的对抗性评估
AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。
MobileGym: 一个可验证且高度并行的移动GUI代理研究仿真平台
MobileGym是一个基于浏览器的移动GUI代理研究仿真平台,具有确定性状态评估和可扩展的并行执行功能。它包含一个包含416个任务的基准测试,并展示了在Qwen3-VL-4B上使用GRPO带来的提升。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。