MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试

Hugging Face Daily Papers 论文

摘要

MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。

模型上下文协议(MCP)已成为连接大型语言模型(LLM)与外部数据源和工具的革命性标准,并迅速被个人应用和开发平台所采纳。然而,现有基准测试主要关注通用信息检索工具,未能捕捉个人社交应用(如工具与个人账户或本地数据库交互)所带来的实际挑战。为弥合这一关键差距,我们推出了MCP-Persona,这是首个专门用于评估智能体在真实世界个性化MCP工具上性能的基准测试。MCP-Persona涵盖多种广泛使用的应用程序,从Reddit、小红书等社交媒体平台到Lark(飞书)、Slack等企业协作套件。我们对多种最先进(SOTA)智能体进行的广泛实验表明,它们在个性化工具使用方面存在显著困难,从而凸显了该基准测试在识别和解决这些局限性方面的关键作用。MCP-Persona已在 https://github.com/wwh0411/MCP-Persona 公开提供。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

Paper page - MCP-Persona:通过环境模拟对真实个人应用中的LLM智能体进行基准测试

来源:https://huggingface.co/papers/2606.02470 作者:

,

,

,

,

,

,

,

,

,

,

摘要

MCP-Persona 基准测试评估了智能体在与个人账户和本地数据库交互的个性化工具上的表现,揭示了当前 SOTA 智能体面临的重大挑战。

模型上下文协议 (https://huggingface.co/papers?q=Model%20Context%20Protocol) (MCP) 已成为连接大型语言模型 (https://huggingface.co/papers?q=large%20language%20models) (LLM) 与外部数据源 (https://huggingface.co/papers?q=external%20data%20sources) 和工具 (https://huggingface.co/papers?q=tools) 的变革性标准,并已在个人应用和开发平台上迅速得到采用。然而,现有的基准测试 (https://huggingface.co/papers?q=benchmark) 主要聚焦于通用信息查询工具 (https://huggingface.co/papers?q=tools),未能捕捉个人社交应用带来的实际挑战——在这些应用中,工具 (https://huggingface.co/papers?q=tools) 与个人账户或本地数据库交互。为弥补这一关键差距,我们推出了 MCP-Persona,这是首个专门用于评估智能体在真实个性化 MCP 工具 (https://huggingface.co/papers?q=tools) 上性能表现 (https://huggingface.co/papers?q=agent%20performance) 的基准测试 (https://huggingface.co/papers?q=benchmark)。MCP-Persona 涵盖了广泛使用的多样化应用,从 Reddit、小红书(Rednote)等社交媒体平台 (https://huggingface.co/papers?q=social%20media%20platforms),到飞书(Lark)、Slack 等企业协作套件 (https://huggingface.co/papers?q=enterprise%20collaboration%20suites)。我们在多种最先进 (SOTA) 智能体上进行的广泛实验表明,它们在个性化工具使用 (https://huggingface.co/papers?q=personalized%20tool%20use) 方面存在显著困难,从而凸显了该基准测试 (https://huggingface.co/papers?q=benchmark) 在识别和解决这些局限方面的重要作用。MCP-Persona 公开可用,访问地址为 https://github.com/wwh0411/MCP-Persona}https://github.com/wwh0411/MCP-Persona。

查看 arXiv 页面 (https://arxiv.org/abs/2606.02470) 查看 PDF (https://arxiv.org/pdf/2606.02470) GitHub4 (https://github.com/wwh0411/MCP-Persona) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02470)

在你的智能体中获取此论文:

hf papers read 2606\.02470

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以从此页面链接它。

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

APeB:大型语言模型智能体个性化能力的基准测试

arXiv cs.AI

提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。