MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
摘要
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
查看缓存全文
缓存时间: 2026/06/02 15:37
Paper page - MCP-Persona:通过环境模拟对真实个人应用中的LLM智能体进行基准测试
来源:https://huggingface.co/papers/2606.02470 作者:
,
,
,
,
,
,
,
,
,
,
摘要
MCP-Persona 基准测试评估了智能体在与个人账户和本地数据库交互的个性化工具上的表现,揭示了当前 SOTA 智能体面临的重大挑战。
模型上下文协议 (https://huggingface.co/papers?q=Model%20Context%20Protocol) (MCP) 已成为连接大型语言模型 (https://huggingface.co/papers?q=large%20language%20models) (LLM) 与外部数据源 (https://huggingface.co/papers?q=external%20data%20sources) 和工具 (https://huggingface.co/papers?q=tools) 的变革性标准,并已在个人应用和开发平台上迅速得到采用。然而,现有的基准测试 (https://huggingface.co/papers?q=benchmark) 主要聚焦于通用信息查询工具 (https://huggingface.co/papers?q=tools),未能捕捉个人社交应用带来的实际挑战——在这些应用中,工具 (https://huggingface.co/papers?q=tools) 与个人账户或本地数据库交互。为弥补这一关键差距,我们推出了 MCP-Persona,这是首个专门用于评估智能体在真实个性化 MCP 工具 (https://huggingface.co/papers?q=tools) 上性能表现 (https://huggingface.co/papers?q=agent%20performance) 的基准测试 (https://huggingface.co/papers?q=benchmark)。MCP-Persona 涵盖了广泛使用的多样化应用,从 Reddit、小红书(Rednote)等社交媒体平台 (https://huggingface.co/papers?q=social%20media%20platforms),到飞书(Lark)、Slack 等企业协作套件 (https://huggingface.co/papers?q=enterprise%20collaboration%20suites)。我们在多种最先进 (SOTA) 智能体上进行的广泛实验表明,它们在个性化工具使用 (https://huggingface.co/papers?q=personalized%20tool%20use) 方面存在显著困难,从而凸显了该基准测试 (https://huggingface.co/papers?q=benchmark) 在识别和解决这些局限方面的重要作用。MCP-Persona 公开可用,访问地址为 https://github.com/wwh0411/MCP-Persona}https://github.com/wwh0411/MCP-Persona。
查看 arXiv 页面 (https://arxiv.org/abs/2606.02470) 查看 PDF (https://arxiv.org/pdf/2606.02470) GitHub4 (https://github.com/wwh0411/MCP-Persona) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02470)
在你的智能体中获取此论文:
hf papers read 2606\.02470
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
引用此论文的 Spaces0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以从此页面链接它。
相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
PolyWorkBench: 多语言长周期LLM智能体基准测试
介绍PolyWorkBench,一个用于评估LLM智能体在多语言长周期职场工作流中的表现的基准测试,涵盖五个领域,并展示了与单语言设置相比显著的性能下降。