MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
摘要
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
查看缓存全文
缓存时间: 2026/06/02 15:37
Paper page - MCP-Persona:通过环境模拟对真实个人应用中的LLM智能体进行基准测试
来源:https://huggingface.co/papers/2606.02470 作者:
,
,
,
,
,
,
,
,
,
,
摘要
MCP-Persona 基准测试评估了智能体在与个人账户和本地数据库交互的个性化工具上的表现,揭示了当前 SOTA 智能体面临的重大挑战。
模型上下文协议 (https://huggingface.co/papers?q=Model%20Context%20Protocol) (MCP) 已成为连接大型语言模型 (https://huggingface.co/papers?q=large%20language%20models) (LLM) 与外部数据源 (https://huggingface.co/papers?q=external%20data%20sources) 和工具 (https://huggingface.co/papers?q=tools) 的变革性标准,并已在个人应用和开发平台上迅速得到采用。然而,现有的基准测试 (https://huggingface.co/papers?q=benchmark) 主要聚焦于通用信息查询工具 (https://huggingface.co/papers?q=tools),未能捕捉个人社交应用带来的实际挑战——在这些应用中,工具 (https://huggingface.co/papers?q=tools) 与个人账户或本地数据库交互。为弥补这一关键差距,我们推出了 MCP-Persona,这是首个专门用于评估智能体在真实个性化 MCP 工具 (https://huggingface.co/papers?q=tools) 上性能表现 (https://huggingface.co/papers?q=agent%20performance) 的基准测试 (https://huggingface.co/papers?q=benchmark)。MCP-Persona 涵盖了广泛使用的多样化应用,从 Reddit、小红书(Rednote)等社交媒体平台 (https://huggingface.co/papers?q=social%20media%20platforms),到飞书(Lark)、Slack 等企业协作套件 (https://huggingface.co/papers?q=enterprise%20collaboration%20suites)。我们在多种最先进 (SOTA) 智能体上进行的广泛实验表明,它们在个性化工具使用 (https://huggingface.co/papers?q=personalized%20tool%20use) 方面存在显著困难,从而凸显了该基准测试 (https://huggingface.co/papers?q=benchmark) 在识别和解决这些局限方面的重要作用。MCP-Persona 公开可用,访问地址为 https://github.com/wwh0411/MCP-Persona}https://github.com/wwh0411/MCP-Persona。
查看 arXiv 页面 (https://arxiv.org/abs/2606.02470) 查看 PDF (https://arxiv.org/pdf/2606.02470) GitHub4 (https://github.com/wwh0411/MCP-Persona) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02470)
在你的智能体中获取此论文:
hf papers read 2606\.02470
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
引用此论文的 Spaces0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.02470,以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以从此页面链接它。
相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
面向任务对话的人格引导LLM代理
本文探讨了在面向任务对话中,LLMs如何作为人格引导的代理,并通过GPT-4o和Gemini 2.0 Flash等模型评估,分析了人格适应对任务性能和用户满意度的影响。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。
面向时间干预下个人LLM智能体的用户条件化评估
本文认为,评估个人LLM智能体需要跨不同的用户条件化状态重放时间干预,并指出现有基准中的空白。它提出了一个最小基准设计和用于用户条件化适应的报告指标。
FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents
Introduces FinPerMA, an event-grounded benchmark for evaluating personalized memory in LLM agents for financial advising, showing that current models and memory systems remain far from saturated.