SPIEval:评估大语言模型作为移动助手在分散个人信息上的表现

Hugging Face Daily Papers 论文

摘要

SPIEval是一个人工构建的基准测试,用于评估大语言模型作为移动助手在分散个人信息任务上的表现,涵盖10个应用中的250个任务。结果显示,即使是最佳模型GPT-5.5(xhigh),准确率也仅为57.3%,大多数失败源于信息定位不准确和验证不足。

大语言模型(LLM)越来越多地被部署为移动助手,其中一个关键挑战是如何利用分散在多个应用程序(app)中的个人信息来完成用户指令。然而,由于缺乏专门的基准测试,这些模型的能力仍未得到充分了解。为了解决这一空白,我们推出了SPIEval——一个基于五种认知能力(即推理、消歧、整合、偏好推断和多意图分解)的人工构建基准。SPIEval包含250个任务,涵盖分布在10个应用中的4,335条个人记录,并通过21个工具支持多轮交互。分析表明,该基准具有多样化的场景、具有挑战性的任务、分散的信息、可控的环境和可验证的结果。我们评估了九个代表性的大语言模型,发现仍有很大的改进空间。表现最好的模型GPT-5.5(xhigh)仅达到57.3%的准确率,而最弱的模型仅为16.4%。进一步分析显示,79%的失败源于信息定位不准确,因为大语言模型常常执着于看似合理但不正确的信息,而不是继续检索以进行验证。我们还发现,只有不到2%的检索操作使用了高级搜索方法,并且不同模型在搜索效率上存在显著差异。这些发现揭示了当前基于大语言模型的移动助手的根本局限性,并激励了未来在这一方向上的研究。数据和代码可在 https://huggingface.co/datasets/Junjie-Ye/SPIEval 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:20

论文页面 - SPIEval:评估大型语言模型作为移动助手处理分散个人信息的能力

来源:https://huggingface.co/papers/2608.10692

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

SPIEval 对移动助手大语言模型在分散的个人数据任务上进行基准测试,揭示了信息检索与验证

相似文章

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。

评估大语言模型在社交媒体分析中的能力:多任务探索

arXiv cs.CL

犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。

大型语言模型用于安全数据提取的基准测试

arXiv cs.CL

本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。