SPIEval:评估大语言模型作为移动助手在分散个人信息上的表现
摘要
SPIEval是一个人工构建的基准测试,用于评估大语言模型作为移动助手在分散个人信息任务上的表现,涵盖10个应用中的250个任务。结果显示,即使是最佳模型GPT-5.5(xhigh),准确率也仅为57.3%,大多数失败源于信息定位不准确和验证不足。
查看缓存全文
缓存时间: 2026/08/12 08:20
论文页面 - SPIEval:评估大型语言模型作为移动助手处理分散个人信息的能力
来源:https://huggingface.co/papers/2608.10692
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SPIEval 对移动助手大语言模型在分散的个人数据任务上进行基准测试,揭示了信息检索与验证
相似文章
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
大型语言模型能否模仿人类语音进行临床评估?基于LLM的数据增强方法用于认知评分预测
本文提出了一种基于大型语言模型的数据增强框架,利用GPT-5从书面锚点生成合成口语独白,用于从语音中预测认知评分。一种相似性引导的选择策略持续降低了预测误差,特别是对于少数低分参与者。
评估大语言模型在社交媒体分析中的能力:多任务探索
犹他州立大学和范德堡大学的研究人员对GPT-4、Gemini 1.5 Pro、DeepSeek-V3、Llama 3.2与BERT在三大社交媒体任务——作者身份验证、帖子生成与用户属性推断——进行了基准测试,引入新的采样方案与分类体系以减少偏差,打造可复现的评测基准。
大型语言模型用于安全数据提取的基准测试
本文对四种大型语言模型(Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70B)从安全数据表中提取结构化信息的能力进行了基准测试,发现基于文本的提取结合思维链提示可获得最高准确率(Gemini 1.5 Pro 为84%),但没有任何模型超过工业可靠部署所需的90%阈值。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。