评估个人健康记录在个性化健康AI中的效用

arXiv cs.AI 论文

摘要

本研究评估了大型语言模型(Gemini 3.0 Flash)结合个人健康记录回答患者健康查询的效果,发现当提供PHR上下文时,在有用性、安全性和个性化方面有显著改善。

arXiv:2605.18937v1 公告类型:新 摘要:患者管理的个人健康记录(PHR)有望赋能患者更好地了解自己的健康状况,但记录中的信息较为复杂,可能阻碍洞察。在本研究中,我们评估了大型语言模型(LLM,Gemini 3.0 Flash)在提供PHR临床数据作为上下文时,对用户健康查询给出有用回答的潜力。共从3种不同分布中抽取了2,257个用户查询,代表患者问题:较短的网络搜索查询、基于聊天机器人对话模板的较长问题,以及患者向医疗团队提出的问题(患者来电)。查询与去识别化的PHR(来自1,945个记录的池)进行匹配。Gemini 生成的回答分为以下情况:(1) 无PHR上下文;(2) 提供人口统计学、病情和药物的基本摘要;(3) 提供完整、详尽的临床记录。评估方面,我们利用了现有评分框架(SHARP),并开发了一个新框架用于识别解读PHR时的特定错误模式。评估采用自动评分器对全部样本进行评分,并由临床医生对子集(n=95)进行评分,两组评分者均知晓完整的PHR上下文。我们发现,对于所有类型的问题,使用PHR数据后回答的有用性均有显著提高(p < 0.001,配对t检验)。我们还观察到在安全性、准确性、相关性和个性化方面的潜在提升。我们的PHR评估框架进一步识别出LLM在理解复杂PHR特定方面(如时间定向障碍以及罕见但有意义的虚构)时存在的不足。这些结果表明PHR数据有潜力帮助满足广泛用户需求,并为基于PHR上下文的LLM回答差距监测提供了框架。本研究激励进一步工作,以评估并实现用户通过理解自身健康记录而获得潜在收益。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:27

# 评估个人健康记录在个性化健康AI中的实用性
来源:https://arxiv.org/abs/2605.18937  
作者:Rory Sayres (https://arxiv.org/search/cs?searchtype=author&query=Sayres,+R), Kejia Chen (https://arxiv.org/search/cs?searchtype=author&query=Chen,+K), Ayush Jain (https://arxiv.org/search/cs?searchtype=author&query=Jain,+A), Matthew Thompson (https://arxiv.org/search/cs?searchtype=author&query=Thompson,+M), Jonathan Richina (https://arxiv.org/search/cs?searchtype=author&query=Richina,+J), Xiang Yin (https://arxiv.org/search/cs?searchtype=author&query=Yin,+X), Jimmy Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+J), Fan Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+F), Bob Lou (https://arxiv.org/search/cs?searchtype=author&query=Lou,+B), Mike Sanchez (https://arxiv.org/search/cs?searchtype=author&query=Sanchez,+M), Ines Mezerreg (https://arxiv.org/search/cs?searchtype=author&query=Mezerreg,+I), Meredith Schreier (https://arxiv.org/search/cs?searchtype=author&query=Schreier,+M), Hamsa Subramaniam (https://arxiv.org/search/cs?searchtype=author&query=Subramaniam,+H), I-Ching Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+I), Yugang Jia (https://arxiv.org/search/cs?searchtype=author&query=Jia,+Y), Daniel Mcduff (https://arxiv.org/search/cs?searchtype=author&query=Mcduff,+D), Yossi Matias (https://arxiv.org/search/cs?searchtype=author&query=Matias,+Y), Avinatan Hassidim (https://arxiv.org/search/cs?searchtype=author&query=Hassidim,+A), Dale Webster (https://arxiv.org/search/cs?searchtype=author&query=Webster,+D), Yun Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Y), Jackie Barr (https://arxiv.org/search/cs?searchtype=author&query=Barr,+J), Quang Duong (https://arxiv.org/search/cs?searchtype=author&query=Duong,+Q)

查看PDF (https://arxiv.org/pdf/2605.18937)

> **摘要**:患者管理的个人健康记录(PHRs)有望帮助患者更好地了解自身健康状况;但记录中的信息复杂,可能阻碍洞察。在本研究中,我们评估了大型语言模型(LLMs,Gemini 3.0 Flash)在提供PHRs临床数据作为上下文时,对用户健康查询提供有帮助答案的潜力。共抽取2,257个用户查询,来自三种不同分布,以代表患者问题:较短的网络搜索查询、基于聊天机器人模板的较长问题,以及患者向其医疗团队提出的问题(患者通话)。查询与去标识化的PHRs(来自1,945份记录的池)进行匹配。Gemini的回答生成方式如下:(1) 无PHR上下文;(2) 包含人口统计信息、病情和用药的基本摘要;(3) 包含完整、详细的临床记录。在评估方面,我们利用了现有的评分框架(SHARP),并针对解释PHRs时的特定错误模式开发了新框架。评估通过自动评分器对全量数据进行,并对子集(n=95)进行临床评分,两组评分者均知晓完整PHR上下文。我们观察到,使用PHR数据后,所有问题类型的答案帮助性均有显著提升(p < 0.001,配对t检验)。我们还注意到答案在安全性、准确性、相关性和个性化方面可能获得改进。我们的PHR评估框架进一步揭示了LLM在理解复杂PHRs特定方面的不足,例如时间方向感混乱以及罕见但有意义的虚构内容。这些结果表明,PHR数据有可能帮助满足广泛用户的需求;同时,本研究提供了一个基于PHR上下文监控LLM答案不足的框架。该研究促使进一步工作,以评估并实现用户通过理解其健康记录而获得的潜在收益。

## 提交历史

来自:Rory Sayres [查看电子邮件 (https://arxiv.org/show-email/89838d5d/2605.18937)] **\[v1\]** 2026年5月18日 星期一 17:55:15 UTC (1,386 KB)

相似文章

提升ChatGPT的健康智能

OpenAI Blog

OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。