评估个人健康记录在个性化健康AI中的效用
摘要
本研究评估了大型语言模型(Gemini 3.0 Flash)结合个人健康记录回答患者健康查询的效果,发现当提供PHR上下文时,在有用性、安全性和个性化方面有显著改善。
arXiv:2605.18937v1 公告类型:新
摘要:患者管理的个人健康记录(PHR)有望赋能患者更好地了解自己的健康状况,但记录中的信息较为复杂,可能阻碍洞察。在本研究中,我们评估了大型语言模型(LLM,Gemini 3.0 Flash)在提供PHR临床数据作为上下文时,对用户健康查询给出有用回答的潜力。共从3种不同分布中抽取了2,257个用户查询,代表患者问题:较短的网络搜索查询、基于聊天机器人对话模板的较长问题,以及患者向医疗团队提出的问题(患者来电)。查询与去识别化的PHR(来自1,945个记录的池)进行匹配。Gemini 生成的回答分为以下情况:(1) 无PHR上下文;(2) 提供人口统计学、病情和药物的基本摘要;(3) 提供完整、详尽的临床记录。评估方面,我们利用了现有评分框架(SHARP),并开发了一个新框架用于识别解读PHR时的特定错误模式。评估采用自动评分器对全部样本进行评分,并由临床医生对子集(n=95)进行评分,两组评分者均知晓完整的PHR上下文。我们发现,对于所有类型的问题,使用PHR数据后回答的有用性均有显著提高(p < 0.001,配对t检验)。我们还观察到在安全性、准确性、相关性和个性化方面的潜在提升。我们的PHR评估框架进一步识别出LLM在理解复杂PHR特定方面(如时间定向障碍以及罕见但有意义的虚构)时存在的不足。这些结果表明PHR数据有潜力帮助满足广泛用户需求,并为基于PHR上下文的LLM回答差距监测提供了框架。本研究激励进一步工作,以评估并实现用户通过理解自身健康记录而获得潜在收益。
查看缓存全文
缓存时间: 2026/05/20 08:27
# 评估个人健康记录在个性化健康AI中的实用性 来源:https://arxiv.org/abs/2605.18937 作者:Rory Sayres (https://arxiv.org/search/cs?searchtype=author&query=Sayres,+R), Kejia Chen (https://arxiv.org/search/cs?searchtype=author&query=Chen,+K), Ayush Jain (https://arxiv.org/search/cs?searchtype=author&query=Jain,+A), Matthew Thompson (https://arxiv.org/search/cs?searchtype=author&query=Thompson,+M), Jonathan Richina (https://arxiv.org/search/cs?searchtype=author&query=Richina,+J), Xiang Yin (https://arxiv.org/search/cs?searchtype=author&query=Yin,+X), Jimmy Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+J), Fan Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+F), Bob Lou (https://arxiv.org/search/cs?searchtype=author&query=Lou,+B), Mike Sanchez (https://arxiv.org/search/cs?searchtype=author&query=Sanchez,+M), Ines Mezerreg (https://arxiv.org/search/cs?searchtype=author&query=Mezerreg,+I), Meredith Schreier (https://arxiv.org/search/cs?searchtype=author&query=Schreier,+M), Hamsa Subramaniam (https://arxiv.org/search/cs?searchtype=author&query=Subramaniam,+H), I-Ching Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+I), Yugang Jia (https://arxiv.org/search/cs?searchtype=author&query=Jia,+Y), Daniel Mcduff (https://arxiv.org/search/cs?searchtype=author&query=Mcduff,+D), Yossi Matias (https://arxiv.org/search/cs?searchtype=author&query=Matias,+Y), Avinatan Hassidim (https://arxiv.org/search/cs?searchtype=author&query=Hassidim,+A), Dale Webster (https://arxiv.org/search/cs?searchtype=author&query=Webster,+D), Yun Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+Y), Jackie Barr (https://arxiv.org/search/cs?searchtype=author&query=Barr,+J), Quang Duong (https://arxiv.org/search/cs?searchtype=author&query=Duong,+Q) 查看PDF (https://arxiv.org/pdf/2605.18937) > **摘要**:患者管理的个人健康记录(PHRs)有望帮助患者更好地了解自身健康状况;但记录中的信息复杂,可能阻碍洞察。在本研究中,我们评估了大型语言模型(LLMs,Gemini 3.0 Flash)在提供PHRs临床数据作为上下文时,对用户健康查询提供有帮助答案的潜力。共抽取2,257个用户查询,来自三种不同分布,以代表患者问题:较短的网络搜索查询、基于聊天机器人模板的较长问题,以及患者向其医疗团队提出的问题(患者通话)。查询与去标识化的PHRs(来自1,945份记录的池)进行匹配。Gemini的回答生成方式如下:(1) 无PHR上下文;(2) 包含人口统计信息、病情和用药的基本摘要;(3) 包含完整、详细的临床记录。在评估方面,我们利用了现有的评分框架(SHARP),并针对解释PHRs时的特定错误模式开发了新框架。评估通过自动评分器对全量数据进行,并对子集(n=95)进行临床评分,两组评分者均知晓完整PHR上下文。我们观察到,使用PHR数据后,所有问题类型的答案帮助性均有显著提升(p < 0.001,配对t检验)。我们还注意到答案在安全性、准确性、相关性和个性化方面可能获得改进。我们的PHR评估框架进一步揭示了LLM在理解复杂PHRs特定方面的不足,例如时间方向感混乱以及罕见但有意义的虚构内容。这些结果表明,PHR数据有可能帮助满足广泛用户的需求;同时,本研究提供了一个基于PHR上下文监控LLM答案不足的框架。该研究促使进一步工作,以评估并实现用户通过理解其健康记录而获得的潜在收益。 ## 提交历史 来自:Rory Sayres [查看电子邮件 (https://arxiv.org/show-email/89838d5d/2605.18937)] **\[v1\]** 2026年5月18日 星期一 17:55:15 UTC (1,386 KB)
相似文章
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
提升ChatGPT的健康智能
OpenAI宣布通过使用GPT-5.5 Instant,在ChatGPT中显著提升了健康相关回答的质量,其准确性与前沿模型相当,并通过医生主导的评估将事实性问题减少了71%。
RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
技能增强型AI代理在医学研究分析中的应用:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估
本探索性研究在NSCLC生物标志物任务中使用多模型人类评估,评估将AI代理与医学研究技能包相结合是否能提高转录组研究分析输出的质量(与原生AI相比)。结果显示有方向性但无统计显著性的改善,强调了进行更大规模、更稳健评估的必要性。