启用全新医疗模式:AI 联合临床医生

Google DeepMind Blog 模型

摘要

Google DeepMind 宣布启动 AI 联合临床医生研究计划,旨在通过"三方协同诊疗"改善医疗服务——即 AI 智能体在医生监督下协助患者。该系统在一项初级医疗咨询研究中展现出高准确率且零严重错误,表现优于现有循证综合工具。

探索 AI 增强医疗的路径,以及 AI 联合临床医生的开发。
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:04

# 借助 AI 联合临床医生开启医疗新模式 来源:https://deepmind.google/blog/ai-co-clinician/ 全球医疗系统都在追求更好的治疗效果、更低的成本,以及患者和临床医生体验的改善。然而,进展受到全球临床专家短缺的制约,世界卫生组织预测到 2030 年卫生工作者缺口将超过 1000 万(https://www.who.int/health-topics/health-workforce#tab=tab_1)。 虽然 AI 常被视为弥合这一差距的关键,但它尚未能完全满足临床医生和患者的需求。正因如此,我们今天宣布启动 AI 联合临床医生研究计划,探索 AI 如何更好地放大医生的专业能力,为患者提供更高质量的医疗服务。 在 Google DeepMind,我们的医疗 AI 之旅已经从 MedPaLM(https://www.nature.com/articles/s41586-023-06291-2)掌握考试风格的医学知识测试,发展到 AMIE(https://www.nature.com/articles/s41586-025-08866-7)在基于文本的模拟医学咨询中达到医生水平,包括在真实世界可行性(https://arxiv.org/abs/2603.08448)试验环境中。我们长期以来也在研究临床医生和 AI 系统如何协同工作(https://www.nature.com/articles/s41591-023-02437-x)(https://www.nature.com/articles/s41586-025-08869-4)。 我们假设,医疗服务的下一次演进将是"三方协作"模式,即 AI 智能体在医生的指导下帮助患者完成诊疗旅程。医学一直是一项团队运动,AI 智能体可以带来更多队友:扩展临床医生的覆盖范围,同时确保他们保留判断力和控制权。 这构成了我们 AI 联合临床医生研究计划的基础:AI 被设计为在专家临床监督下与患者互动的护理团队的协作成员。我们在面向临床医生和面向患者的场景中设计并评估了 AI 联合临床医生。兼顾这两个视角对于 AI 提升医疗服务的质量、成本、可及性和体验至关重要。 推进医学 AI 研究,使其对临床医生协助患者时更可信、更有帮助。 ## 以 AI 联合临床医生增强临床医生能力 对医生而言,工具只有在可信且基于事实的情况下才有用。因此,我们研究了 AI 联合临床医生如何通过呈现高质量证据来支持临床医生。 与学术医生合作,我们改编了 "NOHARM(https://arxiv.org/abs/2512.01241)" 框架来测试我们的 AI 是否存在"主动错误"(不正确信息)和"遗漏错误"(未能呈现关键信息)。 在头对头的盲评中,医生始终更青睐 AI 联合临床医生的回答,而非主流证据综合工具。在对 98 个真实初级护理查询的客观分析中,我们的系统在 97 个案例中记录了零关键错误,优于两个医生广泛使用的 AI 系统。 该研究使用了 98 个真实初级护理查询的盲比,这些查询来自多样化的来源,随后由主治医师团队精炼。这个多步骤迭代过程涉及全面的背景研究和查询特定答案指标的制定,以实现临床准确性和最佳实践指南合规性的严格专业评估。通过利用这一专家主导精炼阶段,该方法能够精确刻画共识场景特定的遗漏错误和主动错误,确保评估反映真实临床决策的复杂性。 除了可靠的临床证据综合外,AI 系统还应以医生要求的精确度回答关于药物和治疗干预的问题。这对 AI 来说是项困难任务,且仍有待探索。为解决这一空白,我们在 OpenFDA 的 RxQA(https://arxiv.org/abs/2503.06074)问题集上评估了 AI 联合临床医生,这是一个旨在评估复杂药物知识和推理的具有挑战性的基准。我们在这些测试中取得了显著进展,超越了其他前沿 AI 系统,尤其是在以真实护理中常见的开放式方式提出问题时。研究结果凸显了先进 AI 在帮助临床医生应对日益数据密集型的护理规划和管理需求方面的潜力。 RxQA 最初以选择题(MCQ)形式呈现,即使初级护理医生得分也一般。虽然我们的结果显示 AI 系统在公开可用的(OpenFDA)RxQA 选择题表现上有显著改善,但临床医生在现实世界中的需求表现为开放式问题,而非从预设选项中识别正确答案。在这种更现实的药物开放式问答临床任务上,AI 联合临床医生优于现有前沿模型。综合来看,这些结果表明 AI 可以在临床推理的某些方面媲美人类医生的能力,同时仍有进一步改进的空间。 ## 在远程医疗环境中研究 AI 联合临床医生的实时多模态能力 除了辅助临床医生的场景外,我们还在研究 AI 联合临床医生在面向患者研究场景中的表现。专家临床评估传统上包括细微的视听线索,如观察患者的步态、呼吸模式的细微差别,或皮肤变化的外观。虽然先前研究(包括我们与 Beth Israel Deaconess Medical Center 的合作(https://research.google/blog/exploring-the-feasibility-of-conversational-diagnostic-ai-in-a-real-world-clinical-study/))证明了 AI 文本聊天在医生预约前的价值,但将互动限制在文本本质上限制了 AI 的临床价值。医学不仅仅是文本;它需要眼睛、耳朵和声音。 这就是为什么我们正在探索实时多模态 AI 作为护理团队辅助组件的潜力。基于 Gemini(https://deepmind.google/models/gemini/pro/)和 Project Astra(https://deepmind.google/models/project-astra/)的能力,我们测试了 AI 联合临床医生使用实时音频和视频与患者互动的能力,模拟远程医疗通话,有能力的 AI 有朝一日可能在专家监督下支持更好的诊断和管理。有关我们方法和结果的更多细节可在我们的技术报告中找到:《迈向具有眼睛、耳朵和声音的会话式医学 AI(https://www.gstatic.com/vesper/ai_coclinician_technical_report.pdf)》 与哈佛和斯坦福的学术医生合作,我们设计了一项随机模拟研究,包含 20 个合成临床场景和 10 名医生"患者扮演者"。该智能体展示了纯文本系统之外的新能力,如实时指导患者完成复杂的体格检查。例如,它成功纠正了患者的吸入器使用技术,并指导肩部动作以识别肩袖损伤。 虽然关于 AI 匹配或超越人类临床表现的讨论频繁,但这些高保真模拟更严格地评估了这一前提。我们评估了咨询技能的 140 多个方面,发现专家医生总体上表现优于 AI 系统,特别是在识别"危险信号"和指导关键体格检查方面。这一发现表明这些系统目前最适合作为医生的辅助工具,而非临床判断的替代品。同时,我们的工作凸显了 AI 能力的重大进步:AI 联合临床医生在 140 个评估领域中的 68 个领域达到了与初级护理医生(PCPs)相当或超越的水平。研究结果强调了广阔前景,并指出了进一步研究能够最有影响力地推进医学 AI 的具体领域。 来自一项涉及 120 次假设远程医疗接触的随机、界面盲法、交叉模拟研究的结果,由真实初级护理医生、AI 联合临床医生或 GPT-realtime 执行。为进行评估,一组内科住院医师担任患者扮演者,演绎 20 个标准化门诊场景。这些场景涵盖一系列临床状况,专门设计为需要主动的听觉和视觉推理。场景定制标准评估了咨询质量的七个领域,每个项目使用锚定的 0-2 评分来区分遗漏、部分完成和完全适当的表现。误差条对应 95% 置信区间。 以下您可以看到研究团队在此远程医疗环境中扮演假设患者与 AI 联合临床医生互动的场景,展示了系统的潜在能力和局限性。 ## 以临床级 AI 的防护措施构建信任 AI 向临床环境的过渡和部署需要毫不妥协的架构和操作保障。在我们对患者面向远程医疗对话模拟的研究中,AI 联合临床医生使用双智能体架构:"规划器"模块持续监控对话,验证"对话器"智能体保持在安全的临床边界内。 同样,为满足医生需求,AI 联合临床医生优先使用临床级证据,对检索进行验证和引用检查。我们上述报告的评估由医生构建,以反映他们广泛的现实世界证据需求,从假设场景制定问题以严格评估 AI 的能力。 ## 研究合作以严格真实世界评估 AI 联合临床医生 为进一步开发和评估 AI 联合临床医生,我们目前正与全球多样化医疗环境中的学术和研究合作者推进分阶段方法,包括美国、印度、澳大利亚、新西兰、新加坡和阿联酋。 随着我们在这些评估阶段的推进,我们将在更多地区深化研究,包括使命一致的医疗机构和学术医学中心。我们的目标是确保医学 AI 按照适用标准负责任地开发和部署,支持全球更好的健康。 *注意:我们的研究合作在此阶段不用于疾病的诊断、治愈、缓解、治疗或预防,也不提供医疗建议。* ## 致谢 我们感谢哈佛医学院和斯坦福医学的研究合作伙伴,以及众多参与与我们团队进一步可信测试评估的医学中心和护理组织。该项目涉及与 Google DeepMind、Google Research、Google Cloud 和 Google for Health 多个团队的合作,我们感谢团队成员的深入讨论和贡献。 特别是,AI 联合临床医生离不开以下核心研究和工程人员的努力:Aniruddh Raghu、Arthur Chen、Charlie Taylor、CJ Park、David Stutz、Devora Berlowitz、Doug Fritz、Dylan Slack、Eliseo Papa、Jack Chen、JD Velasquez、Jing Rong Lim、Katya Tregubova、Kelvin Guu、Meet Shah、Richard Green、Ryutaro Tanno、Sukhdeep Singh、Victoria Johnston、Adam Rodman。 我们感谢众多合作者的宝贵贡献,包括:Ali Eslami、Aliya Rysbeck、Andy Song、Anil Palepu、Anna Cupani、Bakul Patel、Bibo Xu、Brett Hatfield、David Wu、Ed Chi、Emma Cooney、Erica Oppenheimer、Erwan Rolland、Euan A. Ashley、Francesca Pietra、Rebeca Santamaria-Fernadez、Gordon Turner、Gregory Wayne、Hannah Gladman、Irene Teinemaa、Jack O'Sullivan、Jacob Koshy、Jan Freyberg、Jason Gusdorf、Joelle Wilson、Katherine Tong、Juraj Gottweis、Michael Howell、Mili Sanwalka、Pavel Dubov、Pete Clardy、Peter Brodeur、Rachelle Sico、SiWai Man、Sumanth Dahathri、Taylan Cemgil、Tim Strother、Uchechi Okereke、Valentin Lievin、Vishnu Ravi、Yana Lunts、Yun Liu、Simon Staffell、Rachel Teo、Adriana Fernandez Lara、Armin Senoner、Danielle Breen、Paula Tesch、Leen Verburgh、Dimple Vijaykumar、Juanita Bawagan、Muinat Abdul、Mariana Montes 和 Rob Ashley。特色视频由 Christopher Godfree、Matt Mager、Emma Moxhay 和 Simon Waldron 制作。 感谢 James Manyika 和 Demis Hassabis 在研究过程中提供的深刻指导和支持。 ### 为医疗开发可靠的 AI 工具

相似文章

与 Penda Health 一起开创医疗 AI 副驾驶

OpenAI Blog

OpenAI 与肯尼亚 Penda Health 合作研究了一个由大语言模型驱动的临床助手 AI Consult,在 39,849 次患者就诊中诊断错误相对降低 16%,治疗错误相对降低 13%。该研究突出了 AI 在初级保健中的成功真实应用,并为 LLM 安全有效地部署以支持临床医生提供了模板。

用代理式AI重振全球医疗的人性化

MIT Technology Review

医疗保健提供者正转向代理式AI,实现复杂任务自动化,减轻临床医生倦怠,改善患者预后,如HSS利用AI代理处理保险理赔和患者分诊所示。