面向安全的假设演绎框架用于AI辅助鉴别诊断

arXiv cs.AI 论文

摘要

AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。

arXiv:2607.08038v1 公告类型:新\n摘要:诊断错误是对患者安全的主要威胁,但当前的大型语言模型(LLM)系统通常将诊断视为单次预测任务,缺乏对高风险替代方案的防范,也缺乏对其推理的严格验证。在此,我们提出AegisDx,一个面向安全的假设演绎临床推理框架。AegisDx通过角色特异性合约、结构化中间输出、证据检索接口和验证门协调专门的LLM组件,生成广泛的鉴别诊断,强制对危险的“不可遗漏”病症进行明确筛查,根据经过验证的医学证据验证推理,并构建可操作的后续步骤。我们在三个层面上评估了AegisDx。在来自NEJM和JAMA的文献衍生病例报告中,以GPT-oss-120B为共享骨干,对于JAMA病例的Top-3诊断准确率为59.9%,而独立LLM为52.1%;对于NEJM病例为62.7%对51.4%。在来自《急诊医学年鉴》的病例中,Top-3准确率为85.7%对68.6%;针对医生共识的“不可遗漏”诊断集,AegisDx在其前三名诊断中至少包含一种此类病症的病例占78.0%,而独立LLM为52.0%。在一项对来自耶鲁纽黑文健康系统的43份真实世界急诊科病历进行的盲法医生评估中,与GPT-5相比,AegisDx将医生评定的综合安全评分从4.31提高到4.55(5分制,校正后p=2.1x10^-4),在“不可遗漏”识别和推理安全性方面有定性提升。我们的发现表明,将诊断AI设计为面向安全的推理框架,而不仅仅是优化原始预测准确性,可以为急性护理工作流程提供更安全、更透明且更具临床意义的床边决策支持层。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:06

# 面向安全的人工智能辅助鉴别诊断假设演绎框架 来源: https://arxiv.org/html/2607.08038

Fan Ma  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  
同等贡献  

Mauro Giuffrè  
的里雅斯特大学医学、外科与健康科学系,的里雅斯特,意大利  
同等贡献  

Donald Wright  
Kent McCann  
耶鲁大学医学院急诊医学系,耶鲁大学,纽黑文,美国  

Mark Iscoe  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  
耶鲁大学医学院急诊医学系,耶鲁大学,纽黑文,美国  

Lingfei Qian  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Mingyang Jiang  
范德堡大学应用数学与计算机科学系,纳什维尔,美国  

Chi Wing Ng  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Na Hong  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Huan He  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Cathy Shyr  
范德堡大学生物医学信息学系,纳什维尔,美国  

Qingyu Chen  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Lee Schwamm  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  
耶鲁大学医学院神经病学系,耶鲁大学,纽黑文,美国  

Lucila Ohno\-Machado  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

Hua Xu  
耶鲁大学医学院生物医学信息学与数据科学系,耶鲁大学,纽黑文,美国  

###### 摘要  
诊断错误是患者安全的主要威胁,然而当前的大型语言模型(LLM)系统通常将诊断视为一次性预测任务,缺乏对高风险替代诊断的遗漏进行系统性防范,也缺乏对其推理过程的严格验证。在此,我们提出 **AegisDx**,一个面向安全的诊断推理框架,用于实现假设演绎式临床推理,而非传统的自由形式模型调用或纯智能体管道。AegisDx 通过角色特定契约、结构化中间输出、证据检索接口和验证门控来协调专门的 LLM 组件,以生成广泛的鉴别诊断、强制对危险的“不可遗漏”病症进行明确筛查、对照基于实际医学证据(如 PubMed 和临床指南)验证推理,并规划可操作的下一步诊断和管理步骤。我们从三个不同层面评估了 AegisDx。首先,针对来自两本综合医学期刊——《新英格兰医学杂志》(NEJM)和《美国医学会杂志》(JAMA)——的文献病例报告,以来源文章中报告的最终诊断为参考标准,AegisDx 始终优于匹配的独立 LLM。当以 GPT-oss-120B 作为共享骨干模型时,对于 JAMA 病例,Top-3 诊断准确率为 59.9% 对比 52.1%(+7.8 个百分点);对于 NEJM 病例,为 62.7% 对比 51.4%(+11.3 个百分点)。其次,在《急症医学年鉴》(Annals of EM)的病例中,以来源文章中报告的最终诊断为参考,AegisDx 的 Top-3 准确率为 85.7%,而独立 LLM 为 68.6%(+17.1 个百分点)。针对医生共识的“不可遗漏”诊断集,AegisDx 在其前三项诊断中至少捕获到一种此类疾病的案例占 78.0%,而独立 LLM 为 52.0%(+26.0 个百分点)。第三,在一项针对耶鲁纽黑文健康系统(YNHHS)43 份真实急诊科(ED)临床病历的盲法医生评估中(与 GPT-5 对比),AegisDx 将医生评定的综合安全得分从 4.31 分提升至 4.55 分(5 分制;校正后 p = 2.1×10⁻⁴),特别是在“不可遗漏”病症识别和推理安全性方面取得了定性上的改进。我们的研究结果表明,将诊断性人工智能(AI)设计为面向安全的诊断推理框架,而非仅优化原始预测准确性,能够为急性诊疗工作流程提供一个更安全、更透明且更具临床意义的床边决策支持层。

###### 关键词: AegisDx, 多智能体, 验证, 可操作

## 1 引言

诊断错误仍然是现代医学中最重大且未解决的患者安全挑战之一[who2021patientsafety, who2016diagnosticerrors, taylor2025leveraging]。在所有医疗环境中,遗漏、延迟或错误的诊断会显著导致可预防的发病率和死亡率,以及不可持续的下游资源消耗[graber2013incidence, sabertehrani2013claims, schiff2009diagnostic]。在一项针对美国 65 岁及以上 Medicare 受益人的全国性研究中,潜在诊断错误估计先于 3.2% 因选定高风险急诊状况而住院的病例,且与较高的 30 天死亡率和更少的在家健康天数相关[lin2025potential]。在急诊科等时间紧迫的环境中,这些风险尤为突出,临床医生必须在高认知负荷下,利用复杂动态表现中的不完整信息,快速进行推理[taylor2025leveraging]。

LLM 在医学知识基准测试中展现了卓越能力,在受控环境中经常接近甚至超过人类专家水平[singhal2023large, McDuff2023TowardsAD, Moor2023FoundationMF]。这些进展建立在一个长期的临床决策支持目标之上:生成并对鉴别诊断进行优先级排序。在 LLM 出现之前,基于知识的专家系统(如 INTERNIST-1 和 DXplain)能够生成排序后的诊断假设[internist1, dxplain]。现代基于 LLM 的系统现在支持相关但更广泛的诊断功能:AMIE 生成全面的鉴别诊断并协助临床医生优化诊断假设[McDuff2023TowardsAD];ConfiDx 识别并解释诊断不确定性[zhou2025confidx];而顺序式和智能体化方法可以在获取更多证据时生成、测试或修订假设[HealthcareAgent, kim2024mdagents, li2025macd, DEEP-DXSEARCH, Nori2025]。

尽管取得了这些进展,仍存在一个重要的转化鸿沟。现有系统通常只处理诊断过程的选择性组成部分,且许多评估仍侧重于最终答案或 Top-k 准确性,而没有系统性地评估对危险遗漏的保护、竞争性假设的证据支持,或建议的临床可操作性。对于常规临床应用,诊断安全要求系统能够关注危险的替代诊断,避免无依据的安抚,揭示其结论背后的证据,并在不确定性下保持可审计性[klang2025agentsreview, nasem2015diagnosis]。

临床诊断并非分类练习,而是一个迭代的假设演绎推理过程[elstein1978medical]。临床医生同时生成竞争性假设,严格关注“不可遗漏”的病症,根据不断演变的证据严格测试这些假设,并将残余不确定性转化为可操作的下一步行动。因此,我们假设,围绕这些安全关键功能来组织诊断 AI,而非仅仅依赖预测生成,能够增强诊断安全性和透明度。

在此,我们提出 **AegisDx**,一个新颖的面向安全的假设演绎诊断推理框架,专为急诊和急症护理的严格需求而定制。AegisDx 通过角色契约、结构化中间输出、证据检索接口、验证门控以及面向临床医生的输出模式,协调专门的智能体组件,实现以下功能:(1) 广泛的鉴别诊断假设生成,(2) 明确的“不可遗漏”病症筛查,(3) 基于PubMed和临床指南的实证证据验证,以及 (4) 下一步诊断和管理步骤的结构化规划。我们按照临床复杂性递增的三个阶段评估了 AegisDx。

首先,在来自 NEJM 和 JAMA 的公共文献病例报告上,通过控制共享骨干模型进行对比,AegisDx 在诊断准确性上持续优于强大的独立 LLM,Top-3 准确性提升高达 13.3 个百分点。其次,在 Annals of EM 病例上,AegisDx 在整个来源层面取得了最大的诊断增益(Top-3 准确性提升 +17.1 个百分点),并且更直接地改善了“不可遗漏”安全性能,在前三项预测中至少捕获一种“不可遗漏”疾病的比例提升了 +26.0 个百分点。最后,在一项盲法医生审查中,针对 43 份来自 YNHHS 的去标识化真实 ED 临床记录(与 GPT-5 对比),AegisDx 在综合安全指标上显示出更高的安全相关质量(5 点 Likert 量表:4.31 对比 4.55;校正后 p = 2.1×10⁻⁴),并在推理、治疗安全性和关键病症识别等定性方面取得增益。

总体而言,这些发现表明,围绕面向安全、透明的临床功能设计的诊断推理框架,能够将领域向前推进,超越静态基准测试,迈向一个更具临床意义且更安全的急症护理决策支持层。

参考图注  
图 1: AegisDx 诊断推理框架概览。  
(a) 示例输入-输出视图:将自由文本临床描述映射到 Top-3 鉴别诊断列表、Top-3 不可遗漏病症、带有参考文献的可追溯推理,以及结构化处理计划。  
(b) AegisDx 的阶段式组织:涵盖假设生成、证据收集与验证,以及临床管理,包括专科假设生成、不可遗漏安全检查、鉴别约简、证据检索、临床推理、假设验证、建议的下一步诊断步骤及早期处理考虑。  
(c) 四个数据集及三种互补评估方法的总结:基于公共文献基准的 Top-k 诊断准确性、Annals of EM 的不可遗漏诊断覆盖率,以及 YNHHS 真实世界临床病历队列的盲法医生评估。

## 2 结果

### 2.1 概述与评估设置

图 1 (https://arxiv.org/html/2607.08038#S1.F1) 总结了 AegisDx 诊断推理框架如何将急症护理中的临床优先事项付诸实践。该系统的输出并非返回单一诊断,而是生成一个面向临床医生的输出,结合了 Top-3 鉴别诊断列表、明确的不可遗漏病症、附带证据链接的推理以及初步处理计划(图 1a),直接满足了临床一线在安全覆盖、可追溯性和可操作性方面的需求。该框架分为三个相互关联的阶段(图 1b):假设生成(结合专科假设生成、不可遗漏安全检查与鉴别约简)、证据收集与验证(连接证据检索、临床推理与假设验证),以及临床管理(将保留的鉴别诊断转化为建议的下一步诊断步骤与早期处理考虑)。图 1c 总结了本研究使用的四个数据集及三种互补评估方法:基于公共文献基准的 Top-k 诊断准确性、Annals of EM 的不可遗漏诊断覆盖率,以及 YNHHS 真实世界临床病历队列的全面安全评估。这三种评估方法共同评估了排序性能、安全导向覆盖率和临床医生感知的实用性。

参考图注  
(a)  
参考图注  
(b)  
图 2: 不同模型类别和共享骨干模型下的诊断准确性。  
(a) 广泛基准比较:散点图总结了三组基于文献病例报告数据集的代表性通用、医学领域、推理导向及其他医学智能体系统的诊断表现,AegisDx 实现了最强的总体 Top-3 诊断准确性。  
(b) AegisDx 与独立 LLM 在 Qwen3-32B、LLaMA-3.1-70B、GPT-4.1 和 GPT-oss-120B 上的 Top-k 诊断准确性 (k=1-3)。

### 2.2 跨模型类别、骨干模型、专科和基准测试的诊断准确性

我们首先将 AegisDx 与一系列具有代表性的基础模型进行比较,这些模型涵盖通用、医学专用、推理导向以及最先进的医学智能体系统[grattafiori2024llama3, openai2025gpt41mini, qwen3_2025, medgemma2025, chen2024huatuogpt_o1, kim2024mdagents, deeprare2026]。如图 2a 所示,AegisDx 在所有四个比较组中均达到了最高的 Top-3 诊断准确性。在医学智能体系统组中,AegisDx 以 10.3 个百分点的优势超越了最强大的竞争者 DeepRare[deeprare2026]。鉴于 DeepRare 是在启用其完整搜索栈(PubMed 和 Google 搜索)的情况下进行评估的,这一结果表明,AegisDx 的性能增益源于其假设演绎推理架构和面向安全的设计,而不仅仅是使用了外部检索工具。

为分离 AegisDx 诊断推理框架的效益与底层基础模型的性能,我们进行了一系列受控的共享骨干模型分析,在相同的专科、骨干模型和来源数据集下直接比较 AegisDx 与独立 LLM(图 2 和图 3)。

**跨基础模型骨干的性能一致性。** 在所有四个测试的基础模型骨干(Qwen3-32B、LLaMA-3.1-70B、GPT-4.1 和 GPT-oss-120B)上,AegisDx 均相较于相应的独立 LLM 基线取得了持续的改进(图 2b)。尽管所有指标均有增益,但最显著的改进体现在 Top-3 准确性上,范围从 6.4 到 13.3 个百分点。Top-3 增益的幅度,特别是在 LLaMA-3.1-70B 骨干模型上尤为明显,表明该框架的假设演绎协调机制能有效浮现并排序合理的替代诊断,而不仅仅是提高单个最顶部预测的准确性。在实践中,维持一个广泛且有序的鉴别诊断列表是减少诊断错误的关键要求。

**跨临床专科的性能泛化能力。** 这种改进模式在 12 个不同的医学专科中均得以保持(图 3a)。增益分布广泛,且在 Top-3 准确性上通常更为显著,与更广泛的覆盖临床鉴别诊断相一致。我们观察到,AegisDx 的相对优势在以异质性临床表现和高症状重叠为特征的专科中尤为明显。

相似文章

AEGIS:增强感知的迭代保护引导

arXiv cs.CL

AEGIS是一个探索性框架,用于研究跨英语、普通话和韩语的跨度级引导的多语言去毒化,分析显式理由如何影响毒性降低与意义保留之间的权衡。

MedAction:迈向主动式多轮临床诊断大语言模型

arXiv cs.CL

本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。