MedAction:迈向主动式多轮临床诊断大语言模型
摘要
本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。
arXiv:2605.07305v1 发布类型:新论文
摘要:现有的大多数 LLM 诊断评估均基于静态的单轮设置,即一次性提供完整的患者信息,这过度简化了真实的临床实践。我们研究了主动诊断:即现实临床过程中,从初步观察开始,开具检查、解读结果,并在多轮交互中不断更新鉴别诊断。通过系统分析,我们确定了当前 LLM 存在的三种反复出现的失效模式:缺乏依据的检查开具、不可靠的诊断更新以及多轮连贯性下降。这些失效共同揭示了一个核心缺陷:现有的医学训练数据教导模型从完整信息中进行推理,但未能教导模型在不断演变且不完整的证据下采取行动。为填补这一空白,我们提出了 MedAction,一种基于树状结构的蒸馏流水线,通过 LLM 与环境的交互合成多样化且高质量的多轮诊断轨迹。我们提出了两个基于知识图谱的指标来筛选轨迹质量:疾病轨迹一致性(DTC),用于追踪模型的假设是否收敛至正确诊断;推理-行动一致性(RAC),用于验证信念更新是否由收集到的证据驱动。利用该流水线,我们构建了 MedAction-32K,一个包含来自 2,896 个 PMC 病例的 32,681 条轨迹的数据集。在 MedAction-32K 上微调的 8B 参数模型,在 MedR-Bench 和我们精心策划的 MedAction-300-Hard 基准测试中,均实现了开源模型中的最先进水平(SOTA),推动了开源医学大语言模型的前沿发展。
查看缓存全文
缓存时间: 2026/05/11 06:59
# MedAction:迈向主动式多轮临床诊断大语言模型 来源:https://arxiv.org/html/2605.07305 Hsin-Ling Hsu<sup>1</sup> Zizheng Wang<sup>2*</sup> Donghua Zhang<sup>3*</sup> Nai-Chia Chen<sup>1</sup> Jerry Wang<sup>1</sup> Jun-En Ding<sup>4</sup> Chia-Hsuan Hsu<sup>5</sup> Guoan Wang<sup>4</sup> Feng Liu<sup>4</sup> Fang-Ming Hung<sup>6</sup> Chenwei Wu<sup>3†</sup> Liyue Shen<sup>3†</sup> <sup>1</sup>国立政治大学 <sup>2</sup>乔治城大学 <sup>3</sup>密歇根大学 <sup>4</sup>史蒂文斯理工学院 <sup>5</sup>国立台湾科技大学 <sup>6</sup>远东纪念医院 ###### 摘要 现有的大多数大语言模型(LLM)诊断评估基于静态的单轮设置,即预先提供完整的患者信息,这简化了真实的临床实践。我们研究了主动诊断:这是一种真实的临床流程,从初步观察开始,通过多轮交互进行检验、解读结果并更新鉴别诊断。通过系统性分析,我们识别出当前大语言模型中三种反复出现的故障模式——无依据的检验开具、不可靠的诊断更新以及多轮连贯性下降——这些共同揭示了一个核心缺陷:现有的医学训练数据教会模型从完整信息进行推理,但无法使其在不断变化的、部分证据下采取行动。为了填补这一空白,我们引入了 MedAction,这是一种树状结构的蒸馏管道,通过大语言模型与环境的交互合成多样化且高质量的多轮诊断轨迹。我们提出了两种基于知识图谱的指标来筛选轨迹质量:疾病轨迹一致性(DTC),用于跟踪模型的假设是否收敛于正确诊断;以及推理-动作一致性(RAC),用于验证信念更新是否由收集到的证据驱动。使用该管道,我们构建了 MedAction-32K,这是一个包含来自 2,896 个 PMC 病例的 32,681 条轨迹的数据集。在 MedAction-32K 上微调一个 8B 参数模型,在 MedR-Bench 和我们精心策划的 MedAction-300-Hard 基准测试上,均在开源模型中取得了最先进的性能,推动了开源医学大语言模型的边界。<sup>11</sup>这些作者贡献相同。 <sup>22</sup>脚注文本:共同通讯作者。联系邮箱:[email protected] (https://arxiv.org/html/2605.07305v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2605.07305v1/mailto:[email protected]) <sup>11</sup>脚注文本:代码和数据可访问 https://github.com/JustinHsu1019/MedAction ## 1 引言 大语言模型(LLMs)在医学问答(QA)基准测试中表现出了有前景的性能,显示出作为临床诊断决策支持工具的巨大潜力<sup>Singh et al., 2023 (https://arxiv.org/html/2605.07305#bib.bib1); Jin et al., 2021 (https://arxiv.org/html/2605.07305#bib.bib2)</sup>。然而,大多数现有基准测试将医学诊断表述为静态的单次问答任务:模型接收一份完整且组装好的患者记录,包括实验室结果、影像学和生物标志物,隐含地假设这些数据已经可用,然后通过设定良好的问题提示来预测诊断。这种设置高度简化且不切实际,未能反映真实世界临床诊断的复杂性。 相反,如图 1 (https://arxiv.org/html/2605.07305#S1.F1) 所示,医学诊断是一个主动的、迭代的过程。在实践中,临床医生总是从不完整的信息开始,然后迭代地推荐新检验以解决不确定性,并根据新的检验结果逐步缩小鉴别诊断范围,直到以足够的信心做出最终的确切诊断。我们将这种新表述称为**带有迭代检验开具的主动诊断**。为了构建在临床环境中真正有用大语言模型,我们必须通过在此类多轮、信息收集机制中的评估来启用其主动诊断能力。 尽管最先进的大语言模型在静态医学问答方面表现良好<sup>Jin et al., 2021 (https://arxiv.org/html/2605.07305#bib.bib2); Pala et al., 2022 (https://arxiv.org/html/2605.07305#bib.bib4); Jin et al., 2019 (https://arxiv.org/html/2605.07305#bib.bib5)</sup>,并且在一般领域的多轮任务中能力不断增长<sup>Wu et al., 2025b (https://arxiv.org/html/2605.07305#bib.bib19); Liu et al., 2024 (https://arxiv.org/html/2605.07305#bib.bib20); Yao et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib21)</sup>,但最近的一项研究<sup>Qiu et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib3)</sup>揭示,当相同的模型在主动医学诊断任务上进行评估时,性能会出现惊人的下降。即使对于 GPT-o3<sup>OpenAI, 2025 (https://arxiv.org/html/2605.07305#bib.bib15)</sup> 这样强大的代理模型,以及 MedGemma<sup>Sellergren et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib33)</sup> 这样的医学专家模型,这种差距依然存在。为了理解是什么使得这种设置具有独特的挑战性,我们调查了大语言模型在主动多轮诊断中的行为,并确定了三种代表性的故障模式(图 2 (https://arxiv.org/html/2605.07305#S1.F2))。 **无依据的检验开具**。临床动作空间涵盖数千种实验室检验、影像研究和程序,导致决策景观高度复杂。我们发现,大语言模型经常在没有与其陈述的假设明确联系的情况下开具检验,缺乏特定病例的临床推理和基于上下文的动作。 **不可靠的诊断更新**。临床检验结果的解释并非易事,需要考虑竞争性假设、先前证据和患者背景。由于对新获取的检验结果理解不精确,大语言模型往往在存在相反证据的情况下僵化地坚持初始诊断,或在无关诊断之间剧烈摇摆。 **多轮连贯性下降**。随着多轮交互中证据的积累,大语言模型经常失去对已开具哪些检验、获得了什么结果以及哪些不确定性仍未解决的跟踪,导致长上下文中的不一致。 这些失败揭示了现有医学大语言模型的关键局限性,它们通常使用诸如思维链(CoT)推理轨迹<sup>Wu et al., 2025a (https://arxiv.org/html/2605.07305#bib.bib11); Chen et al., 2025a (https://arxiv.org/html/2605.07305#bib.bib13)</sup> 之类的医学训练数据进行微调:模型被训练去*思考*——假设信息完整地向诊断进行推理——而不是去*行动*——按顺序决定收集哪些新信息(“动作”)并根据新收集的信息更新当前假设(“状态”)。解决主动诊断中的这些挑战需要开发多轮交互式医学训练数据,使大语言模型具备正确推理和行动的能力。 静态诊断 完整患者记录 CC Labs Exam Imaging Vitals Pathology Diagnosis vs. 主动诊断 6 DDx 4 DDx 2 DDx Turn 1 Turn 2 Turn 3 Final CC + Exam CC + Exam Labs CC + Exam Labs Imaging Order next test Diagnosis 图 1:静态与主动诊断对比。左:现有基准提供完整患者记录并要求一次性诊断。右:在主动诊断中,模型仅从主诉(CC)和体格检查开始,然后迭代开具新检验以解决不确定性,并通过多轮交互将鉴别诊断(DDx)从六个候选条件逐步缩小至确切诊断。 在本工作中,我们引入了 MedAction,这是一个用于从公开可用的医学文献中自动构建高质量多轮主动诊断训练数据的框架。与教导模型从完整信息进行*思考*的现有医学 CoT 数据不同,MedAction 轨迹捕捉了在部分、演变证据下的*思考*和*行动*。从原始病例报告开始,我们首先提取 2896 个交互式临床环境,这些环境模拟了主动诊断的部分信息设置:模型仅观察到初始患者信息,需要采取主动行动逐轮请求新的检验结果。然后,我们通过让最先进的大语言模型与这些环境交互来构建结构化多轮轨迹,产生反映真实临床医生诊断程序的推理-动作数据链:维持鉴别诊断、识别诊断不确定性并选择检验以解决它。 为了蒸馏高质量训练数据并最大化数据利用率,我们提出了两种基于知识图谱的指标以启用临床 grounded 的拒绝采样。**疾病轨迹一致性(DTC)**测量模型当前顶级假设与 PrimeKG<sup>Chanda et al., 2023 (https://arxiv.org/html/2605.07305#bib.bib17)</sup> 上真实诊断之间的知识图谱距离,使我们能够保留达到正确答案的完整轨迹,以及假设仍在收敛的部分正确轨迹。**推理-动作一致性(RAC)**随后测量所开具的检验是否在 ClinGraph<sup>Johnson et al., 2024 (https://arxiv.org/html/2605.07305#bib.bib18)</sup> 上引起了鉴别诊断的有意义变化,过滤掉假设转移与收集到的证据无关的单轮数据。我们进一步调查了轨迹构建中的关键设计选择,包括教师模型选择、树采样策略和过滤阈值,为构建多轮医学推理-动作数据提供了可操作的指导。在生成的 MedAction-32K 数据集上训练,我们的 8B 参数模型在多轮主动诊断设置下,在开源模型中取得了最先进的性能,证明即使规模适中,高质量轨迹数据带来的增益也大于仅靠架构缩放。除了训练集外,我们整理了 MedAction-300 Hard,这是一个包含 300 个罕见病病例的测试集,比现有基准需要更长的诊断轨迹和更广泛的检验开具。 参见标题 图 2:主动诊断中三种代表性故障模式(MedGemma)。每个面板通过具体示例说明一种故障模式:(A)无依据的检验开具,(B)不可靠的诊断更新,以及(C)多轮连贯性下降。韦恩图显示了训练集中 222 个审查病例中 155 个错误病例的故障模式共现情况。 我们的贡献有三方面: 1. **新表述与故障分析**。我们将临床诊断重构为带有迭代检验开具的多轮主动诊断设置,并确定了三种解释当前大语言模型在此设置中为何挣扎的代表性故障模式。 2. **新数据集构建与新指标**。我们引入了一种树状结构数据蒸馏管道,从公共病例报告中自动合成高质量多轮医学诊断轨迹,调查了轨迹构建中的关键设计选择,并向社区发布了 MedAction-32K 训练集和 MedAction-300 Hard 测试集——一个具有挑战性的罕见病病例基准。我们还提出了两种用于训练数据蒸馏和严格模型评估的新指标。 3. **高效且有效的模型**。我们的数据集训练了一个 8B 参数模型,在主动诊断和检验推荐方面,在开源模型中取得了最先进的结果。 ## 2 相关工作 表 1:与现有医学基准和训练框架的比较。 特征 | 静态基准<sup>Jin et al., 2021 (https://arxiv.org/html/2605.07305#bib.bib2)</sup><sup>Jin et al., 2019 (https://arxiv.org/html/2605.07305#bib.bib5)</sup> | 交互式查询<sup>Liu et al., 2024 (https://arxiv.org/html/2024#bib.bib6)</sup><sup>Lai et al., 2026 (https://arxiv.org/html/2026#bib.bib36)</sup> | 多代理模拟<sup>Schmidgall et al., 2024 (https://arxiv.org/html/2024#bib.bib35)</sup> | 多轮评估<sup>Qiu et al., 2025 (https://arxiv.org/html/2025#bib.bib3)</sup> | 训练数据构建<sup>Wu et al., 2025a (https://arxiv.org/html/2025#bib.bib11)</sup><sup>Ossowski et al., 2025 (https://arxiv.org/html/2025#bib.bib12)</sup> | MedAction<sup>Ours</sup> ---|---|---|---|---|---|--- 多轮诊断 | ✗ | ✓ | ✓ | ✓ | ✗ | ✓ 迭代检验开具 | ✗ | ✗ | ✓† | ✓† | ✗ | ✓ 交互式数据生成 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ 逐轮质量过滤 | ✗ | ✗ | ✗ | ✗ | ✗ | ✓ 数据配方 | ✗ | ✓ | ✗ | ✗ | ✓ | ✓ 评估基准 | ✓ | ✓ | ✓ | ✓ | ✗ | ✓ † 仅评估。 我们在表 1 (https://arxiv.org/html/2605.07305#S2.T1) 中总结了与先前工作的比较。 **超越静态诊断大语言模型基准**。MedQA<sup>Jin et al., 2021 (https://arxiv.org/html/2605.07305#bib.bib2)</sup>、MedMCQA<sup>Pala et al., 2022 (https://arxiv.org/html/2605.07305#bib.bib4)</sup> 和 PubMedQA<sup>Jin et al., 2019 (https://arxiv.org/html/2605.07305#bib.bib5)</sup> 等标准医学基准在静态、单轮格式下评估大语言模型,提供完整记录。最近的工作开始研究更真实的设置:MediQ<sup>Liu et al., 2024 (https://arxiv.org/html/2605.07305#bib.bib6)</sup> 将静态 MedQA 病例转换为需要模型提出后续问题的部分信息场景;MedR-Bench<sup>Qiu et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib3)</sup> 评估大语言模型在多轮检验推荐和诊断方面的表现,发现即使在静态任务中表现良好的模型,在检查推荐方面的准确率也会急剧下降。其他努力如 MedJourney<sup>Wu et al., 2024 (https://arxiv.org/html/2605.07305#bib.bib7)</sup> 将临床过程分解为顺序阶段。尽管取得了这些进展,但主动诊断中失败的根本原因以及如何为此设置构建训练数据仍未得到探索。 **医学大语言模型训练数据构建**。精心策划的推理轨迹<sup>Muennighoff et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib10); Guha et al., 2026 (https://arxiv.org/html/2605.07305#bib.bib9)</sup> 可以显著提高推理性能。将这些理念应用于医学需要推理链在事实上的准确性。MedReason<sup>Wu et al., 2025a (https://arxiv.org/html/2605.07305#bib.bib11)</sup> 通过将 CoT 生成 grounded 于医学知识图谱来解决这一问题;而其他工作则从具有领域特定验证的更强模型中蒸馏长推理轨迹<sup>Ossowski et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib12); Chen et al., 2025a (https://arxiv.org/html/2605.07305#bib.bib13); Huang et al., 2025 (https://arxiv.org/html/2605.07305#bib.bib14)</sup>。然而,所有现有的医学数据构建工作都针对从完整信息进行的单轮推理,忽略了现实生活中的主动诊断设置。MedAction 通过构建捕捉每个诊断步骤中推理和行动的轨迹,直接解决了这一差距。 ## 3 方法学 ### 3.1 问题表述 我们将**带有迭代检验开具的主动诊断**定义为部分可观察性下的序列决策问题。令 $s^*$ 表示真实诊断。诊断轨迹 $\tau=(o_1, a_1, r_1, o_2, a_2, r_2, \dots, o_T)$ 由以下部分组成: * **观察** $o_t$:第 $t$ 轮累积的临床证据(初始表现加上所有先前的检验结果),其中部分可观察性源于仅揭示已开具检验的结果; * **动作** $a_t \subseteq \mathcal{A}$:从大型开放词汇动作空间中选择的临床检验; * **结果** $r_t$:为 $a_t$ 返回的发现(实验室数值、影像报告或临床观察); * **信念状态** $b_t$:模型排名后的鉴别诊断,近似于关于 $s^*$ 的后验概率。 当模型做出确切诊断或达到轮次限制 $T_{\max}$ 时,过程终止。 病例报告(PMC) 阶段 1 $o_1$:初始观察 $\mathcal{M}$:检验菜单 CBC CT MRI ... $f$:预言函数 $a \in \mathcal{M} \to \text{result}$ $a \notin \mathcal{M} \to \text{UNAVAIL.}$ 多轮交互 $a_t$ $r_t$ 阶段 2 轮次 1
相似文章
MedExAgent:在嘈杂的临床环境中训练大语言模型代理进行询问、检查与诊断
本文介绍了 MedExAgent,这是一个将临床诊断形式化为部分可观测马尔可夫决策过程(POMDP)以处理嘈杂和不完整信息的框架。该框架提出了一种结合监督微调与强化学习的两阶段训练流程,以提高医疗大语言模型的诊断准确性和成本效益。
完全开放的 Meditron:用于临床 LLM 的可审计管道
介绍了完全开放的 Meditron,这是首个用于构建临床 LLM 的完全开放管道,具有临床医生审核的训练语料库和可重现框架,在全开放医学专科模型中达到领先水平。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
评估大语言模型在多轮医疗对话中的误解纠正能力
本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。
对齐临床需求与AI能力:关于LLMs在医学推理中的综述
本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。