MedExAgent:在嘈杂的临床环境中训练大语言模型代理进行询问、检查与诊断
摘要
本文介绍了 MedExAgent,这是一个将临床诊断形式化为部分可观测马尔可夫决策过程(POMDP)以处理嘈杂和不完整信息的框架。该框架提出了一种结合监督微调与强化学习的两阶段训练流程,以提高医疗大语言模型的诊断准确性和成本效益。
查看缓存全文
缓存时间: 2026/05/11 06:44
# MedExAgent:在嘈杂的临床环境中训练大型语言模型代理进行问诊、检查和诊断
来源:https://arxiv.org/html/2605.07058
Yicheng Gao<sup>1</sup>, Xiaolin Zhou<sup>2</sup>, Yahan Li<sup>1</sup>, Yue Zhao<sup>1</sup>, Ruishan Liu<sup>1</sup>
<sup>1</sup>南加州大学, <sup>2</sup>亚利桑那州立大学
\{gaoyiche, ruishanl\}@usc.edu
###### 摘要
现实世界中的临床诊断是一个复杂的过程,医生需要从与患者的互动和进行医学检查中获取信息。此外,医生需要适应不同的患者特征,以及过程中随时可能出现的嘈杂和不完整信息。然而,现有的医学大型语言模型(LLM)基准和自动诊断方法大多通过将其简化为单轮问答、无噪声对话或顺序检查等方式来简化这一过程,忽略了临床诊断的交互性和不确定性。在本文中,我们通过将临床诊断形式化为具有三种行动类型的部分可观测马尔可夫决策过程(POMDP)来解决这一差距:询问患者、通过工具调用开具医学检查以及发布诊断。我们还引入了一个系统性的噪声模型,包含七种患者噪声类型和三种检查噪声类型。利用我们提出的环境,我们通过两阶段流水线训练了一个有效的诊断代理 MedExAgent:首先基于以卡尔加里-剑桥临床访谈模型为结构的合成对话进行监督微调,然后应用 DAPO 来优化一个综合奖励,该奖励捕捉诊断准确性、工具调用质量以及包括财务成本和患者不适在内的检查成本。通过广泛的实验和消融研究,我们证明 MedExAgent 实现了与更大模型相当的诊断性能,同时保持了成本效益高的检查策略。
代码:https://github.com/EndlessCG/medexagent
图 1:MedExAgent 概览。(a) 工具增强的诊断推理实现了仅在对话的基线方法失败的案例中的正确诊断。(b) 在 OOD 测试集 AgentClinic-MedQA<sup>[35]</sup>上,我们的 8B 代理在诊断准确性上匹敌得更大的基线模型。
**免责声明**:MedExAgent 是一个研究原型。不得将其用于医疗建议或患者护理。
## 1 引言
诊断错误每年导致严重的患者伤害,且及时、高质量的诊断护理的可及性在不同人群和地理区域间分布不均<sup>[27,1,14]</sup>。这些压力激发了长期以来对临床推理计算支持的兴趣<sup>[38]</sup>,而近期大型语言模型(LLM)的进展使这一目标触手可及。医学 LLM 在 MedQA<sup>[17]</sup> 和 MedMCQA<sup>[29]</sup> 等知识密集型基准上表现出强劲的性能,越来越多的医学专用模型<sup>[34,22,36,7]</sup> 正在为此类任务进行训练;最近的诊断评估通过要求模型对完整临床病例进行推理,更接近临床使用<sup>[45,9,13]</sup>。在这种背景下,模型被提供完整的病例描述并要求对其进行分析;然而,在临床实践中,病例必须通过与患者的互动构建。构建一个可部署的**诊断代理**,即在真实临床条件下自行构建病例的代理,是本文的研究主题。
实际应用的临床诊断与这些基准有三点不同。首先是**顺序性**:医生从主诉开始,提出问题以细化工作鉴别诊断,在新证据出现时开具检查,并最终确定诊断<sup>[3]</sup>。其次是**噪声性**:患者可能误报症状位置或严重程度<sup>[32,23]</sup>,实验室结果可能受到污染、部分缺失或存在歧义<sup>[37]</sup>。最后是**成本高昂**:检查从常规抽血到侵入性活检不等,相应的财务成本<sup>[26,15]</sup> 和患者不适感是医生在权衡预期诊断收益时考虑的因素<sup>[25]</sup>。静态基准未能捕捉这些特性。
最近的工作开始将 LLM 引入交互环境,但每项工作仅处理了部分画面。基准评估患者提问<sup>[24,35]</sup> 或 EHR 工具调用<sup>[16]</sup>;专用代理针对对话病史采集<sup>[40,33]</sup> 或检查开具<sup>[31]</sup> 进行训练。因此,临床实践的三个属性仍然缺失于任何单一代理的训练信号中。首先,没有现有系统在单集内优化涵盖提问、检查开具和诊断的组合行动空间的单一代理。其次,患者和检查观察被视为干净而非嘈杂的。第三,调查成本很少成为目标的一部分。单一代理是否可以接受训练以同时处理顺序交互、噪声和成本,以及此类训练需要什么,仍然是一个开放性问题。
我们从两个角度来解决这个问题:一个暴露代理面对所有这三个特性的环境,以及一个教导其在其中行动的训练配方。我们将观测不确定性下的交互诊断形式化为部分可观测马尔可夫决策过程(POMDP)。行动空间统一了自由形式的患者提问、作为工具调用的检查开具以及最终诊断,填补了交错操作的空白。通过系统噪声模型(七种患者噪声类型,三种检查噪声类型),观测噪声被随机注入观察函数,多样化的患者特征来自 PatientSim<sup>[21]</sup>。每项检查的成本基于 CMS 费用表<sup>[6,5]</sup> 确定财务成本,并基于 Whiteley 等人<sup>[41]</sup> 的可及性和侵入性分类确定患者不适感,因此检查的成本反映了其对真实患者造成的负担。
在此环境中,我们训练了 MedExAgent,这是一个基于 Meditron3-8B<sup>[34]</sup> 构建的 8B 参数代理。我们借鉴了医学教育中广泛采用的卡尔加里-剑桥医学访谈模型<sup>[20,19]</sup>,该框架将临床接触分解为五个阶段:(1) 开始会话,(2) 收集信息,(3) 体格检查,(4) 解释和计划,以及 (5) 结束。医患对话按照这些阶段合成并用作监督。训练分为两个阶段:首先在这些对话上进行监督微调,然后针对诊断准确性、工具调用质量和每项检查成本的综合奖励进行 DAPO<sup>[43]</sup> 强化学习。在分布内和分布外基准上,MedExAgent-8B 在诊断准确性上匹敌或超越了远大于它的基线,同时保持了成本效益。具体而言,我们做出了三项贡献:
1. 一个用于交互式临床诊断的 POMDP 环境,统一了患者提问、检查开具和诊断,将患者和检查噪声注入观察函数,且每项检查的成本反映了现实世界的财务负担和患者不适。
2. 一种训练配方,结合了基于卡尔加里-剑桥结构的医患对话的监督微调,以及针对诊断准确性、工具调用质量和每项检查成本的综合奖励的强化学习。
3. 一个开放的 8B 模型,表明在此环境中训练的小型专用模型在诊断准确性上匹敌或超越了大得多的基线,同时保持了成本效益高的检查策略。
## 2 相关工作
### 2.1 交互式诊断的基准和环境
随着基于 LLM 的代理的近期激增,一系列工作旨在弥合基于文本的 LLM 与交互式现实临床环境之间的差距。MediQ<sup>[24]</sup> 引入了一个允许 LLM 与患者通信的基准。结果表明,赋予 LLM 询问患者的灵活性可以显著提高性能,凸显了代理-环境交互的重要性。同样,AgentClinic<sup>[35]</sup> 提出了一个多代理框架,以在允许多模态信息收集的环境中评估 LLM 的诊断性能。MedAgentBench<sup>[16]</sup> 进一步在基于 EHR 的临床任务(如患者信息检索、实验室检查开具等)中评估 LLM。然而,现有环境和基准通常假设 LLM 行动的响应是准确的,这忽略了现实中常见的噪声。事实上,一项针对 5,900 名患者的大规模研究发现,自我报告数据与 EHR 记录之间只有 5.5% 的完全一致<sup>[46]</sup>。我们的工作通过系统地建模环境中的患者噪声、检查噪声和患者性格来弥补这一差距。
### 2.2 用于临床诊断的基于 LLM 的系统
先前将 LLM 应用于临床诊断的工作大致可分为两类:多代理系统和微调专家模型。涉及多代理系统的方法通常为一组 LLM 分配不同的角色,并设计工作流程来编排诊断过程。MAI-DxO<sup>[28]</sup> 使用五个 LLM 分别扮演工作流程中的每一步(例如规划、假设生成、成本管理)。MedAgents<sup>[39]</sup> 和 MDAgents<sup>[18]</sup> 将每个 LLM 分配到一个医学领域(例如放射科医生、肿瘤科医生、外科医生)。这些方法需要广泛调用闭源模型的 API,引发了对医学领域高度敏感的患者隐私问题的担忧。另一类工作旨在微调专家模型以进行交互式临床诊断。AMIE<sup>[40,33]</sup> 和 ClinDiag-GPT<sup>[8]</sup> 都训练闭源专家模型以进行基于对话的信息采集。DiagAgent<sup>[31]</sup> 则训练一个代理为给定患者预测医学检查。这两个方向仅建模了完整诊断程序的一部分(要么是对话,要么是检查选择),这可能会限制有效性和现实真实性。
## 3 问题形式化
在本文中,我们研究以医学检查作为工具调用的自动诊断问题。我们将此问题形式化为 POMDP $(\mathcal{S}, \mathcal{A}, T, \Omega, O, R)$。状态空间 $\mathcal{S}=\mathcal{D}$ 是所有可能疾病的集合,在每集开始时从中随机采样一个疾病 $d$ 作为患者患有的真实疾病。行动空间 $\mathcal{A}$ 包含代理在每个时间步 $t$ 可以采取的三种类型的行动:$\mathcal{A} = \mathcal{A}_{\text{ask}} \cup \mathcal{A}_{\text{exam}} \cup \{a_{\text{dx}}\}$。如果 $a_t \in \mathcal{A}_{\text{ask}}$,代理向患者提问;如果 $a_t \in \mathcal{A}_{\text{exam}}$,代理从预定义的可用检查列表中选择一个检查;如果 $a_t = a_{\text{dx}}$,代理给出最终诊断 $\hat{d} \in \mathcal{D}$。我们假设患者在集期间疾病不会改变或进展。这表明转移函数是确定性的:$T(s'|s,a) = \mathbbm{1}(s'=s)$,其中 $\mathbbm{1}$ 是指示函数。我们详细说明 POMDP 的其他部分如下。
### 3.1 噪声建模
在我们的 POMDP 定义中,观察空间 $\Omega$ 包含两种类型的观察:$\Omega = \Omega_{\text{conv}} \cup \Omega_{\text{exam}}$,其中 $\Omega_{\text{conv}}$ 代表患者的所有可能回应,$\Omega_{\text{exam}}$ 代表所有可能的检查结果。在时间步 $t$,当且仅当行动 $a_t \in \mathcal{A}_{\text{ask}}$ 时,观察 $\omega_t \in \Omega_{\text{conv}}$;当且仅当行动 $a_t \in \mathcal{A}_{\text{exam}}$ 时,观察 $\omega_t \in \Omega_{\text{exam}}$。在现实世界中,医学诊断会话通常包含噪声。例如,患者可能错误报告疼痛区域(例如胃痛 $\rightarrow$ 肝痛),医学检查可能误报某些症状(例如受污染的样本导致不准确血液检查结果)。为了反映这一点,我们在观察函数 $O(\omega|d,a)$ 中建模此类噪声。我们考虑了七种患者噪声类型和三种检查噪声类型,详见表 6。每种噪声类型以固定概率 $p_{\text{conv}}$ 或 $p_{\text{exam}}$ 独立应用于患者回应或检查结果。
### 3.2 奖励设计
我们的奖励函数 $R$ 是包含三个部分的总集奖励:诊断准确性、...相似文章
MedAction:迈向主动式多轮临床诊断大语言模型
本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。
DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
MedDDC-Eval: 多轮医疗咨询智能体的诊断解耦评估
MedDDC-Eval引入了一个针对多轮医疗咨询智能体的诊断解耦评估测试平台,将策略引导的对话历史与诊断生成分离,以实现对证据获取和诊断有用性的更清晰测量。
MedLatentDx:面向跨医院罕见病诊断的潜在多智能体通信框架
MedLatentDx提出了一种用于跨医院罕见病诊断的潜在多智能体通信框架,利用潜在KV块共享诊断证据而不暴露临床文本,并引入了CrossRare-Bench基准测试。
LingxiDiagBench:一个用于中文精神科咨询与诊断中LLM评估的多智能体基准框架
介绍了LingxiDiagBench,这是一个大规模多智能体基准,用于评估LLM在中文精神科咨询与诊断中的表现。关键发现表明:二分类任务上准确率高(最高达92.3%),但多分类鉴别诊断性能较差(抑郁-焦虑共病识别43.0%,12类鉴别诊断28.5%),揭示了对话质量与诊断准确性之间的脱节。