MTDiag:面向临床意义的多轮诊断数据集,用于评估大语言模型

arXiv cs.CL 论文

摘要

本文介绍了MTDiag,一个多轮诊断对话数据集,用于在现实临床诊断场景中评估大语言模型,解决了静态问答基准测试的局限性。

arXiv:2608.25085v1 公告类型:新 摘要:临床诊断本质上是交互性和渐进性的,然而在医学领域评估大语言模型(LLMs)的主流范式仍然是静态问答基准测试或基于模板的对话。这些基准测试对于模型能否在动态临床情境中充当诊断代理几乎无法说明问题,而LLMs在多轮设置中显示出显著的准确性和可靠性下降。为解决这一问题,我们推出了MTDiag,一个大型多轮诊断对话数据集,它由三个异构源构建:DDXPlus、MIMIC-IV和已发表的病例报告(AJCR),涵盖常见的急诊科表现以及长尾罕见和非典型病症。所有病例均被规范化为基于最全面和广泛采用的医学知识库(UMLS概念标识符,带有ICD-10诊断代码)的规范模式。我们发布了该模式、一个基于UserLM-8B的语音生成管道以及医生验证的数据集,该数据集将结构化临床证据转换为自然语言语音。重要的是,我们引入并论证了基于临床知识的指标,用于评估LLMs作为诊断代理的能力,超越诊断准确性,针对多轮鉴别诊断任务。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:15

# 面向临床有意义的大语言模型评估的多轮诊断数据集  
来源:https://arxiv.org/html/2608.25085  
Alexander M. Fichtl*  
附属机构:慕尼黑工业大学  
Miriam Anschütz*  
附属机构:慕尼黑工业大学  
George Doumat*  
附属机构:德克萨斯大学西南医学中心内科系  
Georg Groh*  
附属机构:慕尼黑工业大学  

###### 摘要  
临床诊断本质上是交互性和渐进性的,然而当前评估医学领域大语言模型(LLMs)的主流范式仍是静态问答基准或基于模板的对话。这些基准无法充分说明模型能否在动态临床场景中充当诊断代理,且LLMs在多轮对话场景中的准确性和可靠性会出现显著下降。为解决此问题,我们提出MTDiag,一个基于三种异构数据源构建的大规模多轮诊断对话数据集,涵盖DDXPlus、MIMIC-IV及已发表的病例报告(AJCR),覆盖常见急诊表现以及长尾罕见病和非典型病症。所有病例均被规范化为标准化的患者向量(PatientVector)模式,该模式锚定于最全面且广泛采用的医学知识库(UMLS概念标识符及ICD-10诊断编码)。我们公开了患者向量模式、基于UserLM-8B的语句生成流程,以及将结构化临床证据转化为自然语言语句的医生验证数据集。尤为重要的是,我们提出并论证了基于临床知识的评估指标,用于超越诊断准确率,对大语言模型在多轮鉴别诊断任务中的表现进行评估。  

## 1 引言  
大语言模型(LLMs)日益被视为增强医疗能力的潜在工具,可辅助医生完成日常工作Vladika等人(2026)(https://arxiv.org/html/2608.25085#bib.bib2),但其在面向患者场景中的适用性需要经过广泛测试与评估。医学领域评估LLMs的主流方法长期依赖于静态多选题或问答(QA)设置Jin等人(2019)(https://arxiv.org/html/2608.25085#bib.bib4);Jin等人(2021)(https://arxiv.org/html/2608.25085#bib.bib6);Nentidis等人(2025)(https://arxiv.org/html/2608.25085#bib.bib5)。这一方法推动了可衡量的进步,前沿模型在医学执业资格考试基准上常能达到近乎完美的分数。然而,近期一项涵盖39个临床LLM基准的系统性综述揭示了一个严重的知识-实践鸿沟:模型在知识型问题上准确率可达90%,但在基于实践的诊断任务上表现骤降至约45%Gong等人(2025)(https://arxiv.org/html/2608.25085#bib.bib1)。这种性能下降源于临床诊断本质上是一个在不确定性下进行信息提取、优先级排序和综合的交互式渐进过程。现有基准为模型提供完整、预结构化且通常自包含的信息。现实中,医生必须主动从可能遗忘关键症状、使用不精确语言或遗漏重要背景的患者身上获取信息。因此,在简短案例基准上的高分并不能预测实际诊断能力Alaa等人(2025)(https://arxiv.org/html/2608.25085#bib.bib8)。  

近期面向对话式诊断AI的研究Tu等人(2025)(https://arxiv.org/html/2608.25085#bib.bib9);Fan等人(2025)(https://arxiv.org/html/2608.25085#bib.bib10);Johri等人(2024)(https://arxiv.org/html/2608.25085#bib.bib11)证实了这一点,发现交互场景中准确性和可靠性明显下降,而数百万用户已从通用商业LLMs寻求医疗指导。更令人担忧的是,医学界近期对患者与商业LLMs对话的定性分析显示,LLMs对患者提出的医疗问题提供了不安全的答案Draelos等人(2026)(https://arxiv.org/html/2608.25085#bib.bib13)。  

图1:UMLS(统一医学语言系统)Bodenreider(2004)(https://arxiv.org/html/2608.25085#bib.bib17)是一个为医疗健康系统互操作性构建的国际生物医学知识库、本体和术语元词典。它通过CUI(唯一概念标识符)索引独立概念,并实例化一个语义网络(图2(https://arxiv.org/html/2608.25085#S1.F2)),将单一概念链接至所有参与的源术语表。  

为解决这一鸿沟,我们推出MTDiag,一个基于三种异构真实及模拟临床数据源构建的大规模多轮诊断对话数据集,并锚定于UMLS(图1(https://arxiv.org/html/2608.25085#S1.F1)),使超越诊断准确率的临床推理评估成为可能。我们的主要贡献包括:  

-(1)MTDiag数据集:一个将DDXPlusFansi Tchango等人(2022)(https://arxiv.org/html/2608.25085#bib.bib12)、MIMIC-IVJohnson等人(2023)(https://arxiv.org/html/2608.25085#bib.bib15)及精选诊断性AJCR病例汇编Hirosawa等人(2024)(https://arxiv.org/html/2608.25085#bib.bib16)数据规范化为标准患者向量模式(图6(https://arxiv.org/html/2608.25085#S4.F6))的多轮诊断数据集,其中诊断映射至ICD-10¹¹ICD-10(图3(https://arxiv.org/html/2608.25085#S3.F3)):国际疾病分类第十次修订本,由世界卫生组织(WHO)维护,症状映射至UMLS(图1(https://arxiv.org/html/2608.25085#S1.F1))CUI标识符。  

-(2)语句生成流程:基于UserLM-8BNaous等人(2025)(https://arxiv.org/html/2608.25085#bib.bib18)的框架,可将结构化临床证据转化为自然、类患者的语句。它支持针对病例的语句和表现生成,为每个患者向量提供一组标准语句。  

-(3)患者协调器:基于MedGemmaSellergren等人(2025)(https://arxiv.org/html/2608.25085#bib.bib19)的运行时代理,可从预生成语句库中选择语境适配的回应。此“对话运行器”通过患者向量模拟患者与考官之间的对话。参见标题图2:UMLS语义网络的临床相关子集,展示语义类型节点与类型化关系边。节点按语义类别颜色编码:∙\\bulletEvents(随时间发生的行动),如Procedure;∙\\bulletEntities(物理物质与解剖结构),如Clinical Drug;∙\\bulletConceptual Entities(抽象分类与状态),如Disease or Syndrome。实边表示层级is-a关系;虚边表示类型化联想关系。  

## 2 背景与相关工作  
MTDiag旨在实现“诊断场景”的临床基础模拟,我们将其定义为:患者为“主诉”(CC)自愿寻求诊断,通过与医疗从业者(考官)的对话(检查)进行。考官的任务本质上属于鉴别诊断:通过逐轮获取和权衡临床证据,迭代性(且隐性地)生成、排序并逐步缩小候选诊断集合,直至确定最可能的诊断Fansi Tchango等人(2022)(https://arxiv.org/html/2608.25085#bib.bib12);Tu等人(2025)(https://arxiv.org/html/2608.25085#bib.bib9)。因此,MTDiag的结构从考官视角间接模拟了此过程:真实诊断、症状与病史锚点以及对话日志用于评估模型是否正确进行鉴别推理:提出正确的问题,以正确顺序,基于正确原因。  

以下部分我们将阐述为何此场景在结构上不同于现有基准所能捕捉的内容,并综述为数据集设计提供动机与背景的前期工作。  

### 2.1 诊断场景作为对话建模任务  
医生从可能含糊、健忘、抗拒或不了解临床相关信息的患者处收集信息。现病史(HPI)——患者医疗史的日志——从不会直接呈现;它是在对话中协商的结果Redelmeier等人(2001)(https://arxiv.org/html/2608.25085#bib.bib22),患者常系统性地表现出报告病史的失败模式,包括理解、回忆和表达错误。模糊的患者表现会降低症状的鉴别力及正确诊断的概率Sonnenberg和Gogel(2002)(https://arxiv.org/html/2608.25085#bib.bib23)。患者在听到医生评估后也会主动抗拒或重新协商诊断框架Ijäs-Kallio等人(2010)(https://arxiv.org/html/2608.25085#bib.bib24),这种动态是静态案例无法建模的。此外,临床推理(无论是人类还是人工智能)都容易受认知偏差影响,这些偏差会加剧上述挑战Vally等人(2023)(https://arxiv.org/html/2608.25085#bib.bib27)。  

在现实场景中,LLMs表现出不一致的风险分层Heston和Lewis(2024)(https://arxiv.org/html/2608.25085#bib.bib28),在增量信息收集过程中未能遵循诊断指南Hager等人(2024)(https://arxiv.org/html/2608.25085#bib.bib25),并根据患者语言标记改变事实性临床输出Kearney等人(2025)(https://arxiv.org/html/2608.25085#bib.bib30);Zhou等人(2025)(https://arxiv.org/html/2608.25085#bib.bib31)。作为医疗直接面向消费者的服务,ChatGPT Health对高达52%的紧急情况进行了分诊不足,并在患者淡化症状时改变了建议Ramaswamy等人(2026)(https://arxiv.org/html/2608.25085#bib.bib29)。因此,MTDiag试图回答的问题不仅是模型是否得出正确诊断,更重要的是:模型能否进行足够良好的诊断对话以达成正确诊断?  

##### 静态医学QA基准  
评估LLMs“临床能力”(并论证其作为“医疗助手”)的标准主要依赖于在静态QA基准(如PubMedQAJin等人(2019)(https://arxiv.org/html/2608.25085#bib.bib4)、MedQAJin等人(2021)(https://arxiv.org/html/2608.25085#bib.bib6)和MedMCQAPal等人(2022)(https://arxiv.org/html/2608.25085#bib.bib7))上日益增强的结果,这些基准汇总了来自医学执业考试和文献的问题。医学考试中的问题是自包含的:具备足够知识时,答案所需全部信息都包含在问题表述中。这与真实患者记录相去甚远:由于它们测试理想条件下的回忆能力,当面对QA案例时正确回答问题并不能预测在类似实际病例中的正确表现Alaa等人(2025)(https://arxiv.org/html/2608.25085#bib.bib8);Gong等人(2025)(https://arxiv.org/html/2608.25085#bib.bib1)。这些基准的有效性进一步受到数据污染和泄露的削弱Balloccu等人(2024)(https://arxiv.org/html/2608.25085#bib.bib21);Xu等人(2024)(https://arxiv.org/html/2608.25085#bib.bib20),其中出现在预训练语料中的测试项目会抬高报告分数。  

##### 对话式诊断AI  
近期系统已开始在交互式临床环境中探测LLMs。AMIETu等人(2025)(https://arxiv.org/html/2608.25085#bib.bib9)和CRAFT-MDJohri等人(2024)(https://arxiv.org/html/2608.25085#bib.bib11)表明,在静态基准上表现近乎完美的模型在需要跨多轮对话获取信息时会出现显著性能下降。AI HospitalFan等人(2025)(https://arxiv.org/html/2608.25085#bib.bib10)和JAMA多代理框架Sangwon等人(2025)(https://arxiv.org/html/2608.25085#bib.bib33)进一步揭示了交互场景中的可靠性和一致性问题。Arias-Duart等人(2025)(https://arxiv.org/html/2608.25085#bib.bib26)提出超越问答的医疗LLMs自动评估,并实施了一系列子任务,强调了对话层面评估的必要性。  

##### 医学对话数据集  
为捕捉多轮动态,已引入多个医学对话数据集,最新综述见Gong等人(2025)(https://arxiv.org/html/2608.25085#bib.bib1)。我们将在第3.2节(https://arxiv.org/html/2608.25085#S3.SS2)描述我们考虑的数据集及其适用性。  

## 3 本体论锚定与资源选择  
本节讨论MTDiag构建背后的设计决策,这些决策直接受执业医疗专业人员指导,并基于对成熟临床行为文献的调研,同时考虑了多轮鉴别诊断设置中可能出现的逻辑与实践错误空间。随后我们介绍并论证本体论锚定所支持的部分指标。  

##### 最小锚点  
首先我们定义三个必要元素(称为“最小锚点”),用于诊断对话的执行和评估:  

图3:ICD-10-CM代码结构示例(S52.501A:右侧桡骨远端未特指骨折,闭合性骨折初始就诊)。每个位置编码特定临床维度:类别、解剖部位/病因、严重程度及就诊扩展。无CM扩展的WHO ICD-10等效代码为S52.5。  

图4:(精简版)本体论赋能的对话评估示例 - MTDiag AJCR病例。诊断:巨细胞动脉炎(GCA, M31.6)Szydełko-Paśko等人(2022)(https://arxiv.org/html/2608.25085#bib.bib41)。左(虚线左侧):此病例的患者向量*,包含真实诊断(对考官隐藏)及UMLS CUI映射症状(仅子集)。语句由UserLM-8B为患者向量各元素离线预生成,构成CUI映射语句库。对话运行时,患者协调器LLM从语句库中回答考官问题。右:对话运行时:基于同一主诉语句进行的两次对话。对话A:考官探查头皮触痛、颌跛行及视野缺损,达成正确诊断。对话B:考官过早锚定于偏头痛/紧张型头痛,仅询问压力、屏幕时间、水分摄入及家族史,诊断为紧张型头痛。发生Ⅱ级危害(延误治疗)错误。\*简化版  

- •主诉(CC):患者寻求医疗护理的主要原因,即患者“自述”。这作为对话的开场语句(第0轮)。  
- •症状:患者的其他症状。  
- •初步诊断:病例的真实主要发现,以ICD-10代码表示(图3(https://arxiv.org/html/2608.25085#S3.F3))。ICD-10代码匹配构成最低评估目标:模型是否得出正确诊断?  

##### 对话追踪  
为说明为何诊断准确率(Diagacc\\mathrm\\{Diag\\_\\{acc\\}\\})这一最低评估目标无法完全捕捉临床能力,我们追踪图4(https://arxiv.org/html/2608.25085#S3.F4)中两个示例对话。两位LLM考官收到相同的开场患者语句:“我头痛大约三周了。一直不好。”真实诊断为巨细胞动脉炎(GCA, M31.6),一种严重的动脉炎症性疾病。在对话A中,考官探查头皮触痛、颌跛行及视

相似文章

MedAction:迈向主动式多轮临床诊断大语言模型

arXiv cs.CL

本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。