多轮多模态诊断推理在具有挑战性的真实临床案例上的评估

arXiv cs.CL 论文

摘要

本文提出了一种利用具有挑战性的真实临床案例对多轮多模态诊断推理进行评估的方法,旨在衡量AI模型处理复杂医疗场景的能力。

arXiv:2607.25933v1 公告类型:新 摘要:临床诊断评估不仅应评估模型能否提供正确诊断,还应反映临床实践的实际情况,包括多模态信息的逐步披露、诊断假设的动态更新以及临床推理的持续完善。然而,现有的多模态大语言模型(MLLMs)评估通常依赖于单轮或孤立任务,难以完全捕捉真实临床诊断的复杂性。为弥补这一差距,我们开发了 ClinMM-Bench,这是迄今为止最大的多轮多模态临床诊断评估基准。ClinMM-Bench 包含 1,089 个具有挑战性的真实临床案例和 3,760 张涵盖八个专科的医学图像。我们使用两级评估框架系统评估了 15 个代表性的 MLLMs,该框架同时评估诊断准确性和诊断推理质量。结果表明,专有模型在总体诊断准确性上表现最佳,但所有模型完全正确诊断的比例仍然有限。在诊断推理质量方面,当前模型能够识别合理的诊断方向,但在生成可靠的诊断推理方面仍存在较大局限。错误分析进一步识别出五种典型的失败模式:信息整合失败、知识映射错误、感知错误、过早闭合和视觉幻觉。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:56

# 评估基于真实世界复杂临床案例的多轮多模态诊断推理 来源: https://arxiv.org/html/2607.25933 Rui Yang 杜克-新加坡国立大学医学院生物医学数据科学中心,新加坡,新加坡 杜克-新加坡国立大学人工智能与医学科学联合计划,新加坡,新加坡 威尔康奈尔医学院人口健康科学系,纽约,纽约州,美国 康奈尔大学工程学院系统工程系,伊萨卡,纽约州,美国 Weihao Xuan 东京大学前沿科学研究生院,千叶,日本 日本理化学研究所先进智能项目中心,东京,日本 Zhuhan Bao 杜克大学生物统计学与生物信息学系,达勒姆,北卡罗来纳州,美国 Jonathan Chong Kai Liew 宾夕法尼亚大学佩雷尔曼医学院,费城,宾夕法尼亚州,美国 Matthew Yu Heng Wong 剑桥大学临床医学院,剑桥,英国 Nicolás Lescano 宾夕法尼亚大学佩雷尔曼医学院,费城,宾夕法尼亚州,美国 宾夕法尼亚大学医院,费城,宾夕法尼亚州,美国 Nikita R. Paripati 宾夕法尼亚大学佩雷尔曼医学院,费城,宾夕法尼亚州,美国 宾夕法尼亚大学医院,费城,宾夕法尼亚州,美国 费城儿童医院,费城,宾夕法尼亚州,美国 Emily Ling-Lin Pai 宾夕法尼亚大学医院解剖病理学和实验室医学系,宾夕法尼亚州,美国 加州大学旧金山分校病理学和检验医学系,旧金山,加利福尼亚州,美国 Jiarui Liu 卡内基梅隆大学语言技术研究所,匹兹堡,宾夕法尼亚州,美国 Heli Qi 日本理化学研究所先进智能项目中心,东京,日本 Heng-Jui Chang 斯坦福大学化学系,斯坦福,加利福尼亚州 Benny Kai Guo Loo 新加坡竹脚妇幼医院运动与运动医学科,新加坡,新加坡 SingHealth 杜克-新加坡国立大学学术医学中心儿科学术临床项目,新加坡,新加坡 Huitao Li 杜克-新加坡国立大学医学院生物医学数据科学中心,新加坡,新加坡 杜克-新加坡国立大学人工智能与医学科学联合计划,新加坡,新加坡 Kunyu Yu 杜克-新加坡国立大学医学院生物医学数据科学中心,新加坡,新加坡 杜克-新加坡国立大学人工智能与医学科学联合计划,新加坡,新加坡 Yufan Wang 威尔康奈尔医学院人口健康科学系,纽约,纽约州,美国 Chuan Hong 杜克大学生物统计学与生物信息学系,达勒姆,北卡罗来纳州,美国 Shijian Lu 南洋理工大学计算与数据科学学院,新加坡,新加坡 Douglas Teodoro 日内瓦大学放射学与医学信息学系,日内瓦,瑞士 Naoto Yokoya 东京大学前沿科学研究生院,千叶,日本 日本理化学研究所先进智能项目中心,东京,日本 Ross Koppel 宾夕法尼亚大学佩雷尔曼医学院,费城,宾夕法尼亚州,美国 布法罗大学雅各布斯医学院生物医学信息学系,布法罗,纽约州,美国 Mona Diab 卡内基梅隆大学语言技术研究所,匹兹堡,宾夕法尼亚州,美国 Hua Xu 耶鲁医学院生物医学信息学与数据科学系,纽黑文,康涅狄格州,美国 David W. Bates 布莱根妇女医院普通内科学与初级保健科,波士顿,马萨诸塞州,美国 哈佛医学院医学系,波士顿,马萨诸塞州,美国 哈佛T.H.陈公共卫生学院卫生保健政策与管理系,波士顿,马萨诸塞州,美国 Nan Liu 杜克-新加坡国立大学医学院生物医学数据科学中心,新加坡,新加坡 杜克-新加坡国立大学人工智能与医学科学联合计划,新加坡,新加坡 杜克大学生物统计学与生物信息学系,达勒姆,北卡罗来纳州,美国 杜克-新加坡国立大学医学院院前与急诊研究中心,卫生服务研究与人口健康系,新加坡,新加坡 Yifan Peng 威尔康奈尔医学院人口健康科学系,纽约,纽约州,美国 ###### 摘要 临床诊断评估不仅应评估模型是否能够提供正确诊断,还应反映临床实践的实际情况,包括多模态信息的逐步披露、诊断假设的动态更新以及临床推理的持续优化。然而,现有的多模态大语言模型(MLLMs)评估通常依赖于单轮或孤立任务,难以完全捕捉真实世界临床诊断的复杂性。为弥补这一差距,我们构建了 ClinMM-Bench,这是迄今为止最大的多轮多模态临床诊断评估基准。ClinMM-Bench 包含 1,089 个具有挑战性的真实世界临床案例和 3,760 张涵盖八个专科的医学图像。我们使用一个两级评估框架系统评估了 15 个代表性 MLLM,该框架同时评估了诊断准确性和诊断推理质量。结果表明,专有模型在整体诊断准确性上表现最佳,但所有模型的完全正确诊断比例仍然有限。在诊断推理质量方面,当前模型能够识别合理的诊断方向,但在生成可靠的诊断推理方面仍有相当大的局限性。错误分析进一步识别出五种代表性失败模式:信息综合失败、知识映射错误、感知错误、过早闭合和视觉幻觉。 ###### 关键词:多模态大语言模型,临床诊断推理,多轮多模态诊断,真实世界临床案例 通讯作者:Nan Liu,杜克-新加坡国立大学医学院生物医学数据科学中心,新加坡,新加坡 电子邮件:[email protected] (https://arxiv.org/html/2607.25933v1/mailto:[email protected]) Yifan Peng,威尔康奈尔医学院人口健康科学系,纽约,纽约州,美国 电子邮件:[email protected] (https://arxiv.org/html/2607.25933v1/mailto:[email protected]) ## 摘要 \AbstractContent ## 1 引言 诊断决策是临床实践的核心,依赖于对来自多个来源的患者特定临床信息的逐步整合 \cite{McDuff2025-om}。在日常临床实践中,医生很少仅根据单一症状、影像学发现或实验室结果做出诊断。相反,他们会随着更多信息的获得而更新诊断假设,调解相互矛盾的证据,并确定哪种诊断最能解释整体临床情况 \cite{Scott2009-ud;McMahon2009-qw;Meyer2013-fc;Centor2019-yp}。这些需求共同使得临床诊断成为一个本质上动态且依赖于上下文的过程 \cite{Committee_on_Diagnostic_Error_in_Health_Care2015-uk}。生成式人工智能的最新进展加速了其在医学领域的应用,在临床咨询、疾病诊断和患者管理方面展现出越来越大的潜力 \cite{Yang2023-vj;Fahrner2025-jy;Yang2025-lw;yangRetrievalaugmentedGenerationMedicine}。特别是,多模态大语言模型在处理多模态医学数据方面表现出日益增强的能力,在图像解读和报告生成等任务上取得了令人鼓舞的性能 \cite{Tu2024-hd}。随着 MLLM 在领域知识表示和跨模态理解方面的持续改进,它们支持诊断决策的潜力预计将进一步扩大 \cite{Saab2026-tb}。尽管取得了这些进展,但目前尚不清楚 MLLM 是否能够在临床信息随时间以不同模态逐步披露的情况下执行诊断推理。当前评估不足以捕捉这种能力 \cite{Johri2025-vn}。首先,现有基准主要采用单轮、静态的问答格式,一次性向模型提供完整的临床信息以生成答案 \cite{Jin2020-bw;Wu2025-ep}。同时,它们通常侧重于孤立任务,如图像理解或报告生成 \cite{Zhang2024-ig}。这些设置低估了临床推理的复杂性,因为它们不评估逐步的多模态信息综合、诊断假设修订、跨轮记忆,以及区分基于临床证据的推理与看似合理但实际为幻觉推理的能力。此外,大多数基准强调诊断的准确性,而忽视了推理过程的质量 \cite{McCoy2025-fm}。临床诊断的可靠性不仅取决于结论是否正确,还取决于推理是否有证据基础、是否充分完整、逻辑是否连贯 \cite{Tanno2025-xs;Omar2025-vp}。最后,尽管一些研究试图构建多轮诊断评估,但它们往往规模有限或未公开,使得建立可重复和可扩展的评估框架变得困难 \cite{McDuff2025-om;Yang2025-ky;nori2025sequential}。这些限制在 MLLM 的医学评估中造成了关键缺口。一个模型可能正确回答一个静态的医学问题,却未能综合不断演变的临床信息,误解医学图像发现,幻觉出实验室结果,或者坚持早期的错误假设 \cite{Hager2024-cz;Ke2024-aq;Mahajan2025-tr}。另一方面,一个模型可能生成部分正确的诊断,但省略了临床信任所必需的关键推理步骤 \cite{Qiu2025-iv}。为弥合这些差距,我们引入了 ClinMM-Bench,这是一个多模态、多轮基准,旨在评估在具有挑战性的真实世界临床案例中的诊断准确性和推理质量。ClinMM-Bench 包含 1,089 个临床案例和 3,760 张医学图像,涵盖八个专科:皮肤科、急诊科、内科、肾病科、神经科、肿瘤科、眼科和放射科。每个案例都被设计成一个多轮诊断场景,其中临床信息和图像逐步披露,从而评估模型如何综合多模态信息并随时间更新诊断假设。本研究有三项主要贡献(图 1 (https://arxiv.org/html/2607.25933#S1.F1)):(1) 我们构建了 ClinMM-Bench,据我们所知,这是迄今为止面向真实世界复杂案例的多轮多模态诊断推理的最大基准;(2) 我们提出了一个两级评估框架,用于衡量诊断准确性和推理质量。诊断准确性使用双大语言模型共识机制进行评估,推理质量使用原子事实分解进行量化;事实召回率、幻觉率和事实密度分别衡量 MLLM 在临床诊断推理中的完整性、可靠性和效率;(3) 我们系统评估了 15 个代表性 MLLM,覆盖专有模型、开源权重模型、医学模型和推理模型。通过深入分析,我们揭示了不同模型之间的能力差距,并识别出五种代表性失败模式(信息综合失败、知识映射错误、感知错误、过早闭合和视觉幻觉),为未来 MLLM 在医学领域的发展提供了重要见解。

图 1:ClinMM-Bench 和评估框架概述。a,数据整理。ClinMM-Bench 通过六阶段流程开发:(1) 数据收集与提取,从PubMed Central Open Access 收集临床案例报告;(2) 数据检查,排除不含医学图像的案例报告、包含视频的案例报告以及低分辨率医学图像的案例报告;(3) 数据验证,使用双大语言模型共识机制识别适合临床诊断推理任务的案例;(4) 数据转换,将验证后的案例报告解析并转换为标准化的结构化格式;(5) 质量控制,通过自动评分程序评估结构化案例报告,仅保留达到预定义质量阈值的案例;(6) 专家验证,医学专家进行人工审核以确保数据可靠性。b,多轮多模态评估。评估过程中,模型通过多轮对话进行诊断推理,每个案例的临床信息和图像在对话过程中逐步披露。评估框架包括两个层级:(1) 诊断准确性评估,其中双大语言模型共识机制将 MLLM 预测的诊断与金标准诊断进行比较,法官 LLM 分配 0 到 2 的准确性分数。(2) 诊断推理质量评估,其中 MLLM 生成的推理和参考推理都被分解为原子事实,并在三个维度上进行量化:事实召回率、幻觉率和事实密度。

## 2 结果

### 2.1 ClinMM-Bench 概述

ClinMM-Bench 包含从 PubMed Central Open Access 案例报告中精选的 1,089 个具有挑战性的真实世界临床诊断案例,以及 3,760 张医学图像,涵盖八个专科。放射科是最大的专科,有 679 个案例(62.35%),其次是肿瘤科 114 个案例(10.47%),神经科 98 个案例(9.00%),皮肤科 63 个案例(5.79%),眼科 60 个案例(5.51%),肾病科 29 个案例(2.66%),急诊科 23 个案例(2.11%),内科 23 个案例(2.11%)。每个案例被构建为一个多轮多模态诊断对话,平均每个案例有 5.45 轮对话。在每个案例中,临床信息和图像逐步披露,要求模型随着时间更新其诊断。除了金标准诊断外,每个案例还包括一个参考诊断推理过程。由于 ClinMM-Bench 是从已发表的案例报告中整理而来,因此它富集了在常规临床记录中代表性不足、涉及相对罕见临床表现的诊断挑战性案例。

### 2.2 诊断准确性

#### 2.2.1 15 个 MLLM 在 ClinMM-Bench 上的整体诊断性能

我们采用双大语言模型共识评分策略来评估 15 个代表性 MLLM 在 ClinMM-Bench 上的整体诊断准确性(图 2 (https://arxiv.org/html/2607.25933#S2.F2)a)。评分范围为 0 到 2,其中 0 表示完全错误或不相关的诊断;1 表示部分正确的诊断;2 表示完全正确的诊断。更多细节见诊断准确性评估部分的方法。

图 2:15 个 MLLM 在 ClinMM-Bench 上的整体诊断性能。a,诊断准确性分数。使用双大语言模型共识评分策略评估的 15 个代表性 MLLM 的平均诊断准确性分数。分数范围为 0 到 2,0 表示完全错误或不相关的诊断;1 表示部分正确的诊断;2 表示完全正确的诊断。b,完全正确和部分正确诊断的比例。堆叠条形图显示每个模型完全正确诊断和部分正确诊断的比例。深色阴影代表完全正确的诊断,浅色阴影代表部分正确的诊断。

专有模型取得了最强的整体性能,其中 GPT-5-medium 获得了最高的诊断准确性分数(1.140),其次是 Gemini 3 Pro(1.038)和 GPT-5-minimal(1.031)。相比之下,开源权重模型的性能较低。Qwen3-VL-32B(0.718)和 LLaMA-4-Scout(0.713)是表现最好的两个开源权重模型,但它们与顶级专有模型仍有差距。

相似文章

MedAction:迈向主动式多轮临床诊断大语言模型

arXiv cs.CL

本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。

DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争

arXiv cs.AI

DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。