MedRealMM:一个用于中国在线医疗咨询的现实世界多模态基准
摘要
MedRealMM是一个基于真实医患交互构建的新的多模态基准,用于评估大语言模型在在线医疗咨询中的下一响应生成能力,并配有临床评价标准。
arXiv:2607.09142v1 公告类型:新论文
摘要:大语言模型(LLMs)越来越多地应用于在线医疗咨询,然而现有基准仍然与真实临床实践脱节。许多基准依赖合成对话或患者模拟器,忽略了患者上传的医学图像,或使用选择题或词汇重叠指标来评估开放性临床回答,这些指标难以反映临床质量。我们提出了 \textbf{MedRealMM},一个用于多模态在线医疗咨询的大规模基准,该基准基于从全国性中国互联网医院收集的去标识化医患交互数据构建。MedRealMM 使用多模态临床挑战点(MCCP)提取框架来识别真实咨询轨迹中的临床需求时刻,并将每个时刻转化为标准化的下一响应生成任务,同时保留之前的文本-图像上下文。每个实例配有由医生细化的病例特异性评价标准,该标准奖励临床理想行为,并惩罚不安全、无依据或矛盾的回答。当前版本包含覆盖64个临床科室的5,620个真实多模态病例。我们评估了19个通用和医学专用的大语言模型,包括纯文本和多模态系统。结果表明,图像信息对于可靠的临床性能至关重要,且当前的先进模型仍低于在线医师的响应水平。尽管一些先进模型满足的正面临床标准数量与医生相当甚至更多,但它们触发了更多的负面标准,表明安全敏感的错误避免仍然是核心瓶颈。MedRealMM 为在真实在线咨询场景中评估多模态医学推理提供了一个现实且可重复的基准。该数据集将在Hugging Face上公开,地址为 https://huggingface.co/datasets/jdh-algo/MedRealMM。
查看缓存全文
缓存时间: 2026/07/13 07:52
# MedRealMM:一个面向中国在线医疗咨询的真实世界多模态基准
来源:https://arxiv.org/abs/2607.09142
作者:Runhan Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R), Quan Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+Q), Yuqian Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+Y), Shuai Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+S), Xin Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+X), Zitong Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+Z), Hui Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+H), Bin Cha (https://arxiv.org/search/cs?searchtype=author&query=Cha,+B), Zheming Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Z), Liya Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+L), Wei Wei (https://arxiv.org/search/cs?searchtype=author&query=Wei,+W), Haoyuan Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+H), Jun Xu (https://arxiv.org/search/cs?searchtype=author&query=Xu,+J)
查看PDF (https://arxiv.org/pdf/2607.09142)
> 摘要:大型语言模型 \(LLMs\) 正日益部署于在线医疗咨询领域,然而现有基准与真实临床实践之间存在较大差距。许多基准依赖于合成对话或患者模拟器,忽略了患者上传的医学图像,或采用选择题、词汇重叠度等指标评估开放式临床回答,难以反映真实的临床质量。为此,我们提出 \\textbf\{MedRealMM\},一个基于全国范围中国互联网医院中脱敏医患交互数据构建的大规模多模态在线医疗咨询基准。MedRealMM 采用多模态临床挑战点(MCCP)提取框架,从真实咨询轨迹中识别临床要求较高的时刻,并将其转化为标准化的下一轮回答生成任务,同时保留之前的图文上下文。每个实例均配有由医生精调的病例专属评分细则,对符合临床期待的回答予以奖励,并对不安全、缺乏依据或前后矛盾的回答施加惩罚。当前版本包含来自 64 个临床科室的 5,620 个真实多模态病例。我们评估了 19 个通用型和医疗专用型(包括纯文本及多模态系统)的 LLM。结果表明,图像信息对于可靠的临床性能至关重要,且当前前沿模型的表现仍低于在线执业医师水平。尽管部分前沿模型满足的正面临床标准数量达到或超过医生,但它们触发的负面标准也更多,说明安全性敏感的避错能力仍是核心瓶颈。MedRealMM 为评估真实在线咨询中的多模态医学推理提供了一个现实且可复现的基准。该数据集将公开发布于 Hugging Face,链接为:https://huggingface.co/datasets/jdh-algo/MedRealMM
## 提交历史
来自:Runhan Shi \[查看邮箱 (https://arxiv.org/show-email/a59488a4/2607.09142)\] **\[v1\]** 2026年7月10日 星期五 06:52:05 UTC (5,636 KB)相似文章
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
LingxiDiagBench:一个用于中文精神科咨询与诊断中LLM评估的多智能体基准框架
介绍了LingxiDiagBench,这是一个大规模多智能体基准,用于评估LLM在中文精神科咨询与诊断中的表现。关键发现表明:二分类任务上准确率高(最高达92.3%),但多分类鉴别诊断性能较差(抑郁-焦虑共病识别43.0%,12类鉴别诊断28.5%),揭示了对话质量与诊断准确性之间的脱节。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。
MMIR-TCM: 用于中医临床决策支持的记忆增强多模态推理与检索
本文介绍了MMIR-TCM,一种新颖的框架,它整合了多模态大语言模型与记忆增强分割和检索增强生成技术,以支持中医临床决策,同时提供了新的数据集MedTCM和评估指标TDEU。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。