MyoCardBench:面向临床真实心血管护理场景的大型语言模型评估的真实世界数据基准

arXiv cs.CL 论文

摘要

MyoCardBench是一个用于评估心血管护理领域大型语言模型的真实世界基准,包含13个任务共2,263个条目。GPT-5.4获得了最高总分,展现了在全周期护理和多模态解读方面的优势。

arXiv:2607.25186v1 Announce Type: new 摘要:背景:大多数医学大型语言模型(LLM)基准侧重于考试知识或孤立任务,可能无法反映心血管护理的长程、多模态和安全关键的工作流程。目的:开发MyoCardBench,一个覆盖心血管护理全程的真实世界基准,并评估LLM在临床维度和专科任务上的表现。方法:MyoCardBench包含来自13个任务特定数据集的2,263个条目,这些数据集来源于去标识化的心血管记录和检查数据。十六位心内科医师进行了标注和参考标准构建,随后由两位资深心内科医师进行交叉审核。七种LLM在标准零样本设置下生成了15,841个输出。开放式任务通过关键点覆盖率和整体临床质量进行评估,而CardioEthics则通过准确率评分。结果:GPT-5.4取得了最高的宏平均分(62.55)和项目加权平均分(62.19),其次是Gemini 3.1 Pro(59.95)和Qwen 3.6 27B(59.72)。GPT-5.4在所有三个维度上均排名第一。CardioAuxReport表现最佳(86.38),而CardioECGRead(17.25)和CardioEthics(17.34)最低。整体临床质量与关键点覆盖率之间差距最大的任务出现在CardioComm(52.71)、CardioEmergRescue(52.05)和CardioTreatPlan(48.80)。结论:据我们所知,MyoCardBench是目前覆盖心血管护理全程的LLM评估中最大规模的真实世界多任务基准,提供了迄今为止报道的最广泛的临床真实心脏病学场景覆盖。它为识别模型优势、临床重要遗漏以及未来发展方向提供了严格的框架。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# MyoCardBench:一个用于在临床真实心血管诊疗场景中评估大语言模型的真实世界数据基准

来源:https://arxiv.org/html/2607.25186
李晓  复旦大学附属中山医院心内科 上海,中国 上海市心血管病研究所 国家临床上海 介入医学研究中心 上海,中国
吴兆迪  复旦大学附属闵行医院 上海,中国
任思杰  上海人工智能实验室 上海,中国
陈珏辰  复旦大学附属中山医院心内科 上海,中国 上海市心血管病研究所 国家临床上海 介入医学研究中心 上海,中国
陆路  上海人工智能实验室 上海,中国
丁靖如  上海人工智能实验室 上海,中国
钟昀  上海人工智能实验室 上海,中国
徐捷  上海人工智能实验室 上海,中国
梁义秀  复旦大学附属中山医院心内科 上海,中国 上海市心血管病研究所 国家临床上海 介入医学研究中心 上海,中国
葛均波  复旦大学附属中山医院心内科 上海,中国 上海市心血管病研究所 国家临床上海 介入医学研究中心 上海,中国

###### 摘要

**背景:** 大多数医学大语言模型基准测试侧重于考试知识或孤立任务,可能无法反映心血管诊疗纵向、多模态、安全至上的工作流程。

**目的:** 开发 MyoCardBench——一个覆盖完整诊疗路径的真实世界心血管基准测试,并刻画模型在临床维度、专科任务和互补评估指标上的表现特征。

**方法:** MyoCardBench 包含来自去标识化真实世界心血管记录和检查数据的 13 个任务特定数据集,共计 2,263 个项目。数据集注释、参考答案构建和关键原子要点定义由 16 名持有中级及以上职称的心内科医生完成。随后,两名具有高级职称的心内科医生进行交叉审核与裁定,以验证临床有效性、任务清晰度、指南一致性和参考标准的一致性。7 个 LLM 在标准化零样本推理设置下生成了 15,841 个输出。开放式任务采用互补的关键点覆盖率和整体临床质量要素进行评估,而五选一的临床伦理任务则按准确性评分。

**结果:** GPT-5.4 取得了最高的整体宏观平均值(62.55)和项目加权平均值(62.19),其次是 Gemini 3.1 Pro(59.95)和 Qwen 3.6 27B(59.72)。GPT-5.4 在所有三个维度上均排名第一,在全周期诊疗中获得 70.42 分,在多模态解读与记录中获得 58.47 分,在沟通、安全与伦理中获得 43.17 分。CardioAuxReport 的跨模型平均分最高(86.38),其次是 CardioChronicMed(75.04)、CardioAdmRec(74.66)和 CardioChronicHealth(70.16)。CardioECGRead(17.25)和 CardioEthics(17.34)是最弱的任务。GPT-5.4 在六个任务中领先,Qwen 3.6 27B 在四个任务中领先,Grok 4.3 在两个任务中领先,Gemini 3.5 Flash 在一个任务中领先。整体临床判断与关键点覆盖率之间最大的差异出现在 CardioComm(52.71)、CardioEmergRescue(52.05)和 CardioTreatPlan(48.80)。

**结论:** 据我们所知,MyoCardBench 是专门为评估跨心血管诊疗连续体的 LLM 而开发的最大规模真实世界多任务基准,提供了迄今为止报道的最广泛的临床真实心脏病学场景覆盖。其专家主导的注释和高级交叉审核框架为识别任务特异性优势、临床重要遗漏以及未来模型开发的优先事项提供了严谨的基础。

11footnotetext:†这些作者贡献相同。
22footnotetext:\*通讯作者:梁义秀 ([email protected]), 徐捷 ([email protected])

*关*键词大语言模型 · 心脏病学 · 基准测试 · 临床决策支持 · 紧急救治

## 1 引言

心血管疾病仍然是全球死亡和残疾的主要原因,并对快速诊断、定量风险评估、急性稳定、二级预防和长期随访产生了持续的需求[23,20]。临床负担并非集中在一个单一的决策点上。相反,心血管诊疗在反复的接触中展开,临床医生必须协调症状、合并症、用药、系列实验室数值、生理测量、影像学和患者偏好。这种纵向和多模态结构使得心血管医学成为评估通用人工智能的一个特别苛刻的场景。

大语言模型已经展示了广泛的医学知识、在执业资格考试中的强劲表现以及日益强大的临床文本生成能力[29,30,36,22,34]。然而,系统性评估警告说,在结构化医学任务中的高分可能无法直接转化为可靠的临床决策[14,5,2]。最近的研究也已超越静态的问答,转向真实世界病例评估、动态诊断流程、临床预测和基于能力的基准测试[27,8,42,18]。这些研究共同表明,在结构良好的问题上的强劲表现并不能保证可靠地执行完整的临床工作流程。当信息不完整、时间分布、基于图像、操作受限或安全至上时,性能可能会发生变化。

心血管工作流程结合了很少被一起评估的几种推理模式。记录任务需要忠实的提取和时间顺序综合。诊断和治疗任务需要整合症状、风险因素、检查结果、禁忌症和指南建议。紧急救治需要在对诊断明确陈述之前识别细微的恶化迹象,然后在时间压力下采取优先行动。慢性病管理需要在就诊之间保持连续性、调整药物、监测不良反应并提供个体化的生活方式指导。沟通和伦理则增加了另一层要求,需要对不确定性进行解释、知情同意、共同决策、能力评估、隐私保护和临终关怀考量。

多模态解读是困难的核心来源。十二导联心电图和心血管影像编码了无法简化为普通文本的空间和时间信息。心律诊断、间期测量、形态学、缺血性改变、病变定位、斑块特征描述和狭窄分级需要领域特定的视觉推理和校准的不确定性。早期的评估表明,支持视觉的 LLM 能够回答选定的医学影像问题,但在开放式解读方面仍然不可靠[15,41,12,32]。2025 年一项多模态 LLM 与专用心电图系统的比较进一步显示,通用模型诊断性能显著较低,这强化了区分广泛语言能力与经过验证的信号解读能力的必要性[17]。

心脏病学特定证据仍然具有异质性且范围相对狭窄。现有研究侧重于考试式心脏病学问题[31]、潜在应用的广泛综述[28,7]、针对急性冠脉综合征指南的检索增强回应[3]、辅助复杂遗传性心肌病管理[24]或标准化心血管病例[38]。这些研究为个别应用提供了重要证据,但并未在一个专科特异性框架内共同评估记录、诊断推理、风险计算、治疗计划、紧急识别与救治、多模态解读、纵向管理、沟通和伦理。

开放式临床回应的评估提出了一个平行的测量问题。精确答案匹配是不合适的,因为临床可接受的回应可能在措辞和结构上有所不同。关键点覆盖率提供了一个可审计的度量,用于判断是否包含了必需的诊断、行动、禁忌症、监测步骤和升级标准。整体临床评估可以识别语义等价性、结构和整体合理性,但可能受到流畅性、冗长性、评估者偏好和评分标准设计的影响[9,40,39,16,33]。因此,一个严谨的基准测试应该保留对响应质量的互补性视角,而不是将所有性能压缩到一个单一的模糊指标中。

我们开发了 MyoCardBench 来解决这一差距。它包含跨 13 个任务特定数据集和三个高层次维度的 2,263 个项目:全周期心血管决策制定与纵向诊疗;多模态解读与临床记录;以及沟通、人文关怀、安全与伦理。据我们所知,MyoCardBench 是专门为评估跨心血管诊疗连续体的 LLM 而开发的最大规模真实世界多任务基准,提供了迄今为止报道的最广泛的临床真实心脏病学场景覆盖。其独特性在于将异质性临床输入、纵向信息、多模态解读、安全关键决策、沟通和伦理结合在一个评估框架内。该基准由 16 名持有中级及以上职称的心内科医生注释,并由两名高级职称心内科医生进行交叉审核,为客观、一致和稳定的评估提供了严谨的基础。

## 2 方法

### 2.1 研究设计

我们使用去标识化的真实世界心血管数据开展了一项回顾性基准开发和比较性模型评估研究。分析单位是一个任务特定的临床项目,反映了心血管实践中可能进行的活动,包括:记录综合、诊断与鉴别诊断、命名风险评分、治疗计划、早期恶化识别、紧急管理、心电图或心血管影像解读、纵向健康与药物管理、医患沟通以及临床伦理(表LABEL:tab:dataset)。MyoCardBench 旨在进行比较性能力评估、错误分析和研究优先级排序,而非用于自主临床决策。

该基准的组织是为了再现心血管诊疗的顺序,而非一系列无关的考试问题。因此,设计保留了临床相关的时间顺序、合并症、药物暴露、重复测量、竞争性诊断和干扰信息。最近的基准研究同样强调了真实世界病例、动态流程、基于能力的评估和专家注释是考试式测试的必要补充[27,8,42,18]。

表 1:MyoCardBench 13 个数据集的临床范围与任务特征
数据集 | 维度 | 临床内容 / 输入 | 预期输出 / 评估的能力 | 格式
--- | --- | --- | --- | ---
CardioAdmRec | 多模态与记录 | 门诊病史、入院前实验室与检查结果、初始体检发现及其他与入院相关的临床信息 | 一份结构化的心脏病学入院记录,具有来源忠实性、连贯的时间顺序、恰当的术语以及临床可用的组织方式 | 开放式回答
CardioAuxReport | 多模态与记录 | 在不同时间点记录的多项实验室、影像、超声及其他辅助检查报告 | 一份按时间顺序组织的辅助检查部分,能准确地将多来源结果整合为临床记录格式 | 开放式回答
CardioDiagDiff | 全周期诊疗 | 真实世界住院病史、体检、实验室结果、影像学及临床相关的时间信息 | 主要诊断、临床相关的鉴别诊断及支持证据,包括对紧急或高风险发现的识别 | 开放式回答
CardioRiskScore | 全周期诊疗 | 指定心血管风险工具所需的病例信息,嵌入在包含相关和干扰变量的详细病例中 | 所请求的数值评分、风险类别以及使用指定评分系统的临床适当解释 | 开放式回答
CardioTreatPlan | 全周期诊疗 | 诊断、症状、检查发现、实验室与影像结果、当前治疗、合并症及近期临床变化 | 一个个体化的诊断与治疗计划,涵盖优先级、药物或介入决策、禁忌症、监测及随访 | 开放式回答
CardioEmergAlert | 全周期诊疗 | 在明确宣布心血管急症之前的系列临床观察和不断变化的检查结果 | 识别早期恶化、识别可能的急症、评估紧急性,以及提出升级或立即评估的建议 | 开放式回答
CardioEmergRescue | 全周期诊疗 | 已确立的急性或危重心血管表现,包括生命体征、检查、合并症和治疗约束 | 有优先级的紧急管理,包括稳定、根治性治疗、监测、禁忌症和升级阈值 | 开放式回答
CardioECGRead | 多模态与记录 | 心电图图像输入,临床背景有限 | 识别心律和主要心电图异常,并提供基于显示描记的简明诊断解释 | 图像 + 开放式回答
CardioImgRead | 多模态与记录 | 心血管影像输入,主要是冠状动脉 CTA 图像或结构化影像信息,临床背景有限 | 准确且结构化地描述心脏

相似文章

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。

MedicalBench:评估大型语言模型以改进医学概念提取

arXiv cs.CL

MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。