Holtercare-Bench:一个评估长期动态心电图分析的多模态基准
摘要
Holtercare-Bench是一个多模态基准,用于使用Holtercare-23K数据集评估长期动态心电图分析,揭示了当前MLLMs的性能差距,并通过微调为临床应用提供改进。
查看缓存全文
缓存时间: 2026/08/21 10:21
# Holtercare-Bench:一个评估长期动态心电图分析的多模态基准
来源:https://arxiv.org/html/2608.19297
Yihan Xie¹¹¹¹ Hanwen Cui²¹¹¹ Runze Ye¹¹¹¹ Juekai Lin¹ Haoyang Wang¹ Jinhao Mao¹ Bo Zhang³ Wenqiao Zhang¹²²² Xiaogang Guo¹²²² Jun Xiao¹²²² Lei Zhang¹ email:[\{yihanxie, wenqiaozhang\}@zju\.edu\.cn](mailto:{yihanxie,%20wenqiaozhang}@zju.edu.cn) 机构:¹浙江大学 ²北京理工大学 ³电子科技大学
参考图注 Figure 1:我们提出的 Holtercare-23K 数据集概述。
**摘要**。
††脚注:*这些作者对本研究贡献相等。††脚注:†通讯作者。
虽然多模态大语言模型(MLLMs)在医疗应用中表现出色,但它们大多倾向于静态图像或短期信号。在动态心电图(ECG)这一关键领域,由于缺乏高质量的数据集和基准,模型在复杂时序推理和诊断报告生成方面面临挑战。为此,我们引入了(i)Holtercare-23K,这是一个大规模多模态动态心电图数据集,包含来自788份临床Holter记录的22,980个问答对,并具有新颖的信号-视频-文本三模态对齐特性。基于此数据集,我们提出了(ii)Holtercare-Bench,一个多模态基准,用于评估模型在时序定位、临床诊断和全局总结方面的能力。对领先MLLMs的零样本评估揭示了在处理超长病理序列方面存在显著的性能差距。然而,对代表性模型进行微调后,性能得到了显著提升。本工作阐明了当前MLLMs在电生理学方面的局限性,并为长期医疗MLLMs提供了一个基础性基准。我们的项目可在以下网址获取:https://github.com/ZJU4HealthCare/Holtercare-Bench。
## 1. 引言
近年来多模态大语言模型(MLLMs)的进展彻底改变了医疗人工智能(AI)。然而,目前的研究严重偏向空间模态,如放射学图像和病理切片。在心脏病学领域,虽然像PTB-XL(52 (https://arxiv.org/html/2608.19297#bib.bib15))和MIMIC-IV-ECG(11 (https://arxiv.org/html/2608.19297#bib.bib14))这样的短期心电图(ECG)数据集推动了关键进展,但它们只捕捉了几秒钟的心脏活动。在临床实践中,连续动态心电图Holter监测是诊断间歇性心律失常的金标准。不幸的是,Holter监测的数据生态系统发展不足,使得现代MLLMs尚未经过测试和优化,无法应用于长期心脏护理。
分析动态心电图带来了独特的挑战,这些挑战无法通过短期数据集或基准来解决。标准的Holter记录跨度约24小时,包含数十万次心跳。在这个巨大的时间上下文中,关键的病理事件——例如短暂的心动过速发作——极其稍纵即逝。发现它们需要在保持毫秒(ms)级时间敏感性的同时处理超长序列。此外,临床诊断不仅仅是分类;它需要将微观层面的波形变化(例如P波缺失)与宏观层面的疾病标签联系起来。当前的MLLMs既缺乏高质量数据,也缺乏用于学习这种复杂临床推理的特定基准。
为弥合这一差距,我们引入了**Holtercare-Bench**,一个用于评估长期动态心电图分析的多模态基准。我们工作的主要贡献如下:
(i)**数据集**。我们提出了**Holtercare-23K**,一个大规模动态心电图数据集,包含788条真实世界临床记录,每条记录持续13至24小时。将MLLMs应用于电生理学的一个主要障碍是模态不匹配:现代语言模型无法自然地处理原始电压数组。为克服此问题,我们设计了**HolterAgent**,一个自动化数据引擎,将Holter记录转换为**信号-视频-文本**三模态格式。此外,我们从专家临床注释和报告中构建了三种不同类型(**封闭式问答**、**开放式问答**和**报告生成**)的总计22,980个问答对,弥合了电生理信号与现代MLLM架构之间的差距。完整的Holtercare-23K数据集概述如图1所示 (https://arxiv.org/html/2608.19297#S0.F1)。
(ii)**基准**。基于Holtercare-23K,我们提出了**Holtercare-Bench**,这是一个全面的评估框架,旨在量化模型在长上下文心脏病学中的认知能力。Holtercare-Bench包含12个细粒度任务,模拟了心脏病专家的实际诊断工作流程。我们没有依赖单一通用指标,而是采用了一套定制的评分系统。该系统范围从离散决策的匹配准确度,到用于评估生成的临床报告逻辑一致性的LLM-as-a-judge系统。
我们在我们的基准上评估了广泛的主流通用和医疗MLLMs。零样本结果暴露了显著的性能差距——大多数现有模型难以在超长序列上保持时间一致性。然而,在我们的数据集上进行微调带来了显著的性能提升,证明了Holtercare-23K在增强复杂临床推理方面的有效性。我们的结果建立了一个强大的基线,并为未来的长上下文医疗MLLMs定义了性能前沿。
## 2. 相关工作
**医疗MLLMs与心电图表征学习。** 近期的MLLMs已从通用视觉-语言理解逐步发展到细粒度的时空感知、指令驱动的视觉推理和自适应多模态架构。代表性工作包括用于时空对象理解的VideoRefer(63 (https://arxiv.org/html/2608.19297#bib.bib64))和PixelRefer(64 (https://arxiv.org/html/2608.19297#bib.bib65)),用于指令驱动视觉分割的InstructSAM(62 (https://arxiv.org/html/2608.19297#bib.bib66)),用于视觉中间推理的VisualThink-VLA(9 (https://arxiv.org/html/2608.19297#bib.bib68)),以及用于动态视觉-语言适应的HyperLLaVA(65 (https://arxiv.org/html/2608.19297#bib.bib67))。这些进展也扩展到了医疗领域,其中如Med-Flamingo(40 (https://arxiv.org/html/2608.19297#bib.bib37))、LLaVA-Med(21 (https://arxiv.org/html/2608.19297#bib.bib5))、MedVLM(43 (https://arxiv.org/html/2608.19297#bib.bib6))、Lingshu(56 (https://arxiv.org/html/2608.19297#bib.bib4))和HealthGPT(29 (https://arxiv.org/html/2608.19297#bib.bib7))等MLLMs推动了多模态临床理解的发展。专门的MLLMs进一步出现在各个临床领域,包括放射学中的LLaVA-Rad(5 (https://arxiv.org/html/2608.19297#bib.bib49)),眼科学中的EyecareGPT(23 (https://arxiv.org/html/2608.19297#bib.bib59)),以及皮肤病学中的SkinGPT(68 (https://arxiv.org/html/2608.19297#bib.bib50))。最近的工作已转向特定模态建模和基于临床的推理,包括OmniCT(28 (https://arxiv.org/html/2608.19297#bib.bib60))中的统一切片-体积分析,TumorChain(24 (https://arxiv.org/html/2608.19297#bib.bib61))中的多模态链式思维(CoT)推理,TIF-GRPO(27 (https://arxiv.org/html/2608.19297#bib.bib62))中的组相对策略优化(GRPO),以及E-MRL(25 (https://arxiv.org/html/2608.19297#bib.bib63))中的基于证据的多模态强化学习。
在心电图领域,像ECGFounder(22 (https://arxiv.org/html/2608.19297#bib.bib38))和ECG-FM(35 (https://arxiv.org/html/2608.19297#bib.bib39))这样的模型通过大规模数据集和自监督学习技术的组合增强了预训练。多模态集成也在进步:ECG-SL(60 (https://arxiv.org/html/2608.19297#bib.bib51))、HeartLang(17 (https://arxiv.org/html/2608.19297#bib.bib52))和ESI(59 (https://arxiv.org/html/2608.19297#bib.bib55))侧重于信号-语义对齐,而ECG-LM(58 (https://arxiv.org/html/2608.19297#bib.bib53))、SuPreME(4 (https://arxiv.org/html/2608.19297#bib.bib54))、MERL(31 (https://arxiv.org/html/2608.19297#bib.bib44))和KED(50 (https://arxiv.org/html/2608.19297#bib.bib40))利用外部临床知识来改进表征。同时,生成式范式通过连续电压标记化(如ECG-Byte(14 (https://arxiv.org/html/2608.19297#bib.bib43)))、用于报告生成的指令微调(如MEIT(53 (https://arxiv.org/html/2608.19297#bib.bib41)))或视觉适应(如PULSE(33 (https://arxiv.org/html/2608.19297#bib.bib42)))连接了LLMs和心电图。尽管取得了这些进展,但当前研究通常解决的是孤立的任务或短时间静态输入,缺乏一个用于在超长Holter上下文中进行复杂推理的统一框架。
**表1:当前心电图数据集的系统比较。**
| 数据集 | 导联数 | 持续时间 | 大小 | 注释 | 心跳 | 节律 | 报告 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| **静态心电图数据集** |
| PTB-XL(52) | 12 | 10秒 | 21,837 | ✓ | ✓ | ecg-arrhythmia(67) |
| ecg-arrhythmia(67) | 12 | 10秒 | 45,152 | ✓ | | |
| MIMIC-IV-ECG(11) | 12 | 10秒 | 800K | ✓ | | |
| CPSC 2018(32) | 12 | 6–60秒 | 9,831 | ✓ | | |
| LUDB(18) | 12 | 10秒 | 200 | ✓ | | |
| **动态心电图数据集** |
| MITDB(39) | 2 | 30分钟 | 48 | ✓ | | |
| INCARTDB(57) | 12 | 30分钟 | 75 | ✓ | | |
| LTSTDB(16) | 2–3 | 1–24小时 | 86 | ✓ | ✓ | |
| Icentia11k(49) | 1 | 70分钟 | 11K | ✓ | ✓ | |
| AFDB(36) | 2 | 10小时 | 25 | ✓ | ✓ | |
| LTDB(37) | 2 | 14–22小时 | 7 | ✓ | | |
| SDDB(13) | 2 | 14–25小时 | 23 | ✓ | | |
| NSRDB(38) | 2 | 23–26小时 | 18 | ✓ | | |
| LTAFDB(46) | 2 | 24–25小时 | 84 | ✓ | ✓ | |
| SHDB-AF(51) | 2 | 24小时 | 143 | ✓ | | |
| QTDB(19) | 2 | 15分钟 | 105 | ✓ | | |
| Apnea-ECG(45) | 1 | 7–10小时 | 70 | ✓ | ✓ | |
| **Holtercare-23K (ours)** | **3** | **13–24小时** | **788** | **✓** | **✓** | **✓** |
**心电图分析数据集。** 公开的心电图数据集,如PTB-XL(52 (https://arxiv.org/html/2608.19297#bib.bib15))和MIMIC-IV-ECG(11 (https://arxiv.org/html/2608.19297#bib.bib14)),推动了深度学习诊断的发展,但它们由短期信号段组成。因此,它们无法捕捉长期心律失常动态。为了进行连续监测,已经引入了如MITDB(39 (https://arxiv.org/html/2608.19297#bib.bib23))、LTSTDB(16 (https://arxiv.org/html/2608.19297#bib.bib24))和LTAFDB(46 (https://arxiv.org/html/2608.19297#bib.bib27))等动态数据集。然而,如表1 (https://arxiv.org/html/2608.19297#S2.T1) 所示,这些数据集存在关键局限性。它们要么规模太小无法训练大规模模型,要么注释有限,仅限于简单的离散标签和心跳级别定位。它们严重缺乏用于复杂跨模态分析和临床报告生成所需的细粒度描述。这种差距阻碍了模型学习因果临床推理,并凸显了对具有多模态对齐的大规模数据的关键需求。
**医疗基准。** 当前的基准不足以进行长期心电图分析。最近的大规模医疗VQA基准(例如,PMC-VQA(66 (https://arxiv.org/html/2608.19297#bib.bib56))、GMAI-MMBench(7 (https://arxiv.org/html/2608.19297#bib.bib57)))提供了跨越各种临床模态的全面评估框架;然而,与之前的VQA-RAD(20 (https://arxiv.org/html/2608.19297#bib.bib45))和Slake(30 (https://arxiv.org/html/2608.19297#bib.bib46))等数据集一样,它们严格限于静态空间图像。即使在心血管领域,像ECG-QA(41 (https://arxiv.org/html/2608.19297#bib.bib58))这样的当前基准也主要强调短时间静态波形,而非连续监测。相比之下,通用的长序列基准(Video-MME(8 (https://arxiv.org/html/2608.19297#bib.bib47))、LVBench(54 (https://arxiv.org/html/2608.19297#bib.bib48)))专注于缺乏专门医疗推理的普通视频。评估动态心电图需要高维病理特征提取和时间依赖性建模,然而,目前该社区缺乏一个全面的基准来系统评估MLLMs在连续、长期临床推理上的表现。
## 3. 数据集:Holtercare-23K
为了解决MLLMs研究中长期动态心电图数据的稀缺问题,我们构建了**Holtercare-23K**,一个大规模、多模态的动态心电图数据集,源自788条临床收集的动态心电图,包含22,980个问答对,分为三类。
### 3.1 数据集概述
Holtercare-23K中的所有数据均来自2026年记录的真实世界医院采集。与表1 (https://arxiv.org/html/2608.19297#S2.T1) 中现有的公共数据库相比,该数据集包含788个独立病例,每个连续监测时段持续13到24小时,如图3 (https://arxiv.org/html/2608.19297#S3.F3)(a)所示。为了确保深厚的医疗效用,每条记录都配备了全面的三级注释系统:
(i)**心跳级注释。** 如图3 (https://arxiv.org/html/2608.19297#S3.F3)(b)所示,这些注释精确标定了18种不同心跳类别(例如,正常心跳、期前收缩)和各种非心跳事件(例如,P波、T波、伪影)的确切发生时间戳。
(ii)**节律级注释。** 这些注释捕获了连续的心脏事件和心律失常,并提供由精确时间戳界定的特定字符串描述(例如,室性心动过速、ST段变化),图3 (https://arxiv.org/html/2608.19297#S3.F3)(c)显示了排名前10的常见事件。
(iii)**报告级摘要。** 每个病例都包含一份经过专业心脏病专家严格验证的全局报告。这些报告提供了整体记录统计(例如,总心跳数、平均心率、最大/最小心率的精确时间戳、心动过速/心动过缓的持续时间百分比)以及最终的诊断结论。
关于数据隐私和合规性,所有原始数据都经过了严格的去标识化处理。我们移除了所有敏感的个人标识符,但保留了关键的医疗背景:年龄、性别,并对电子病历(EMRs)进行了匿名化处理。这些EMR提供了简要的临床病史和主要症状(例如,“高血压病史”、“头晕”或“胸闷”),作为多模态临床推理的重要补充输入。整个数据集构建完全符合医疗伦理和数据保护法律。
### 3.2 多模态数据引擎:HolterAgent
为了将这种大规模、多粒度的临床数据转换为适合MLLMs评估的问答对,我们开发了一个自动化的多模态数据引擎——**HolterAgent**。HolterAgent从信号预处理到问答生成的系统工作流程如图2 (https://arxiv.org/html/2608.19297#S3.F2)所示。处理流程涉及三个核心模块:
参考图注 Figure 2:HolterAgent 的多模态生成和数据构建框架。
参考图注 Figure 3:Holtercare-23K 的统计分布。(a) 记录持续时间的密度估计。(b) 心跳类别的对数尺度计数。相似文章
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。
ECG-InterpBench:使用匹配尺度稀疏自编码器对ECG基础模型可解释性进行基准测试
ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.