CardioState-JEPA:延迟感知的跨模态共享心脏表征学习
摘要
介绍了CardioState-JEPA,一种心脏基础模型,利用延迟感知的联合嵌入预测架构,在ECG、PPG和PCG信号之间学习共享表征,从而改进下游心脏分类任务。
arXiv:2608.12944v1 公告类型:新
摘要:心电图(ECG)、光电容积脉搏波(PPG)和心音图(PCG)提供了同一心动周期的互补视图,然而现有的心脏基础模型仅针对单一传感模态进行训练,未利用跨传感器的共享生理信息。我们提出了CardioState-JEPA,一种心脏基础模型,基于生理感知的联合嵌入预测架构,在ECG、PPG和PCG上联合学习单一共享表征。该模型将异质波形映射到一个公共词元空间,使用单一共享Transformer编码器进行处理,并通过预测掩蔽的潜在心脏状态进行学习,将预训练目标置于共享生理信息而非传感器特定的波形外观上。为了处理电、机械和血流动力学事件之间的时间偏移,跨模态预测使用一个学习的延迟对齐器,在对应的心脏时间上匹配信号。由于同步多传感器记录稀缺,CardioState-JEPA首先从丰富的单模态数据中学习模态内结构,然后利用配对数据在潜在心脏时间上对齐模态。作为冻结编码器在涵盖ECG、PPG和PCG的25个下游任务上进行评估,我们的编码器在平均PPG分类上比最佳自监督信号基线提高8.2个AUROC点,PCG杂音检测提高18.8个AUROC点,ECG分类提高15.5个AUROC点,并且在多个ECG基准上达到或超过使用特权临床文本或监督标签训练的心脏模型。这些结果表明,异质心脏信号可以相互监督一个统一的 cardiac 生理基础模型。
查看缓存全文
缓存时间: 2026/08/14 09:32
# CardioState-JEPA:面向共享心脏表示的延迟感知跨模态学习
Source: https://arxiv.org/html/2608.12944
## CardioState\-JEPA: Delay\-Aware Cross\-Modal Learning of a Shared Cardiac Representation
Hung Manh Pham机构:新加坡管理大学,新加坡Bin Zhu机构:新加坡管理大学,新加坡Pan Zhou机构:新加坡管理大学,新加坡Aaqib Saeed致谢:通讯作者:a\.saeed@tue\.nl机构:Jun Hu\[4pt\] 埃因霍温理工大学机构:Jun Hu荷兰
###### 摘要
心电图 \(ECG\)、光电容积脉搏波 \(PPG\) 和心音图 \(PCG\) 提供了同一心动周期的互补视图,然而现有的心脏基础模型都是针对单一传感模态训练的,未利用跨传感器的共享生理信息。我们提出了 CardioState\-JEPA,一种心脏基础模型,用于在 ECG、PPG 和 PCG 上联合学习单一共享表示,其构建于一种生理感知的联合嵌入预测架构之上。该模型将异质波形映射到一个公共 token 空间,使用单个共享 Transformer 编码器处理它们,并通过预测掩蔽的潜在心脏状态来学习,将预训练目标置于共享生理学而非传感器特定的波形外观上。为处理电活动、机械活动和血流动力学事件之间的时间偏移,跨模态预测使用一个学习得到的延迟对齐器,在相应的心动时间匹配信号。由于同步的多传感器记录很稀缺,CardioState\-JEPA 首先从丰富的单模态数据中学习模态内结构,然后使用配对数据在潜在心脏时间上对齐模态。作为冻结编码器,在涵盖 ECG、PPG 和 PCG 的 25 个下游任务上进行评估,我们的编码器在平均 PPG 分类上比最佳自监督信号基线提高了 8.2 个 AUROC 点,PCG 杂音检测提高了 18.8 个 AUROC 点,ECG 分类提高了 15.5 个 AUROC 点,并且在若干 ECG 基准上与使用特权临床文本或有监督标签训练的心脏模型持平或更优。这些结果表明,异质心脏信号可以相互监督一个统一的生理学基础模型。
## 1 引言
心脏信号是临床诊断、长期监测、可穿戴传感和日常健康评估中常见且重要的信息来源\[24 (https://arxiv.org/html/2608.12944#bib.bib41)\]。在观察心脏活动的众多方式中,心电图 \(ECG\)、光电容积脉搏波 \(PPG\) 和心音图 \(PCG\) 尤为重要,因为它们分别捕获心脏的电活动、血流动力学和声学方面。这些模态越来越多地用于临床和日常场景,从心律失常分析、心音筛查到脉搏、血压和生理应激的可穿戴监测\[38 (https://arxiv.org/html/2608.12944#bib.bib40),29 (https://arxiv.org/html/2608.12944#bib.bib9),32 (https://arxiv.org/html/2608.12944#bib.bib8)\]。如图1 (https://arxiv.org/html/2608.12944#S1.F1) 所示,这三种模态是共享心脏活动的互补观测,但对同一潜在生理过程提供了不同视角。电激活启动收缩,瓣膜运动随后产生心音,射血以后出现的周围脉搏波,因此三种模态在不同生理时间观测同一心搏。
见图注图 1:CardioState\-JEPA 的动机。ECG、PPG 和 PCG 在不同生理时间观测同一心动周期,激发了一种共享心脏表示。
尽管存在这种生理联系,心脏信号的机器学习在很大程度上仍沿各自的模态特定路径发展。近期大规模表征学习和基础模型的进展显著提高了单个心脏传感器的性能,ECG 模型支持节律、传导和心律失常分析\[28 (https://arxiv.org/html/2608.12944#bib.bib26),33 (https://arxiv.org/html/2608.12944#bib.bib31),25 (https://arxiv.org/html/2608.12944#bib.bib27)\],PPG 模型支持心率估计、血压预测和血管状态评估等可穿戴任务\[35 (https://arxiv.org/html/2608.12944#bib.bib32)\],PCG 模型则针对杂音和瓣膜异常等声学特征\[36 (https://arxiv.org/html/2608.12944#bib.bib13)\]。然而,这些模型仍然通常在单一传感模态内训练和部署,因此从某一心脏生理视角学到的结构并未被显式用于改进另一视角。相反,一个统一的心脏表示模型应利用以下事实:电、血流动力学和声学信号是同一心脏过程的不同观测。
然而,构建这样的模型需要的不仅仅是应用标准多模态学习。ECG、PPG 和 PCG 受生理机制耦合,但在时间上存在偏移:PCG 通过电机械耦合跟随电激活,而 PPG 通过脉搏传导时间更晚出现。同时,同一心脏事件可能表现为尖锐的电偏转、声学突发或平滑的周围脉搏波。因此,朴素的时间戳对齐可能比较同一搏动的不同相位,而原始跨信号重建可能鼓励传感器特定的捷径。这些挑战促使我们设计一个在共享潜在空间中运作的学习目标,以及一个显式考虑生理延迟的对齐机制。
为应对这些挑战,我们提出了 CardioState\-JEPA,一种生理感知的联合嵌入预测架构,用于 ECG、PPG 和 PCG 的统一心脏表示学习。该模型通过轻量模态特定 stems 将异质波形映射到一个公共 token 空间,并使用单个共享 Transformer 编码器处理它们。由于这些模态不共享波形外观,但共享潜在心脏结构,CardioState\-JEPA 通过学习预测掩蔽的潜在心脏状态,而不是重建原始信号。这种预测公式避免强调低层传感器形态,也消除了对负样本对的需求,后者在生理数据中可能具有歧义,因为不同受试者或片段可能共享节律、心率或病理。
CardioState\-JEPA 还围绕心脏传感的数据环境进行设计。大规模单模态 ECG、PPG 和 PCG 语料库日益可用,但同步的多传感器记录相对稀缺。因此,我们采用两阶段课程。模型首先通过模态内掩蔽潜在预测,从丰富的单模态记录中学习模态内结构。然后,它使用配对记录通过延迟感知的跨模态预测来对齐模态,同时继续采样单模态数据以保持各模态性能。额外的生理引导目标鼓励心动周期相位感知、一致的延迟估计和鲁棒的共享表示。
我们在涵盖 ECG、PPG 和 PCG 的 25 个下游任务上将 CardioState\-JEPA 作为冻结编码器进行评估,其中单个共享编码器始终优于强模态特定基线。总体而言,我们的贡献如下:
- •我们将统一心脏表示学习公式化为从异构 ECG、PPG 和 PCG 观测中恢复共享潜在心脏状态的问题,这些观测因生理延迟而在时间上偏移。
- •我们提出了 CardioState\-JEPA,一种联合嵌入预测架构,通过模态内掩蔽潜在预测和延迟感知的跨模态潜在预测来学习共享心脏表示。
- •我们引入了一种生理引导的对齐策略,其中模态间延迟被显式估计和监督,从而使电、血流动力学和声学信号能够在潜在心脏时间而非原始时间戳上对齐。
- •我们表明,我们的预训练编码器可迁移到 ECG、PPG 和 PCG 任务,在 PPG 和 PCG 的平均性能上优于模态特定基线,同时在 ECG 上保持竞争力,为独立的逐传感器表示学习提供了一种统一替代方案。
## 2 相关工作
#### 通用时间序列基础模型。
通用时间序列基础模型已成为学习跨预测、分类和异常检测任务可迁移表示的重要方向\[39 (https://arxiv.org/html/2608.12944#bib.bib45),2 (https://arxiv.org/html/2608.12944#bib.bib46)\]。这些模型大多依赖自监督学习来利用大规模未标注时间序列语料库。在该领域内,对比方法 \(TS2Vec\[45 (https://arxiv.org/html/2608.12944#bib.bib44)\], CoST\[43 (https://arxiv.org/html/2608.12944#bib.bib47)\]\)、受掩蔽自编码器启发的掩蔽预测方法\[15 (https://arxiv.org/html/2608.12944#bib.bib19),12 (https://arxiv.org/html/2608.12944#bib.bib43)\]以及联合嵌入预测架构\[11 (https://arxiv.org/html/2608.12944#bib.bib42)\]通过预测潜在结构而非原始结构来学习可迁移表示。尽管取得了进展,大多数通用时间序列基础模型在聚焦的临床任务上表现欠佳,同时仍将传感器或通道视为独立流,因此未显式建模多个模态观测同一潜在物理过程时产生的结构化对应关系。
#### 心脏信号基础模型。
在通用自监督学习进展的基础上,近期工作聚焦于心脏信号作为一个大规模未标注数据集日益可获取的领域。对于 ECG,早期的自监督模型如 ST\-MEM\[30 (https://arxiv.org/html/2608.12944#bib.bib24)\]已展示出通过公开录制的掩蔽预测目标向心律失常、节律和形态分类的强迁移能力。最近一系列 ECG 基础模型,包括 ECGFounder\[23 (https://arxiv.org/html/2608.12944#bib.bib25)\], ECG\-FM\[28 (https://arxiv.org/html/2608.12944#bib.bib26)\], HeartLang\[17 (https://arxiv.org/html/2608.12944#bib.bib28)\]和 D\-BETA\[33 (https://arxiv.org/html/2608.12944#bib.bib31)\],进一步利用大规模配对标签或弱临床报告作为多模态框架来实现更高性能,但代价是需要特权标注。对于 PPG,PaPaGei\[35 (https://arxiv.org/html/2608.12944#bib.bib32)\]和 AnyPPG\[31 (https://arxiv.org/html/2608.12944#bib.bib33)\]将对比预训练应用于可穿戴记录,并在心率和血压估计方面表现出强性能。对于 PCG,通用音频模型如 AudioMAE\[16 (https://arxiv.org/html/2608.12944#bib.bib36)\]和 CLAP\[10 (https://arxiv.org/html/2608.12944#bib.bib37)\]已被应用于心音分类。然而,这些模型均针对单一传感模态设计。CardioState\-JEPA 的不同之处在于,它同时训练一个跨 ECG、PPG 和 PCG 的共享编码器,将模态间的生理对应关系视为额外的监督信号,而非需要避免的复杂性。
## 3 方法
图 2:CardioState\-JEPA 总览。阶段 I 从丰富的 ECG、PPG 和 PCG 记录中通过掩蔽潜在预测学习单模态心脏码。阶段 II 使用配对记录进行延迟感知的跨模态预测,其中学习得到的对齐器估计生理偏移,使一种模态在相应的心脏时间预测另一种模态。
### 3.1 总览
CardioState\-JEPA 学习一个同时服务于 ECG、PPG 和 PCG 的单一表示,而不是为每个传感器训练一个单独模型。如图2 (https://arxiv.org/html/2608.12944#S3.F2) 所示,每种模态首先通过一个轻量模态特定 tokenizer 映射到一个公共 token 空间,然后所有模态由一个共享 Transformer 编码器处理,该编码器产生一个公共心脏码。由于这些模态在时间上存在生理偏移,我们分两阶段训练(详见下文):阶段 I 从丰富的单模态数据中学习每种模态的结构,阶段 II 通过学习得到的延迟从稀缺的配对数据中对齐模态。
### 3.2 问题表述
我们不将 ECG、PPG 和 PCG 视为三种信号族,而是视为同一隐藏过程的三种渲染,这明确了共享表示应该捕获什么。一个心动周期产生一个潜在状态c\(t\)∈Rdc\mathbf\{c\}\(t\)\in\mathbb\{R\}^\{d_\{c\}\},每个传感器通过自身的换能方式以及自身在心血管路径上的位置来观测它:
xm\(t\)=Om\(c\(t−τm\(t\)\),um\(t\)\),\mathbf\{x\}_\{m\}\(t\)\;=\;\mathcal\{O\}_\{m\}\\\!\\big\(\mathbf\{c\}\\big\(t\-\tau_\{m\}\(t\)\\big\),\;\mathbf\{u\}_\{m\}\(t\)\\big\),(1)
其中Om\mathcal\{O\}_\{m\}是模态特定渲染,um\mathbf\{u\}_\{m\}收集传感器噪声如噪声和放置位置,τm\tau_\{m\}是从电激活开始的生理延迟。这些延迟使心脏信号区别于普通多模态数据:ECG 几乎是即时的,PCG 跟随电机械耦合,PPG 仅在脉搏传导时间之后到达。因此,同一心搏的两种模态共享c\mathbf\{c\},但在渲染、噪声和相对延迟τm→n=τn−τm\tau_\{m\rightarrow n\}=\tau_\{n\}\-\tau_\{m\}上不同。随后产生两个要求:首先,由于c\mathbf\{c\}对整个心动周期是共同的,共享表示必须能从单一模态的部分视图中恢复。其次,由于不同传感器在同一时刻描述同一状态,在去除延迟τm→n\tau_\{m\rightarrow n\}后,它们的表示必须一致。我们不显式建模um\mathbf\{u\}_\{m\};在潜在空间预测而非重建波形,再加上朝向模态不变性的压力,足以减少对它的依赖。这两个要求对应于两个阶段:第一个要求通过丰富的单模态数据满足,第二个要求通过稀缺的配对数据满足。
### 3.3 模态 Tokenizer 和共享编码器
由于 ECG、PPG 和 PCG 在采样率、通道数和形态上不同,我们在共享编码器之前使用模态特定 tokenizerfmf_\{m\}使它们可比,从而使编码器将容量用于心脏结构而非采集差异。给定xm∈RCm×Tm\mathbf\{x\}_\{m\}\in\mathbb\{R\}^\{C_\{m\}\times T_\{m\}\},tokenizer 产生hm=fm\(xm\)∈RN×d\mathbf\{h\}_\{m\}=f_\{m\}\(\mathbf\{x\}_\{m\}\)\in\mathbb\{R\}^\{N\times d\}:一个步长卷积,其步长按模态设置,使三种模态都以相近速率产生 token;一个多尺度深度可分离卷积块,为 QRS 波群、PPG 上升支和第一心音等短时事件添加上下文;以及一个线性投影,随后添加正弦位置嵌入和模态嵌入。然后,一个共享 Transformer 编码器处理这些 token,没有模态特定层,因此 ECG、PPG 和 PCG 更新相同的参数。记Hm=gθ\(hm\)\mathbf\{H\}_\{m\}=g_\{\theta\}\(\mathbf\{h\}_\{m\}\),一个共享投影器将每个 token 映射到用于训练和迁移的心脏码Zm=π\(Hm\)\mathbf\{Z\}_\{m\}=\pi\(\mathbf\{H\}_\{m\}\)。一个动量编码器g ̄θ ̄\bar\{g\}_\{\bar\{\theta\}\},即 tokenizer、编码器和投影器的指数移动平均,在未掩蔽信号上无梯度运行以提供稳定目标。
### 3.4 阶段 I:模态内 JEPA
阶段 I 强制满足第一个要求,即从单一模态的部分视图恢复心脏码。我们在潜在空间中预测掩蔽区域,而不是重建相似文章
CGM-JEPA:通过预测性自监督预训练学习一致的连续血糖监测表征
介绍 CGM-JEPA,这是一种针对连续血糖监测数据的自监督预训练框架,通过掩码潜在预测和分布目标提升了跨模态及跨队列的性能。
一个未来,每个机器人:去中心化JEPA下的标签高效集体状态预测
本文介绍了集体状态JEPA(CS-JEPA),这是一种循环联合嵌入预测架构,使群体中的每个机器人能够从局部观测和受限消息中预测相同的未来集体状态。该方法展示了在预测误差和机器人间一致性方面的标签高效改进,并提供了与规划相关的价值估计。
@iScienceLuvr:学习稀疏潜在预测基础模型用于多模态神经影像 本文介绍了Neuro-JEPA,一个基…
本文介绍了Neuro-JEPA,一个基础模型,它使用潜在预测目标和混合专家架构来编码跨T1w、T2w和FLAIR序列的脑部MRI扫描,并在包含155万次扫描的大型数据集上进行了预训练。
ECG与血管造影表征的跨模态对比学习用于重度狭窄分类
本文介绍了StenCE,一个预训练框架,利用ECG与X射线血管造影表征之间的跨模态对比学习,从ECG中检测重度冠状动脉狭窄,实现了高性能,并能够在无症状患者中实现早期诊断。
STST-JEPA: 浅层目标时空联合嵌入预测架构用于EEG自监督学习
介绍STST-JEPA,一种用于EEG的自监督Transformer,可预测掩码令牌表示,并在47,703次会话上预训练,用于5-81岁年龄段的脑年龄回归。