MedTVL:利用视觉和语言进行医学时间序列分类

arXiv cs.AI 论文

摘要

MedTVL是一种文本引导的双路径架构,用于医学时间序列分类,它协同时间模态和视觉模态与文本语义,在各种学习设置中展示优越性。

arXiv:2608.28605v1 公告类型:新 摘要:多模态学习在医学时间序列(MedTS)分类中的最新进展强调了整合互补模态以进行临床决策的好处。然而,现有方法通常关注双模态交互(例如,时间序列和文本),使得时间序列、视觉和语言之间的三模态协同在很大程度上未被探索。受诊断实践中协同数值评估、视觉检查和临床背景的启发,我们介绍了MedTVL,这是一种专为MedTS分类定制的文本引导双路径架构。具体来说,它协同了一个基于卷积的时间路径,用于从原始数值序列中提取细粒度的时间动态,以及一个基于Transformer的视觉路径,用于从时间序列衍生的图像中提取整体形态结构。这种跨模态和架构异质性的结合提供了全面的诊断视角。为进一步解决潜在的诊断歧义,两个路径都由自适应的医学文本语义引导。最后,一个混合专家机制动态地将每个实例路由到专门的融合专家,捕获实例对时间和视觉路径输出的特定依赖。此外,MedTVL支持多模态对比学习以缓解临床标签稀缺的挑战。在多个医学数据集和任务上进行的广泛实验,涵盖监督学习、少样本学习和对比学习设置,证明了MedTVL的优越性和可迁移性,突显了其在鲁棒临床决策支持方面的潜力。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:30

# MedTVL:利用视觉与语言进行医疗时间序列分类  
来源:https://arxiv.org/html/2608.28605  
作者:叶洁霞([jye324@connect\.hkust\-gz\.edu\.cn](mailto:[email protected]))香港科技大学(广州)数据科学与分析分部 中国广州;李佳([jialee@hkust\-gz\.edu\.cn](mailto:[email protected]))香港科技大学(广州)数据科学与分析分部 中国广州;丛秋实([season@ust\.hk](mailto:[email protected]))香港科技大学工业工程与决策分析系 中国香港  

\(2026\)  

###### 摘要  
近期针对医疗时间序列(MedTS)分类的多模态学习研究强调,整合互补模态对临床决策具有显著优势。然而,现有方法通常聚焦于双模态交互(例如时间序列与文本),对时间序列、视觉与语言三者之间的协同作用尚未充分探索。受临床诊断中结合数值评估、视觉检查与临床背景的实践启发,我们提出 MedTVL,一种面向 MedTS 分类的文本引导双路径架构。具体而言,该架构融合基于卷积的时间通路以从原始数值序列中提取细粒度时序动态,以及基于 Transformer 的视觉通路以从时间序列衍生图像中提取整体形态结构。这种跨模态与架构异质性的结合提供了全面的诊断视角。为解决潜在的诊断模糊性,两条通路均受到自适应医学文本语义的引导。最终,专家混合机制将每个样本动态路由至专门的融合专家,以捕获实例对时间通路和视觉通路输出的特定依赖。此外,MedTVL 支持多模态对比学习,以缓解临床标签稀缺问题。在多个医疗数据集和任务上的大量实验(涵盖监督学习、小样本学习和对比学习场景)表明了 MedTVL 的优越性和可迁移性,凸显其在稳健临床决策支持方面的潜力。  

医疗时间序列分类;多模态学习;对比学习  

††journalyear:2026††copyright:cc††conference:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2; August 09–13, 2026; Jeju Island, Republic of Korea††booktitle:Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V\.2 \(KDD ’26\), August 09–13, 2026, Jeju Island, Republic of Korea††doi:10\.1145/3770855\.3818883††isbn:979\-8\-4007\-2259\-2/2026/08††ccs:Applied computing Health informatics††ccs:Computing methodologies Temporal reasoning  

## 1. 引言  
参见标题图1. MedTS多视角诊断过程示意图,突出数值、视觉和文本视角在支持临床决策方面的互补优势。  
医疗时间序列(MedTS)广泛应用于临床监测、疾病筛查和诊断决策等关键医疗场景(Guet al.,2025 (https://arxiv.org/html/2608.28605#bib.bib21)),涵盖多种生理信号,包括心电图(ECG)(Ding et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib22))、脑电图(EEG)(Sharma and Meena,2024 (https://arxiv.org/html/2608.28605#bib.bib23))和其他生命体征(Fatourechi et al.,2007 (https://arxiv.org/html/2608.28605#bib.bib26))。MedTS的特性具有多方面的复杂性:首先,显著的数据异质性,表现为多源信号模态、不同的采样率以及多样化的诊断任务(Rim et al.,2020 (https://arxiv.org/html/2608.28605#bib.bib25); Woo et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib20))。其次,突出的多尺度模式,某些模式在短时间窗口内表现为瞬时波动,而另一些则反映在整体的形态结构中(Wang et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib67))。第三,固有的标签稀缺性,因为现实临床环境中不完整的标注常常损害模型的泛化能力(Li et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib84))。这些多方面的复杂性对开发稳健且可泛化的MedTS分类模型提出了挑战。  

传统方法大多依赖单模态数值信号(Wang et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib67); Ye et al.,2026 (https://arxiv.org/html/2608.28605#bib.bib69)),少数尝试将时间序列转换为图像(Wu et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib2))。然而,单模态建模难以捕捉完整的诊断证据谱系,导致性能欠佳。随着多模态学习的发展,越来越多的研究将时间序列与文本相结合,验证了文本语义在支持临床决策中的重要性(Liu et al.,2024a (https://arxiv.org/html/2608.28605#bib.bib83); Chan et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib77))。然而,由于缺乏显式的视觉建模,这些方法未能捕捉关键的形态模式,这与临床医生严重依赖视觉推理的实践相悖。近期,在通用时间序列领域出现了时间序列-视觉融合方法(Shen et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib119); Lyu et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib113));然而,这些方法缺乏文本基础,且未针对医疗数据的独特属性进行优化。尽管对三模态建模(时间序列、视觉和语言)的兴趣日益增长,但现有研究仍然稀少且局限于通用预测(Zhong et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib123))或特定医疗模态(Lan et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib124))。例如,TimeVLM(Zhong et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib123))专注于以时间为中心的注意力进行时间序列预测,将视觉和文本视为辅助,这一限制阻碍了这些模态的充分利用。GEM(Lan et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib124))专为ECG设计,将时间序列和图像映射到共享的文本空间,这可能会缓冲和稀释细粒度的生理细节。  

在现实临床实践中,MedTS的诊断本质上是一个多视角过程(Lan et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib124); Fan et al.,2025b (https://arxiv.org/html/2608.28605#bib.bib125))。临床医生通常检查原始时间信号以识别细粒度的病理模式(例如室性早搏(Klewer et al.,2022 (https://arxiv.org/html/2608.28605#bib.bib19)))。作为补充,对信号的视觉检查使他们能够评估整体形态(例如ST段抬高(McLaren et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib18)))。同时,临床文本通过纳入患者病史和先前评估提供必要的语义上下文,使临床医生能够确认、细化或修正其判断。这些视角共同反映了临床医生如何将精确的时间细节、全局视觉线索和语义信息整合为连贯的诊断决策。  

基于并超越这些临床实践,我们提出了 MedTVL,一个整合时间序列、视觉与语言的统一框架,专为 MedTS 分类量身定制。MedTVL 采用文本引导的双路径架构,对跨多个尺度的多样化诊断模式进行建模。具体而言,时间通路利用卷积主干网络从原始数值信号中提取细粒度动态,而视觉通路采用基于 Transformer 的主干网络从时间序列衍生的连续小波变换(CWT)图像中捕捉整体形态。这种协同设计超越了模态层面的互补性,通过明确引入架构异质性,其中卷积和基于 Transformer 的主干网络为多尺度诊断建模提供互补的归纳偏置。随后,共享的文本语义被自适应地注入通路子空间,以用临床背景约束特定模态的学习。最后,为解决样本中时间线索和视觉线索重要性各异的问题,MedTVL 引入了一种专家混合(MoE)机制,动态地将每个实例分配给专门的融合专家。这种细粒度的融合使模型能够自适应地协调异构信号,在不同临床场景中提供稳健灵活的整合。此外,双路径结构天然形成跨模态正对,促进多模态对比学习,以缓解临床环境中的标签稀缺挑战。  

- •据我们所知,MedTVL 是首个封装临床诊断视角、用于通用医疗时间序列分类的三模态框架。  
- •MedTVL 引入双路径架构,从时间-视觉协同视角捕捉多尺度模式,使用自适应文本引导和基于 MoE 的实例级融合来处理医疗数据异质性。它还支持多模态对比学习。  
- •我们在涵盖多个医疗任务的数据集上进行了全面的实验,覆盖监督学习、小样本学习和对比学习设置。我们的结果表明,MedTVL 优于 SOTA 基线,同时展示了其解决标签稀缺挑战的能力。代码链接为 https://github.com/start2020/MedTVL  

参见标题图2. MedTVL 框架概览。更多细节见第3节 (https://arxiv.org/html/2608.28605#S3)。  

## 2. 相关工作  
**单模态医疗时间序列分类**。单模态方法主要依赖数值医疗信号建模,只有少数研究探索了基于图像的时间序列表示(Wu et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib2); Pratiher et al.,2022 (https://arxiv.org/html/2608.28605#bib.bib70))。许多近期的深度学习方法采用了卷积神经网络(CNN)(Lawhern et al.,2018 (https://arxiv.org/html/2608.28605#bib.bib65))、循环神经网络(RNN)(Salloum and Kuo,2017 (https://arxiv.org/html/2608.28605#bib.bib64))、图神经网络(GNN)(Tang et al.,2021 (https://arxiv.org/html/2608.28605#bib.bib44))和 Transformer(Wang et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib67); Ye et al.,2026 (https://arxiv.org/html/2608.28605#bib.bib69))等架构。尽管这些方法显示出有希望的结果,但它们通常针对特定信号(例如ECG)量身定制,跨信号泛化能力有限。此外,依赖单模态视角限制了其充分捕捉现实临床数据的变异性和异质性的能力,从而激发了人们对多模态学习日益增长的兴趣。  

**双模态时间序列表示学习**。当前的多模态研究主要集中在时间序列-文本对齐上,特别是在通用时间序列领域(Cheng et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib74); Ye et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib68))(例如Time-LLM(Jin et al.,2023 (https://arxiv.org/html/2608.28605#bib.bib72)),UniTS(Gao et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib73)))。在医疗领域,一些工作利用大型语言模型(LLM)整合时间序列和文本(例如 MedTsLLM(Chan et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib77)),MedualTime(Ye et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib78)))进行监督学习,而其他工作则关注报告引导的ECG对比学习(Li et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib84); Liu et al.,2024a (https://arxiv.org/html/2608.28605#bib.bib83))。然而,这些方法通常忽略了显式视觉建模,未能捕捉诊断实践所必需的临床意义形态模式。尽管时间序列-视觉方法最近出现(Shen et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib119); Lyu et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib113)),但它们主要关注预测,并未针对临床诊断的独特挑战进行优化。一个值得注意的例外是 MedViA(Fan et al.,2025b (https://arxiv.org/html/2608.28605#bib.bib125)),它专为医疗数据设计;然而,它依赖于静态融合且缺乏临床语义引导,限制了其处理 MedTS 变异性的灵活性。  

**三模态时间序列表示学习**。据我们所知,三模态框架的探索仍然更少,迄今仅有 Time-VLM(Zhong et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib123))和 GEM(Lan et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib124))被报道。Time-VLM(Zhong et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib123))优先通过时间主导的注意力进行预测,限制了对视觉和文本输入的充分利用。其门控融合在实例间应用共享权重,可能限制了模型在整合异构通路输出时的灵活性。相反,GEM(Lan et al.,2025 (https://arxiv.org/html/2608.28605#bib.bib124))将数值信号和视觉图像都压缩到统一的文本空间,这不可避免地会削弱细粒度的波形动态和形态细节。  

**时间序列的对比学习**。对比学习是缓解标签稀缺性的强大范式。在通用时间序列领域,它已从定义正对的方法(Tonekaboni et al.,2021 (https://arxiv.org/html/2608.28605#bib.bib95))发展到基于增强的多视角对齐(例如TS-TCC(Eldele et al.,2021 (https://arxiv.org/html/2608.28605#bib.bib92)),TS2Vec(Yue et al.,2022 (https://arxiv.org/html/2608.28605#bib.bib94))),并进一步发展到利用内在时间属性(如频域一致性和季节-趋势解耦)的方法(Woo et al.,2021 (https://arxiv.org/html/2608.28605#bib.bib96); Zhang et al.,2022 (https://arxiv.org/html/2608.28605#bib.bib97))。医疗时间序列对比学习已从早期采用通用领域技术发展到更深入地适应医疗特性,但其中大多数针对特定信号类型(例如EEG)量身定制(Liu et al.,2023 (https://arxiv.org/html/2608.28605#bib.bib79))。所有上述方法仍然局限于时间序列模态。最近,一些工作关注报告引导的ECG对比学习(Li et al.,2024 (https://arxiv.org/html/2608.28605#bib.bib84); Liu et al.,2024a (https://arxiv.org/html/2608.28605#bib.bib83))。然而,大多数公共数据集中配对文本的缺失限制了报告引导对比学习的应用。AimTS(Chen et al.,2025b (https://arxiv.org/html/2608.28605#bib.bib89))是一项近期开创性工作,它引入了时间序列-图像对比学习以增强表示泛化。与 MedTVL 相比,它是为通用时间序列设计的,缺乏文本语义支持。  

## 3. 方法论  
**问题表述**。考虑一个包含NN个样本的医疗数据集D=\{\(Xi,si,yi\)\}i=1N\\mathcal\{D\}=\\\{\(\\m

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。