一种用于T2DM可解释疾病轨迹的结构化FHMM

arXiv cs.LG 论文

摘要

本文提出了一种结构化的因子隐马尔可夫模型变体,用于利用电子健康记录分析和解释2型糖尿病患者的疾病轨迹,揭示了具有临床意义的模式和进展路径。

arXiv:2608.24328v1 Announce Type: new 摘要:在本研究中,我们提出了一种结构化的因子隐马尔可夫模型(FHMM)变体,用于分析2型糖尿病(T2DM)患者的疾病轨迹。该模型将患者的潜在健康状态表示为多个独立、同时演进的组成部分的组合,这些组成部分与合并症和实验室检查结果相关联。这种结构化的潜在表示有助于识别具有临床意义的患者状态和聚类常见的疾病轨迹。我们使用IQVIA医学研究数据(包含THIN数据库的匿名电子健康记录(EHR)数据)评估所提出的方法,识别了在2006年1月至2019年12月期间首次处方非胰岛素降糖药(NIAD)的患者。该模型识别出多个与已知糖尿病相关并发症模式一致的临床连贯潜在组成部分,并揭示了异质性的进展路径,包括与升高的合并症负担和死亡率相关的显着微血管主导和多器官轨迹。这些结果表明,所提出的框架能够捕获EHR数据中有意义的纵向结构,并为T2DM及其合并症的演变提供了可解释的见解。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:36

# 一种用于T2DM可解释疾病轨迹的结构化FHMM模型
来源:https://arxiv.org/html/2608.24328

作者:  
Alessandro Mari  
单位:瑞士数据科学中心(SDSC),洛桑联邦理工学院(EPFL),瑞士  
Guillaume Obozinski  
单位:瑞士数据科学中心(SDSC),苏黎世联邦理工学院(ETH Zürich),瑞士  
Maria Luisa Marques de Sa Faquetti  
单位:药物流行病学组,苏黎世药学院,瑞士  
Adrian Martinez de la Torre  
单位:药物流行病学组,苏黎世药学院,瑞士  
Andrea Burden  
单位:药物流行病学组,苏黎世药学院,瑞士  

2026年8月24日

###### 摘要

本研究提出了一种用于分析2型糖尿病(T2DM)患者疾病轨迹的**因子隐马尔可夫模型**(FHMM)结构化变体。该模型将患者的潜在健康状态表示为多个独立、同步演化的组分的组合,这些组分与合并症和实验室检查结果相关联。这种结构化的潜在表示有助于识别临床有意义的患者状态并聚类常见的疾病轨迹。我们使用IQVIA医学研究数据(包含来自THIN的Cegedim匿名电子健康记录(EHR)数据库)对所提方法进行评估,该数据纳入了2006年1月至2019年12月间首次处方非胰岛素降糖药(NIAD)的患者。模型识别出多个与已知糖尿病相关并发症模式一致的临床连贯潜在组分,并揭示了异质性的进展路径,包括与高合并症负担和死亡率相关的不同微血管主导型和多器官型轨迹。这些结果表明,所提框架能够捕捉EHR数据中有意义的纵向结构,并为T2DM及其合并症的演变提供了可解释的见解。

## 1 背景

2型糖尿病(T2DM)是一种慢性代谢紊乱,以胰岛素抵抗和胰岛素分泌不足导致的血糖升高为特征。它是全球主要的健康问题,常伴随一系列合并症,这些合并症显著降低生活质量并增加发病率和死亡率风险[1]。这些合并症的存在和发展导致了T2DM轨迹的异质性,使得疾病管理和风险分层尤其具有挑战性。从纵向临床观测中推断患者的潜在健康状态,结合T2DM及其相关合并症的信息,可以支持疾病进展模式和新兴健康风险的识别。利用回顾性电子健康记录(EHRs)来表征这些动态健康状态,具有改善疾病理解、将患者分层为有意义的临床亚组以及指导及时干预的潜力。

本研究分析与T2DM和多种合并症相关的EHR纵向观测,以推断患者的潜在健康状态并表征常见的疾病演变模式。为此,我们提出一种旨在捕捉患者健康多维动态特性的统计模型,特别关注潜在表示的可解释性和临床相关性。

具体而言,我们考虑了一种**因子隐马尔可夫模型**(FHMM)[2]的结构化变体,它能够通过几个独立的、随时间同步演化的潜在组分来建模多维患者健康状态的动态变化。给定纵向临床观测,所提模型推断这些组分的潜在配置,提供疾病进展和相关健康风险的结构化表示。与使用单一潜在状态代表患者健康的标准隐马尔可夫模型(HMM)相比,FHMM框架允许将患者的整体状况近似为少量演化潜在过程的组合。这种结构提高了建模灵活性并促进了可解释性,因为单个潜在链可以与疾病演变或合并症负担的不同方面相关联。

通过使用患者健康指标和疾病史的回顾信息,所提模型能够识别有临床意义的潜在状态并分析它们之间的转换。由此产生的潜在轨迹可用于根据共同的进展模式聚类患者、表征典型疾病路径以及评估合并症相关风险随时间的变化。

**相关工作**。从T2DM患者的纵向健康观测中追踪和建模合并症,对于理解疾病异质性和支持有效的疾病管理至关重要。大量统计和机器学习方法已被提出,用于分析大规模健康数据并揭示与疾病进展和风险相关的时间模式。HMM及其广义形式是医疗保健应用中建模疾病动态最广泛使用的概率方法之一[3,4,5,6]。输入-输出隐马尔可夫模型混合等扩展方法已被提出以捕捉更复杂的时间依赖性[7]。非参数潜在特征模型,包括基于印度自助餐过程的方法,也已被探索用于合并症分析,特别是在精神障碍的背景下[8]。

最近,深度生成模型已被应用于纵向临床数据。在[9]中,作者提出了一种基于变分自编码器的框架,用于学习能够联合生成临床测量值和医学概念的潜在表示。虽然有效,但他们的方法需要手动将潜在维度分配给特定的医学概念。相比之下,我们的模型在结构上自动学习潜在空间的结构化分解。此外,我们方法中的潜在表示是离散的,并受单调性约束,这增强了可解释性并促进了疾病轨迹的分析。

处理多种疾病共同演化的方法也已被提出。例如,[10]引入了基于二元Copula的潜在过程来使用人群时间序列建模两种疾病之间的相互作用。在T2DM的背景下,机器学习方法已被应用于建模疾病进展[11],而基于聚类的分析已用于研究合并症模式[12]。我们的工作通过提供一个结构化的、可解释的潜在状态模型来补充这些方法,该模型适用于复杂的多合并症疾病轨迹分析。

## 2 方法

### 2.1 数据

IQVIA英国医学研究数据库(IMRD-UK)包含了由The Health Improvement Network(THIN)提供的数据,THIN是一个由Cegedim管理的匿名电子健康记录数据库,来源于全科医生(GPs)的日常记录。研究方案和数据使用经科学审查委员会(SRC,参考号20SR062)审查批准。

该数据集包括来自参与初级保健诊所的患者,他们已为研究目的提供了一般同意。同意可随时撤回,届时个人数据将从数据集中移除。二级医疗服务提供者,如门诊护理或专科医生,会向全科医生提供有关诊断的额外反馈。

通常,该数据库包含从临床实践中常规收集的数据,包括患者诊断、症状、处方、转诊、免疫接种、实验室检测结果(包括糖化血红蛋白[HbA1c])、选定的行为因素(体重指数[BMI]、饮酒情况和吸烟状况)以及人口统计学特征。与大多数电子医疗数据库一样,数据是在常规护理而非研究目的下生成的,导致观测时间不等距,且某些变量捕获不完整。生活方式因素如BMI、吸烟状况和饮酒量存在缺失。此外,诊断仅在作为就诊主要原因时记录,实验室检测仅在开单时捕获;虽然药物处方可识别,但处方配药和依从性情况未知。

### 2.2 队列描述

我们确定了所有在2006年1月1日至2019年12月31日期间首次处方非胰岛素降糖药(NIAD)的成年患者(18岁以上)。索引日期定义为首次NIAD处方日期。为确保识别新用户,要求患者在索引日期前至少有一年有效数据。我们排除了在NIAD开始前4年内没有任何关注变量实验室测量记录的患者(见表1)。

#### 2.2.1 数据预处理

图1:预处理步骤的图形化表示。为协调数据集并准备建模,我们应用了以下数据准备步骤。这些步骤的摘要见图1。

##### 合并症与实验室测量:

分析中纳入的合并症和实验室变量列于表1。合并症在索引日期或之前以及随访期间通过每次患者临床就诊记录的Read代码进行识别。仅考虑慢性疾病。因此,如果在相关六个月间隔内出现了任何相应的Read代码,则认为合并症c在时间t存在。一旦识别,合并症被假定随时间持续存在,反映其慢性或复发性特征;因此,合并症c的指示变量在首次出现后保持为1。在基础模型中,药物仅用于建模初始状态。关于在转移矩阵中使用药物效应的详细讨论见附录C。

实验室值被标准化为一致的单位(见表1),并使用预定义阈值去除异常值(见附录A)。为了解决常规临床数据固有的不规则测量时间和部分缺失问题,实验室测量值被聚合成六个月间隔,当给定间隔内有多个测量值时,使用中位数。如果任何所需实验室变量在NIAD开始前四年没有记录测量值,则排除患者。这一步骤对于NIAD后期间缺失值的向前插补是必要的。

此外,为了区分医生关于诊断和药物处方的决定时间,我们使用了相对于处方时间向前移动的合并症状态(存在或不存在)和实验室检测结果。这种方法有助于避免与六个月聚合相关的问题,其中诊断可能受药物处方而非患者实际健康状态的影响。

为了进一步保留患者健康状态和临床决策之间的预期时间顺序,合并症指标和实验室测量值相对于药物处方时间向前移动。这种方法缓解了由六个月聚合引入的潜在反向因果关系伪影,否则在任何治疗开始前不久记录的诊断或实验室结果可能看起来与药物暴露同时发生(或受其影响)。

##### 临床分层:

患者观测按年龄和性别分层,以考虑有意义的临床异质性。年龄在索引日期确定,并分为两组:64岁及以下患者和65岁及以上患者。这种分层反映了生命历程中糖尿病进展和与年龄相关合并症负担的差异[13]。此外,分析按性别分层,以捕捉男性和女性患者在疾病患病率和合并症特征(如骨质疏松症)方面的已知差异[14]。

表1:模型中包含的变量列表。
| 合并症 | 实验室值 | 药物(ATC编码) |
| :--- | :--- | :--- |
| • 中风<br>• 心肌梗死(MI)<br>• 充血性心力衰竭(CHF)<br>• 外周血管疾病(PVD)<br>• 糖尿病视网膜病变(DR)<br>• 高血压(HT)<br>• 慢性肾脏病(CKD)<br>• 骨质疏松症<br>• 慢性阻塞性肺疾病(COPD)<br>• 慢性肝病(CLD) | • 糖化血红蛋白(HbA1c)%<br>• 低密度脂蛋白(LDL)胆固醇 mmol/L<br>• 高密度脂蛋白(HDL)胆固醇 mmol/L<br>• 甘油三酯(TG) mmol/L<br>• 血压(收缩压/舒张压) mmHg<br>• 体重指数(BMI) kg/m²<br>• 肾小球滤过率(GFR) mL/min/1.73m² | • 糖尿病药物*<br>• 抗血栓药(B01)<br>• 心脏病治疗药(C01)<br>• 抗高血压药(C02)<br>• 利尿剂(C03)<br>• β受体阻滞剂(C07)<br>• 钙通道阻滞剂(C08)<br>• ACE抑制剂(C09)<br>• 他汀类药物(C10)<br>• 皮质类固醇(H02)<br>• 骨疾病治疗药(M05) |

*包括格列齐特、格列美脲、格列吡嗪、二甲双胍、吡格列酮、罗格列酮、西格列汀、达格列净。

### 2.3 结构建模FHMM

我们的建模方法基于**因子隐马尔可夫模型**(FHMM)[2],它是隐马尔可夫链的扩展,其输出不是基于一个具有M个状态的隐马尔可夫链,而是基于K个独立的隐马尔可夫链。这允许对时间序列依赖多个独立潜在过程进行建模(见图2)。在合并症和实验室值进展建模的背景下,FHMM方法转化为一个假设:存在K个潜在健康状态组分,它们是独立的,并共同影响输出。尽管独立性假设可能看起来不现实,因为身体系统很少孤立运作,但FHMM可以被理解为动态过程的独立基分解,其中多个隐过程独立演化并共同生成观测到的合并症和实验室值。这种观点突显了FHMM是一种结构化近似:潜在链充当抽象的基过程,捕捉疾病进展的关键方面。

相似文章

通过交互感知的Mixture-of-Experts理解结构化健康数据

arXiv cs.LG

本文研究了利用结构化健康记录的多层次视图,通过交互感知的Mixture-of-Experts进行中风后僵硬预测。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调视图构建是实现可解释性的关键。