利用信息性缺失生成不规则临床时间序列

arXiv cs.LG 论文

摘要

提出了一种基于扩散的方法来生成不规则临床时间序列,该方法联合建模实验室检测值及其观测模式,使用了来自MIMIC-III的DACMI基准。该模型在类似非随机缺失(MNAR-like)的缺失机制下,捕捉了患者生理状态与检验行为之间的临床有意义依赖关系。

arXiv:2606.17106v1 Announce Type: new 摘要:电子健康记录中的实验室检测是不定期收集的,而检测医嘱的缺失可能与测量本身一样具有信息量。这种缺失反映了临床医生的决策和患者的生理状态,因此将其直接建模而不是作为预处理伪影来处理非常重要。本文提出了一种基于扩散的方法来生成临床时间序列,该方法使用源自MIMIC-III的公共数据集——数据缺失插补分析挑战(DACMI)基准,联合建模实验室检测值及其观测模式。为了保留真实的采样特征,我们将图表时间对齐为4小时间隔,并将住院时间划分为7天窗口,生成将每个实验室值与相应的观测指标配对的轨迹。应用标准变换和归一化以稳定训练。我们的方法扩展了TimeDiff框架,通过互补的扩散目标学习连续实验室值和离散缺失模式。实验表明,生成的数据在单个实验室分布和联合值-缺失嵌入方面与真实患者轨迹高度吻合,证明扩散模型能够在类似非随机缺失(MNAR,即缺失并非随机)的缺失机制下,捕捉患者生理状态与临床医生检验行为之间的临床有意义依赖关系。这些初步结果表明,我们的模型可以作为开发临床基础模型的初始组件。通过生成保留关键生理-缺失关系的合成先验,这项工作为后续训练能够利用信息性缺失的先验数据拟合网络(Prior-Data Fitted Networks)提供了动机,我们将在后续工作中对此进行研究。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:35

# 信息性缺失用于生成不规则临床时间序列
来源:https://arxiv.org/html/2606.17106

11institutetext:奥尔堡大学,丹麦奥尔堡
11email:mhme@cs\.aau\.dk22institutetext:帕维亚大学,意大利帕维亚
33institutetext:鲍灵格林州立大学,美国俄亥俄州鲍灵格林
Gabriele Santangelo, Giovanna Nicora, Simon Lebech Cichosz, Arianna Dagliati, Arijit Khan, Riccardo Bellazzi

###### 摘要

电子健康记录中的实验室检测数据是未按固定时间收集的,检测项目的缺失可能与测量结果本身一样具有信息量。这种缺失反映了临床医生的决策和患者的生理状态,因此应该直接对其进行建模,而不是将其视为预处理的人为产物。本文提出了一种基于扩散模型的临床时间序列生成方法,该方法使用源自MIMIC-III的公共缺失数据插补挑战(DACMI)基准,联合建模实验室检测值和其观测模式。为保留真实的采样模式,我们将图表时间对齐为4小时间隔,并将住院记录分割为7天窗口,生成每个实验室值对应一个观测指示变量的轨迹。应用标准变换和归一化以稳定训练。我们的方法扩展了TimeDiff框架,通过互补的扩散目标学习连续实验室值和离散缺失模式。实验表明,生成的轨迹在单个实验室值分布以及联合值-缺失嵌入方面与真实患者轨迹高度匹配,证明扩散模型能够捕捉患者生理状态与临床医生检测行为之间具有临床意义的依赖关系(在类似MNAR(非随机缺失)缺失场景下)。这些初步结果表明,我们的模型可以作为开发临床基础模型的基础组件。通过生成保留关键生理-缺失关系的合成先验,这项工作为后续训练能够利用信息性缺失的先验数据拟合网络奠定了基础,我们将在扩展工作中对此进行研究。

## 1 背景

电子健康记录(EHR)记录了由生理状态、患者行为和临床决策共同导致的非规则测量序列[8 (https://arxiv.org/html/2606.17106#bib.bib8)]。例如,实验室检测很少按照固定时间表进行,而检测的缺失本身可能反映了疾病严重程度或临床意图。先前的研究表明,实验室数据的缺失通常具有信息性而非随机性,并且可能因不同医疗站点和护理环境而异[6 (https://arxiv.org/html/2606.17106#bib.bib6),10 (https://arxiv.org/html/2606.17106#bib.bib10)]。对于生成式建模而言,这意味着生成真实的合成实验室轨迹不仅需要匹配实验室检测值,还需要匹配检测发生的时间、其出现的突发方式,以及采样与潜在值之间的关联。许多临床时间序列处理流程主要通过插补来处理缺失问题,旨在建模前将稀疏记录稠密化[3 (https://arxiv.org/html/2606.17106#bib.bib3),4 (https://arxiv.org/html/2606.17106#bib.bib4)]。基于MIMIC-III[2 (https://arxiv.org/html/2606.17106#bib.bib2)]构建的DACMI挑战[5 (https://arxiv.org/html/2606.17106#bib.bib5)]为13种常见血液检测提供了具有真实标签的插补方法公共基准。然而,在插补基准上的成功并不一定意味着生成器能够捕捉真实EHR采样下值和观测值的联合过程。这在非随机缺失(MNAR)场景中最为关键,即某个实验室检测是否被测量取决于未观测或部分观测的临床状态,使得缺失与数据生成机制紧密耦合。扩散模型是时间序列生成的先进选择[1 (https://arxiv.org/html/2606.17106#bib.bib1),9 (https://arxiv.org/html/2606.17106#bib.bib9)]。TimeDiff[7 (https://arxiv.org/html/2606.17106#bib.bib7)] 是最早针对EHR序列的扩散方法之一,支持混合连续变量和二元变量。然而,许多先前的评估重点关注近乎规则的信号(例如生命体征),并且主要通过边际比率报告缺失情况,未能检验模型是否能重现不规则的实验室检测爆发及其与值的耦合——即使单变量分布看起来正确,这个问题仍然可能持续存在。

**贡献。** 我们提出了一个生成框架,作为开发临床基础模型的初步步骤,提供训练先验数据拟合网络[12 (https://arxiv.org/html/2606.17106#bib.bib12)]所需的高保真合成先验。我们的贡献是:(i) 在公共基准上,提出了一个针对不规则实验室检测和信息性缺失的基于扩散的合成实验室生成管线,同时生成实验室值和观测指示变量,以支持下游推断。(ii) 我们修改了TimeDiff[7 (https://arxiv.org/html/2606.17106#bib.bib7)]中的数值(高斯)损失,排除真正缺失的实验室值,将缺失视为不存在而非噪声值。(iii) 我们提出了一种实用的预处理和窗口化协议,旨在保留类似MNAR的结构,同时保持与扩散训练兼容。(iv) 我们使用单变量实验室分布、值和掩码的联合嵌入以及用于模型选择的额外相似性指标评估分布相似性,以评估生理状态和采样行为的真实性。

## 2 材料与方法

**数据集。** 我们使用了公开可用的DACMI插补挑战数据集[5 (https://arxiv.org/html/2606.17106#bib.bib5)],该数据集源自MIMIC-III,提供了标准化的训练/测试分割,便于在稀疏临床时间序列上公平比较方法。从每次住院记录中,我们提取了13个实验室变量,并直接从原始表格构建了相应的缺失掩码,其中每个时间步的每个实验室检测被标记为观测(0)或缺失(1)。这产生了生理状态(连续实验室值)和采样行为(二元指示变量)的配对表示,适用于研究信息性缺失,尤其在类似MNAR的场景中,检测的医嘱和频率反映了临床决策。模型开发和选择基于DACMI训练分割。

**设置和预处理。** 我们将 charttime(入院后的分钟数)离散化为4小时间隔,以最小化人为缺失,创建42步窗口(7天)。超出此范围的入院记录被分割为连续的非重叠窗口,从8,267次入院中获得16,580个训练样本。为近似高斯分布,特征经过对数或Box-Cox变换,然后进行z-score标准化。模型输入由26个通道组成(13个标准化值和13个二元掩码)。除了值和二元掩码轨迹,我们使用了*增量条件*来编码观测的新近度。增量条件在每次扩散步骤向去噪网络提供辅助条件张量。因此,模型仍然只生成实验室值和掩码变量,但在去噪过程中受此额外上下文的引导。对于每个实验室和时间索引,增量值表示自最近一次观测以来经过的步数。具体来说,在每个时间索引处,我们计算从当前位置向后回溯到达该实验室被观测(mask=0)的最新时间点所需的步数。这为每个窗口产生一个(42,13)矩阵,通过除以42归一化到[0,1)。

**实验设置和采样。** 我们使用Adam优化器(学习率8×10^{-5},批量大小64)训练模型200,000步。为平衡两个目标,我们对离散缺失损失相对于连续值损失应用权重λ=10^{-5},采用TimeDiff[[7 (https://arxiv.org/html/2606.17106#bib.bib7)]的符号。为进行评估,我们通过迭代去噪随机噪声生成16,000个合成窗口(42步×26通道)。该样本大小与真实数据集匹配,使我们能够对比合成分布和观测模式与真实情况。

## 3 结果与讨论

图1 (https://arxiv.org/html/2606.17106#S3.F1) 的面板A–B比较了两种代表性实验室检测(具有不同形状)的真实和合成单变量分布。血红蛋白(A)分布较为集中,带有轻微的右尾,合成密度在主要模态周围和整个上尾区域与真实直方图紧密匹配。白细胞计数(B)明显右偏,尾部较长,由偶发的高值驱动;尽管这种设置更具挑战性,合成样本在高密度区域也很好地跟随真实分布,并保持了整体尾部轮廓。图1 (https://arxiv.org/html/2606.17106#S3.F1) 面板C比较了真实数据和合成数据的整体分布。嵌入使用基于DTW距离度量的UMAP计算,针对所有26个通道(13个值和13个掩码)。两个分布之间的大量重叠表明生成方法产生了高质量的合成样本,没有生成真实数据支持范围之外的实例。

表1:13个实验室值逐特征比较:缺失率(mask=1)、实验室值边际的单变量EMD和DTW轨迹距离。

表1 (https://arxiv.org/html/2606.17106#S3.T1) 总结了13个实验室变量的逐特征真实性。它报告了:(i) 缺失率(真实窗口中 mask=1 的时间点比例,以及有和没有增量条件生成的合成窗口中的比例);(ii) 实验室值边际的单变量推土机距离(EMD)[11 (https://arxiv.org/html/2606.17106#bib.bib11)],以真实对真实作为同域参考,以及真实对合成(针对每个生成器);(iii) 每个特征在随机子样本(N=100窗口)上计算的动态时间规整(DTW)轨迹距离。EMD和DTW均以缺失感知的方式计算,仅限制在根据真实或生成掩码标记为观测的时间点上进行比较。

总体而言,增量条件生成的合成数据与真实数据的一致性略好:平均EMD和DTW低于无条件设置,且更接近真实对真实参考。相比之下,合成缺失率始终低于观测到的缺失率,表明模型仍低估了未观测测量的频率,缺失生成过程有待改进。最后,我们注意到这些结果应被视为模型的初步证据,即它捕捉了耦合的生理-采样过程的重要方面,而不是下游临床实用性的完整验证。在扩展工作中,我们评估生成的合成数据如何用于训练先验数据拟合网络,以在分布偏移下进行插补和预测,同时显式利用信息性缺失。

参照图注

图1:真实与合成对比:(A)血红蛋白和(B)白细胞计数单变量密度;(C)使用所有26个通道(实验室+掩码)的窗口UMAP嵌入,基于500个真实窗口和500个合成窗口的随机子样本计算。

## 4 结论

这项初步工作展示了如何调整TimeDiff以生成实验室轨迹,同时在源自MIMIC-III的公共基准上联合建模信息性缺失。通过实用的预处理,模型生成的合成窗口在边际实验室分布以及值和缺失掩码的联合结构方面与真实数据高度匹配。我们的结果表明,扩散模型是在类似MNAR缺失下进行真实合成实验室生成的有前途的基础,并激励在基础模型中利用学习到的生成先验进行下游推断和预测的未来工作。

## 5 致谢

Hadi Mehdizavareh 和 Arijit Khan 感谢诺和诺德基金会资助(NNF 22OC0072415)。

## 参考文献

- [1] Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. In: Proceedings of the 34th International Conference on Neural Information Processing Systems (NeurIPS), pp. 6840–6851. Curran Associates, Inc., Red Hook, NY (2020)
- [2] Johnson, A.E.W., et al.: MIMIC-III, a freely accessible critical care database. Scientific Data 3, 160035 (2016)
- [3] Kazijevs, M., Samad, M.D.: Deep imputation of missing values in time series health data: A review with benchmarking. Journal of Biomedical Informatics 144, 104440 (2023)
- [4] Li, J., Yan, et al.: Imputation of missing values for electronic health record laboratory data. npj Digital Medicine 4(1), 14 (2021)
- [5] Luo, Y.: Evaluating the state of the art in missing data imputation for clinical data. Briefings in Bioinformatics 23(1), bbab489 (2022)
- [6] Tan, A.L.M., et al.: Informative missingness: What can we learn from patterns in missing laboratory data in the electronic health record? Journal of Biomedical Informatics 139, 104306 (2023)
- [7] Tian, M., et al.: Reliable generation of privacy-preserving synthetic electronic health record time series via diffusion models. JAMIA Open 5(4), ooac229 (2022)
- [8] Xiao, C., Choi, E., Sun, J.: Opportunities and challenges in developing deep learning models using electronic health records data: a systematic review. Journal of the American Medical Informatics Association 25(10), 1419–1428 (2018)
- [9] Yang, Y., et al.: A survey on diffusion models for time series and spatio-temporal data. ACM Computing Surveys 58(8), 196:1–196:39 (2026)
- [10] Cichosz, S.L., et al.: Biases in glucose metrics are directly related to low coverage of continuous glucose monitoring: insights from diverse populations. Diabetes Technology & Therapeutics 28(2), 180–184 (2026).
- [11] Farahani, M.A., et al.: Time-series forecasting in smart manufacturing systems: An experimental evaluation of the state-of-the-art algorithms. Robotics and Computer-Integrated Manufacturing 95, 103010 (2025).
- [12] Müller, S., et al.: Transformers can do Bayesian inference. In: International Conference on Learning Representations (ICLR) (2022).

相似文章

用于交互式放射学报告起草的离散扩散语言模型

arXiv cs.AI

本文改编了一种扩散语言模型用于交互式放射学报告起草,表明其在准确性上与自回归模型相当,同时提供独特的填充能力,使放射科医生能够修复报告片段并让模型填充它们之间的文本。