Timesynth: 健康信号数字孪生的时间保真度框架
摘要
Timesynth 引入了一个用于健康信号数字孪生的受控基准测试框架,包括一个生理信号生成器和诊断工具来评估时间保真度,揭示了逐点指标无法捕捉预测模型中的相位和频率失真。
查看缓存全文
缓存时间: 2026/07/02 05:38
# Timesynth:健康信号数字孪生的时序保真度框架 来源:https://arxiv.org/html/2607.00431 \[3\]\\fnmWarren Woodrich\\surPettine 1\]\\orgdivScientific Computing and Imaging Institute,\\orgnameUniversity of Utah,\\orgaddress\\citySalt Lake City,\\postcode84112,\\stateUT,\\countryUSA 2\]\\orgdivKahlert School of Computing,\\orgnameUniversity of Utah,\\orgaddress\\citySalt Lake City,\\postcode84112,\\stateUT,\\countryUSA \[3\]\\orgdivDepartment of Psychiatry,\\orgnameUniversity of Utah,\\orgaddress\\citySalt Lake City,\\stateUT,\\countryUSA ###### 摘要 健康信号数字孪生的预测模型必须保留生理信号的振荡、频率、相位和状态跃迁动态,然而,用于基准测试这些模型的逐点指标无法检测到这些基本属性何时丢失。我们证明,这一盲区会导致模型排名错误:在11种架构中,具有可比逐点误差的模型在相位精度上的差异可达 $53^\circ$,相当于1.2 Hz心脏节律的约123 ms,而标准指标无法捕捉这一差异。为了支持开发能够避免此类失败的模型,我们引入 **TimeSynth**,一个受控基准测试框架,包含两个可重用组件:一个生理学基础生成器,通过拟合真实脑电图、心电图和光电容积描记信号的参数模型,生成具有解析已知真实动态的信号;以及一组诊断指标,用于量化幅度、频率、相位和状态跃迁保真度。线性模型和全序列注意力模型在幅度误差可接受的情况下,系统性地丢失频率和相位信息,而具有局部时序结构的架构能更好地保留动态保真度并适应可观测的状态跃迁;然而,没有一个模型能可靠地保留随机切换。由于保真度的主导决定因素是架构特性,模型选择从寻找单一优胜者转变为基于用例驱动原则的决策。因此,TimeSynth 提供了在模型耦合到患者数据之前,临床前压力测试所缺失的受控评估,并提供了可重用的生成器和保真度感知开发诊断工具。 ###### 关键词:数字孪生、预测模型、生理信号、状态变化 ## 1 引言 预测生理时间序列支撑着从连续患者监测和早期预警系统到新兴健康信号数字孪生[li2025advancing,sarani2026technologies,sadee2025medical]等一系列应用:这些患者特定的计算系统,持续更新生理数据,旨在预测未来的生物状态[nasem2024]。在这些应用中,预测模型必须不仅仅是准确预测未来值。生理信号在其时序动态中编码了临床相关信息,包括振荡结构、频率成分、相位关系以及跨多时间尺度演变的生理状态跃迁[clifford2006advanced,tong1990non,sornmo2005bioelectrical]。一个模型如果能在数值上准确地再现未来值,却扭曲了这些动态,可能看起来数值准确,但无法保留其本该代表的生理行为。然而,现代预测模型通常使用逐点指标进行评估,如均方误差(MSE)和平均绝对误差(MAE)[zeng2023transformers,kim2025comprehensive],这些指标量化了预测值与观测值之间的数值一致性,但几乎无法揭示预测是否保留了振荡时序、频率演变或相位相干性[wang2024comprehensive,kim2025comprehensive]。因此,具有相似预测误差的模型可能以截然不同的方式表示底层过程:一个可能再现幅度但相位漂移,另一个可能保留主频但平滑了有临床意义的结构。这一问题因真实记录的动态特性通常未知而加剧;在没有真实幅度、频率和相位轨迹的情况下,无法区分由幅度失真、频率漂移和时序相干性损失引起的误差[zeng2023transformers,wang2024comprehensive]。总的来说,这些局限性在预测准确性和生理保真度之间造成了根本性的差距。 这一差距对健康信号数字孪生尤其重要。美国国家科学院、工程院和医学院(NASEM)将验证、确认和不确定性量化(VVUQ)视为数字孪生信任的关键[nasem2024],近期综述也指出,缺乏用于评估预测是否保留生理有意义行为(而非仅仅达到可接受的总体准确性)的框架[tudor2025scoping,sel2025vvuq]。仅凭临床数据无法解决这一问题:记录包含噪声、非平稳,且受多种交互过程影响[goldberger2000physiobank],而心律失常发作、癫痫演变和睡眠阶段转换等事件无法系统控制、重复或定位[obermeyer2016predicting]。因此,真实记录在分离单个动态属性与生理变异性的复杂性方面提供的机遇有限。 一种互补的方法是在受控环境中评估架构,其中相关的动态属性是已知的——这一策略在生物医学机器学习中有先例。当丰富标注的真实数据稀缺时,基于生理学的合成生成器已被用作支持性基础设施,例如最近的一个肌电数字孪生,它模拟大规模、完美标注的肌电图数据集来训练神经解码器[maksymenko2023myoelectric];在那里,合成真实值是贡献,而非局限。同时,严格的基准测试已反复表明,标题性指标具有误导性:一旦采用可重复、抗偏置的测试流程,最先进的癌症药物反应模型几乎无法胜过简单基线[bernett2026dreval];而在合成电子健康记录生成器中,没有一种方法在所有标准上最佳,因此生成器必须根据用例进行评估[yan2022multifaceted]。然而,现有的时间序列基准主要侧重于预测准确性,很少提供显式的真实动态;因此,该领域缺乏一个受控框架用于直接测量幅度、频率、相位和状态跃迁保真度,而非从聚合误差中推断。 为填补这一空白,我们引入 **TimeSynth**,一个用于评估生理预测中动态保真度的受控基准测试框架(图1)。合成信号从拟合真实心电图(ECG)、脑电图(EEG)和光电容积描记(PPG)记录的闭式参数模型生成,提供解析已知的幅度、瞬时频率和瞬时相位。该框架应用受控扰动,包括噪声污染、频率分布偏移、确定性状态跃迁和随机切换,并使用诊断指标分别量化幅度、频率、相位和状态跃迁保真度。 > 参见图注 > 图1:TimeSynth 支持对生理预测中动态保真度的受控评估。使用真实生理记录拟合参数信号模型,生成具有解析已知动态属性的合成时间序列。所得信号系列提供覆盖干净预测、噪声污染、频率分布偏移、确定性状态跃迁和随机切换的受控评估环境。来自多个模型家族的预测架构使用保真度诊断进行评估,分别量化幅度、频率、相位和状态跃迁的保留情况。信号生成器和保真度诊断共同实现对超越传统预测准确性指标的动态保真度的系统评估。 利用 TimeSynth,我们评估了来自四个模型家族的11种预测架构。我们证明,传统指标可能严重误判动态保真度:具有相似预测误差的模型在相位精度上差异可达 $53^\circ$。具有局部时序处理能力的架构(PatchTST[nie2022time] 和 MICN[wang2023micn])在噪声和分布偏移下最一致地保留相位和频率保真度,而 PatchTST 和 ModernTCN[luo2024moderntcn] 对可观测状态跃迁的适应速度最快;线性模型和全序列注意力模型尽管点对点准确性具有竞争力,但经常丢失相位和频率信息。然而,没有一种架构能可靠地保留随机切换。总之,这些发现揭示了当前预测架构在健康信号数字孪生中的系统性局限,并将 TimeSynth 确立为保真度感知评估的可重用基础设施——即在预测模型耦合到真实患者数据之前,VVUQ 差距所要求的受控临床前压力测试。 ## 2 结果 我们评估了11种预测架构,涵盖四个归纳偏差家族:线性(Linear、DLinear、FITS)、MLP类(MLinear、NBeats、FreMLP)、卷积和分块类(MICN、ModernTCN、PatchTST)以及全序列注意力类(Transformer、Autoformer)模型,作为候选健康信号数字孪生。每种模型在五种受控压力测试下进行测试,这些测试独立了生理预测的动态需求:干净重建、噪声污染、频率分布偏移、确定性状态跃迁和随机马尔可夫切换。架构原理及各家族假设详见方法部分。除非另有说明,与线性基线的成对比较采用经 Holm 校正的配对 t 检验;状态跃迁分析采用 Wilcoxon 符号秩检验(方法)。 ### 基于生理学的合成信号提供受控真实值 真实生物信号不暴露真实幅度、频率和相位轨迹,因此需要受控合成信号来测试预测是否保留这些动态,而不仅仅是匹配未来值[clifford2006advanced,sornmo2005bioelectrical]。因此,我们拟合闭式参数模型到三个公开数据集的记录中,并从所得经验参数分布采样新信号,产生幅度、瞬时频率和瞬时相位在每个时间点解析已知的信号(方法;补充表A1–A2)。拟合的模型家族重现了每种信号类型的主要形态。漂移谐波家族(源自 PPG-DaLiA[ppg] 的血容量脉搏片段)捕捉了外周心血管信号的准正弦形态,拟合频率集中在约1.0–1.1 Hz(与静息心率一致),漂移系数接近零(图2C)。单相位调制和双相位调制家族(源自 MIT-BIH 心律失常数据库[moody2001impact,goldberger2000physiobank])捕捉了 S-Q 间期平滑振荡基线,排除了违反正弦分解的尖锐 R 波瞬变,载波频率集中在约1.0 Hz(覆盖所有48个记录),调制与心率变异性一致(图2B)。双相位调制家族(拟合到 CHB-MIT 头皮脑电图数据库[shoeb2009application] 的 FP1-F7 通道)捕捉了主要皮质节律活动,同时容纳瞬态偏转(图2A)。表1将每种合成范式映射到其近似的生理现象,为整个研究中使用的临床前评估奠定基础。 > 参见图注 > 图2:参数模型拟合到真实生物信号,将合成评估建立在生理动态基础上。参数拟合(虚线)叠加原始记录(黑色),分别显示(A)脑电图(CHB-MIT,通道FP1-F7,10秒片段)、(B)心电图(MIT-BIH记录100,10秒片段,S-Q间期基线)和(C)PPG/血容量脉搏(PPG-DaLiA受试者S1,最佳拟合5秒片段)。拟合捕获了每种信号类型的主要振荡形态,同时提供幅度、频率和相位的闭式真实值。 > 表1:TimeSynth 中用于模拟生理事件及其对应的合成信号。 | 生理事件 | 合成信号 | |----------|----------| | [根据原文列表翻译] | [根据原文列表翻译] | (注:原文中表1内容未在提供的文本中完整给出,但根据上下文,应包含一系列生理事件与对应信号类型的映射。由于用户未提供具体内容,此处仅保留表结构,待补充。) ### 逐点准确性未能反映生理保真度 生理信号中的临床相关信息编码在振荡事件的时序和节律中,而非仅幅度,因此一个具有低预测误差但相位或频率跟踪失准的模型可能看起来可靠,却未能保留驱动数字孪生的动态。由于 MSE、MAE 及其归一化变体仅量化逐点幅度偏差,我们并行评估了三个互补的保真度维度:幅度、相位(时序失准)和频率(主导速率不匹配),各指标定义见方法部分。在全部11种模型和三个信号家族中,MAE 与相位误差之间存在强秩相关(漂移谐波、单相位、双相位信号的 Spearman ρ=0.93, 0.90, 0.97;均p<0.001),证实逐点误差捕获了粗略排序,但具有可比 MAE 的模型在保真度上仍存在显著差异(图3)。在可比 MAE 窗口内,线性家族模型的相位偏差超过50°,而卷积和分块类架构的相位误差低于10°(所有成对比较 p<0.05)。随着信号复杂性增加,差距从漂移谐波的Δ=28°扩大到单相位的46°和双相位信号的53°(约相当于1.2 Hz心脏节律下的123 ms),同时频率差距从0.008 Hz增长到0.05 Hz;在可比 MAE 窗口外,全序列注意力模型的频率偏差可达0.20 Hz。因此,逐点指标仅能近似对模型排序,无法分辨生理预测所需的动态量。后续分析将分别评估五个压力测试下的每个保真度维度。 > 参见图注 > 图3:逐点准确性近似对模型排序,但无法分辨具有可比 MAE 的模型之间的相位和频率差异。漂移谐波信号(a,c,e)和单相位调制信号(b,d,f)上的中位 MAE 与中位绝对相位误差(左列:a,c,e)及中位绝对频率误差(右列:b,d,f)。点按架构家族颜色编码。黄色带标记可比 MAE 窗口(MAE 值的中央60%);水平彩色线表示各家族在该窗口内的平均保真度误差,红色箭头表示家族级差距。误差指标定义见方法部分。 ### 局部架构在干净信号上保留振荡结构 我们首先询问在没有扰动的情况下,哪些家族能保留振荡结构——这是任何可靠数字孪生候选必须通过的基线。在最困难的信号(双相位调制)上,家族之间出现显著分离(图4a,b)。MICN\_Regre (+58.60°)、 [注:原文在图4a,b的描述处中断,后续内容未在提供的文本中完整呈现。根据结构,应继续阐述各架构在干净信号上的表现。由于用户提供的文本截至此处,翻译也相应结束。]
相似文章
DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series
DoTime is a synthetic benchmark generator for interventional and counterfactual time series, providing scalable TSCM-based data generation with exact ground truth, released as a PyPI package with evaluation suites. It enables training and benchmarking causal foundation models on non-observational time series data.
生成模型能否把握时间?合成顺序表格数据的时间感知评估
本文提出了一种基于分类学引导的评估协议,用于评估合成顺序表格数据的时间保真度,揭示了传统评估忽略了时间上的失败,并且考虑时间因素后排名结果存在显著差异。
迈向混沌理论平衡与潜在动力学的生理信号世界建模
介绍NormWear-2,一种将多变量生理信号和临床干预编码到共享潜空间的世界模型,利用混沌理论平衡改进长期预测,涵盖日常生活、即时护理和临床环境。
TS-Fault:针对结构性故障的时间序列预测器基准测试
本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。
基于表格基础模型的统一且数据高效的预测与健康管理
本文提出一个框架,将表格基础模型应用于工业时间序列的预测与健康管理,在多个PHM任务上展示了强大的性能和高效的数据利用率。