迈向混沌理论平衡与潜在动力学的生理信号世界建模

arXiv cs.LG 论文

摘要

介绍NormWear-2,一种将多变量生理信号和临床干预编码到共享潜空间的世界模型,利用混沌理论平衡改进长期预测,涵盖日常生活、即时护理和临床环境。

arXiv:2605.15465v1 公告类型:新 摘要:生理时间序列信号反映了人体复杂、多尺度的动力学过程。现有建模研究集中于静态任务,如分类、事件预测或短时域下一步预测,而长时域信号级预测及生理信号的预测性尚未得到充分探索。我们提出NormWear-2,一种世界模型,将多变量生理信号和临床干预变量编码到共享潜空间,并将其联合时间演化建模为动力系统。我们的方法结合了来自预训练知识的推理(直觉)与即时的非参数潜状态转移适应(洞察),从而在异构临床干预条件下实现跨多个时间尺度的连贯预测。在预训练阶段,我们发现混沌理论平衡动力系统多样性可生成更鲁棒的表示,较小的平衡语料库优于其两倍大小的非平衡语料库,并捕捉到分岔状态。我们在多种真实世界生理数据集上评估世界模型性能,这些数据集涵盖异构时间分辨率和干预方案,包括日常生活、即时护理和临床环境,如健身规划、血液透析、糖尿病管理和手术监测。这些评估数据集包含来自8,026名受试者的记录,研究时长从高分辨率信号数据的3.2小时到纵向临床生物标志物追踪的2.3年不等。NormWear-2在时间、频率和潜表示域均取得最佳整体预测性能,显著优于最先进的时序基础模型,同时保持有竞争力的下游表示质量,为通用生理信号世界模型提供了关键一步。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:41

# 面向生理信号的世界模型:基于混沌理论平衡与潜在动力学

来源: https://arxiv.org/html/2605.15465

Yunfei Luo¹²²\* Xi Chen¹ Yuliang Chen¹,² Lanshuang Zhang¹ Md Mofijul Islam³ Siwei Zhao⁴ Peter Kotanko⁵,⁶ Subhasis Dasgupta¹ Andrew Campbell² Rakesh Malhotra¹ Tauhidur Rahman¹

1加州大学圣地亚哥分校  
2达特茅斯学院  
3亚马逊云服务  
4桑德林肾脏服务  
5肾脏研究所  
6西奈山伊坎医学院  

![[无说明图片]](https://arxiv.org/html/2605.15465v1/logos/huggingface_logo-noborder.png)

NormWearCollection: mosaic-laboratory/normwear (https://huggingface.co/collections/mosaic-laboratory/normwear)

###### 摘要

生理时间序列信号反映了人体复杂、多尺度的动力学过程。现有建模研究集中于静态任务,如分类、事件预测或短期下一步预测,而长期信号层面预测及生理信号的预测本质仍探索不足。我们提出**NormWear-2**,一种世界模型,它将多变量生理信号和临床干预变量编码到共享潜在空间中,并将其联合时间演化建模为动力学系统。我们的方法结合了来自预训练知识的推理(*直觉*)与即时非参数潜在状态转移自适应(*洞察*),从而在异质临床干预条件下实现跨多个时间尺度的连贯预测。在预训练阶段,我们发现基于混沌理论平衡动力学模态多样性能够产生更鲁棒的表示,一个更小的平衡语料库性能优于两倍规模的不平衡语料库,并能捕捉分岔模态。我们在多个真实世界生理数据集上评估了世界模型的性能,这些数据集覆盖异质时间分辨率和干预机制,包括日常生活、即时检验和临床场景,涵盖健身规划、血液透析、糖尿病管理和手术监测。这些评估数据集包含来自8,026名受试者的记录,跨度从高分辨率信号数据的3.2小时到纵向临床生物标志物追踪的2.3年。NormWear-2在时间、频率和潜在表示域中均取得了最佳的整体预测性能,相较于最先进的时间序列基础模型有显著提升,同时保持具有竞争力的下游表示质量,为通用生理信号世界模型迈出了一步。

请参考图注  
图1:方法论。(A) 从输入信号到预训练和预测输出的建模流程概览。(A.1.) 提出的直觉-洞察推理路径。(B) 标准掩码与重建预训练后生成式预测逻辑的演示。(C) 跨多个时间分辨率和性能指标的多维评估。

## 1 引言

生理信号提供了进入人体内部动力学的连续、无创窗口。脑电图(EEG)、心电图(ECG)和光电容积描记图(PPG)等模态编码了从毫秒到小时的丰富时间模式。这些信号本质上由复杂的动力学系统生成,但大多数机器学习方法将其视为静态输入用于分类、回归或异常检测等下游任务 (Pillai 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib31); Lee 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib1); Luo 等, 2024a (https://arxiv.org/html/2605.15465#bib.bib13))。因此,它们缺乏推理未来轨迹、模拟替代情景或适应变化的生理状态的能力。更广泛地说,现实世界的多变量时间序列通常来自表现出多样动力学行为的系统,范围从准周期和极限环模式到弱或强混沌模态 (Strogatz, 2024 (https://arxiv.org/html/2605.15465#bib.bib56); Wu 等, 2021 (https://arxiv.org/html/2605.15465#bib.bib24); Tan 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib23); Lai 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib14))。观测到的时间序列差异常常反映可预测性、对初始条件的敏感性和结构复杂性的变化,而非根本不同的生成机制。捕捉这种非线性动力学对于学习能够跨系统和领域泛化的表示至关重要。近年来的表示学习进展改善了通用时间序列建模的性能 (Ansari 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib51); Liu 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib15); Lai 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib14); Gilpin, 2021 (https://arxiv.org/html/2605.15465#bib.bib25))。然而,这些工作在预训练基础模型时并未明确研究底层动力学模态的分布。这不仅削弱了我们对模型学习和推理行为的理解,也限制了所学表示的鲁棒性和可迁移性。此外,这些方法在涉及干预变量的生理信号和数字健康应用中的可行性仍探索不足。为解决这些挑战,我们提出 NormWear-2,一个用于生理信号潜在世界模型的框架,简要演示如图1 (https://arxiv.org/html/2605.15465#S0.F1) 所示。该模型将多模态时间序列编码到共享潜在空间中,其中时间演化被建模为动力学系统,结合两种互补机制:(1) **直觉**,从大规模预训练中捕获生理动力学的先验知识;(2) **洞察**,通过即时非参数无监督自适应细化潜在状态转移。这种双重机制能够在适应新观察和新上下文的同时,实现连贯的多步预测和生成式建模。在建模探索中,我们还发现潜在世界模型的有效性取决于预训练数据中动力学模态的多样性。利用混沌启发度量,如 Lyapunov 指数、去趋势波动分析和持久熵 (Wolf 等, 1985 (https://arxiv.org/html/2605.15465#bib.bib39); Hu 等, 2001 (https://arxiv.org/html/2605.15465#bib.bib41); Atienza 等, 2019 (https://arxiv.org/html/2605.15465#bib.bib42)),我们量化了时间序列的动力学特性,并构建了在不同动力学行为上具有平衡覆盖的预训练语料库。实验表明,在动态平衡数据集上预训练的模型产生更鲁棒和可迁移的表示,支持下游预测和生成任务。最后,我们引入一个多维评估框架,从时间、频率和潜在表示域评估预测质量。在多个真实世界生理数据集上的实验表明,NormWear-2 实现了准确且一致的多尺度预测,突显了潜在动力学建模在生理信号预测性世界模型中的潜力。

## 2 相关工作

在生理领域,大部分方法——从任务特定架构 (Foumani 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib21); Wang 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib22); McKeen 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib38)) 到预训练表示 (Luo 等, 2024a (https://arxiv.org/html/2605.15465#bib.bib13))——都强调用于下游任务的监督或自监督表示学习,而非显式的时序动力学建模用于预测或模拟。这限制了它们在干预条件下支持预测推理的能力。动力学系统方法,包括状态空间和潜在变量模型,为建模时间演化提供了原则性框架 (Wang 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib60))。近年来,世界模型和潜在预测学习强调学习结构化表示用于预测 (Maes 等, 2026 (https://arxiv.org/html/2605.15465#bib.bib58); Nam 等, 2026 (https://arxiv.org/html/2605.15465#bib.bib59))。从建模角度看,现有世界建模方法大致可分为基于生成的方法 (Ansari 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib51); Lai 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib14); Liu 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib15)) 和联合嵌入预测架构(JEPA)(Maes 等, 2026 (https://arxiv.org/html/2605.15465#bib.bib58))。生成方法显式建模未来轨迹的条件分布。近期的时间序列基础模型 (Das 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib18); Rasul 等, 2023 (https://arxiv.org/html/2605.15465#bib.bib20); Woo 等, 2024 (https://arxiv.org/html/2605.15465#bib.bib19); Wu 等, 2021 (https://arxiv.org/html/2605.15465#bib.bib24)) 为该范式提供了强大骨干,但模型在不同时间分辨率下的推理行为,以及将此类模型应用于涉及干预变量的生理信号预测(也称为世界建模或生理模拟)的可行性,仍基本未被探索。相比之下,JEPA 方法 (Fox 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib69)) 主要侧重于学习预测表示,并在生理领域被探索用于改进下游推理任务,而非信号层面的预测准确性。因此,本工作填补了这些研究空白,并提出了一种完善的端到端方法论,用于生理学和数字健康领域的世界建模。

## 3 方法

### 3.1 问题设定

根据 Maes 等 (2026 (https://arxiv.org/html/2605.15465#bib.bib58)); Hu 和 Shu (2023 (https://arxiv.org/html/2605.15465#bib.bib61)) 的定义,世界模型是指一个维持对世界内部理解的模型,能够根据当前和过去的观测预测未来轨迹。在生理信号建模领域,这种范式尚未充分探索,如引言和相关工作所述。在数字健康背景下,我们将世界模型定义为动力学系统,通常表述为  \(\mathbf{x}_{t+1}=f_{\theta}(\mathbf{x}_{\leq t},\mathbf{u}_{\leq t})\),其中 \(\mathbf{x}_{t}\) 表示系统状态,\(\mathbf{u}_{t}\) 表示在时间 \(t\) 的动作或干预。在生理信号背景下,我们将此表述实例化为一个**多变量时间序列系统**,其中生理测量和干预都随时间演化。这自然引出一个条件预测公式:\(p_{\theta}(\mathbf{x}_{t+1:t+H}\mid\mathbf{x}_{\leq t},\mathbf{u}_{\leq t+H})\),其中 \(H\) 表示预测视界。在此观点下,医疗健康中的世界建模变成了一个通道条件化的多变量时间序列预测问题,因为在许多临床场景中,干预本质上是时间性的,可以直接与生理信号对齐。例如,在外科手术环境中,机器控制参数如呼吸和麻醉给药是与生理变量同步演化的连续时间序列。类似的模式出现在透析和其他重症监护场景中。对于基于事件的干预,如糖尿病管理中的胰岛素给药或进食,我们将其转换为阶跃函数表示序列,其中非零值跨越事件持续时间。更抽象的生活方式因素,如身体活动,可在数据预处理期间通过预训练语言模型 (Alsentzer 等, 2019 (https://arxiv.org/html/2605.15465#bib.bib70)) 编码到有限语义空间中,然后以与基于事件的干预相同的方式进行变换。这些策略使得在多样化的医疗场景中能够统一表示异质干预的时间序列。

表 1:评估数据集。表格中的时间跨度指每个受试者数据的平均时间跨度。每个数据集的附加信息见附录A (https://arxiv.org/html/2605.15465#A1)。

| 数据集 | 受试者数量 | 时间跨度 | 尺度与范围 | 生理信号 | 干预变量 |
|--------|------------|----------|------------|----------|----------|
| VitalDB (Lee 等, 2022 (https://arxiv.org/html/2605.15465#bib.bib62)) | 6,388 | 3.2 小时 | 毫秒级,可穿戴与医疗设备传感 | ECG, PPG, EEG, 呼吸 | 瑞芬太尼目标浓度、吸入氧分数、新鲜气体流量 (L/min)、吸气时间 (s)、呼吸频率、潮气量 (mL) |
| PMData (Thambawita 等, 2020 (https://arxiv.org/html/2605.15465#bib.bib65)) | 16 | 5 个月 | 分钟级,运动腕带传感 | 心率、步数、距离、卡路里 | 生活方式运动,例如跑步、足球、力量训练等 |
| CGMacros (Gutierrez-Osuna 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib67)) | 45 | 10.9 天 | 分钟级,生物流体传感 | 血糖、心率、身体运动 | 食物营养组成 |
| 上海糖尿病 (Zhao 等, 2023 (https://arxiv.org/html/2605.15465#bib.bib66)) | 125 | 10.7 天 | 一刻钟级,生物流体传感 | 血糖、心率 | 胰岛素、降糖药 |
| 肾脏透析 (Luo 等, 2024b (https://arxiv.org/html/2605.15465#bib.bib63)) | 1,452 | 2.3 年 | 小时级,医疗设备传感 | 心率、血压、体温 | 血流速率、透析液流速、透析液温度、超滤速率 |

### 3.2 数据集

为了研究生理信号的世界模型,我们需要多变量、纵向且包含显式动作/干预变量的数据集。我们利用五个真实世界生理数据集进行核心方法评估:VitalDB (Lee 等, 2022 (https://arxiv.org/html/2605.15465#bib.bib62))、PMData (Thambawita 等, 2020 (https://arxiv.org/html/2605.15465#bib.bib65))、上海糖尿病 (Zhao 等, 2023 (https://arxiv.org/html/2605.15465#bib.bib66))、CGMacros (Gutierrez-Osuna 等, 2025 (https://arxiv.org/html/2605.15465#bib.bib67)) 和一个临床肾脏透析(KidneyDialysis)数据集 (Luo 等, 2024b (https://arxiv.org/html/2605.15465#bib.bib63))。这些数据集的核心属性总结在表1 (https://arxiv.org/html/2605.15465#S3.T1) 中。具体而言,VitalDB 是围手术期监测数据集,包含手术患者的生理信号和麻醉机参数。PMData 是可穿戴健康数据集,包含日常生命监测的心率、活动、睡眠和运动记录。CGMacros 是糖尿病数据集,包含血糖监测、膳食记录和活动信息,用于个性化营养分析。上海糖尿病是真实世界糖尿病数据集,包含血糖记录、药物、胰岛素和饮食信息。KidneyDialysis 数据集是血液透析数据集,包含治疗期间的生理信号和透析机参数。总体而言,这些数据集覆盖了包括临床监测、日常健康管理、即时检验治疗和临床治疗在内的代表性医疗场景,提供了多样的生理观测和干预变量,使其非常适合评估医疗健康世界模型。对于下游任务,我们遵循相同的评估设置

相似文章

一种基于Latent ODE的电影心脏磁共振时空建模方法

arXiv cs.AI

本文提出了一种潜在动态模型,使用心率感知的神经ODE和基于图的网格自编码器,对电影心脏磁共振中的全周期心室运动进行建模。该模型应用于72,386名英国生物样本库参与者,在心衰风险预测方面优于传统心脏标志物。

Timesynth: 健康信号数字孪生的时间保真度框架

arXiv cs.LG

Timesynth 引入了一个用于健康信号数字孪生的受控基准测试框架,包括一个生理信号生成器和诊断工具来评估时间保真度,揭示了逐点指标无法捕捉预测模型中的相位和频率失真。

Valdi: 价值扩散世界模型

Hugging Face Daily Papers

Valdi 将端到端在线训练与潜在扩散动态相结合,用于强化学习中的模型预测控制,实现快速且能处理不确定性的动态预测,并在 CarRacing 环境中展示了初步结果。