EpiFlow:一种改进废水信号在疾病预测中效用的框架

arXiv cs.LG 论文

摘要

本文介绍了EpiFlow,一个通过处理废水信号、分析其与医院负担指标的关系并将其纳入时变预测模型来改进基于废水的疾病预测的框架。作者表明,纳入废水病毒载量可改善COVID-19住院预测,尤其是在低流行期。

arXiv:2608.06671v1 公告类型:新提交\n摘要:基于废水的监测是疾病监测的有效工具,可提供疫情暴发的早期预警。尽管废水病毒载量(WVL)与疾病负担相关,但其在改善实时预测方面的效用仍在研究中。在疫情早期阶段,许多指标可以有效监测疾病传播,但由于报告疲劳和低流行率,其可靠性可能下降。即使在低流行期,医院负担也可能出现显著变化,因此准确预测负担指标对于最大程度减少疾病影响至关重要。\n 在本文中,我们提出了处理废水数据、表征其与负担指标的关系以及生成实时预测的原则性方法。我们使用熵度量评估WVL的可预测性。我们使用能够捕捉时间动态和WVL先行指标行为的因果检验来分析WVL与负担指标之间的关系。我们将这些见解纳入一个考虑信号之间不断演变关系的时变预测模型。我们还通过模拟评估WVL报告延迟的影响。\n 我们通过预测弗吉尼亚州及其各卫生区域在不同疾病流行期的COVID-19住院人数来检验我们方法的效用。与基线模型相比,纳入WVL提高了预测准确性,尤其是在关键疫情阶段,预测覆盖率提高了20个百分点。我们的结果表明,即使在低流行率或延迟报告的条件下,WVL信号也能改善传染病预测。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:02

# EpiFlow:改善废水信号在疾病预测中效用的框架  
来源:https://arxiv.org/html/2608.06671

††¹弗吉尼亚大学生物复杂性研究所(Biocomplexity Institute, University of Virginia)  
²弗吉尼亚大学计算机科学系(Department of Computer Science, University of Virginia)  
³弗吉尼亚州卫生部(Virginia Department of Health)  
⁴总务部综合实验室服务处(Department of General Services, Division of Consolidated Laboratory Services)  
⁵美国国防部生物防御研究员,五角大楼(Biodefense Fellow, US Department of Defense, Pentagon)  
⁶奥多明尼昂大学土木与环境工程系(Department of Civil and Environmental Engineering, Old Dominion University)  
∗通讯作者:[email protected], [email protected]

Jingyuan Chou¹,², Gursharn Kaur¹, Andrew Warren¹, Srinivasan Venkatramanan¹, Baltazar Espinoza¹, Bryan Lewis¹, Justin Crow³, Alexandra Lorentz⁴, Rekha Singh⁵,⁶, and Madhav Marathe¹,²,∗

###### 摘要

基于废水的监测是疾病监测的有效工具,能够提供疫情的早期预警。虽然废水病毒载量(WVL)与疾病负担相关,但它们在改进实时预测方面的效用仍在研究之中。在疫情早期阶段,许多指标能有效监测传播,但随着监测疲劳和低流行率的影响,其可靠性可能下降。即使在低流行期,住院负担也可能变化显著——因此,对负担指标进行准确预测对于最小化影响至关重要。在本文中,我们提出了处理废水数据、理解其与负担指标关系以及生成实时预测的原则性方法。我们使用熵度量评估WVL的可预测性。我们通过能够捕捉时间动态和WVL领先指标行为的因果检验,分析WVL与负担指标之间的关系。我们将这些见解纳入一个随时间变化的预测模型,该模型考虑了信号之间不断演变的关系。我们还通过模拟测试了WVL报告延迟的影响。我们通过预测弗吉尼亚州及其各卫生区域在不同流行期的COVID-19住院人数来检验我们方法的实用性。将WVL纳入模型可提高相对于基线模型的预测准确性,尤其是在关键阶段,我们观察到预测覆盖率提高了20个百分点。我们的结果表明,即使在低流行率或报告延迟的条件下,WVL信号对传染病预测仍然重要。

###### 关键词:基于废水的流行病学、预测、生物监测、向量自回归模型、排列熵、因果检验、去噪

## 1 引言

基于废水的监测已成为临床监测传染病的重要补充,因为它能够捕获有症状和无症状人群中的感染,同时较少受就医行为的影响[nwss,national2023phase1]。然而,废水病毒载量(WVL)信号受到噪声和不确定性的影响,这些不确定性源于汇水区人口变化、脱落动态、流速、稀释、废水性质、环境条件和采样策略[bertels2023time,greenwald2021tools,mohring2024estimating]。这些不确定性使得直接使用WVL对住院人数等负担指标进行实时预测变得复杂。检验废水效用的一种有效方式是,看它能否在仅使用负担指标的模型基础上改善疾病负担预测。随着COVID-19向低流行率和后公共卫生紧急状态时期过渡,临床检测行为发生了显著变化,WVL的信噪比可能下降,这一问题尤为重要[burki2023ends,emergency_term]。尽管多项研究表明,SARS-CoV-2废水浓度可领先于报告病例和住院人数[fen2021evaluation,phan2023simple,weidhaas2021correlation,jiang2022artificial,duvallet2022nationwide,keshaviah2022separating,nattino2022association,zhan2022relationships,kaplan2021aligning,galani2022sars,peccia2020measurement],但NASEM第二阶段报告强调,将废水数据用于运营性实时预测仍处于早期阶段,需要改进数据质量和整合方法[national2024increasing]。在此,我们提出*EpiFlow*,一个用于提高废水信号实时预测效用的集成框架。EpiFlow结合了数据预处理、信号质量分析、动态关系评估和概率预测。该框架将汇水区(sewershed)级别的WVL转换为病毒活动水平(VAL),使用排列熵评估信号的内在可预测性,使用滚动窗口格兰杰因果(RWGC)分析废水与负担指标之间的时变依赖关系,并使用滚动向量自回归(VAR)模型生成概率预测。该框架还评估了废水报告延迟的影响,这种延迟通常源于采样和检测工作流程。

##### 结果总结。我们使用2021年10月至2023年12月弗吉尼亚州五个卫生区域及州级的SARS-CoV-2废水数据和COVID-19住院人数来演示EpiFlow框架。预测结果以加权区间得分(WIS)和预测覆盖率与ARIMA和ARIMAX基线进行比较,这两者是流行病预测中的标准指标[bracher2021evaluating,mathis2024evaluation]。我们的结果表明,废水衍生指标可以改善概率预测,尤其是在去噪并通过时变VAR动态建模后。这种改善在激增期最为显著,并且即使在废水报告延迟的情况下仍然有用。

## 2 相关工作

基于废水的流行病学已被用于追踪SARS-CoV-2及其他病原体,多项研究显示废水浓度与病例、住院人数和死亡等临床指标之间存在关联[fen2021evaluation,phan2023simple,weidhaas2021correlation,jiang2022artificial,duvallet2022nationwide,keshaviah2022separating,nattino2022association,zhan2022relationships,kaplan2021aligning,galani2022sars,peccia2020measurement]。该领域使用的统计和数据驱动模型包括ARIMA、VAR、广义可加模型、负二项模型、贝叶斯滤波器、状态空间模型、半机制模型、随机森林、最近邻方法和神经网络[karthikeyan2021high,zhao2022five,cao2021forecasting,galani2022sars,chen2024wastewater]。然而,其中一些研究仅限于较短时间范围,且多在大流行早期阶段开展,并局限于单个或少数几个采样频率较高(每日、每周三次等)的汇水区。一个反复出现的挑战是,WVL信号噪声大且异质性强,这可能降低可解释性和预测性能。已有工作使用贝叶斯平滑、信号处理和状态空间方法来减轻不确定性并恢复稳定的时间趋势[dai2022statistical,greenwald2021tools,mohring2024estimating]。最近的废水研究进一步强调使用动态和状态空间模型来处理缺失观测、评估全市趋势以及废水浓度与感染之间的时变关系[CDCWastewaterForecast2024,ensor2025nonlinear,sun2025uncovering]。与主要关注点预测或高流行期的研究不同,EpiFlow评估废水信号是否能在异质区域以及公共卫生紧急状态(PHE)和PHE后时期改善实时概率预测。本文引用的参考文献并非详尽列表。我们建议读者参阅SIA(https://arxiv.org/html/2608.06671#A1)和Chen-Chen等人[chen2024wastewater]以获取基于废水的流行病学中各种方法和模型的详细综述。

## 3 EpiFlow框架与方法

EpiFlow分为三个模块,以应对处理废水数据和负担指标时遇到的若干挑战:数据预处理、信号分析和预测(图1(https://arxiv.org/html/2608.06671#S3.F1))。预处理模块在空间上对齐废水和住院信号,并对废水信号进行去噪;信号分析模块量化废水的可预测性及其与负担指标的动态关系;预测模块生成概率预测。

图 1:EpiFlow框架总览。该框架由数据预处理、信号分析和预测模块组成。

### 3.1 数据预处理与信号构建

#### 3.1.1 数据准备

废水和住院人数数据首先在时间上对齐到周分辨率。每日住院人数汇总为每周计数,并分配到相应流行病学周的开始。对于废水病毒载量(WVL)测量,每周一次的样本分配到相应周;当一周内有两个样本时,我们计算对数转换后病毒浓度的平均值,并将结果值分配到该周。缺失值使用最近一次可用观测的前向填充进行插补。包含连续四个以上缺失值的数据源被排除在分析之外。空间对齐在弗吉尼亚州卫生区域级别进行。住院人数按服务于各区域的设施汇总,而汇水区级别的WVL信号按照NWSS规定的归一化方法转换为病毒活动水平(VAL)[nwss](参见SIC.1(https://arxiv.org/html/2608.06671#A3.SS1))。区域VAL计算为服务于该区域各汇水区VAL的中位数。由此产生每周配对的住院人数时间序列,记为 $h(t)$,以及废水衍生病毒活动时间序列,记为 $v(t)$。

#### 3.1.2 去噪与Savitzky–Golay滤波器选择

由于WVL和VAL信号可能包含由采样变异性、汇水区异质性、流量效应和报告不规则性引起的高频波动,我们还额外分析了去噪后的VAL信号,记为VAL-dn。去噪使用Savitzky–Golay(SG)滤波器完成,该滤波器通过在移动窗口内局部拟合低阶多项式,并在中心点处评估拟合多项式来平滑时间序列[schafer2011savitzky,krishnan2012selection]。SG滤波器由两个参数控制:多项式阶数 $m$ 和滤波器窗口长度 $L$。为选择实用的去噪配置,我们遍历了候选多项式阶数 $m \in \{1,2,3\}$ 和候选滤波器长度 $L \in \{1,3,\ldots,11\}$(仅奇数)。对于每个候选组合 $(m,L)$ 和每个区域VAL时间序列,计算滤波后信号,并使用均方误差(MSE)与原始信号进行比较。目标并非去除所有高频变异,而是找到一个能够在保留流行病学上有意义的变化的时序和幅度的同时减少短尺度噪声的滤波器。每次获得新观测时都会执行去噪。由于SG滤波器是零相位滤波器,我们在信号边界附近使用多项式插值而非显式填充,从而减少边缘伪影并保留最近观测的局部时间结构。有关SG滤波器的更多细节,请参见SIC.2(https://arxiv.org/html/2608.06671#A3.SS2)。

### 3.2 信号分析

#### 3.2.1 使用排列熵进行可预测性分析

排列熵(PE)用于量化废水和住院信号中的时间结构和内在可预测性[bandt2002permutation]。PE是一种无模型的序数不确定性度量,它总结了时间序列中秩序模式的出现频率。对于滚动窗口¹、嵌入维度 $d$ 和延迟 $\tau$,时间序列被映射为长度为 $d$ 的序数模式;然后对经验序数模式分布的香农熵按 $\log(d!)$ 进行归一化。我们将可预测性定义为 $1-\mathrm{PE}$,因此值越高表示序数结构越强、不确定性越低。在[scarpino2019predictability]中,PE被用于理解多种传染病时间序列的可预测性。传染病时间序列会受到观测误差的影响,这些误差引入了不确定性,并降低了信号中的冗余信息。通过基于滚动窗口的分析,观察到随着窗口长度的增加,信号的可预测性下降。这一重要观察表明,由于不确定性的存在,使用较长时段的时间序列(更多数据点)不一定有助于预测信号的未来值。研究表明,超过10−16周后,可预测性显著下降。

¹ 这里的窗口指固定长度的观测值序列。预测时域则指生成预测的未来时间长度。

##### 观测窗口。在我们的分析中,PE在滚动窗口内计算,使用嵌入维度 $d=3$ 和 $d=4$ 以及单位延迟 $\tau=1$。我们避免使用更高的嵌入维度,因为较短的滚动窗口包含的观测值太少,无法可靠估计所有 $d!$ 种序数模式。为确定适用于下游分析的滚动窗口长度,我们比较了从较短局部窗口到完整可用时间序列的候选窗口长度的平均可预测性。对于每个候选长度,在所有滚动窗口和位置上计算可预测性。然后使用Tukey诚实显著差异(HSD)检验在 $\alpha=0.05$ 水平下比较不同窗口长度之间的平均可预测性(参见SIF(https://arxiv.org/html/2608.06671#A6)),并选择最小的窗口长度——超过该长度后,增加窗口长度不再使平均可预测性产生统计学显著变化。该过程确定了一个窗口大小,能够在局部适应性与足够样本量之间取得平衡,以进行低熵和模型估计。

##### 基于排列的排列熵显著性检验。为了评估在相对较短窗口长度下观察到的PE是否反映非随机时间结构,我们使用随机打乱置换检验。对于每个滚动窗口,观测到的归一化熵 $H_{\mathrm{obs}}$ 与从 $B=500$ 条随机置换(打乱)替代序列中获得的经验零分布进行比较。置换保留了时间序列的边际分布,同时破坏了时间依赖性[Theiler1992,Good2005]。由于结构化信号的熵通常低于随机排序序列,我们使用单侧检验,经验 $p$ 值为 $p=\frac{1}{B}\sum_{b=1}^{B}\mathbb{I}\left(H^{(b)}\leq H_{\mathrm{obs}}\right)$,其中 $H^{(b)}$ 是第 $b$ 条打乱替代序列的PE。如果 $p<0.05$,则该特定窗口的PE值被认为是统计显著的。

### 3.3 滚动窗口格兰杰因果分析

在讨论用于捕捉住院人数 $h(t)$ 与VAL $v(t)$ 之间关系的方法之前,需要注意,废水病毒载量主要反映感染流行率,而住院人数代表发病率。因此,这两个信号可能表现出间接但可能对预测有用的关系。我们建议读者参阅SID(https://arxiv.org/html/2608.06671#A4)以获取详细描述以及概念性因果图。

相似文章

Recursive Flow Matching

Hugging Face Daily Papers

引入了 Recursive Flow Matching (RecFM),一种用于预测复杂时空动态的生成框架,以更少的步骤实现高保真度,并提高了准确性和速度,包括相比基于扩散的模拟器高达20倍的加速。

HantaWatch:基于联邦学习的汉坦病毒基因组监测

arXiv cs.LG

HantaWatch 是一个用于汉坦病毒基因组监测的联邦学习框架,能够在不共享原始数据的情况下协作训练基于序列的模型,集成了k-mer特征提取和自适应优化,以支持风险筛查和专家优先排序。