机器学习与ARIMA模型平均在自适应公共卫生预测中的应用:比较评估与Ontario COVID-19案例研究
摘要
本文评估了机器学习和ARIMA模型在自适应公共卫生预测中的应用,使用Ontario COVID-19数据,并提出一种名为MLAMA的集成方法,以在不同条件下提升性能。
arXiv:2608.20406v1 Announce Type: new
Abstract: 公共卫生预测必须对监测数据中的突然变化做出响应,而不应过度外推噪声、报告伪影或临时趋势。我们使用190个每周观测数据评估了自回归综合移动平均(ARIMA)、随机森林和极端梯度提升(XGBoost)模型,这些数据来自2020年1月至2023年10月的公开Ontario COVID-19病例计数。在模型调整和评估期间,采用滚动起源时间序列交叉验证以保持时间顺序。性能评估涵盖三个操作维度:在选定转折点后的响应性、一至六周的预测范围以及历史训练数据量。我们还开发了机器学习与ARIMA模型平均(MLAMA),这是一种非负性能加权集成方法,其权重根据预测范围和响应性设置而变化。回顾性比较显示,ARIMA在转折点后能快速适应,但其归一化误差在较长范围内增加。随机森林和XGBoost在初始阶段响应性较低,但在较长范围内保持更稳定的归一化误差。在研究期末,对于两周预测,使用最近数据进行训练优于使用更长历史时期,特别是对于XGBoost。MLAMA在大多数预测范围内实现了最低的归一化平均绝对百分比误差,并在响应性设置中均排名为最佳性能方法之一。这些发现支持根据操作条件选择预测模型,而不是依赖单一的普遍优选方法。MLAMA为结合互补的统计和机器学习预测提供了一个实用框架。配套的Python包目前在私有仓库中维护,同时软件验证和可重复性测试正在进行中。
查看缓存全文
缓存时间: 2026/08/24 04:27
# 用于自适应公共卫生预测的机器学习与ARIMA模型集成:比较评估及安大略省COVID-19案例研究
来源:https://arxiv.org/html/2608.20406
Yushu Zou1,2, Ye Li1,2, Johra Moosa1, Martin Grunnill1, Samir N\. Patel1,3, Venkata R\. Duvvuri1,2,3,4
1安大略省公共卫生局,加拿大多伦多
2多伦多大学Dalla Lana公共卫生学院生物统计学系,加拿大
3多伦多大学实验室医学与病理生物学系,加拿大
4约克大学工业与应用数学实验室,加拿大
\(2025年7月\)
###### 摘要
**背景**:公共卫生预测必须对监测数据的突变作出响应,同时避免对噪声、报告假象或暂时性趋势进行过度外推。
**方法**:我们使用2020年1月至2023年10月间190个来自安大略省公开的每周汇总COVID-19病例数,评估了自回归积分滑动平均(ARIMA)、随机森林和极限梯度提升(XGBoost)模型。采用滚动起点时间序列交叉验证来调整和评估模型,同时保持时间顺序。我们从三个操作维度考察了模型性能:选定拐点后的响应性、1至6周的预测时界以及用于训练的历史数据量。随后,我们开发了机器学习与ARIMA模型集成(MLAMA),这是一种非负性能加权集成方法,其权重随预测时界和响应性设置而变化。
**结果**:在回顾性比较中,ARIMA在选定拐点后适应迅速,但其归一化误差在较长预测时界下增长更陡峭。随机森林和XGBoost的即时响应性较弱,但在较长时界下表现出更稳定的归一化误差。在研究期末的两周预测对比中,使用最近分析期数据训练比包含更早时期数据产生的误差更低,尤其是对于XGBoost。MLAMA在所绘制的预测时界内具有更低的归一化平均绝对百分比误差,并且在不同响应性设置下均属于误差最低的方法之列。
**结论**:研究结果支持根据具体操作条件选择公共卫生预测方法,而非选取单一普遍适用的模型。MLAMA为一个已实施的框架,用于结合互补的统计预测和机器学习预测。相关Python软件包目前存放在私有代码库中,同时进行密集的软件与可复现性测试。
**关键词**:公共卫生监测;时间序列预测;模型集成;ARIMA;随机森林;XGBoost;响应性;预测时界;COVID-19
## 1引言
传染病活动的及时预测有助于备灾、资源规划、态势感知和公共卫生应对。COVID-19大流行也暴露出持续存在的操作难题:监测序列可能受到报告延迟、检测实践变化、干预措施、行为反应、疫苗接种、新出现的变异株以及传播的突然变化等因素影响。在稳定期表现良好的预测方法可能在拐点处响应过慢,而高度响应的方法又可能对噪声或暂时性局部趋势进行过度外推。
统计时间序列模型如自回归积分滑动平均(ARIMA)模型可解释性强,且通常对短期预测有效,但在结构变化、非线性动力学或有影响力的观测下性能可能下降\[6 (https://arxiv.org/html/2608.20406#bib.bib6),1 (https://arxiv.org/html/2608.20406#bib.bib1),4 (https://arxiv.org/html/2608.20406#bib.bib4)\]。机器学习方法可以建模非线性关系和交互作用,但可能需要更多数据,对特征构建敏感,并且可能无法可靠地外推观测范围之外的时间结构\[7 (https://arxiv.org/html/2608.20406#bib.bib7),8 (https://arxiv.org/html/2608.20406#bib.bib8),9 (https://arxiv.org/html/2608.20406#bib.bib9)\]。这些互补特性激发了预测组合的动机:具有不同归纳假设的模型可以根据其观察到的样本外性能进行前瞻性评估和组合\[3 (https://arxiv.org/html/2608.20406#bib.bib3)\]。
现有的COVID-19预测研究已比较了统计方法、机器学习方法、机理方法和混合方法\[2 (https://arxiv.org/html/2608.20406#bib.bib2),11 (https://arxiv.org/html/2608.20406#bib.bib11),12 (https://arxiv.org/html/2608.20406#bib.bib12)\]。对于操作性的公共卫生监测,仅预测准确性是不够的。相关的操作特性包括:对变化趋势的响应性、对有影响力的观测的鲁棒性、跨预测时界的可靠性、对历史训练数据数量和相关性的敏感性,以及在近期信息不可用时的性能。
本研究有三个目标。首先,我们比较了ARIMA、随机森林和XGBoost在响应性、预测时界和训练历史深度方面的表现。其次,我们开发了机器学习与ARIMA模型集成(MLAMA),一种为候选模型分配特定条件权重的集成方法。第三,我们将回顾性分析扩展为一个连续的滚动工作流程,并在一个Python软件包中实现实时预测。本预印本报告了回顾性安大略省案例研究、MLAMA框架以及操作软件设计。
## 2方法
### 2\.1数据源和分析期
案例研究使用了从安大略省呼吸道病毒工具\[10 (https://arxiv.org/html/2608.20406#bib.bib10)\]获取的公开的安大略省(加拿大)每周确认COVID-19病例数。该序列覆盖2020年1月至2023年10月,包含190个每周观测值。仅使用汇总数据;未访问个体级记录。
对于回顾性评估,该序列被划分为三个宽泛的分析期:2020年2月–2021年2月、2021年3月–2022年2月以及2022年3月–2023年10月。这些区间用于在变化的流行病学和政策背景下创建时间上不同的训练和评估设置。它们并非旨在作为正式的基于变异株定义的流行波。
参照标题图1:安大略省每周汇总的COVID-19病例数及用于回顾性评估的三个宽泛分析期。
### 2\.2候选模型
初始实施包括三种候选预测方法:
- •ARIMA,从时间上允许的训练数据中选择自回归、差分和滑动平均阶数;
- •随机森林,一种装袋回归树集成方法\[7 (https://arxiv.org/html/2608.20406#bib.bib7)\];以及
- •XGBoost,一种正则化的梯度提升实现\[8 (https://arxiv.org/html/2608.20406#bib.bib8)\]。
机器学习模型作为自回归回归器进行拟合,仅使用每个预测起点之前可用的观测值构建预测变量。MLAMA框架是模型无关的:如果其他统计或机器学习模型能在相同的前瞻性评估协议下生成预测,则可以将其纳入。
### 2\.3滚动起点交叉验证与模型调优
随机交叉验证不适用于有序的监测数据,因为它可能将未来的观测值放入用于预测过去的训练折叠中。因此,我们使用了滚动起点时间序列交叉验证,采用扩展训练窗口后跟时间上较晚的验证块\[5 (https://arxiv.org/html/2608.20406#bib.bib5)\]。图2 (https://arxiv.org/html/2608.20406#S2.F2)中说明的配置包含12个扩展折叠和一个固定的12周验证块。所有预处理、预测变量构建、超参数选择和预测均使用在相应验证区间之前可用的数据完成。
ARIMA阶数和机器学习超参数在滚动过程中进行选择。实现使用平方相对误差目标进行参数和权重优化,
MSRE=1N∑i=1N\(yi−y^iyi\)2,\\operatorname\{MSRE\}=\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\left\(\\frac\{y\_\{i\}\-\\widehat\{y\}\_\{i\}}\{y\_\{i\}}\\right\)^\{2\},\(1\)
其中yiy\_\{i\}和y^i\\widehat\{y\}\_\{i\}分别是观测值和预测值。我们使用术语均方相对误差(MSRE)而非均方误差,因为误差是相对于观测值缩放的。
参照标题图2:滚动起点交叉验证设计示意图,包含扩展训练窗口和固定的12周验证块。
### 2\.4评估维度
#### 响应性。
响应性围绕选定的局部极大值和极小值进行评估。拐点之后的观测值依次从评估集转移到训练集。对于响应性索引r=1,...,4r=1,\\ldots,4,在获得rr个拐点后观测值后,模型被重新拟合。误差的快速降低表明对新趋势方向的敏感性;较小的变化表明更高的稳定性或鲁棒性。响应性被视为一个操作特性,而非内在的理想属性:高敏感性可以提高早期适应性,但也可能增加方差。
#### 预测时界。
对h=1,...,6h=1,\\ldots,6周的预测时界评估了预测准确性。此项分析旨在考察在近期操作决策中表现良好的模型,对于更长的规划时界是否仍保持可靠。
#### 历史训练深度。
为评估是否总是更多历史数据有益,我们使用第三分析期之后固定的两周预测,比较了ARIMA和XGBoost在三种训练历史下的表现:所有三个时期、第二和第三时期、仅第三时期。
### 2\.5评估指标
平均绝对百分比误差(MAPE)计算为
MAPE=1N∑i=1N\|yi−y^iyi\|\.\\operatorname\{MAPE\}=\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\left\|\\frac\{y\_\{i\}\-\\widehat\{y\}\_\{i\}}\{y\_\{i\}}\\right\|\.\(2\)
由于病例数量在各分析期之间差异显著,回顾性跨期图表使用了最小-最大归一化MAPE。对于每个时期ww,MAPE值在该时期内包含的模型、响应性和时界配置之间进行归一化,
nMAPEh,m,r,w=MAPEh,m,r,w−minc∈CwMAPEc,wmaxc∈CwMAPEc,w−minc∈CwMAPEc,w,\\operatorname\{nMAPE\}\_\{h,m,r,w\}=\\frac\{\\operatorname\{MAPE\}\_\{h,m,r,w\}\-\\min\_\{c\\in\\mathcal\{C\}\_\{w\}}\\operatorname\{MAPE\}\_\{c,w\}}\{\\max\_\{c\\in\\mathcal\{C\}\_\{w\}}\\operatorname\{MAPE\}\_\{c,w\}\-\\min\_\{c\\in\\mathcal\{C\}\_\{w\}}\\operatorname\{MAPE\}\_\{c,w\}}\},\(3\)
并将归一化值在各时期内取平均。此处使用缩写nMAPE以避免与对称MAPE混淆。当观测计数为零或接近零时,MAPE和nMAPE可能不稳定;未来的验证还将报告绝对误差、尺度误差和概率校准指标。
### 2\.6MLAMA集成
令y^m,i\(h,r\)\\widehat\{y\}\_\{m,i\}\(h,r\)表示候选模型mm在预测时界h和响应性设置r下的样本外预测。MLAMA使用非负且和为1的权重组合候选预测,
y^iMLAMA\(h,r\)=∑m=1Mwm,h,ry^m,i\(h,r\),wm,h,r≥0,∑m=1Mwm,h,r=1\.\\widehat\{y\}\_\{i\}^\{\\mathrm\{MLAMA\}\}\(h,r\)=\\sum\_\{m=1\}^\{M\}w\_\{m,h,r\}\\widehat\{y\}\_\{m,i\}\(h,r\),\\qquad w\_\{m,h,r\}\\geq 0,\\quad\\sum\_\{m=1\}^\{M\}w\_\{m,h,r\}=1\.\(4\)
对于每个\(h,r\)\(h,r\)条件,权重通过最小化聚合MSRE从滚动样本外预测中选择,
w^h,r=argminw∑i\[yi−∑mwm,h,ry^m,i\(h,r\)yi\]2,\\widehat\{\\boldsymbol\{w\}\}\_\{h,r\}=\\arg\\min\_\{\\boldsymbol\{w\}}\\sum\_\{i\}\\left\[\\frac\{y\_\{i\}\-\\sum\_\{m\}w\_\{m,h,r\}\\widehat\{y\}\_\{m,i\}\(h,r\)}\{y\_\{i\}}\\right\]^\{2\},\(5\)
并满足方程4 (https://arxiv.org/html/2608.20406#S2.E4)中的约束。因此,允许集成组合在短期和较长预测时界之间以及在更具响应性和更稳定的条件下有所不同。
### 2\.7Python软件包、手册和操作工作流程
MLAMA研究代码已实现为一个Python软件包,并附有将回顾性模型评估与当前预测分开的用户手册。该软件包将方法论框架转化为可重现的五个操作序列:候选模型配置、滚动窗口构建、超参数优化、基于性能的权重估计以及最终集成预测。当前实现包括ARIMA、随机森林和XGBoost;其设计允许在符合相同输入、预测和评估接口的前提下添加额外的预测模型。
表1:MLAMA软件包手册中记录的操作组件。操作工作流程使用连续的历史序列,而非要求预先定义的回顾性时期。对于基线预测起点t,响应性更新s将起点推进至t+s,并将s个新可用观测值纳入训练集。然后从该更新的起点在预测时界h生成预测。这种表述推广了回顾性拐点分析:它衡量随着额外观测值可用,预测和误差如何变化,而无需预先知晓峰值或谷值。
该软件包构建顺序训练和评估窗口,允许训练窗口之间可配置的重叠,保持每个评估区间的时间分离,调整候选模型,记录特定于时界和响应性的误差,估计权重矩阵,在最近允许的数据上重新拟合模型,并生成加权预测。中等重叠策略被记录为历史评估数量和窗口间依赖性之间的默认折衷方案,同时仍提供无重叠和更高重叠的替代方案。
参照标题图3:MLAMA软件包手册中记录的操作滚动窗口配置。训练窗口可以重叠以增加历史评估数量,但每个评估区间都紧随其对应的训练数据。该软件包和手册已足够完整以支持当前的研究工作流程,但在进行密集验证期间,源代码库仍保持私有。验证计划包括窗口构建和权重约束的单元测试、显式的泄漏测试、跨候选模型的集成测试、针对存储预测的数值回归测试、跨环境的可重现性测试、缺失和延迟观测的压测,以及数值输出的独立审查。在此测试以及所需的共同作者和机构审查后,计划发布一个公开的、有版本的版本。
## 3结果
### 3\.1基础模型响应性与预测时界
图4 (https://arxiv.org/html/2608.20406#S3.F4)总结了回顾性基础模型比较。在响应性分析中,随着额外拐点后观测值进入训练集,ARIMA误差迅速下降,表明其对变化方向的适应更快。随机森林和XGBoost的变化更为渐进,这与更高的稳定性但更慢的即时响应一致。在较长的预测时界下,ARIMA的归一化误差增长更为陡峭,而机器学习模型在所检验的时界内显示出更平缓的误差曲线。这些结果阐释了相似文章
用于支持主动运营决策的急诊科滞留时间集成预测原型
本文介绍了一种多时间尺度时间序列预测框架,使用DLinear和NLinear模型预测急诊科滞留时间,并开发了一个MLOps网页应用原型,以支持主动运营决策。
通过先进机器学习技术变革心脏病预测
本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。
基于CPRD的可扩展临床数据基础设施及比较性机器学习评估在多重慢性病老年患者住院风险预测中的应用
本文提出了一种可扩展的临床数据基础设施,并比较了深度学习(TG-CNN)与传统机器学习模型(LASSO和Random Forests)在多重慢性病老年患者住院风险预测中的应用,结论是由于LASSO具有更优的校准性能,更适合临床部署。
AdaWeather: 自适应混合概率天气预报与对数遗憾
介绍了AdaWeather,一个自适应框架,它利用机器学习和专家混合来组合多个概率天气预报,相比最佳的静态专家混合实现了对数遗憾,并在温度预报方面展示了实证改进。
针对CTF4Science Lorenz挑战的度量感知混合预测
本文描述了一种针对CTF4Science Lorenz挑战的度量感知混合预测系统,该系统结合了神经去噪器、ODE拟合和直方图尾部分布替代,以优化九个任务对中的不同度量,在公开排行榜上取得了83.85529分的成绩。