粒度悖论:时间解聚如何夸大样本内拟合并加剧样本外误差
摘要
本文形式化了时间序列预测中的“粒度悖论”,表明更细的时间解聚会改善样本内拟合,但由于递归误差传播而降低样本外精度,并在不同粒度上对多种模型进行基准测试。
arXiv:2607.05450v1 公告类型:新论文
摘要:本文探讨了时间序列预测中的“粒度悖论”,即更细的时间解聚(例如,从月度到周度/日度)会改善样本内诊断指标并增加数据集规模(N),但由于在更长预测周期(H)上的递归误差累积,反而降低了样本外精度。相反,粗粒度聚合(年度)消除了递归误差传播,但减少了估计器可用的数据量。我们形式化了这一权衡,并利用一个13年的公共采购数据集,在六种粒度上对10个模型(涵盖朴素、统计、机器学习和深度学习架构)进行了基准测试。实证结果揭示了一个非单调的阈值结构:递归自回归和季节模型在高频预测下性能显著下降(例如,Holt-Winters在日度粒度上的测试R平方达到-151,TPFE达到425.85%),而LSTM呈现出U形误差曲线,从月度(19.66%)恶化到双周(35.94%),然后在日度粒度上克服误差传播惩罚(TPFE为4.35%,R平方为0.66)。线性回归在所有粒度上保持稳定(TPFE 16.3-17.0%),证实该悖论是由递归反馈拓扑驱动,而非模型复杂度。结果表明,标准逐点指标(RMSE, MAE)系统性地掩盖了累积误差传播,且在不依赖目标相关累积指标的情况下评估预测会导致对模型充分性的误导性判断。我们引入了一种共识-分歧诊断方法,比较逐点指标与累积TPFE在不同粒度上的方向行为,从而识别出那些标准诊断指标掩盖了系统性误差传播的模型。
查看缓存全文
缓存时间: 2026/07/08 04:43
# 时间粒度悖论:时间离散化如何膨胀样本内拟合并加剧样本外误差
来源:https://arxiv.org/html/2607.05450
###### 摘要
本文探讨了时间序列预测中的“时间粒度悖论”,即更精细的时间离散化(例如,从月度到周度或日度)虽然能改善样本内模型诊断并扩大数据集规模(N),但由于递归误差在更长预测期(H)上复合,反而降低了样本外多步前向预测的准确性。反之,粗粒度聚合(年度)消除了递归误差传播,但减少了可供估计器使用的数据。我们形式化了这一权衡,并基于一个13年的公共采购数据集,在六种时间粒度(年度、月度、季度、双周、周度、日度)上对10种预测模型(包括朴素基线、统计学、机器学习和深度学习架构)进行了基准测试。实证结果揭示了一个非单调的阈值结构:递归自回归和季节性模型在高频递归预测下表现显著下降,其中Holt-Winters在日度粒度上的测试R²达到 -151,TPFE达到425.85%;而LSTM则呈现U形误差曲线——从月度(19.66%)恶化到双周(35.94%),随后在日度克服了误差传播惩罚,实现了4.35%的TPFE和0.66的样本外R²。线性回归在所有六种粒度上保持稳定(TPFE在16.1%–17.0%之间),证实了悖论是由递归反馈拓扑驱动的,而非模型复杂度。结果还表明,标准逐点指标(RMSE、MAE)系统性地掩盖了累积误差传播,而在不采用目标相关累积指标的情况下评估预测,会产生对模型充分性的误导性评估——这一发现对预测实践具有直接影响。我们引入了一种共识-分歧诊断方法,通过比较逐点指标的方向性行为与跨粒度的累积TPFE,能够识别出那些标准诊断掩盖了系统性误差传播的模型。
###### 关键词:
预测;时间聚合;误差传播;深度学习;时间粒度悖论;公共采购
{Frontmatter}
[1]Hugo Moreira · orcid0000-0002-4199-6006 [1] · orgdivCIES - 社会学研究中心,· orgnameIscte - 里斯本大学学院,· city里斯本,· country葡萄牙
## 1 引言
时间聚合是预测工作流中的核心设计决策。当对一个固定的物理规划期(例如1年预算周期)进行建模时,研究者必须选择目标序列的时间粒度:日度、周度、月度、季度或年度。这一选择决定了基本的权衡关系。
更精细的粒度会扩大样本量(N),为机器学习和神经架构提供估计高维参数空间所必需的数据量。然而,离散化也会膨胀覆盖规划期所需的预测步数(H)。例如,一个1年的规划期需要H_monthly=12步,H_weekly=52步,或者H_daily=365步。对于生成递归多步前向预测的状态依赖或自回归模型而言,H的膨胀会触发指数级误差传播,因为每个中间预测都会被反馈作为后续步骤的输入。
本文将这一现象形式化为“时间粒度悖论”。我们证明,样本内拟合诊断(如训练R²)是跨粒度样本外性能的欺骗性指标。我们对10种预测模型(包括作为递归误差控制的朴素基线)在六种频率上进行基准测试,以划定样本量扩大的收益被递归误差复合惩罚所超越的边界。
## 2 时间聚合的理论基础
时间聚合——将高频观测(例如日度)合并为较粗的低频区间(例如月度或年度)——是时间序列分析中的标准操作 (Hamilton, 1994 (https://arxiv.org/html/2607.05450#bib.bib8))。它主要充当低通滤波器,平滑高频噪声、局部波动性和短期季节波动,以揭示长期趋势。然而,这种过滤也带来了可衡量的信息和统计成本 (Silvestrini and Veredas, 2008 (https://arxiv.org/html/2607.05450#bib.bib23))。
### 2.1 信息损失与参数估计
时间聚合改变了潜在过程的随机性质,影响参数估计量的一致性和效率。早期工作由 Wei (2006 (https://arxiv.org/html/2607.05450#bib.bib25)) 证明,在聚合分布滞后模型上估计参数会导致精度的系统性下降。这种下降由两种统计机制驱动:聚合误差项方差的放大,以及聚合解释变量之间多重共线性的膨胀。此外,Silvestrini 和 Veredas (2008 (https://arxiv.org/html/2607.05450#bib.bib23)) 表明,当原始离散序列呈现负自相关时(这在误差修正系统或快速库存补充周期中很常见),信息损失更为显著。
### 2.2 因果扭曲与协整
除了参数估计,时间聚合还可能扭曲因果关系的结构识别。如 Tiao 和 Wei (1976 (https://arxiv.org/html/2607.05450#bib.bib24)) 所示,如果潜在的高频过程具有单向动态因果关系(例如 X→Y 且无反馈),时间聚合算子可能会人为地在聚合数据中诱导出双向反馈回路。这种虚假因果关系出现的原因是:精细分辨率下的滞后关系在较粗分辨率下被压缩为同期关系,从而妨碍了真实因果方向的识别。
此外,聚合改变了序列的整合和协整性质。取决于聚合因子,包含季节性单位根的过程可能被转化为具有非季节性单位根的过程 (Silvestrini and Veredas, 2008 (https://arxiv.org/html/2607.05450#bib.bib23))。这种修改改变了单位根和协整检验的渐近分布,意味着必须仔细调整模型规格以避免伪回归。
### 2.3 多尺度建模与层次协调
为了解决高频细节(统计丰富但有噪声)与低频稳定性(干净但数据稀缺)之间的冲突,多尺度预测框架被开发出来。由 Kourentzes 等人 (2014 (https://arxiv.org/html/2607.05450#bib.bib13)) 提出的多聚合预测算法 (MAPA),在多个非重叠聚合水平 k 上对时间序列进行建模。设 y_t 是以基本频率 t=1,...,n 采样的序列。在聚合水平 k 上的聚合序列 Y_i^{[k]} 定义为:
Y_i^{[k]}= ∑_{t=1+(i-1)k}^{ik} y_t for i=1,...,⌊n/k⌋ (1)
在每个单独的聚合水平 k 上拟合一个线性 Holt 指数平滑模型,以提取水平 (L_t) 和趋势 (T_t) 分量:
L_t = α Y_t^{[k]} + (1-α)(L_{t-1}+T_{t-1}) (2)
T_t = β(L_t - L_{t-1}) + (1-β)T_{t-1} (3)
这些分量随后被映射回基本频率并取平均,使得每个尺度贡献其估计最稳健的动态分量:
f = (1/K) Σ_{k=1}^{K} (L_k + T_k)/k (4)
类似地,时间层次将这些关系组织成一个连贯的树形结构 (Athanasopoulos et al., 2017 (https://arxiv.org/html/2607.05450#bib.bib1))。这确保了在短期规划期所做的运营决策与长期规划期的战略目标完美对齐,消除了不一致性。在不同层次生成的独立预测之间的一致性通过预测协调实现。设 ŷ_h 是层次结构中所有层次的独立(未协调)预测向量。协调后的、一致的预测 ỹ_h 通过稳定的线性投影计算:
ỹ_h = S (S' W^{-1} S)^{-1} S' W^{-1} ŷ_h (5)
其中 S 是将基础节点映射到聚合节点的结构求和矩阵,W 是基础预测误差的协方差矩阵 (Athanasopoulos et al., 2024 (https://arxiv.org/html/2607.05450#bib.bib2))。
## 3 多步前向预测与误差传播
在一个较长的未来规划期 H 上投影时间序列轨迹需要选择模型如何生成多步预测。预测文献将这些策略分为递归式、直接式和多输出 (MIMO) 方法 (Ben Taieb et al., 2012 (https://arxiv.org/html/2607.05450#bib.bib3))。
### 3.1 递归(迭代)策略与时间粒度悖论
递归策略训练一个单步前向预测模型 (h=1)。对于更长的规划期,预测是顺序生成的,前一步的预测作为自回归输入反馈给下一步。如果模型是完美指定的,递归策略渐近地比其竞争对手更有效,因为它保留了数据的完整时间依赖结构 (Marcellino et al., 2006 (https://arxiv.org/html/2607.05450#bib.bib17))。然而,在存在错误指定或参数偏差的情况下,这个反馈回路会指数级地复合误差。
让我们形式化这一权衡。对于一个一阶自回归过程 y_t = φ y_{t-1} + ε_t,在第 h 步的样本外预测为:
ŷ_{T+h} = φ̂^h y_T (6)
如果估计的参数存在偏差 δ,使得 φ̂ = φ + δ,那么第 h 步的预测误差复合为:
e_{T+h} = y_{T+h} - ŷ_{T+h} = φ^h y_T - (φ+δ)^h y_T (7)
对于一个日度预测模型 (H=365),即使是微小的参数偏差 δ 也会导致在整个规划期上呈指数级发散,而月度模型 (H=12) 则限制了这种误差复合。时间粒度悖论的产生是因为日度估计扩大了样本量 N(从而降低了 φ̂ 的估计量方差),但同时膨胀了预测规划期 H(从而放大了偏差 δ 在整个规划期上的传播)。
### 3.2 直接式和多输出 (MIMO) 策略
直接式策略通过训练 H 个独立的模型来避免递归误差传播,每个模型针对特定的预测步长 h ∈ [1, H] 进行优化。虽然对短期模型错误指定具有鲁棒性,但这种方法忽略了连续预测之间的时间相关性,导致预测轨迹高度不规则。此外,它还带来了巨大的计算负担,因为需要训练和维护 H 个独立的模型 (Marcellino et al., 2006 (https://arxiv.org/html/2607.05450#bib.bib17))。
多输入多输出 (MIMO) 策略通过使用单个多输出模型同时预测整个未来输出向量 Y_H = [y_{t+1}, ..., y_{t+H}]' 来解决这些问题。如 Ben Taieb 等人 (2012 (https://arxiv.org/html/2607.05450#bib.bib3)) 所示,MIMO 模型保留了预测误差的时间协方差结构,而没有迭代方法的不稳定性和直接方法的计算开销。其他非参数方法,如惰性学习 (Bontempi et al., 1999 (https://arxiv.org/html/2607.05450#bib.bib5)),将参数拟合推迟到推理时刻,在嵌入状态空间的最近邻上拟合局部加权回归。
## 4 相关工作
时间聚合与预测准确性之间的相互作用已从多个角度进行了研究。Nikolopoulos 等人 (2011 (https://arxiv.org/html/2607.05450#bib.bib18)) 提出了聚合-离散间歇需求方法 (ADIDA),建立了一个正式框架,其中序列首先聚合到较粗的水平,用简单模型进行预测,然后再离散回操作频率。Rostami-Tabar 等人 (2013 (https://arxiv.org/html/2607.05450#bib.bib21)) 通过实证证明非重叠区间的时间聚合可以提高平稳需求过程的预测准确性,而 Petropoulos 和 Kourentzes (2015 (https://arxiv.org/html/2607.05450#bib.bib20)) 表明,结合多个聚合水平的预测优于针对间歇序列的单尺度方法。我们的工作与此文献的不同之处在于,我们关注的不是需求的间歇性,而是当状态依赖模型在越来越长的规划期 H 上投影时所出现的递归误差复合机制,这是先前聚合研究尚未单独分离出的粒度选择结果。
在更广泛的预测基准测试文献中,M4 竞赛 (Makridakis et al., 2020 (https://arxiv.org/html/2607.05450#bib.bib16)) 确立了混合统计-神经方法可以超越纯方法,但每个序列在固定的时间分辨率上评估模型,并未系统地将粒度作为受控实验因素进行变化。Makridakis 等人 (2018 (https://arxiv.org/html/2607.05450#bib.bib15)) 早期就提出了关于统计与机器学习方法之间差距的担忧,指出当样本量有限时,ML 模型通常表现不及经典方法——这一发现与我们观察到的深度学习在粗粒度下数据饥渴的现象一致。
时间序列深度学习的最新进展引入了通过根本不同机制处理多规划期预测的架构。Salinas 等人 (2020 (https://arxiv.org/html/2607.05450#bib.bib22)) 提出了 DeepAR,一种生成概率预测的自回归递归网络,明确建模了在递归规划期上复合的不确定性。Lim 等人 (2021 (https://arxiv.org/html/2607.05450#bib.bib14)) 引入了时间融合变换器 (TFT),它使用注意力机制在多个尺度上加权时间依赖关系,而无需递归状态传播。值得注意的是,Zeng 等人 (2023 (https://arxiv.org/html/2607.05450#bib.bib26)) 证明了简单的线性模型 (DLinear) 可以在长期预测中匹配或超越基于变换器的架构,这与我们关于线性回归在所有粒度下保持稳定的发现一致。我们的基准测试通过证明时间粒度的选择(模型选择上游的设计决策)对样本外准确性的影响可能超过架构复杂性的影响,补充了这一工作体系。
## 5 算法范式与架构
预测相似文章
粒度是有代价的 – 博弈论
一篇博客文章,讨论了系统中增加粒度(例如金融市场的最小变动单位和预订运动场地的时间段)如何引入策略性博弈和低效,认为更细化的选择并不总是有益的。
检索机制在时间序列预测中超越长上下文缩放
这篇学术论文挑战了长上下文缩放在时间序列预测中的有效性,证明基于检索的方法优于 PatchTST 等标准架构以及 Chronos 和 Moirai 等基础模型。
行为曲线中的辛普森悖论:聚合如何扭曲用户动态的参数模型
这篇学术论文识别并表征了行为曲线建模中的辛普森悖论,展示了由于生存偏差,聚合如何系统性地扭曲对用户动态的参数估计。作者们在 Goodreads 和 Amazon Electronics 等数据集上验证了这种失真,并提出了分层峰值估计方法来缓解这一问题。
无需数据清洗即可获得高质量预测(为何“垃圾进,垃圾出”有时是一种误区)
这篇arXiv预印本挑战了“垃圾进,垃圾出”的经验法则,认为在高维表格数据中,激进的手动数据清洗可能会通过减少三角测量潜在驱动因素所需的维度,从而限制预测性能。
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。