当去噪有害时:反思扩散时间序列预测器的终端步骤——扩展版本
摘要
本文挑战了迭代去噪总能改善基于扩散的时间序列预测的假设,提出了一种全局停止准则和伯努利采样器,以提高准确性和速度。
arXiv:2608.14067v1 Announce Type: new
摘要: 扩散模型为时间序列预测提供了一种自然的不确定性建模方式,但其迭代采样过程通常被视为一个普遍有益的优化程序。本研究通过考察反向扩散过程中预测质量的变化,挑战了这一观点。我们发现,一般的时间结构往往在相对较高的噪声水平下就能恢复,而持续的低噪声优化可能引入统计漂移并降低最终预测的质量。我们的分析进一步表明,这种行为解释了为什么先前的方法往往偏好相对较窄的扩散架构和调度设计。基于这一观察,我们提出了一种无标签全局停止准则,用于检测最佳终止点,从而加速推理并提高预测准确性。此外,由于早停会在高噪声区域终止推理,我们提出了一种伯努利时间步采样器,专注于该区域的训练,同时保持对整个扩散过程的覆盖。在八个真实数据集上进行的广泛实验表明,我们的方法比现有方法具有更优的性能。
查看缓存全文
缓存时间: 2026/08/17 10:19
# 重新思考扩散时间序列预测器的终端步骤
来源:https://arxiv.org/html/2608.14067
###### 摘要
扩散模型为时间序列预测中的不确定性建模提供了一种自然方式,但其迭代采样过程通常被视为一种普遍有益的精细化处理。我们的研究通过考察预测质量在反向扩散过程中的演变规律,对这一观点提出了挑战。我们发现,一般的时间结构往往在相对较高的噪声水平下就得以恢复,而持续的低噪声精细化过程反而可能引入统计漂移并降低最终预测质量。我们的分析进一步表明,这一现象解释了为何先前方法通常倾向于采用较窄的扩散架构和调度设计。基于这一观察,我们提出了一种无标签的全局停止准则,用于检测最优终止点,从而最终加速推理并提高预测准确性。此外,由于提前停止会在高噪声区域终止推理,我们提出了一种伯努利时间步采样器,将训练重点集中于该区域,同时保持对完整扩散过程的覆盖。在八个真实世界数据集上进行的大量实验证明了我们的方法相对于现有方法的优越性能。
## 1 引言
时间序列预测仍然具有挑战性,因为观测数据通常具有噪声,且受随时间演变的非线性、非平稳动力学支配。经典方法,如ARMA(2)(https://arxiv.org/html/2608.14067#bib.bib21)和状态空间模型(9)(https://arxiv.org/html/2608.14067#bib.bib22),虽然性能良好,但通常依赖于线性、平稳性或预定义的转移动力学假设,这可能限制了它们表示复杂时间过程的能力。神经自回归模型(11)(https://arxiv.org/html/2608.14067#bib.bib14);(16)(https://arxiv.org/html/2608.14067#bib.bib15)放宽了其中一些假设,但由于它们是序列化地生成未来值,因此容易受到暴露偏差和递归误差累积的影响,尤其是在较长的预测时间跨度上。另一方面,扩散模型(13)(https://arxiv.org/html/2608.14067#bib.bib7)通过将预测表述为条件生成任务,提供了一种引人注目的替代方案。通过迭代去噪,它们提供了一个灵活的框架,用于学习异质数据分布并显式量化预测不确定性。然而,在时间序列预测的背景下,扩散模型的行为和设计仍然未被充分理解。现有方法引入了时间架构(26)(https://arxiv.org/html/2608.14067#bib.bib8);(37)(https://arxiv.org/html/2608.14067#bib.bib11);(1)(https://arxiv.org/html/2608.14067#bib.bib12)、训练目标(30)(https://arxiv.org/html/2608.14067#bib.bib9)和引导机制(15)(https://arxiv.org/html/2608.14067#bib.bib13),但在很大程度上忽略了时间数据的结构特性如何与去噪轨迹相互作用。相比之下,其他领域(如文本生成)的扩散模型已被调整以适应其离散和稀疏特性(35)(https://arxiv.org/html/2608.14067#bib.bib20);(12)(https://arxiv.org/html/2608.14067#bib.bib19)。只有少数时间序列研究明确考察了这些相互作用(17)(https://arxiv.org/html/2608.14067#bib.bib17);(36)(https://arxiv.org/html/2608.14067#bib.bib18)。即便如此,大多数现有方法隐含地假设每个反向扩散步骤都会单调地改善预测。因此,目前尚不清楚所有去噪步骤是否同样有益,或者是否必须完成整个反向过程才能获得准确的预测。
(a) 预测性能。参见说明 (b) 预测轨迹。
图 1:(a) 性能在不同数量的采样步骤下保持一致,甚至在使用更少步骤时表现更好。(b) 在生成过程中,当中间预测样本在低噪声水平下会发生显著漂移。
#### 过度去噪会破坏和降低预测质量。
如图 1(a)(https://arxiv.org/html/2608.14067#S1.F1.sf1)所示,减少反向采样步骤的数量通常能产生与成本高昂得多的采样配置相当,甚至更好的性能。我们的分析表明,反向过程表现出两个不同的阶段。在高中间噪声阶段,去噪模型能够快速恢复主导的、与预测相关的结构,包括整体趋势和季节性,此后预测统计量趋于稳定。然而,在随后的低噪声阶段,连续的预测可能会经历显著的统计漂移(图 1(b)(https://arxiv.org/html/2608.14067#S1.F1.sf2))。尽管每一步的去噪损失通常随噪声水平降低而减小,但这种局部改善并不一定转化为更好的最终预测(图 2(https://arxiv.org/html/2608.14067#S3.F2))。相反,去噪网络越来越专注于预测数据中固有的、通常难以处理的噪声。随着推理的进行,残差误差在采样结束时不断累积,最终导致生成质量下降。这一观察揭示了局部去噪精度与端到端预测性能之间的重要不匹配。
#### 扩散步骤的不平等贡献。
我们进一步重新审视噪声调度设计。现有的时间序列扩散模型通常使用较少的扩散步骤(19)(https://arxiv.org/html/2608.14067#bib.bib38);(17)(https://arxiv.org/html/2608.14067#bib.bib17);(18)(https://arxiv.org/html/2608.14067#bib.bib3);(27)(https://arxiv.org/html/2608.14067#bib.bib16)来缓解低噪声漂移,而其他模型则依赖于复杂架构(37)(https://arxiv.org/html/2608.14067#bib.bib11)来提高预测准确性。然而,这些方法忽略了不同时间步的不平等贡献。均匀时间步采样将大量模型容量分配给低噪声区域,尽管该区域在推理期间的作用有限,甚至可能有害。
#### 解决方案 1.
基于这些发现,我们提出了一种简单而有效的早停机制,它在后期统计漂移出现之前终止反向扩散。停止点完全由生成样本统计量的演变决定,因此在推理时不需要访问真实未来观测值。通过避免不必要的生成,所提策略将采样成本降低了 20-50%,同时实现了与完整反向过程相当或更好的预测性能。
#### 解决方案 2.
我们引入了一种伯努利时间步采样策略,将训练重点重新分配到高噪声区域,在那里准确的去噪对生成的预测影响最大。该策略在保留对低噪声区域训练覆盖的同时,提高了模型在严重损坏输入上的预测能力。最后,我们在所有实验中采用足够长的扩散调度以及一个简单的基于 Transformer 的网络。我们表明,这种设计降低了对架构超参数和噪声调度的敏感性,并在不依赖复杂架构或精细引导机制的情况下实现了强大的预测性能。
总之,我们的主要贡献如下:
- • 我们在时间序列预测中识别出两个不同的反向扩散阶段,并揭示低噪声精细化会引入统计漂移并降低预测质量。
- • 我们提出了一种早停机制,避免有害的后期去噪,在不需要未来真实值的情况下降低采样成本。
- • 我们引入了一种伯努利时间步采样策略,强调高噪声预测,同时保留对完整扩散轨迹的覆盖。
- • 我们提出的方法在多样化的基准测试中实现了最先进的概率预测性能。
## 2 相关工作
### 2.1 时间序列预测模型
为了捕获趋势、季节性和多尺度时间结构,已经开发了广泛的预测方法。基于基函数展开的模型,如 N-BEATS(24)(https://arxiv.org/html/2608.14067#bib.bib29),使用可解释的趋势和季节性成分来表示时间序列,而 N-HiTS(6)(https://arxiv.org/html/2608.14067#bib.bib30)通过多分辨率的层次插值扩展了这一思想。其他方法依赖于显式分解或频域建模。例如,DLinear(38)(https://arxiv.org/html/2608.14067#bib.bib31)在预测前分离季节性和趋势成分,而 FiLM(41)(https://arxiv.org/html/2608.14067#bib.bib28)将频率分析与低秩近似相结合,以抑制噪声并保留长期信息。最近,基于 Transformer 的预测模型通过专门的架构和分词策略捕获长程依赖性。Informer(40)(https://arxiv.org/html/2608.14067#bib.bib23)、Autoformer(34)(https://arxiv.org/html/2608.14067#bib.bib24)和 FEDformer(42)(https://arxiv.org/html/2608.14067#bib.bib25)使用稀疏注意力、分解和频域表示来提高效率和时间建模能力。PatchTST(23)(https://arxiv.org/html/2608.14067#bib.bib26)采用时间分块,而 iTransformer(21)(https://arxiv.org/html/2608.14067#bib.bib27)将变量建模为 token。最近,TimesFM(8)(https://arxiv.org/html/2608.14067#bib.bib1)和 Chronos(3)(https://arxiv.org/html/2608.14067#bib.bib2)利用大规模预训练进行跨域预测。然而,这些方法并未明确考察预测不确定性在迭代生成过程中如何演变。
### 2.2 用于时间序列预测的扩散模型
扩散模型提供了一种替代的概率公式,其中未来轨迹是通过迭代去噪生成的。现有方法通过条件引导和分解架构改进时间生成。TSDiff(15)(https://arxiv.org/html/2608.14067#bib.bib13)和 TimeDiT(5)(https://arxiv.org/html/2608.14067#bib.bib4)引入了引导机制来指导采样过程,而 TimeDiff(28)(https://arxiv.org/html/2608.14067#bib.bib5)、CDPM(39)(https://arxiv.org/html/2608.14067#bib.bib6)和 D3U(18)(https://arxiv.org/html/2608.14067#bib.bib3)利用时间分解或结构化条件。少数工作如 ANT(17)(https://arxiv.org/html/2608.14067#bib.bib17)、CNDiff(27)(https://arxiv.org/html/2608.14067#bib.bib16)和 NsDiff(36)(https://arxiv.org/html/2608.14067#bib.bib18)考虑了时间序列数据在扩散过程中的时间结构。然而,预测质量沿反向过程的演变仍未得到充分探索,这激发了我们对采样动力学的进一步分析。
## 3 预备知识
(a) 噪声调度 (b) 每步损失 (c) 候选轨迹误差
图 2:不同调度的比较。(a) 信号衰减 ᾱt = √ᾱ_t 随时间步 t 的变化及稳定过渡点。(b) 每步损失曲线显示收敛到稳定损失区域。(c) 不同噪声水平下的候选轨迹均方误差。
#### 符号说明。
我们用 x ∈ ℝ^{Q×D} 表示历史上下文,y₀ ∈ ℝ^{P×D} 表示未来时间跨度,y_t ∈ ℝ^{P×D} 表示扩散步 t ∈ {0, ..., T} 的潜在变量,其中 Q、P、D 分别表示上下文长度、预测长度和变量数量。令 β_t ∈ (0, 1) 为噪声方差调度,α_t := 1 - β_t,ᾱ_t := ∏_{i=1}^t α_i,且 ᾱ₀ = 1,ᾱ_T ≈ 0。
#### 问题表述。
目标是在给定历史上下文 x 的情况下预测未来时间序列 y₀。因此,我们将问题表述为生成任务 p(y₀ | x)。扩散模型通过迭代运行一个可学习的去噪过程来实现这一点,从一个简单的高斯噪声 p(y_T) = N(0, I) 开始:
p_θ(y_{0:T} | x) = p(y_T) ∏_{t=1}^T p_θ(y_{t-1} | y_t, x)。(1)
由于 p_θ(y_{t-1} | y_t, x) 通常难以处理,我们用预定义的后验分布 q(y_{t-1} | y_t, y₀) 近似它,该分布源自辅助加噪过程:
q(y_t | y_{t-1}) = N(√α_t y_{t-1}, β_t I),(2)
q(y_t | y₀) = N(√ᾱ_t y₀, (1 - ᾱ_t) I),(3)
q(y_{t-1} | y_t, y₀) = N(μ̃(y_t, y₀), β̃_t I),(4)
其中 β̃_t := (1 - ᾱ_{t-1})/(1 - ᾱ_t) β_t,μ̃(y_t, y₀) := (√ᾱ_{t-1} β_t)/(1 - ᾱ_t) y₀ + (√α_t (1 - ᾱ_{t-1}))/(1 - ᾱ_t) y_t。
由于公式 (4) 只是 y_t 和 y₀ 的组合,因此学习 p_θ(y_{t-1} | y_t, x) 简化为近似干净预测 y₀:
L_diffusion = E_{t, y₀, y_t} [ || y₀ - y_θ(y_t, x, t) ||²₂ ],(5)
其中 y_t 使用公式 (3) 采样。与输出单一轨迹的确定性预测器不同,扩散模型直接测量*完整预测分布*。这对于真实世界的时间序列尤其适用,因为(i)随机性和测量噪声是不可避免的,以及(ii)存在多个合理的未来。
## 4 方法论
我们的框架将扩散训练和推理与时间序列的去噪动力学对齐,如图 3(https://arxiv.org/html/2608.14067#S4.F3)所示。我们首先分析预测质量如何沿反向轨迹演变,并识别从全局结构恢复到不稳定的后期精细化的过渡(第 4.1 节(https://arxiv.org/html/2608.14067#S4.1)...)。相似文章
扩散模型的时间差分学习
本文提出了一种用于扩散模型的时间差分(TD)学习目标,该目标在去噪轨迹上强制跨时间一致性。它将去噪重新表述为强化学习中的策略评估问题,展示了在样本质量(FID)上的显著改进,尤其适用于少步采样器。
针对时间序列预测中不确定性成分的扩散轨迹差分
本文提出了DiffDiff,一种用于概率时间序列预测的扩散框架,它将可预测性不对称性嵌入到扩散轨迹中,在四个预测跨度的七个基准测试上优于六个扩散基线。
去噪未来:针对时序知识图谱外推的上下文感知频谱扩散
本文提出了FreqDiff,一种用于时序知识图谱外推的频率感知扩散框架,该框架改进了不确定性建模,并在基准测试中取得了最先进的性能。
统一扩散模型再探:留一法去噪器与吸收态重表述
重新审视统一扩散模型,指出了插入式ELBO与交叉熵去噪目标之间的不匹配,并提出了留一法参数化以及吸收态重表述,该方法无需额外训练即可提升生成质量。
文本扩散模型中的安全感知去噪器
本文介绍了安全感知去噪器(SAD),这是一个在去噪过程中将安全约束整合到文本扩散模型中的框架。其目标是在保持生成质量的同时减少不安全内容的生成,填补了非自回归模型安全研究领域的空白。