关注残差缺口:真实世界偏差下的概率降尺度
摘要
本文介绍了ReMatch方法,该方法通过PCA空间中的最优传输将训练残差分布与测试时分布对齐,以减轻概率降尺度中的偏差,从而获得更好的校准和离散度。
arXiv:2606.30821v1 公告类型:新
摘要:概率降尺度是给定粗粒度输入时建模高分辨率场条件分布的任务,是大气科学、气候建模以及其他多尺度物理系统的核心挑战。一个广泛使用的范式将问题分解为确定性均值预测器后接随机残差生成器。虽然在理想化设置中有效,但这种均值-残差方法在实际应用中经常产生有偏和欠分散的集合。这仅仅是通用预测不确定性校准问题吗?我们表明,根本原因更为基础:残差目标错配——由于降尺度偏差,训练期间诱导的残差分布与测试时所需的残差分布系统地不同。为了弥合这一差距,我们引入了ReMatch(残差分布匹配)。ReMatch通过低维PCA空间中的最优传输将训练残差分布与测试时分布对齐。这保留了均值-残差框架的统计优势,同时减少了随机生成器看到的残差目标中的训练-测试不匹配。在一个具有不同偏差水平的受控合成基准和一个真实的HRRR--ERA5风场降尺度任务上,ReMatch显著减少了欠分散,改进了校准(SSR和CRPS),并优于强基线,包括标准的均值-残差模型及其变体,以及最先进的超分辨率模型。我们的代码可在https://github.com/sdean-group/ReMatch.git获取。
查看缓存全文
缓存时间: 2026/07/01 05:32
# 真实世界偏差下的概率降尺度 来源:https://arxiv.org/html/2606.30821 ## 注意残差缺口:真实世界偏差下的概率降尺度 Yujin Kim Department of Computer Science Cornell University Ithaca, NY, 14853 [email protected] Nidhi Soma Department of Computer Science Cornell University Ithaca, NY 14853 [email protected] Sarah Dean Department of Computer Science Cornell University Ithaca, NY 14853 [email protected] ###### 摘要 概率降尺度是根据粗粒度输入建模高分辨率场条件分布的任务,是大气科学、气候建模和其他多尺度物理系统的核心挑战。一种广泛使用的范式将问题分解为确定性均值预测器和随后的随机残差生成器。虽然在理想化设置中有效,但这种均值-残差方法在真实世界应用中经常产生有偏且分散不足的系综。这仅仅是通用的预测不确定性校准问题吗?我们表明,根本原因更为基础:**残差目标指定错误**——训练期间诱导的残差分布与由于降尺度偏差而在测试时需要使用的残差分布系统性地不同。为了弥合这一差距,我们引入了**ReMatch**(残差分布匹配)。ReMatch通过低维PCA空间中的最优传输将训练残差分布与测试时分布对齐。这保留了均值-残差框架的统计优势,同时减少了随机生成器看到的残差目标中的训练-测试不匹配。在具有不同偏差水平的受控合成基准和真实世界HRRR-ERA5风场降尺度任务上,ReMatch显著减少了分散不足,改进了校准(SSR和CRPS),并优于强基线,包括标准均值-残差模型及其变体,以及最先进的超分辨率模型。我们的代码可在 https://github.com/sdean-group/ReMatch.git 获取。 ## 1 引言 概率降尺度旨在根据粗分辨率输入建模高分辨率场的条件分布。这个问题在大气科学、气候建模和其他多尺度物理系统中是一个常见挑战。精细尺度动力学对于下游任务(如灾害评估、局部预报、轨迹规划和不确定性感知决策)至关重要,但直接模拟这些动力学通常计算成本高昂。即使在理想化设置中(低分辨率输入仅通过高分辨率场的简单下采样获得),降尺度本质上也是一个不适定逆问题,因为存在未解析的子网格变异性。然而,在现实应用中,挑战要大得多。粗分辨率和细分辨率数据源之间的系统性偏差和错配——统称为**降尺度偏差**——引入了额外的、通常取决于领域或来源的差异(Maraun and Widmann 2018)。这些偏差扭曲了低分辨率到高分辨率的关系,远超简单插值,使得所需的高分辨率校正既是随机的,又在系统上更难推断。 针对此类任务的一种广泛采用策略是两阶段均值-残差分解:确定性回归器首先预测目标的粗近似,然后随机生成模型产生残差校正,提供精细尺度细节和概率扩散。这种设计已成功应用于概率降尺度(Mardani et al. 2025; Fotiadis et al. 2025; Rampal et al. 2024)、气候预报(Yu et al. 2024; Nguyen et al. 2025)、语音合成(Chen et al. 2022)和医学影像(Zhang et al.)。在大气降尺度中,CorrDiff(Mardani et al. 2025)是一个突出的代表:它在温度、风速和雷达反射率等变量上训练回归模型,然后使用条件扩散模型生成随机残差校正。然而,CorrDiff及后续工作一致报告,生成的系综是分散不足的,系综扩散显著小于系综平均误差(Mardani et al. 2025; Fotiadis et al. 2025)。在本文中,我们认为这种分散不足不仅仅是通用的扩散校准问题。相反,它源于一个我们称之为**残差目标指定错误**的根本问题。在均值-残差框架中,残差不是高分辨率场的内在随机分量;它是一个相对于上游均值预测器 \(\mu_\phi(x)\) 定义的**诱导**校正目标。当低分辨率和场表现出显著降尺度偏差时(在现实世界中典型的跨源或跨分辨率设置中),均值预测器会过拟合训练特定的偏差和伪影。因此,训练期间观察到的残差分布与测试时所需的校正分布系统性地不同。我们将残差目标本身的这种训练-测试不匹配形式化,并从理论和实证上表明,其严重性直接随着低分辨率(LR)-高分辨率(HR)偏差的强度增加而增加。 为了解决这个问题,我们提出了**ReMatch**(残差分布匹配)。使用校准集作为测试时的代理,ReMatch通过最优传输(Wan et al. 2023)将训练残差分布与测试时残差分布显式对齐。这保留了均值-残差分解的统计优势,同时确保随机残差生成器训练的残差目标的分布与推理时遇到的分布更匹配。我们的主要贡献有三方面:(i)严格解释了为什么均值-残差流水线在有偏差的降尺度设置中容易分散不足,(ii)ReMatch,一种有利于精度和系综校准的实用解决方案,(iii)在合成基准(Chung et al. 2023)上进行了系统变化的LR-HR偏差以及使用HRRR(Dowell et al. 2022)和ERA5(Hersbach et al. 2020)的真实世界风场降尺度任务的全面实证评估。在这些设置中,ReMatch始终优于强基线——包括标准均值-残差流水线、其无分类器引导变体(Ho and Salimans 2022)、不确定性条件残差扩散以及最先进的确定性超分辨率模型(Liang et al. 2021; Wen et al. 2022)——证实残差目标指定错误是有偏降尺度中分散不足的主要原因。 ## 2 背景与设置 ### 2.1 概率降尺度 我们考虑从低分辨率输入 \(x \in \mathbb{R}^{c_{\mathrm{in}} \times h \times w}\) 对高分辨率地球物理场 \(y \in \mathbb{R}^{c_{\mathrm{out}} \times H \times W}\) 进行概率降尺度,其中 \(H > h\) 且 \(W > w\)。这里,\(c_{\mathrm{in}}\) 和 \(c_{\mathrm{out}}\) 分别表示输入和输出通道的数量,例如速度、温度或其他物理变量,而 \((h,w)\) 和 \((H,W)\) 表示低分辨率和高分辨率空间网格大小。任务是建模 \(y\) 在给定 \(x\) 下的条件分布。在许多物理降尺度问题中,这种映射本质上是非确定性的。一个有用的抽象是假设低分辨率观测值是通过有效退化过程 \(x = D(y,s)\) 从高分辨率状态获得的,其中 \(D\) 不仅可能包括分辨率降低,还可能包括重网格化、投影、源不匹配、模拟器偏差和其他系统性差异,而 \(s\) 表示潜在源或流水线相关因素。例如,ERA5到HRRR的风速降尺度任务在同一个有效退化过程 \(D\) 中结合了空间分辨率、数值模型公式、数据同化、气压层定义和网格投影的差异。在理想化的超分辨率基准中,\(D\) 通常接近简单的下采样算子,而在现实世界设置中,它可能反映显著的偏差和跨源不匹配。在任何一种情况下,\(D\) 都是多对一的,因此逆问题是不适定的。因此,自然的学习目标不是唯一的确定性逆映射,而是条件分布 \(y \sim p(y \mid x)\)。这种概率视角不仅因为逆问题是多对一的,而且因为下游应用通常需要不确定性感知预测。在多尺度物理系统中,未解析的精细尺度变异性会影响预报、决策制定以及通过预测场移动的智能体运动规划。因此,成功的降尺度应该同时建模中心预测和物理上合理的高分辨率实现扩散。 ### 2.2 均值-残差分解 我们研究一类流水线,其中上游均值预测器 \(\mu_\phi(x) \in \mathbb{R}^{c_{\mathrm{out}} \times H \times W}\) 首先产生目标的确定性近似,然后残差生成器对剩余的校正进行建模(Mardani et al. 2025; Li et al.; Yu et al. 2024; Nguyen et al. 2025; Chen et al. 2022; Li et al. 2025; Lai et al. 2025)。目标被分解为: \[ y = \mu_\phi(x) + r_\phi, \quad r_\phi := y - \mu_\phi(x). \] 残差生成器 \(q_\theta(r \mid x, \mu_\phi(x))\) 产生随机校正 \(\hat{r} \sim q_\theta(r \mid x, \mu_\phi(x))\),从而得到 \(k\) 个系综预测: \[ \hat{y}^{(i)} = \mu_\phi(x) + \hat{r}^{(i)}, \quad i=1,\dots,k. \] CorrDiff(Mardani et al. 2025)是这种设计在大气降尺度中的一个突出例子:它首先预测确定性高分辨率场,然后应用扩散模型生成残差校正。这种分解的动机是残差分布在统计上比完整目标分布更容易建模,因为上游均值预测器去除了大尺度方差的很大一部分。至关重要的是,一旦 \(\mu_\phi\) 固定,残差阶段训练的是预测器诱导的目标,而不是数据分布的内在分量。这一区别是我们分析的核心:当 \(\mu_\phi\) 的可靠性在不同领域发生变化时,残差目标可能发生变化,即使底层降尺度任务保持不变。 ### 2.3 领域与划分 对于训练和测试划分,设 \((X,Y) \sim P_d\),\(d \in \{\mathrm{tr}, \mathrm{te}\}\),表示联合输入-目标分布。尽管这两个划分被视为来自同一总体的独立同分布样本,但已拟合的上游预测器对其并不对称:它在训练划分上优化,并在保留的测试样本上评估。对于固定的 \(\mu_\phi\),每个划分因此诱导其自身的经验残差随机变量: \[ R_d^\phi(X_d, Y_d) := Y_d - \mu_\phi(X_d), \quad (X_d, Y_d) \sim P_d. \] 因此,其误差,以及诱导的残差 \(R_{\mathrm{tr}}^\phi\) 和 \(R_{\mathrm{te}}^\phi\),可能具有系统不同的分布。这种训练-测试残差不匹配是我们下一节分析的对象。 ## 3 残差目标指定错误 我们将残差分布中的诱导偏移形式化为**残差目标指定错误**。与高分辨率场的内在随机分量不同,残差目标是相对于上游均值预测器 \(\mu_\phi\) 定义的。在真实世界降尺度中,有效退化过程可能结合分辨率降低、重网格化、源不匹配和模型偏差,因此 \(\mu_\phi\) 可能学习到训练领域的LR-HR对应关系,而不是全局有效的对应关系。当这种学习关系在测试时在可靠性或结构上发生变化时,诱导的残差目标也会发生偏移。我们将这种预测器诱导的偏移称为残差目标指定错误。 ### 3.1 由均值误差差距引起的残差分布偏移 对于每个领域 \(d \in \{\mathrm{tr}, \mathrm{te}\}\),定义期望平方残差幅度: \[ M_d(\phi) := \mathbb{E}_{(X,Y) \sim P_d} \left[ \| Y - \mu_\phi(X) \|_2^2 \right] = \mathbb{E}_{R \sim R_d^\phi} \left[ \| R \|_2^2 \right]. \] 该量衡量残差生成器在领域 \(d\) 上必须建模的校正典型规模。 ###### 命题1(残差幅度差距意味着残差分布偏移)。 对于固定的均值预测器 \(\mu_\phi\),诱导残差分布之间的2-Wasserstein距离满足: \[ W_2(R_{\mathrm{tr}}^\phi, R_{\mathrm{te}}^\phi) \geq \left| \sqrt{M_{\mathrm{tr}}(\phi)} - \sqrt{M_{\mathrm{te}}(\phi)} \right|. \] ###### 证明。 对于任何领域 \(d\),\(W_2(R_d^\phi, \delta_0) = \sqrt{M_d(\phi)}\),其中 \(\delta_0\) 是原点的狄拉克测度。该结论随后由 \(W_2\) 的反三角不等式得出。∎ 尽管命题1中的下界并不总是紧的,但它建立了一个简单的可测量残差分布偏移证据:残差能量差距必然意味着分布差距。 ### 3.2 为什么指定错误在残差空间中被放大 即使在独立同分布的训练-测试划分下,\(\mu_\phi\) 也在训练样本上优化,因此倾向于在训练划分上实现比在保留样本上更低的经验残差能量。在实践中,最常见的方向是 \(M_{\mathrm{tr}}(\phi) < M_{\mathrm{te}}(\phi)\)。在有偏差的降尺度设置中,这种差距很容易被放大,在训练期间留下小残差,但在测试时需要更大的校正。残差化还可能使地面真值和均值预测中的微小不匹配变得更为明显。为了说明这一点,假设训练和测试残差 \(R_{\mathrm{tr}}\) 和 \(R_{\mathrm{te}}\) 分别服从分布 \(P_{\mathrm{tr}}\) 和 \(P_{\mathrm{te}}\),并且它们的均值 \(\mathbb{E}[R_{\mathrm{tr}}]\) 和 \(\mathbb{E}[R_{\mathrm{te}}]\) 可能由于均值预测器的过拟合而不同。即使均值预测器在训练和测试上都有很好的校准,残差的方差也可能不同,因为测试样本中的不确定性更大。这种方差差距直接对应于残差幅度差距,根据命题1,这暗示了分布偏移。 此外,当存在降尺度偏差时,均值预测器可能学习到LR输入和HR输出之间的虚假关联,这些关联在训练数据中成立但在测试数据中不成立。例如,在HRRR-ERA5风场降尺度中,训练数据可能来自特定时期或区域,其中低分辨率ERA5场与高分辨率HRRR场之间的偏差模式相对一致。在测试数据中,这些偏差模式可能变化,导致均值预测器系统性地出错,从而改变残差分布。这种效应与传统的协变量偏移不同,因为输入 \(x\) 的边际分布可能保持不变,而条件分布 \(y|x\) 由于退化过程的变化而发生偏移。残差目标指定错误正是这种条件分布偏移的体现。 为了缓解这个问题,我们需要一种方法来调整残差生成器,使其在训练期间看到的残差分布与测试时遇到的分布更匹配。这引导我们提出下一节中的ReMatch方法。
相似文章
时态分布偏移下的域自适应气候降尺度
本文研究了基于深度学习的气候降尺度中的时态分布外偏移问题,并提出了一种域自适应框架,该框架结合了监督重建与域对齐,以在非平稳条件下改进高分辨率气候预测。
多重分布偏移下可靠经济预测区间的动态机制感知共形校准
本文介绍了DRACP,一种共形预测方法,它统一多种适应机制,在分布偏移下提供可靠的经济预测区间,实现以更宽区间的校准。
极端降水降尺度的多分位数回归
介绍了Q-SRDRN,一种使用分位数损失的多分位数超分辨率网络,用于改进极端降水降尺度,在保持整体精度的同时,显著提高了强降雨事件的检测率。
阐明扩散概率模型的SNR-t偏差
# 论文页面 - 阐明扩散概率模型的SNR-t偏差 来源:[https://huggingface.co/papers/2604.16044](https://huggingface.co/papers/2604.16044) ## 摘要 扩散概率模型在推理阶段存在SNR-timestep偏差,本文提出一种微分校正方法,对频率分量分别处理,以极低计算代价提升多种模型的生成质量。 [扩散概率模型](https://hugg
恢复知识追踪中被搁置的区分能力:基于经验贝叶斯收缩的逐项偏差校正
本文介绍了 SLC(状态空间逻辑校正),该方法通过卡尔曼平滑器进行经验贝叶斯收缩,纠正知识追踪模型中的逐项逻辑偏差,从而在 AUC 指标上优于全局校准技术。