基于解析预测推断的高效贝叶斯深度集成

arXiv cs.LG 论文

摘要

介绍了一种用于预测回归的高效贝叶斯深度集成方法,该方法结合了低维集成表示、闭式贝叶斯聚合和独立集成训练,以在保持计算效率的同时获得校准的不确定性估计。

arXiv:2607.06776v1 公告类型:新 摘要:我们提出了一种用于预测回归的高效贝叶斯深度集成方法,旨在增强可解释性,同时保持具有竞争力的预测性能和计算效率。我们的方法将贝叶斯推断的统计严谨性与深度集成的可扩展性相结合,提供校准的不确定性估计,使其不仅可用于独立预测,还可作为更广泛学习系统中的组件。为实现这些目标,我们的工作依赖于三个关键设计组件:(i) 低维集成表示:预测表示为少量训练过的神经预测器的组合,实现可扩展推断,其成本取决于集成大小而非数据集大小;(ii) 闭式贝叶斯聚合:使用贝叶斯线性回归组合集成预测,得到可解释的后验权重和校准的不确定性,无需近似推断;(iii) 独立集成训练:多个神经网络分别训练,产生多样化的预测表示,提高鲁棒性和不确定性校准。在标准回归基准上的实验结果表明,所提出的方法在跨设置下保持可靠的不确定性估计的同时,实现了具有竞争力的预测性能。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:43

# 通过分析预测推理实现高效贝叶斯深度集成

来源:https://arxiv.org/html/2607.06776
Sina Aghaee Dabaghan Fard¹, Marie Maros¹, Jaesung Lee¹ ¹德州农工大学 Wm Michael Barnes '64 工业与系统工程系,美国德克萨斯州大学城

###### 摘要

我们提出了一种高效的贝叶斯深度集成预测回归方法,旨在增强可解释性,同时保持有竞争力的预测性能和计算效率。我们的方法将贝叶斯推理的统计严谨性与深度集成的可扩展性相结合,提供校准的不确定性估计,使其不仅适用于独立预测,也可作为更广泛学习系统中的一个组成部分。为实现这些目标,我们的工作依赖于三个关键设计组件:(i) 低维集成表示:预测表示为少量训练好的神经预测器的组合,实现可扩展推理,其成本取决于集成大小而非数据集大小;(ii) 封闭式贝叶斯聚合:使用贝叶斯线性回归组合集成预测,无需近似推理即可得到可解释的后验权重和校准的不确定性;(iii) 独立集成训练:多个神经网络分别训练,产生多样化的预测表示,提高鲁棒性和不确定性校准。在标准回归基准上的实证结果表明,所提出的方法在保持可靠的不确定性估计的同时,达到了有竞争力的预测性能。

图1:提出的框架。一个神经网络集成诱导出一个特征空间表示\{φ_h(x_i;θ_h)\}_{h=1}^H。在这些集成诱导的特征之上放置一个贝叶斯线性模型,并且线性权重β和噪声方差σ²_ε根据其后验被积分掉,从而得到关于目标变量y的封闭式后验预测分布。

## 1 引言

我们考虑在需要可靠的不确定性估计以及(i)计算效率、(ii)强预测性能和(iii)可解释性的场景下的预测回归模型。这一要求在安全关键和风险敏感应用中尤为重要 (Filos 等, 2019),在这些应用中,深度神经网络已知会产生校准不良的预测,可能过于自信 (Guo 等, 2017; Lakshminarayanan 等, 2017; Watson 等, 2021),尤其是在分布偏移下。此外,带有量化不确定性的回归模型是更广泛学习系统的核心组成部分,包括强化学习 (Sutton 等, 1998; Arulkumaran 等, 2017; Levine 等, 2020; Deisenroth and Rasmussen, 2011) 和物理信息神经网络 (Raissi 等, 2019)。目标(i)–(iii)本质上是相互矛盾的。接下来,我们将考察几种广泛使用的范式,这些范式在不同程度上满足了这些要求,同时也暴露出重要的权衡。

在预测性能和原则性不确定性估计方面,高斯过程为非线性回归提供了一个经典的贝叶斯框架,具有精确的后验推理 (Williams and Rasmussen, 2006)。然而,其三次计算复杂性和对核选择的敏感性从根本上限制了可扩展性,尤其是在基于距离的核受维度诅咒影响的高维设置中。深度核学习通过使用神经网络学习数据依赖的协方差函数,部分缓解了这一限制,但精确推理仍然计算密集,可扩展实现通常依赖于近似 (Wilson 等, 2016)。

全贝叶斯神经网络通过在网络参数上放置概率分布,代表了性能-计算权衡中的另一个点 (Neal, 2012; Wilson and Izmailov, 2020)。虽然它们为不确定性建模提供了灵活的贝叶斯框架,但精确推理通常难以处理,实际实现依赖于近似推理方法,如平均场变分推理 (Graves, 2011)。这些近似可能对后验分布施加限制性假设,导致不确定性估计校准不良 (Foong 等, 2020; Wenzel 等, 2020)。

贝叶斯最后一层方法通过将贝叶斯推理限制在神经网络的最后一个线性层,解决了全贝叶斯神经网络的计算局限性。这种设计在保持预测的概率解释的同时实现了高效推理 (Lázaro-Gredilla and Figueiras-Vidal, 2010)。然而,由于不确定性仅放在单个学习到的表示上,表示本身被视为固定。结果,当学习到的表示未能捕捉数据中的变异性时,特别是在训练分布之外,不确定性估计可能过于自信 (Watson 等, 2021)。诸如函数正则化之类的扩展已被提出以缓解这一限制,但它们引入了额外的计算开销,而没有从根本上解决对单一表示的依赖 (Watson 等, 2021)。

深度集成通过独立训练多个神经网络并均匀平均其预测分布,提供了一种简单且可扩展的不确定性量化方法 (Lakshminarayanan 等, 2017)。这些方法通常在保持适度计算成本的同时产生强大的实证性能。然而,它们缺乏显式的概率解释,因为不确定性是通过模型多样性隐式量化的,而不是通过定义良好的函数上的概率测度。此外,均匀平均是非诊断性的:它不提供概率证据来表明哪些集成成员被数据支持,或者单个成员如何对预测做出贡献。结果,当成员质量变化时,性能可能下降,增加了过度自信预测的风险。

综上所述,这些方法揭示了一个重复出现的模式:提供原则性不确定性估计的方法通常带来巨大的计算成本或限制模型灵活性,而可扩展方法通常依赖于提供有限可解释性的启发式聚合规则。因此,设计同时实现计算效率、强大预测性能和可解释不确定性估计的模型仍然是一个开放的挑战。

### 1.1 主要贡献

在这项工作中,我们提出了**贝叶斯深度核网络**,一个结合独立训练神经网络与封闭式贝叶斯聚合的回归框架。该方法在数据集 D = {(x_i, y_i)}_{i=1}^N 上训练 H 个神经网络,产生多个学习到的特征表示,这些表示作为基函数。然后在这些集成输出上应用贝叶斯线性回归层,从而得到聚合权重的解析后验和封闭式的后验预测分布 (图1)。这种设计在保留标准深度集成的计算效率和预测性能的同时,实现了原则性的不确定性估计。

该框架利用了深度集成的可扩展性,同时用贝叶斯聚合替换了均匀平均。通过在聚合阶段执行精确推理,该方法无需依赖近似推理即可产生可解释的后验权重和校准的不确定性估计。综上所述,这种设计解决了相互竞争的目标(i)–(iii)。我们将由此产生的贡献总结如下。

**使用学习到的神经预测器和有限秩GP解释的可扩展贝叶斯聚合。** 我们使用封闭式贝叶斯线性回归聚合独立训练的神经网络,产生解析的后验预测分布,其计算成本与标准深度集成相当。所得模型可解释为一个有限秩高斯过程,其基函数通过集成训练直接学习,无需核设计或三次成本的GP推理即可实现原则性的贝叶斯聚合。

**表示学习和概率推理的分离。** 我们的框架保持标准深度集成训练流程,仅在聚合阶段执行贝叶斯推理。与将不确定性放在单一潜在表示上的贝叶斯最后一层方法不同,我们的方法直接在集成成员贡献上定义不确定性。这种分离在保持实现简单性的同时,为单个预测器提供了可解释的概率权重。

**对异构集成成员质量具有鲁棒性的后验驱动聚合。** 聚合权重不是均匀平均,而是从后验分布中推断出来的。数据支持较弱的集成成员被自动降低权重,从而在由于优化变异性或训练条件导致模型质量变化时提高鲁棒性。这种鲁棒性无需手动模型选择或额外的调整启发式即可实现。

为了评估这些设计选择对计算效率、预测性能和可解释性的实际影响,我们在标准UCI回归基准上,跨一系列架构和优化设置进行了实验。

## 2 贝叶斯深度核网络

在本节中,我们将介绍我们的框架,同时强调与现有方法相比的每项改进。我们从介绍BLL开始,然后在此基础上构建。

### 2.1 通过集成成员学习特征空间表示

令 D = {(x_i, y_i)}_{i=1}^N 表示数据集,其中 x_i ∈ ℝ^P 是输入向量,y_i ∈ ℝ 是标量响应。为了简单且不失一般性,我们在本文中考虑标量响应。记 φ(·;θ): ℝ^P → ℝ^H 为参数 θ 的特征映射。在 BLL 中,潜在函数 f 建模为

y_i = f(x_i;θ) = φ(x_i;θ)^⊤ β + ε_i, ε_i ∼ N(0, σ²_ε) (1)

其中 β ∼ N(μβ, Σβ) 是特征权重。

将响应堆叠到向量 ℝ^N 中,得到紧凑表示

y = Φ(x;θ)β + ε, (2)

其中 Φ(x;θ) = [φ(x_1;θ), ..., φ(x_N;θ)]^⊤ ∈ ℝ^{N×H}。然后,训练通过寻找 θ, σ²_ε, 和 Σβ 进行,这需要最大化精确或近似的边际似然,并且 β 通过其后验 p(β|D,θ) 以封闭形式获得 (Watson 等, 2021)。注意到特征映射 φ(x;θ) 只学习一次,然后在贝叶斯推理期间被视为固定。这意味着用于捕捉不确定性的变异性仅来自于权重 β 的后验,而表示本身保持确定性。因此,不确定性仅被限制在单一学习特征空间内的线性组合。

为了改善分布外区域的不确定性行为,我们将DE风格的表示思想与BLL相结合,以获得更好校准的不确定性。与训练单个神经网络来构建 Φ 的标准BLL不同,我们定义一组特征映射 {φ_h(·;θ_h)}_{h=1}^H,其中每个元素是各自 θ_h 参数化的独立映射,得到

Φ(x;θ) = [φ_1(x_1;θ_1), ..., φ_h(x_h;θ_h)]^⊤

在 (2) 中。这 H 个特征映射中的每一个都由一个独立训练的神经网络实现。训练通过最大化 y_i ∼ N(φ_h(x_i;θ_h), σ²_h(x_i;θ_h)) 的高斯似然进行,其中均值函数 φ_h(·) 和方差函数 σ²_h(·) 都是网络的输出。注意 σ²_h(·) 仅在训练期间使用,以引入异方差目标,目的是防止所有网络以相同的平滑度拟合数据。它重新调整每个训练点对损失的贡献:预测方差较大的点受到较小的惩罚,而方差较小的点拟合得更紧密。这种样本依赖的重新调整导致独立训练的集成成员之间学习到的特征映射具有异质性。

独立训练为我们的模型带来以下好处。首先,特征映射可以完全并行训练,允许集成大小扩展而不增加超过单个神经网络的训练时间。其次,每个特征映射代表数据的完整预测模型,而不是潜在基。这样,独立学习到的特征映射集合捕捉了数据的多个不同函数表示,这在数据相对于模型大小不足时尤为重要。

### 2.2 诱导函数空间中的贝叶斯推理

一旦 Φ 被获得,β ∈ ℝ^H 上的后验分布通过函数空间中的贝叶斯线性回归 (2) 进行推断。

相似文章

轻量级隐式神经表示的误差感知分布预测

arXiv cs.LG

本文提出了一种轻量级方法,通过将连续目标离散化为区间,将基于回归的隐式神经表示训练重新表述为分类任务,从而在科学数据压缩中实现灵活的分布建模,用于误差感知的不确定性估计。

学习预测性模糊集以用于面向决策的分布鲁棒优化

arXiv cs.LG

提出学习预测性模糊集(LPAS)用于分布鲁棒优化,其中深度上下文模型输出名义情景分布、状态依赖的Wasserstein半径和基础度量,并通过决策损失和校准进行训练。应用于S&P 500数据的投资组合优化,该方法实现了更高的回报和夏普比率,同时相比于固定半径基线减少了保守性。