不确定性的隐藏轴:具有贝叶斯输出层的图神经网络中的潜在后验对齐
摘要
本文介绍了潜在后验对齐,以解释具有贝叶斯输出层的图神经网络中的不确定性减少,并提出了对齐引导学习来改善不确定性量化和模型校准。
arXiv:2608.20758v1 公告类型:新
摘要:具有贝叶斯输出层的贝叶斯神经网络(BNNs)提供了一个基于原则且易于处理的框架来量化预测不确定性,但塑造这种不确定性的机制仍然不清楚。传统理论将不确定性减少归因于后验收缩,但相应的假设对于深度模型不一定成立。在本文研究的具有贝叶斯输出层的图神经网络(GNNs)中,我们观察到随着潜在表示向低方差后验方向移动,预测不确定性减少,即使后验方差没有收缩。我们将此行为称为潜在后验对齐(LPA),并进行干预实验,支持其在塑造预测不确定性中的功能作用。基于此洞察,我们提出对齐引导学习(AGL),它在训练期间显式促进这种对齐。AGL在保持准确性的同时有效减少预测不确定性,并改善结构校准,确保模型置信度忠实反映底层数据密度。这些发现为具有平均场贝叶斯输出层的图神经网络中的不确定性动态提供了新视角,将焦点从后验的大小转移到潜在空间和参数空间之间的几何相互作用。
查看缓存全文
缓存时间: 2026/08/24 04:33
# 隐形不确定性轴:贝叶斯输出层图神经网络中的潜在-后验对齐 来源:https://arxiv.org/html/2608.20758 采用贝叶斯输出层的贝叶斯神经网络(BNNs)为量化预测不确定性提供了一个有原则且可处理的框架,但塑造这种不确定性的机制仍不清楚。传统理论将不确定性的降低归因于后验收缩,但相应的假设对于深度模型而言未必成立。在本文研究的具有贝叶斯输出层的图神经网络(GNNs)中,我们观察到,即使后验方差没有收缩,随着潜在表示向更低方差的后验方向移动,预测不确定性也会降低。我们将这种行为称为**潜在-后验对齐**,并通过介入性实验支持其在塑造预测不确定性中的功能作用。基于此见解,我们提出了**对齐引导学习**,该方法在训练过程中显式地促进这种对齐。AGL 在保持精度的同时有效降低了预测不确定性,并改善了结构校准,确保模型置信度忠实地反映底层数据密度。这些发现为具有平均场贝叶斯输出层的GNN中的不确定性动态提供了一个新视角,将重点从后验的大小转移到了潜在空间与参数空间之间的几何相互作用上。 **Suk Hoon Choi** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 **Damdae Park** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 **Junhyuk Choi** 邮箱:[[email protected]](mailto:[email protected]) 单位:高丽大学化学与生物工程系,首尔 02841,大韩民国 **Hyein Jung** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 **Changsoo Kim** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 单位:韩国科学技术大学能源与环境技术部,217 Gajeong-ro, Yuseong-gu, 大田 34113,大韩民国 **Ung Lee** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 单位:韩国科学技术大学能源与环境技术部,217 Gajeong-ro, Yuseong-gu, 大田 34113,大韩民国 **Kyeongsu Kim** 邮箱:[[email protected]](mailto:[email protected]) 单位:韩国科学技术研究院清洁能源研究中心,首尔 02792,大韩民国 单位:韩国科学技术大学能源与环境技术部,217 Gajeong-ro, Yuseong-gu, 大田 34113,大韩民国 **关键词**:图神经网络、贝叶斯输出层、不确定性、后验、潜在-后验对齐、对齐引导学习 ## 1 引言 随着深度学习系统越来越多地部署在数据稀缺的科学和工程领域10 (https://arxiv.org/html/2608.20758#bib.bib70); 11 (https://arxiv.org/html/2608.20758#bib.bib72),量化预测不确定性已变得至关重要。在安全关键型和科学应用中,如自动驾驶8 (https://arxiv.org/html/2608.20758#bib.bib58); 12 (https://arxiv.org/html/2608.20758#bib.bib59); 77 (https://arxiv.org/html/2608.20758#bib.bib60)、医学诊断17 (https://arxiv.org/html/2608.20758#bib.bib61); 48 (https://arxiv.org/html/2608.20758#bib.bib62)和加速材料发现33 (https://arxiv.org/html/2608.20758#bib.bib56); 63 (https://arxiv.org/html/2608.20758#bib.bib57); 49 (https://arxiv.org/html/2608.20758#bib.bib55),这些挑战尤为突出。为应对这些挑战,贝叶斯神经网络(BNNs)已成为建模深度学习架构不确定性的有原则框架55 (https://arxiv.org/html/2608.20758#bib.bib63); 42 (https://arxiv.org/html/2608.20758#bib.bib71); 32 (https://arxiv.org/html/2608.20758#bib.bib64)。常见的近似贝叶斯方法包括平均场变分推断(Bayes-by-Backprop)6 (https://arxiv.org/html/2608.20758#bib.bib3)和蒙特卡洛丢弃法22 (https://arxiv.org/html/2608.20758#bib.bib65),而深度集成(Deep Ensembles)39 (https://arxiv.org/html/2608.20758#bib.bib66)则是一种广泛使用的非贝叶斯替代方案。这些方法共同的实用目标是量化预测不确定性,或称“模型所不知的”34 (https://arxiv.org/html/2608.20758#bib.bib4); 29 (https://arxiv.org/html/2608.20758#bib.bib35)。 传统上,贝叶斯模型中预测不确定性的降低被归因于后验分布的收缩。这一观点根植于经典的Bernstein-von Mises定理69 (https://arxiv.org/html/2608.20758#bib.bib38); 21 (https://arxiv.org/html/2608.20758#bib.bib39),其假设随着数据累积,后验渐近地收敛于以真实参数为中心的高斯分布,导致方差消失6 (https://arxiv.org/html/2608.20758#bib.bib3); 74 (https://arxiv.org/html/2608.20758#bib.bib6); 24 (https://arxiv.org/html/2608.20758#bib.bib15)。然而,这一理论保证建立在严格的假设之上——即模型被良好指定(即能够完美复制真实数据生成过程)36 (https://arxiv.org/html/2608.20758#bib.bib36),参数空间是有限维且固定的21 (https://arxiv.org/html/2608.20758#bib.bib39),且Fisher信息矩阵是正定的71 (https://arxiv.org/html/2608.20758#bib.bib40)——这些条件在现代深度学习环境中可能无法满足13 (https://arxiv.org/html/2608.20758#bib.bib50); 7 (https://arxiv.org/html/2608.20758#bib.bib37)。因此,经典的“数据越多,后验越紧,不确定性越低”的保证在此理论框架下变得脆弱36 (https://arxiv.org/html/2608.20758#bib.bib36); 7 (https://arxiv.org/html/2608.20758#bib.bib37); 47 (https://arxiv.org/html/2608.20758#bib.bib51)。 最近的实证研究进一步表明,深度贝叶斯模型中的不确定性行为可能偏离后验收缩的直觉。对损失景观的分析揭示,深度BNN中的后验是高度复杂且多模态的,与经典贝叶斯理论假设的简单紧凑分布有根本性的不同30 (https://arxiv.org/html/2608.20758#bib.bib25); 19 (https://arxiv.org/html/2608.20758#bib.bib68)。此外,关于“冷后验”效应的研究表明,BNN后验并未表现出预期的收缩,且为了泛化常常需要人为的锐化,这突显了贝叶斯理论与深度模型行为之间的根本不匹配74 (https://arxiv.org/html/2608.20758#bib.bib6); 1 (https://arxiv.org/html/2608.20758#bib.bib41); 53 (https://arxiv.org/html/2608.20758#bib.bib42)。类似地,分布外(OOD)基准测试表明,BNNs在低数据密度区域经常表现出过度自信的预测,而这些区域的不确定性本应很高,且后验应保持分散57 (https://arxiv.org/html/2608.20758#bib.bib13); 2 (https://arxiv.org/html/2608.20758#bib.bib43); 52 (https://arxiv.org/html/2608.20758#bib.bib47); 14 (https://arxiv.org/html/2608.20758#bib.bib44); 18 (https://arxiv.org/html/2608.20758#bib.bib45)。这种失配违背了数据密度与不确定性之间的基本对应关系。 关键的是,此类失败会传播到下游应用。在主动学习中,基于不确定性的采集策略常常无法超越简单的随机采样,因为它们未能忠实地反映数据稀缺性76 (https://arxiv.org/html/2608.20758#bib.bib49); 62 (https://arxiv.org/html/2608.20758#bib.bib46)。同样,在贝叶斯优化中,缺乏距离感知会模糊信息丰富的中间区域,直接阻碍了高效的探索20 (https://arxiv.org/html/2608.20758#bib.bib48)。在化学和材料应用中,这些局限性尤为重要,因为在这些领域,预测模型通常在低数据量和分布偏移条件下运行。在这些领域,不确定性估计不仅仅是辅助输出,它们常常直接影响分子筛选、主动学习和实验优先级排序等决策过程。 在现有的架构中,图神经网络(GNNs)由于其能够编码原子结构和化学相互作用,已成为机器学习原子间势(MLIPs)和分子属性预测任务的常用骨干网络。因此,不确定性估计方面的缺陷——如在稀疏区域的密度感知能力差或过度自信的预测——会传播到下游工作流中,阻碍对化学空间的有效探索。 基于这些实际考量,我们关注采用贝叶斯输出层的贝叶斯图神经网络(BGNNs),并重新审视这些架构中预测不确定性是如何形成的。基于这些理论和实践考量,我们重新审视了BNNs中的不确定性动态。我们重点关注一类模型,该模型由确定性特征提取器和通过Bayes-by-Backprop训练的贝叶斯输出层组成,并在此框架内进行我们的分析。与通过后验收缩降低预测不确定性的传统预期相反,我们观察到,随着数据增加,即使权重后验方差变宽,预测不确定性也会降低。这种解耦行为要求对底层机制进行重新审视。 为此,我们识别出一个关键机制,称为**潜在-后验对齐**,它解释了预测不确定性是如何降低的。通过解析推导和实证分析,我们表明模型不是通过收紧其后验来最小化预测方差,而是通过将其潜在表示 \(\mathbf{z}\) 与后验的低方差方向对齐来实现。我们通过介入性实验探究了这一机制的因果作用:通过潜在正则化结构性地破坏LPA会持续放大预测不确定性,支持了LPA对模型置信度的因果贡献。 基于这一观察,我们引入了**对齐引导学习**,这是一种显式促进这种对齐的训练框架。我们表明,AGL在保持精度的同时降低了预测不确定性,并显著改善了结构校准,表明模型置信度更忠实地反映了底层数据密度。这种输出不确定性与数据密度之间改善的对齐表明,AGL可以使模型的预测置信度与训练数据的局部密度更加一致。这种密度感知在包括分子建模和MLIPs在内的化学和材料领域尤为有价值,因为不确定性估计可以帮助识别支持较弱的结构,并优先考虑额外的计算或实验。 总之,我们的发现为具有贝叶斯输出层的模型中的不确定性提供了新的视角,强调了LPA而非后验大小的作用。 ## 2 结果 为了研究决定预测不确定性的机制,我们设计了一个贝叶斯图神经网络(BGNN),如图1 (https://arxiv.org/html/2608.20758#S2.F1)a所示。该架构结合了一个确定性的图同构网络(GIN)75 (https://arxiv.org/html/2608.20758#bib.bib21); 51 (https://arxiv.org/html/2608.20758#bib.bib29)(用于从分子结构学习潜在表示)和一个用于不确定性量化的贝叶斯线性输出层6 (https://arxiv.org/html/2608.20758#bib.bib3); 67 (https://arxiv.org/html/2608.20758#bib.bib32); 16 (https://arxiv.org/html/2608.20758#bib.bib31); 23 (https://arxiv.org/html/2608.20758#bib.bib33)。先前研究表明,在所研究的设定下,贝叶斯最后一层模型可以保留预测性能并提供与更广泛贝叶斯化网络相当的不确定性估计,同时计算成本大大降低28 (https://arxiv.org/html/2608.20758#bib.bib73); 78 (https://arxiv.org/html/2608.20758#bib.bib74)。尽管这种方法没有捕捉确定性特征提取器中的参数不确定性,但它为将预测方差分解为表示和输出权重贡献提供了一个实用且分析上可处理的框架。因此,我们采用此形式来研究具有贝叶斯输出层的GNN中的不确定性形成。 为确保我们观察的稳健性和普遍性,我们在六个分子属性预测基准数据集上进行了实验。在正文中,我们展示了以分配系数数据集46 (https://arxiv.org/html/2608.20758#bib.bib67)作为代表性示例的结果,其余数据集的结果见补充信息。 在本节中,我们提出一系列重新审视此类BNNs中不确定性传统理解的发现。我们首先识别出一种反直觉的行为:尽管后验方差扩大,但随着数据密度增加,预测不确定性降低(第2.1节 (https://arxiv.org/html/2608.20758#S2.SS1))。为解释这一现象,我们引入LPA作为核心机制。我们表明,潜在表示的几何形状——而非后验方差的大小——在决定预测不确定性中起着核心作用(第2.2节 (https://arxiv.org/html/2608.20758#S2.SS2))。然后,我们通过扰动潜在空间结构的介入性实验来探究LPA的因果贡献,并证明这种基于对齐的机制在多种概率设定下持续存在(第2.3节 (https://arxiv.org/html/2608.20758#S2.SS3))。最后,我们提出了**对齐引导学习**,这是一种显式促进这种几何对齐的训练策略,在保持预测精度的同时降低了平均预测不确定性并增强了密度-不确定性依赖性(第2.4节 (https://arxiv.org/html/2608.20758#S2.SS4))。 ### 2.1 重新思考贝叶斯神经网络中的不确定性行为 参见图注 **图1:BGNN的不确定性行为。** (a) BGNN架构示意图。(b–g) 与传统预期的偏差。随着训练数据增加,预测误差(b)和不确定性降低(c),而权重后验不确定性扩大(d),导致在数据丰富区域(f,红色)比数据稀缺区域(f,蓝色)分布更宽。后验均值平均保持在零附近(e),同时NLL和KL项均降低(g)。阴影区域代表n=30次独立运行的标准差。“训练数据[%]”表示用于训练每个模型的可用训练集的百分比。与Bernstein-von Mises定理69 (https://arxiv.org/html/2608.20758#bib.bib38); 21 (https://arxiv.org/html/2608.20758#bib.bib39)和基本贝叶斯理论4 (https://arxiv.org/html/2608.20758#bib.bib1); 45 (https://arxiv.org/html/2608.20758#bib.bib2); 25 (https://arxiv.org/ht
相似文章
图对齐拓扑作为接地检测的归纳偏置
本文介绍了将图对齐拓扑作为接地检测的归纳偏置,使用图神经网络对参考信息与LLM输出之间的对齐结构进行建模。该方法在多个幻觉和问答数据集上取得了最先进的结果,性能优于GPT-4o。
生物和人工神经网络之间的双向表征对齐
本文提出一个计算框架,用于调控表征几何以改善生物和人工神经网络之间的双向对齐,展示了双向预测能力的55%相对提升。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
贝叶斯因果发现如何失败?潜在混杂下线性高斯网络中结构后果的刻画
本文分析了在潜在混杂下线性高斯网络中贝叶斯因果发现如何失败,推导出一个导致评分函数偏好虚假边的相关性阈值,并刻画了两种不同的后验失败模式。
几何感知的神经算子事后不确定性量化
提出REEF-GP,一种事后不确定性量化框架,通过将高斯过程拟合到冻结神经算子的残差上并利用其内部嵌入,以低成本实现几何感知且校准的不确定性。