PAC-Bayes 超越参数空间:行为等价性、Z-information 与精确复杂度分解
摘要
本文将 PAC-Bayes 理论扩展到参数空间之外,通过行为等价性对其复杂度度量进行分解,引入了 PAC-Bayes Z-information 以及超越参数空间的精确结构分解。
查看缓存全文
缓存时间: 2026/08/13 15:36
来源:https://arxiv.org/html/2608.11465 Vasant G Honavar [email protected] 隶属机构:人工智能研究实验室 隶属机构:信息学与智能系统系 隶属机构:宾夕法尼亚州立大学 Satish Kumar Keshri [email protected] 隶属机构:人工智能研究实验室 隶属机构:信息学与智能系统系 隶属机构:宾夕法尼亚州立大学 Neil Ashtekar [email protected] 隶属机构:人工智能研究实验室 隶属机构:计算机科学与工程系 隶属机构:宾夕法尼亚州立大学 Zehao Liu [email protected] 隶属机构:人工智能研究实验室 隶属机构:信息学与智能系统系 隶属机构:宾夕法尼亚州立大学 ###### 摘要 PAC-Bayes 理论通过控制所选假设表示上后验分布与先验分布之间的 Kullback–Leibler(KL)散度来提供泛化保证。然而,预测风险仅取决于假设所诱导的预测行为,而不取决于实现该行为的特定内部实现。在现代过参数化学习系统中,许多不同的配置可能诱导出相同的预测行为,但经典的 PAC-Bayes KL 散度并不区分预测行为上的不确定性与行为等价实现之间的变异。我们证明,这一区分能够引出经典 PAC-Bayes 复杂度的一个精确结构分解。我们通过可测行为映射形式化行为等价性,并利用测度分解将配置空间上的概率测度分解为一个预测行为上的分布以及行为纤维上的条件分布。这给出了经典 PAC-Bayes KL 散度的一个精确分解,分为行为选择项和行为纤维内期望条件 KL 散度所给出的实现层面项。我们将 PAC-Bayes Z-信息定义为该实现层面贡献的负值。因此,PAC-Bayes Z-信息精确量化了经典 PAC-Bayes KL 散度与预测行为不确定性所对应的不可约复杂度之间的差距。我们进一步证明,行为选择项具有精确的变分刻画:它是在所有诱导相同预测行为分布的后续分布中,经典 PAC-Bayes KL 散度的最小值。等价地,每个后验分布都存在一个典范的纤维对称化代表,该代表具有相同的预测行为且经典 PAC-Bayes 复杂度最小。最后,我们表明对称性、保持行为的方向、纤维几何以及纤维保持扰动下的不变性都自然地源自同一行为映射结构。综合这些结果,我们确认预测行为是 PAC-Bayes 复杂度的自然对象,给出了实现多重性的统一测度论与几何刻画,并揭示了经典 PAC-Bayes 理论中隐含的一个精确结构分解。 ## 1 引言 ### 1.1 背景与动机 PAC-Bayes 理论通过将预测性能与假设的后验/先验分布之间的散度联系起来,为统计学习提供了最强的一类泛化保证(30 (https://arxiv.org/html/2608.11465#bib.bib33);36 (https://arxiv.org/html/2608.11465#bib.bib39);5 (https://arxiv.org/html/2608.11465#bib.bib14))。这些结果建立在熵、相对熵、交叉熵和互信息等基本信息论量之上,而这些量在学习、压缩和统计推断中具有核心地位(38 (https://arxiv.org/html/2608.11465#bib.bib19);39 (https://arxiv.org/html/2608.11465#bib.bib11);8 (https://arxiv.org/html/2608.11465#bib.bib20))。最小描述长度(MDL)等经典原理同样通过压缩和简约表示来解释学习(34 (https://arxiv.org/html/2608.11465#bib.bib38);15 (https://arxiv.org/html/2608.11465#bib.bib1))。这些方法的一个共同特征是,不确定性和复杂度是相对于某一选定的表示来量化的,无论该表示是假设、函数、参数还是可观测结果。然而,预测风险仅取决于假设所诱导的行为,而不取决于实现该行为的特定内部实现。这引出了一个基本问题:经典 PAC-Bayes 复杂度在多大程度上反映的是预测行为上的不确定性,而非对预测没有影响的等价实现之间的变异?这种区分在现代过参数化学习系统中变得越来越重要。神经网络通常具有许多不同的参数配置,它们会诱导相同或几乎相同的输入-输出行为(32 (https://arxiv.org/html/2608.11465#bib.bib37);11 (https://arxiv.org/html/2608.11465#bib.bib22))。这种冗余在经验上与更好的泛化性和鲁棒性相关,通常通过参数空间中的平坦极小值或低曲率区域体现(17 (https://arxiv.org/html/2608.11465#bib.bib23);22 (https://arxiv.org/html/2608.11465#bib.bib24);7 (https://arxiv.org/html/2608.11465#bib.bib16))。与此同时,基于锐度和曲率的刻画对重参数化和优化细节很敏感,因此难以将它们解释为预测行为的内在属性(11 (https://arxiv.org/html/2608.11465#bib.bib22);20 (https://arxiv.org/html/2608.11465#bib.bib7))。这些观察表明,应当区分预测行为上的不确定性与同一行为的实现之间的变异。如果许多配置诱导相同的预测行为——我们将这一现象称为*实现多重性*——那么预测风险无法区分它们,而配置空间的复杂度仍可能为行为等价的实现赋予不同的贡献。PAC-Bayes 理论已经允许在任意可测假设空间上进行表述,包括函数空间表示(36 (https://arxiv.org/html/2608.11465#bib.bib39))。同样,最近的工作表明,不变性和对称性可以通过识别在适当变换下等价的预测器来降低有效 PAC-Bayes 复杂度(29 (https://arxiv.org/html/2608.11465#bib.bib35);2 (https://arxiv.org/html/2608.11465#bib.bib34))。这些进展促成了一个更广泛的问题:给定任意可测的行为等价性概念,经典 PAC-Bayes KL 散度是否可以被精确分解为来自预测行为的贡献与来自实现多重性的贡献?如果可以,这种分解会揭示哪些结构性质? ### 1.2 行为充分性与实现多重性 本文工作的核心观察是,经验风险和总体风险对预测器的特定实现不变,仅取决于其诱导的输入-输出行为。这引出了假设上的一个等价关系: \[ \theta\sim\theta^{\prime}\quad\Longleftrightarrow\quad\theta\text{ 与 }\theta^{\prime}\text{ 诱导相同的预测行为}。 \] 行为等价性将配置空间划分为实现同一预测器的等价类。因此,每个等价类代表一个预测行为及其所有实现。这种行为与实现的分离为区分预测行为上的不确定性与等价实现之间的变异提供了一个自然框架。在后续的测度论发展中,我们通过一个可测行为映射来实现这一结构: \[ \beta:\Theta\rightarrow\mathcal{K}, \] 其中 \(\mathcal{K}\) 是预测行为的标准 Borel 空间,\(\beta(\theta)\) 表示配置 \(\theta\) 诱导的预测行为。行为等价性正是行为映射下的相等: \[ \theta\sim\theta^{\prime}\quad\Longleftrightarrow\quad\beta(\theta)=\beta(\theta^{\prime})。 \] 对于行为 \(k\in\mathcal{K}\),集合 \(\beta^{-1}(k)\) 包含所有诱导该行为的配置。用可测映射的语言来说,这些集合就是 \(\beta\) 的纤维。在本文中,我们互换使用*行为等价类*和*纤维*这两个术语。 在标准测度论假设下,配置空间上的概率测度关于行为映射存在测度分解(6 (https://arxiv.org/html/2608.11465#bib.bib42);21 (https://arxiv.org/html/2608.11465#bib.bib29))。这给出了以下分解: 1. 预测行为上的一个分布;以及 2. 每个行为纤维内关于实现的若干个条件分布。 从这个角度看,经典 PAC-Bayes KL 散度自然地分为两个概念上不同的散度来源: 1. 预测行为上的不确定性;以及 2. 在给定行为的条件下,实现上的不确定性。 只有前者直接影响预测风险。后者反映的是诱导相同行为的实现之间的变异,因此它会对经典 PAC-Bayes KL 散度作出贡献,却不会改变预测行为。重要的是,这种分解完全由行为映射诱导,因此是结构性的,而不是依赖于参数化的。它源于行为等价性本身,而不是来自任何特定的坐标系、优化过程或局部几何近似。 ### 1.3 贡献 我们的目标不是要在行为空间上直接进行 PAC-Bayes 分析,而是要识别任意可测的行为等价性概念在经典 PAC-Bayes 复杂度内部所诱导的潜在结构。我们证明,经典 PAC-Bayes KL 散度可以精确分解为行为层面与实现层面的贡献,并刻画这一分解的信息论与几何后果。我们的主要贡献如下。 - **PAC-Bayes 复杂度的行为分解。** 我们通过任意可测行为映射形式化行为等价性,并发展相应的基于纤维的测度论框架。在该框架内,我们证明经典 PAC-Bayes KL 散度可以精确分解为一个行为选择分量和一个与行为纤维相关的实现层面分量。 - **PAC-Bayes Z-信息。** 我们将 PAC-Bayes Z-信息定义为行为纤维内期望条件 KL 散度的负值,并证明它精确刻画了经典 PAC-Bayes 复杂度中的实现层面贡献,从而分离出实现多重性的影响。 - **行为选择复杂度的变分刻画。** 我们证明,行为选择项是所有诱导相同预测行为分布的后续分布中经典 PAC-Bayes KL 散度的最小值。这将行为选择复杂度识别为与预测行为本身相关的不可约贡献。 - **统一的几何解释。** 在适当的正则性假设下,行为纤维自然引出保持行为的方向、对称性、实现多重性以及纤维保持扰动下的不变性。这些为信息论分解所识别的实现层面分量提供了互补的几何解释。 综合来看,这些结果表明经典 PAC-Bayes 复杂度包含一个潜在的行为层面与实现层面的分解。本文的其余部分将展开这一分解,刻画其信息论与几何后果,并说明它如何阐明实现多重性在 PAC-Bayes 分析中的作用。 ### 1.4 组织结构 本文其余部分的组织结构如下。第 2 节 (https://arxiv.org/html/2608.11465#S2) 介绍行为等价性、行为映射以及全文使用的测度论框架。第 3 节 (https://arxiv.org/html/2608.11465#S3) 发展由行为等价性诱导的纤维分解,并引入实现熵和 PAC-Bayes Z-信息作为实现多重性的度量。第 4 节 (https://arxiv.org/html/2608.11465#S4) 建立经典 PAC-Bayes KL 散度到行为选择项和实现层面项的精确分解,发展相应的 PAC-Bayes 分析,并推导行为选择项的变分刻画。第 5 节 (https://arxiv.org/html/2608.11465#S5) 在连续配置空间中发展几何解释,将实现多重性与行为纤维、对称性、保持行为的方向以及体积结构联系起来。第 6 节 (https://arxiv.org/html/2608.11465#S6) 研究纤维保持扰动下的行为不变性及其与经典算法稳定性的关系。第 7 节 (https://arxiv.org/html/2608.11465#S7) 讨论相关工作。第 8 节 (https://arxiv.org/html/2608.11465#S8) 总结全文,并给出启示与未来研究方向。 ## 2 设置与行为等价性 我们形式化学习设置,并引入行为等价性,它为分离预测行为上的不确定性与内部实现上的不确定性提供了结构基础。关键观察非常简单。在现代过参数化模型中,许多不同的参数配置可以诱导相同的输入-输出行为。隐单元置换、缩放对称性以及其他不可辨识性来源可以产生不同的参数向量,却实现相同的预测器。由于预测只依赖于行为,而不依赖于实现该行为的特定实现方式,泛化分析应当区分预测行为上的不确定性与等价实现之间的冗余。本节的目标就是使这一区分精确化。 ### 2.1 学习框架 设 \(\mathcal{X}\) 和 \(\mathcal{Y}\) 分别表示输入空间和输出空间,并设 \(\mathcal{D}\) 为 \(\mathcal{X}\times\mathcal{Y}\) 上的未知分布。我们采用标准统计学习设置(41 (https://arxiv.org
相似文章
商参数空间上的PAC-Bayes界:几何诱导的隐式偏差先验
本文提出在商参数空间上进行PAC-Bayesian分析,以消除参数对称性带来的KL贡献,并构建一个几何诱导的先验,该先验逼近理想的后验匹配先验,从而得到更紧的泛化界。在傅里叶回归和查询-键注意力机制上的实验表明,KL散度和证据值显著降低。
通过贝叶斯实验设计识别用于认知参数推断的信息丰富环境
本文将认知实验设计表述为贝叶斯实验设计问题,引入了一个摊销框架,能够高效识别用于推断潜在规划参数的信息量最大的环境,并在Mouselab-MDP范式上验证了其性能。
物理信息机器学习泛化性的PAC-Bayesian视角
本文为物理信息机器学习开发了一种PAC-Bayesian框架,为无界损失提供了高概率泛化保证。它提出了一种多任务视角,联合处理数据保真度、偏微分方程残差和边界条件,并引入了一种自界限学习算法。
不可知直接和的速率分离
本文回答了Hanneke、Moran和Waknine提出的一个开放问题,证明了直接和的不可知PAC学习曲线并非仅由单实例学习曲线和因子数量决定,从而提供了一种速率分离。
A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation
This paper connects counterfactual explanations to generalized Bayes inference, showing that distance-minimization CEs are MAP estimates of a Gibbs posterior, and introduces new decision rules and evaluation metrics.