商参数空间上的PAC-Bayes界:几何诱导的隐式偏差先验
摘要
本文提出在商参数空间上进行PAC-Bayesian分析,以消除参数对称性带来的KL贡献,并构建一个几何诱导的先验,该先验逼近理想的后验匹配先验,从而得到更紧的泛化界。在傅里叶回归和查询-键注意力机制上的实验表明,KL散度和证据值显著降低。
arXiv:2607.18422v1 公告类型:新
摘要:过参数化模型通常具有连续参数对称性,因此不同的参数定义相同的预测器。我们表明,PAC--Bayesian分析应在商预测器空间上进行:将先验和后验推到商空间会保留经验吉布斯风险和总体吉布斯风险,同时消除仅由同一预测器的不同参数化之间两种分布的差异引起的非负KL贡献。
仅商化并不能确定使用哪个先验。我们为每个预测器构建一个规范参数化选择,并考虑其等价参数化的几何体积。这将一个中性参考先验转化为一个与数据无关的先验,反映了模型的隐式偏差。它逼近理想但不可行的后验匹配先验,该先验通过依赖训练数据来最小化KL项。当且仅当这个几何诱导先验与学习到的商后验之间的KL散度小于中性先验时,得到的证据会更紧。
我们在具有Hadamard参数化的傅里叶回归和查询-键注意力机制中测试了这一预测,使用了普通的SGD,没有显式正则化器。在傅里叶-Hadamard实验中,隐式偏差先验将平均商空间KL降低了40.69%,将平均PAC-Bayes证据降低了21.40%。查询-键注意力机制中较小且依赖于先验尺度的改进证实了预测的条件性效应。
查看缓存全文
缓存时间: 2026/07/22 08:20
# PAC–Bayes 商参数空间上的界:几何诱导的隐式偏置先验
**来源**: https://arxiv.org/html/2607.18422
**Nicola Aladrah¹, Fabio Anselmi¹,²**
¹ 的里雅斯特大学数学、信息学与地球科学系,Via Valerio 12/1, 34127 的里雅斯特,意大利
² 麻省理工学院麦戈文脑研究所,主街,剑桥,MA 02139,美国
###### 摘要
过参数化模型通常具有连续的参数对称性,因此不同参数定义了相同的预测器。我们证明 PAC–贝叶斯分析应该在商预测器空间上进行:将先验和后验推到商空间,可以保留经验吉布斯风险与总体吉布斯风险,同时消除完全由两个分布在相同预测器的不同参数化上的差异所引起的非负 KL 贡献。仅商化本身并不能决定使用哪个先验。我们构建了一个规范的选择,为每个预测器选择一个参数化,并考虑其等价参数化的几何体积。这将一个中性参考先验转换为一个数据无关的先验,反映了模型的隐式偏置。它近似于理想但不可采纳的后验匹配先验——后者通过依赖训练数据最小化 KL 项。当这个几何诱导的先验与学习到的商后验的 KL 散度小于中性先验时,得到的证书正好更紧。我们在具有 Hadamard 参数化的傅里叶回归和查询-键注意力机制中验证了这一预测,使用普通 SGD 且无显式正则化项。在傅里叶-Hadamard 实验中,隐式偏置先验将平均商空间 KL 降低了 40.69%,并将平均 PAC–贝叶斯证书降低了 21.40%。查询-键注意力机制中较小的、依赖于先验尺度的改进,证实了该效应预测的条件性质。
## 1 引言
现代学习模型通常运行在过参数化 regime 中,即可训练参数的数量超过观测数量。这类模型可能包含大量表示完全相同预测器的参数族,例如在具有参数对称性的机器学习模型中就是这样 [1, 15]。为了精确描述这一点,设 \(\mathcal{X}\) 为输入空间,\(\mathcal{Y}\) 为输出或标签空间。设 \(\mathcal{B}\) 为参数空间,\(b \in \mathcal{B}\) 为一个参数,例如模型的权重集合。每个 \(b\) 定义一个预测器 \(f_b: \mathcal{X} \to \mathcal{Y}\),它将输入 \(x \in \mathcal{X}\) 映射到预测 \(f_b(x) \in \mathcal{Y}\)。经验风险是 \(f_b\) 在观测到的训练样本上的平均损失,而总体风险是其相对于数据生成分布的期望损失。设 \(b\) 和 \(b'\) 是通过这种对称性关联的两个参数。如果 \(f_b = f_b'\) 作为 \(\mathcal{X}\) 上的函数,那么对于任何仅依赖于预测器的损失,它们都会导致相同的经验风险和总体风险。这促使我们的核心目标:构建 PAC–贝叶斯复杂度,使其反映预测器之间的差异,而不是代表同一预测器的参数之间的差异。
然而,直接在参数空间上进行的 PAC–贝叶斯分析可能会将不同的先验和后验质量分配给 \(b\) 和 \(b'\),从而在 KL 散度中计入了它们的差异。因此,其复杂度项可能依赖于那些对预测或风险没有影响的表示自由度。PAC–贝叶斯理论将随机预测器的总体风险界表达为其经验风险与复杂度惩罚项 \(\operatorname{KL}(Q\|P)\) 之和,其中 \(P\) 是与认证样本无关的先验,\(Q\) 是依赖于数据的后验假设 [7, 9]。对于现代过参数化模型,其参数空间可能包含同一预测器的多种表示,那么应当如何制定这一框架?
当参数空间本身被当作假设空间时,KL 散度可以区分赋予不同参数的、但定义同一预测器的概率质量。因此,其结果证书混合了预测器级别的复杂度与等价参数代表之间的变化。为了解决这个问题,我们在商假设空间上应用 McAllester PAC–贝叶斯不等式 [8],将所有表示同一预测器的参数视为同一类。这样,过参数化模型的对称性结构就成为 PAC–贝叶斯假设空间规范的一部分。这里考虑的对称性作用于参数空间而非数据。为了更具体,考虑回归预测器 \(f_{a,c}(x) = (ac)x\),其中回归权重为 \(w = ac\)。变换 \((a,c) \mapsto (\lambda a, \lambda^{-1}c)\),\(\lambda > 0\),保持 \(w\) 不变,因此预测器也不变。对于固定的 \(w\),集合 \(\mathcal{O}_w = \{ (\lambda a, \lambda^{-1}c) : \lambda > 0 \}\) 是 \(\mathcal{O}_w\) 轨道或对称性轨道:其元素是表示同一回归函数的不同参数值。一般来说,对于每个群元素 \(g\) 和参数 \(b\),有 \(f_{g \cdot b} = f_b\)。因此,统计相关的假设是实现一个预测器的参数的等价类。我们用对称性作用下参数空间的商来表示这个假设空间,它将每个对称性轨道坍缩为一个商元素。在回归例子中,整个轨道 \(\mathcal{O}_w\) 由单一的权重 \(w\) 表示。从几何上看,这种识别由双曲对称性轨道和代表性的对称性破缺切片所说明,如先前工作 [1] 的图 1 所示。这一操作移除了不可识别的表示自由度。它既不对数据分布施加不变性,也不对来自不同预测器的预测进行平均。
这种商构造直接影响 PAC–贝叶斯复杂度项。将参数空间的先验和后验通过商映射前推,使概率质量分配到由参数代表的预测器类别上。将每个对称性轨道坍缩成一个商点,并不会改变该轨道所代表的预测器。因此,在识别之前计算经验风险或总体风险与之后计算得到相同的结果,并且它们的后验平均值也不会改变。Kullback–Leibler 散度的表现则不同。在参数空间上,它衡量先验和后验在同一轨道内的参数之间分配概率的差异程度。一旦轨道坍缩为一个商点,这种表示上的差异就消失了。因此,商空间上的 KL 散度不可能大于参数空间上的 KL 散度。因此,在商空间上应用相同的 PAC–贝叶斯不等式可以保留风险项,同时移除完全来自等价参数表示差异的复杂度。
这种商构造是本文的第一个主要贡献。它为预测器保持的参数对称性提供了一种通用的 PAC–贝叶斯约简:当等价的参数化被识别时,复杂度项不会增加,并且每当后验和先验沿着对称性轨道分配概率不同时,复杂度项会减小。这一思路在精神上遵循了 [6] 中基于对称性的 PAC–贝叶斯分析。然而,这里的对称性专门在参数空间上表述:它关联的是同一个预测器的不同参数化,而不是输入或输出的变换。这种参数空间的视角自然地与 [1] 中发展的对称性破缺所诱导的隐式偏置先验的几何机制相联系。
然而,商化本身并不在商空间上可能的先验中选择一个偏好的先验。这引出了我们的第二个贡献。对称性的几何提供了一种规范的方式,将每组等价参数表示为一个单点。它还根据每个预测器的冗余参数化的体积为其分配一个几何权重。这个权重在商空间上定义了一个隐式偏置先验,它定义了一种由模型架构而非数据或附加训练惩罚决定的偏好。仅当该先验与学习到的后验的 Kullback–Leibler 散度小于中性商先验时,它才能比中性商先验给出更紧的 PAC–贝叶斯证书。我们在数值上评估了这个显式的后验依赖条件。因此,商化提供了一般的复杂度降低,而隐式偏置先验的额外好处必须针对学习到的后验进行验证。
我们的结果区分了两个效应。首先,识别表示相同预测器的参数会保持风险项不变,并且对于任何与认证样本无关的先验和任何后验,复杂度项都不会增加。其次,选择隐式偏置先验并不一定改善证书。只有当该先验在 KL 散度上比中性参考先验更接近所选后验时,它才有帮助。我们推导了这种比较的确切条件,并在受控数值实验中进行了测试。
### 1.1 相关工作
PAC–贝叶斯理论通过比较依赖于数据的后验与独立于样本选择的先验,给出了随机预测器总体风险的概率上界 [7, 9]。后续工作发展了 PAC–贝叶斯 kl 不等式、其他依赖于损失的界,以及适用于线性回归和高斯过程分类等设置的公式 [10, 4, 2, 11]。我们的分析采取了不同的出发点。我们并非修改 PAC–贝叶斯不等式或引入另一个依赖于损失的界,而是考察当参数化包含同一预测器的多种表示时,假设空间和先验应如何定义。因此,我们利用参数空间的对称性结构过渡到商假设空间,然后利用相关的几何修正在该商空间上构建一个先验。我们的分析使用有界认证损失,并显式计算后验-先验 KL 散度。
参数对称性是现代学习模型中不可识别性的核心来源。连续的缩放和基变换对称性可以保持所表示的预测器不变,同时改变优化轨迹、局部几何和参数空间的复杂度描述 [15, 14, 12, 13, 5]。在随机学习的补充几何分析中,对称性破缺在约化分布中产生体积修正,从而在等价参数表示中诱导出一个有效的偏好,可视为模型架构的隐式偏置 [1]。我们出于不同的目的使用这个修正:为 PAC–贝叶斯认证构建和比较商空间先验。
一个相关的 PAC–贝叶斯文献研究了学习问题的对称性,其中群作用于输入和输出,并且假设类被要求是不变的或等变的。对于具有不变数据分布的紧致群对称性,已经建立了 PAC–贝叶斯泛化优势 [6],随后扩展到非紧致群和非不变数据分布 [3]。这些工作关注的是变换后的输入和输出如何通过一个预测器相关联。我们的设定不同:对称性仅作用于参数,并且使预测器保持不变。对于 Hadamard 参数化和其它允许对称性的学习模型,适当的操作是在评估 KL 散度之前识别一个预测器的参数代表,而不是对变换后的输入进行平均或施加预测器等变性。
商构造和重参数化在具有不可识别参数的学习模型中也很常见。PAC–贝叶斯方法更为具体:KL 散度定义在所选假设空间上的概率测度之间。当等价参数被视为参数空间中的不同元素时,KL 项可能包含预测器等价类内的后验-先验不匹配。商公式通过在后验平均风险在前推下保持不变的同时收缩 KL 项,使这种贡献显式化。因此,它将预测器级别复杂度与表示复杂度分开。相似文章
物理信息机器学习泛化性的PAC-Bayesian视角
本文为物理信息机器学习开发了一种PAC-Bayesian框架,为无界损失提供了高概率泛化保证。它提出了一种多任务视角,联合处理数据保真度、偏微分方程残差和边界条件,并引入了一种自界限学习算法。
边界方差膨胀导致高斯过程中的采集偏差
本文识别了有界域上高斯过程中边界诱导的采集偏差背后的几何机制,展示了核截断如何独立于目标函数膨胀后验方差并扭曲采集函数。作者引入了一种无函数诊断方法,以量化不同采集类别中的这种偏差。
用于贝叶斯T1映射的广义TV--$\ell_p$结构化先验
本文提出了一种扩展的结构化空间先验族,结合总变分(TV)与ℓ_p范数,用于贝叶斯T1映射,实现不确定性量化。该方法在合成和真实MRI数据集上进行了评估,显示出改善的空间一致性和降低的不确定性。
从隐私到泛化:DP-SGD的线性最大信息界
本文证明了DP-SGD近似最大信息的一个有限样本界,该界最多与数据集大小成线性关系,从而为差分隐私训练的模型带来了PAC-Bayes泛化界。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。