Fisher宽度:统计流形上的一种几何复杂度度量

arXiv cs.LG 论文

摘要

介绍Fisher宽度,这是统计流形上高斯宽度的黎曼类比,它捕捉局部统计曲率且在重参数化下不变。本文发展了其理论,证明了Fisher-Lipschitz类别的泛化界,并在MNIST上展示了可计算估计量。

arXiv:2606.18306v1 Announce Type: new 摘要:高斯宽度是高维概率、压缩感知、凸优化和学习理论中一个核心的几何复杂度度量。它量化了集合沿随机方向的平均范围,从而捕捉了约束集、假设类和下降锥的有效维度。然而,这一概念本质上是欧几里得的。统计模型则携带着由Fisher信息度量诱导的自然黎曼几何,其中方向根据统计可区分性而非环境欧几里得长度进行缩放。 我们引入Fisher宽度,这是统计流形上高斯宽度的Fisher几何类比。在参数点$\theta$处,Fisher宽度将欧几里得恒等替换为局部度量张量$G(\theta)^{1/2}$,测量Fisher重缩放集合的高斯宽度。这使得所得量对局部统计曲率敏感且在光滑重参数化下不变。 我们发展了Fisher宽度的基本理论,表明它保留了高斯宽度的关键结构特征,包括集中性、度量扰动稳定性以及相对于欧几里得基线的谱比较界,同时捕捉了欧几里得度量无法看到的各向异性几何效应。作为应用,我们证明了Fisher-Lipschitz假设类的一个泛化界,并提出了可计算估计量,在MNIST上对三个模型类别进行了实证评估。 Fisher宽度之于统计流形,正如高斯宽度之于欧几里得凸体。这项工作为研究弯曲统计流形上的复杂性和学习奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:40

# 统计流形上的几何复杂度度量 Source: https://arxiv.org/html/2606.18306 ###### 摘要 高斯宽度是高维概率、压缩感知、凸优化和学习理论中的核心几何复杂度度量。它量化了集合沿随机方向的平均延伸程度,从而捕捉了约束集、假设类和下降锥的有效维度。然而,这一概念本质上是欧几里得的。相反,统计模型携带着由Fisher信息度量诱导的自然黎曼几何,其中方向根据统计可区分性而非环境欧几里得长度进行缩放。我们引入了Fisher宽度,即统计流形上高斯宽度的Fisher几何模拟。在参数点θ处,Fisher宽度用局部度量张量G(θ)^{1/2}替换欧几里得恒等矩阵,测量Fisher重新缩放后的集合的高斯宽度。这使得结果量对局部统计曲率敏感,且在光滑重新参数化下保持不变。我们发展了Fisher宽度的基本理论,表明它保留了高斯宽度的关键结构特征,包括集中性、度量扰动稳定性以及与欧几里得基线的谱比较界,同时还能捕捉到欧几里得度量无法观察到的各向异性几何效应。作为应用,我们证明了Fisher-Lipschitz假设类的泛化界,并提出了可计算的估计量,在MNIST上跨三个模型类进行了实证评估。Fisher宽度之于统计流形,正如高斯宽度之于欧几里得凸体。这项工作为研究弯曲统计流形上的复杂性和学习奠定了基础。 ## 1 引言 ### 1.1 统计流形上的复杂性 高维几何和统计学习的一个核心问题是量化模型类的有效复杂性。为此目的最成功的一个概念是高斯宽度 w(T)=E_{g∼N(0,I_d)}[sup_{v∈T}⟨g,v⟩],它在压缩感知(Chandrasekaran et al., 2012)、凸恢复的相变(Amelunxen et al., 2014)和经验过程理论(Bartlett and Mendelson, 2002)中扮演着基础性角色。这里T通常代表一个编码问题复杂性的几何对象,如假设类、切锥或可行区域。其力量基于一个简单的几何洞见:T⊂R^d在随机方向上的平均延伸程度捕捉了其在环境欧几里得空间中的有效大小。然而,现代统计模型很少单独由欧几里得几何支配。指数族、神经网络或变分自编码器的参数自然形成一个统计流形(Θ, g_F),其配备Fisher信息度量 G(θ)_{ij} = E_{x∼p_θ}[∂log p_θ(x)/∂θ_i ∂log p_θ(x)/∂θ_j]。在这样的流形上,统计可区分性由局部Fisher度量而非环境欧几里得距离支配。参数空间中的单位位移可能在一个方向上剧烈改变模型,而在另一个方向上几乎不变,这完全取决于由G(θ)编码的局部几何。经典的高斯宽度将所有方向视为同等重要,无法捕捉这种信息几何结构。这一观察促使我们寻找一种几何复杂度概念,它内在于Fisher几何,正如高斯宽度内在于欧几里得几何一样。 ###### 定义 (Fisher宽度)。令 θ_0∈Θ 且 T⊂R^d。T在θ_0处的Fisher宽度为 w_G(T;θ_0) = E_{g∼N(0,I_d)}[sup_{v∈T}⟨g, G(θ_0)^{1/2}v⟩]。因子G(θ_0)^{1/2}根据局部Fisher曲率重新加权方向,使得统计敏感的方向比不敏感的方向对宽度贡献更大。因此Fisher宽度是一个局部量:它依赖于基点θ_0并在统计流形上变化。当G(θ_0)=I_d时,它退化为经典的高斯宽度。 ### 1.2 主要贡献 本文的主要贡献如下。 - (C1) 我们引入了Fisher宽度,作为统计流形上高斯宽度的局部Fisher几何模拟。我们建立了提升恒等式 w_G(T;θ)=w(G(θ)^{1/2}T),并证明了其在光滑重新参数化下的不变性。 - (C2) 我们发展了Fisher宽度的结构理论,包括集中不等式、代数性质、谱比较界以及在度量扰动下的稳定性。我们还进一步证明了经验Fisher稳定性定理,表明在经验Fisher矩阵的算子范数集中条件下,Fisher宽度可以从得分样本中一致地逼近。 - (C3) 我们证明了Fisher-Lipschitz假设类的泛化界,表明均匀偏差受 w_G(T−T;θ_0)/√n 控制。我们还表明,对于局部指数族似然模型,这一尺度在常数意义下是尖锐的。因此Fisher宽度在Fisher几何学习界中扮演的角色类似于高斯宽度和Rademacher复杂度在欧几里得设定中的角色。 - (C4) 我们基于经验Fisher信息、随机低秩近似和基于得分的采样发展了实用估计量,并在MNIST上对逻辑回归、softmax回归和岭回归模型进行了实证验证。 ### 1.3 相关工作 #### 高斯宽度与高维几何。高斯宽度是渐近凸几何和高维概率中的经典复杂度度量。Gordon的逃逸网格定理(Gordon, 1988)确立了其在随机投影几何中的核心地位。此后它成为压缩感知和凸恢复中的标准工具(Chandrasekaran et al., 2012; Amelunxen et al., 2014),其中尖锐的相变常通过凸锥的统计维度来描述。高斯过程和链式方法提供了互补的分析视角,始于Dudley的熵界(Dudley, 1967),并延续至现代高维概率文献(Ledoux and Talagrand, 1991; Vershynin, 2018; Wainwright, 2019)。我们的工作遵循这一几何传统,但将环境欧几里得度量替换为统计模型诱导的局部Fisher度量。 #### 统计学习中的复杂度度量。高斯复杂度和Rademacher复杂度是学习理论中假设类丰富度的基本度量(Bartlett and Mendelson, 2002)。局部化经验过程方法和oracle不等式通过适应函数类和数据分布的几何进一步细化了这些复杂度度量(Koltchinskii, 2011)。更近的工作发展了神经网络基于范数和架构的复杂度界,包括与大小无关的Rademacher界(Golowich et al., 2018)。Fisher宽度属于这一族宽度型复杂度度量:它是控制均匀偏差的泛函,但底层几何是Fisher而非欧几里得。 #### 信息几何与Fisher度量。Fisher信息度量是许多统计模型空间上的典范黎曼度量。它支撑着统计流形、对偶连接和信息几何曲率的经典理论(Amari and Nagaoka, 2000; Amari, 2016; Ay et al., 2017; Murray and Rice, 1993)。统计曲率由Efron引入(Efron, 1975),本文使用的局部度量展开在黎曼几何中是标准的(do Carmo, 1992)。信息几何的现有工作主要研究散度、测地线、投影、曲率和优化。相比之下,Fisher宽度在统计流形上引入了一个高斯宽度型的复杂度泛函,从而将信息几何与高维几何复杂度联系起来。 #### 优化与深度学习中的Fisher几何。Fisher几何长期以来通过自然梯度下降用于优化(Amari, 1998)。在现代机器学习中,它出现在神经网络的黎曼度量(Ollivier, 2015)、可扩展曲率近似如K-FAC(Martens and Grosse, 2015)以及自然梯度方法的分析(Martens, 2020)中。经验Fisher在计算上很方便,但通常不等同于总体Fisher或Hessian,并且可能表现出明显的局限性(Kunstner et al., 2019)。深度网络中Fisher信息矩阵的谱也可能是高度各向异性的,少数大方向和许多近平坦方向并存(Karakida et al., 2019)。Fisher宽度与这一优化文献是互补的:它不研究算法的动力学,而是使用Fisher度量来度量一个集合的有效几何大小。 #### Fisher-Rao复杂度与相关泛化视角。最接近的前期工作是神经网络的Fisher-Rao范数(Liang et al., 2019),它使用Fisher度量来定义参数空间复杂度度量。其区别在于结构:Fisher-Rao范数衡量单个参数向量的长度,而Fisher宽度衡量整个集合经过Fisher变形后的大小。因此Fisher宽度是高斯宽度传统中的集合复杂度度量,而非参数范数。PAC-Bayes理论提供了另一种对信息敏感的泛化方法,将风险界与后验和先验分布之间的散度联系起来(McAllester, 1999; Seeger, 2002; Dziugaite and Roy, 2017; 详见Alquier, 2024综述)。对于指数族模型,这些散度允许涉及Fisher度量的局部二次近似。关于泛化的平坦性解释也与此相关,始于平坦最小值(Hochreiter and Schmidhuber, 1997),并延续至尖锐最小值现象(Keskar et al., 2017)、尖锐度感知优化(Foret et al., 2021)以及泛化度量的实证研究(Jiang et al., 2020)。Fisher宽度提供了一个不同但兼容的视角:它衡量一个类或扰动集的Fisher几何大小,而非单个训练解的尖锐度。据我们所知,尚无先前工作引入统计流形上的高斯宽度型复杂度泛函,或发展其在Fisher信息度量下的结构、统计和计算性质。 ## 2 Fisher宽度 ### 2.1 统计流形与Fisher几何 令 X 为样本空间,P = {p_θ : θ∈Θ} 为光滑参数族,其中 Θ⊂R^d。在 θ 处的Fisher信息矩阵为 G(θ) = E_{x∼p_θ}[∇_θ log p_θ(x) ∇_θ log p_θ(x)^⊤]。我们假设 G(θ)≻0 始终成立。Fisher度量 g_F(u,v)|_θ = u^⊤ G(θ) v 使 Θ 成为黎曼流形。Fisher度量刻画了邻近分布的局部统计可区分性(Amari and Nagaoka, 2000; Amari, 2016)。具体地,对于足够小的 Δθ,Kullback-Leibler散度 D_KL(p∥q)=∫ p(x) log(p(x)/q(x)) dx 具有局部展开 D_KL(p_θ ∥ p_{θ+Δθ}) = (1/2) Δθ^⊤ G(θ) Δθ + o(‖Δθ‖^2)(见(Amari and Nagaoka, 2000, 第2章))。因此,Fisher度量提供了统计可区分性的局部二次近似,且独立于R^d上的环境欧几里得结构。 ### 2.2 Fisher宽度 我们首先回顾经典的高斯宽度。对于集合 T⊂R^d,高斯宽度定义为 w(T) = E_{g∼N(0,I_d)}[sup_{v∈T}⟨g,v⟩]。以下标准性质将作为后续Fisher宽度理论的参考点。 ###### 命题 2.1 (高斯宽度的基本性质)。对于紧集 T, T_1, T_2 ⊂ R^d 和标量 a∈R: 1. 若 T_1 ⊆ T_2,则 w(T_1) ≤ w(T_2)。 2. w(aT) = |a| w(T)。 3. w(conv(T)) = w(T)。 4. w(T_1 + T_2) ≤ w(T_1) + w(T_2)。 我们现在引入Fisher宽度,即高斯宽度的Fisher几何模拟。 ###### 定义 2.2 (Fisher宽度)。令 θ_0 ∈ Θ 且 G(θ_0) ≻ 0。T ⊂ R^d 在 θ_0 处的Fisher宽度为 w_G(T; θ_0) = E_{g∼N(0,I_d)}[sup_{v∈T}⟨g, G(θ_0)^{1/2} v⟩]。

相似文章

Fisher宽度:局部学习几何与各向异性恢复

arXiv cs.LG

本文介绍了统计流形上的Fisher宽度和逆Fisher宽度,研究了它们在局部学习界限和各向异性恢复中的作用。证明了两者之间的互补关系,并基于Fisher几何获得了恢复估计。