数据偏心性、高斯RBF再生核希尔伯特空间的渐近性及核PCA
摘要
本文证明,在大带宽条件下,高斯RBF再生核希尔伯特空间渐近等距于欧几里得空间,导致核PCA收敛到线性PCA。一种数据偏心性度量能够预测前几个主方向上的收敛行为。
arXiv:2607.21823v1 公告类型:新
摘要:我们证明,在各向同性缩放下,高斯RBF再生核希尔伯特空间(RKHS)在大带宽极限下渐近等距于欧几里得空间。这强烈表明,依赖于RKHS度量性质的基于核的构造,对于高斯RBF核在大带宽下将得到接近线性核的结果。高斯CKA的渐近行为可以由此理解。我们进一步考虑核PCA,证明高斯RBF的特征值、特征投影和主成分均随带宽$\sigma \rightarrow \infty$收敛到经典(线性)PCA。对于给定的数据表示,两种核类型的RKHS特征嵌入和正交PCA特征框架渐近相差一个几何相似变换,残差大小为$O \left (\frac{\rho}{\sigma} \right )^2$,其中$\rho$是表示几何偏心率的度量,等于数据样本间最大距离与中位距离之比。在多种数据集上的实验表明,$\rho$提供了一个简单且可靠的数据集特定收敛行为(在前几个主方向上)的预测因子。
查看缓存全文
缓存时间: 2026/07/27 07:42
# 数据偏心性、高斯RBF再生核希尔伯特空间的渐近行为与核PCA 来源:https://arxiv.org/html/2607.21823 Sergio A. Alvarez本文未使用生成式AI进行研究或写作,标准搜索引擎中可能默认嵌入的除外。S. A. Alvarez任职于波士顿学院计算机科学系,马萨诸塞州栗树山02467。电子邮箱:[email protected] ###### 摘要 我们证明,在各项同性缩放意义下,当带宽趋于无穷时,高斯RBF再生核希尔伯特空间(RKHS)渐近等距于欧几里得空间。这一结果有力地表明,依赖于RKHS度量性质的核构造方法,对于高斯RBF核将趋近于线性核在大带宽下的结果。高斯CKA的渐近行为可以以此理解。我们进一步考虑核PCA,证明当带宽σ→∞时,高斯RBF的特征值、特征投影以及主成分均收敛于经典(线性)PCA的对应量。对于给定的数据表示,两种核类型的RKHS特征嵌入和正交PCA特征框架渐近相差一个几何相似变换,残差大小为O((ρ/σ)²),其中ρ是表示的最大中位成对距离之比,衡量数据的几何偏心性。在多样化数据集上的实验表明,ρ是预测数据集特定收敛行为(尤其在主方向上)的简单可靠指标。 ###### 索引术语: 非线性核,表示,希尔伯特空间,主成分分析。 ## 1 引言 如果 k: ℝᵈ × ℝᵈ → ℝ 是一个半正定对称核函数,Moore-Aronszajn定理[1 (https://arxiv.org/html/2607.21823#bib.bib1)]保证存在一个特征映射 Φ: ℝᵈ → ℋ,从原始属性空间 ℝᵈ 映射到通常更高维的再生核希尔伯特空间(RKHS)ℋ,且满足:对于任意数据样本 xᵢ 和 xⱼ,核函数值 k(xᵢ, xⱼ) 等于这些样本的特征向量在 ℋ 中的内积 ⟨Φ(xᵢ), Φ(xⱼ)⟩_ℋ。任何可以用特征向量间成对内积表达的计算,都可以通过“核技巧”(例如[2 (https://arxiv.org/html/2607.21823#bib.bib2)])高效执行,将高维RKHS中的复杂内积计算替换为在原始低维属性空间中等价但简单得多的核函数求值。 核函数的选择至关重要,因为它决定了RKHS的特征表示。高斯径向基函数(RBF)核是一种流行的核类型,对应无限维RKHS,并具有强大的普适逼近性质[3 (https://arxiv.org/html/2607.21823#bib.bib3),4 (https://arxiv.org/html/2607.21823#bib.bib4)]。后者在“表示定理”[5 (https://arxiv.org/html/2607.21823#bib.bib5),6 (https://arxiv.org/html/2607.21823#bib.bib6),7 (https://arxiv.org/html/2607.21823#bib.bib7)]背景下尤为重要,该定理指出,基于核的最小化经验风险函数的预测模型位于函数 k(·, y)(y固定)的张成空间中:满足普适逼近性质的核能提供任意逼近目标函数的假设空间。 高斯RBF核已成功应用于多种机器学习方法和应用,包括支持向量机(SVM)[8 (https://arxiv.org/html/2607.21823#bib.bib8),9 (https://arxiv.org/html/2607.21823#bib.bib9),10 (https://arxiv.org/html/2607.21823#bib.bib10),11 (https://arxiv.org/html/2607.21823#bib.bib11),12 (https://arxiv.org/html/2607.21823#bib.bib12),13 (https://arxiv.org/html/2607.21823#bib.bib13),14 (https://arxiv.org/html/2607.21823#bib.bib14)];核岭回归[15 (https://arxiv.org/html/2607.21823#bib.bib15),16 (https://arxiv.org/html/2607.21823#bib.bib16),17 (https://arxiv.org/html/2607.21823#bib.bib17),18 (https://arxiv.org/html/2607.21823#bib.bib18),19 (https://arxiv.org/html/2607.21823#bib.bib19),20 (https://arxiv.org/html/2607.21823#bib.bib20),21 (https://arxiv.org/html/2607.21823#bib.bib21),22 (https://arxiv.org/html/2607.21823#bib.bib22)];中心化核对齐(CKA)[23 (https://arxiv.org/html/2607.21823#bib.bib23),24 (https://arxiv.org/html/2607.21823#bib.bib24),25 (https://arxiv.org/html/2607.21823#bib.bib25),26 (https://arxiv.org/html/2607.21823#bib.bib26),27 (https://arxiv.org/html/2607.21823#bib.bib27),28 (https://arxiv.org/html/2607.21823#bib.bib28),29 (https://arxiv.org/html/2607.21823#bib.bib29),30 (https://arxiv.org/html/2607.21823#bib.bib30),31 (https://arxiv.org/html/2607.21823#bib.bib31)];典型相关分析(CCA)[32 (https://arxiv.org/html/2607.21823#bib.bib32),33 (https://arxiv.org/html/2607.21823#bib.bib33),34 (https://arxiv.org/html/2607.21823#bib.bib34),35 (https://arxiv.org/html/2607.21823#bib.bib35),36 (https://arxiv.org/html/2607.21823#bib.bib36),37 (https://arxiv.org/html/2607.21823#bib.bib37)];以及核主成分分析(核PCA)[38 (https://arxiv.org/html/2607.21823#bib.bib38),39 (https://arxiv.org/html/2607.21823#bib.bib39),40 (https://arxiv.org/html/2607.21823#bib.bib40),41 (https://arxiv.org/html/2607.21823#bib.bib41),42 (https://arxiv.org/html/2607.21823#bib.bib42),43 (https://arxiv.org/html/2607.21823#bib.bib43),44 (https://arxiv.org/html/2607.21823#bib.bib44),45 (https://arxiv.org/html/2607.21823#bib.bib45),46 (https://arxiv.org/html/2607.21823#bib.bib46)]。 #### 本文贡献 我们证明,在各项同性缩放因子下,当高斯带宽超参数趋于无穷时,高斯RBF核关联的RKHS在几何上等同于线性核的RKHS。我们证明度量残差为 O((ρ/σ)²),其中 ρ 反映数据集的几何偏心性,由最大中位成对距离之比衡量(定理2 (https://arxiv.org/html/2607.21823#Thmtheorem2))。 根据定理2 (https://arxiv.org/html/2607.21823#Thmtheorem2)的结果,基于RKHS度量结构的构造方法可以预期,当带宽 σ ≫ ρ 时,高斯RBF核的行为将趋近于线性核。高斯RBF CKA 的渐近行为[47 (https://arxiv.org/html/2607.21823#bib.bib47)]是该原理的一个实例。本文通过谱扰动理论[48 (https://arxiv.org/html/2607.21823#bib.bib48)]提供另一个例证,证明当 σ → ∞ 时,高斯核PCA渐近等价于经典线性PCA(定理3 (https://arxiv.org/html/2607.21823#Thmtheorem3))。 在一系列数据集上的实验表明,偏心性 ρ 能可靠地度量高斯RKHS度量结构以及核PCA特征值和特征投影在主方向上的数据集特定收敛行为。 #### 相关工作 基于高斯核的SVM的大带宽和小带宽极限已从SVM对偶优化角度在[49 (https://arxiv.org/html/2607.21823#bib.bib49)]中讨论。在[50 (https://arxiv.org/html/2607.21823#bib.bib50)]中,作者对包括高斯RBF核在内的广泛核类获得了谱渐近结果。高斯过程回归的大带宽渐近在[51 (https://arxiv.org/html/2607.21823#bib.bib51)]中讨论。然而,这些工作都聚焦于非中心化核。 涉及本文所用中心化核的大带宽极限的工作包括[52 (https://arxiv.org/html/2607.21823#bib.bib52)],它讨论了对于广泛核类的相关Hilbert-Schmidt独立性准则(HSIC),以及[47 (https://arxiv.org/html/2607.21823#bib.bib47)],它处理高斯RBF中心化核对齐(CKA)。本文使用的数据偏心性度量由[47 (https://arxiv.org/html/2607.21823#bib.bib47)]提出;该文证明了偏心性与高斯RBF CKA的大带宽收敛有关,但未像本文一样揭示这种行为在高斯RBF RKHS几何中的根源。 据我们所知,此前没有工作涉及高斯RBF RKHS度量空间结构或高斯RBF核主成分分析(PCA)的大带宽渐近,而这些是本文的主要议题。 ## 2 背景 ### 2.1 核PCA 主成分分析(PCA)计算一组数据样本 X = {x_i, i=1...N} ⊂ ℝᵈ 的最大方差方向以及这些方向上的方差,通过样本协方差矩阵的特征方向和特征值实现,该矩阵为 (1/(N-1)) XᵀX(我们假设 X 每行一个数据样本,且数据在属性空间已中心化)。特征方向构成 ℝᵈ 的一个正交参考框架,与数据属性的线性协变轴对齐。众所周知,协方差不能捕获非线性协变;例如,在图1 (https://arxiv.org/html/2607.21823#S2.F1)中,样本协方差矩阵为单位矩阵,错误地暗示没有协变。 图1:具有零协方差的非线性协变属性。核PCA[38 (https://arxiv.org/html/2607.21823#bib.bib38),39 (https://arxiv.org/html/2607.21823#bib.bib39)]在RKHS ℋ 中数据 X 的高维特征表示 Φ(X) 上执行PCA,该RKHS由半正定核函数 k(x,y)=⟨Φ(x),Φ(y)⟩_ℋ 隐式定义,如Moore-Aronszajn定理所述。经典PCA是线性核 k(x,y)=x·y 的特例,其中 · 表示欧几里得空间中的标准内积。 #### 2.1.1 核PCA过程 我们按照[38 (https://arxiv.org/html/2607.21823#bib.bib38),39 (https://arxiv.org/html/2607.21823#bib.bib39)]描述核PCA计算。假设原始数据包含一个 N×d 矩阵 X,其中第 i 行 x_i 包含第 i 个数据样本的原始特征向量(在 ℝᵈ 中)。令 k(x,y) 为半正定核函数,关联RKHS特征映射 Φ,使得 k(x,y) 等于所有 x,y ∈ ℝᵈ 在RKHS ℋ 中的内积 ⟨Φ(x),Φ(y)⟩_ℋ。 核PCA按以下步骤进行[38 (https://arxiv.org/html/2607.21823#bib.bib38),39 (https://arxiv.org/html/2607.21823#bib.bib39)]: 1. 计算Gram矩阵 K = (k(x_i, x_j))_{i,j},其大小为 N×N,与 d 无关。对 K 进行均值中心化([39 (https://arxiv.org/html/2607.21823#bib.bib39)],附录B)。即,用双重中心化矩阵 \overline{\overline{K}} = HKH 替换 K,如下文3.1 (https://arxiv.org/html/2607.21823#S3.SS1)节所述。 2. 计算 K 的特征值 λ_i 和特征向量 α^i。将 α^i 归一化,使得 λ_i α^i·α^i = 1。RKHS特征向量 {Φ(x_i)}_{i=1}^N 的特征向量 V^k 将是 Φ(X)ᵀα^k,即特征向量 Φ(x_i) 与 K 的特征向量 α^k 的双线性组合。这里 Φ(X) 的第 i 行为 Φ(x_i)。 3. 每个 x 的核主分量是特征向量 Φ(x) 在特征向量 V^k 上的投影:⟨Φ(x),V^k⟩_ℋ = Σ_{j=1}^N α_j^k K(x_j,x)。 ### 2.2 高斯核与高斯CKA 我们关注带宽 σ 的高斯核。数据矩阵 X 的高斯Gram矩阵 K_{G(σ)} 如式1 (https://arxiv.org/html/2607.21823#S2.E1)所示;其中 x_i 是 X 的第 i 行,d_X 是 X 各行之间的中位距离[25 (https://arxiv.org/html/2607.21823#bib.bib25),47 (https://arxiv.org/html/2607.21823#bib.bib47)]。在式1 (https://arxiv.org/html/2607.21823#S2.E1)的指数中使用 d_X σ 代替 σ,使得 σ 变为标准化量。 K_{G(σ)} = ( e^{-‖x_i - x_j‖² / (2 d_X² σ²)} )_{i,j} (1) 两个密切相关的核也进入我们的分析:线性核和欧几里得(伪)核,如式2 (https://arxiv.org/html/2607.21823#S6.EGx2)所示。 L(x₁, x₂) = x₁·x₂ (2a) E(x₁, x₂) = -‖x₁ - x₂‖²/2 (2b) 中心化核分析(CKA)是一种基于核的数据表示相似度度量[25 (https://arxiv.org/html/2607.21823#bib.bib25)]。[47 (https://arxiv.org/html/2607.21823#bib.bib47)]证明高斯CKA在大带宽下渐近线性,并且数据偏心性(由表示直径与中位成对距离之比衡量,式4 (https://arxiv.org/html/2607.21823#S2.E4))近似于CKA开始表现出近线性行为时的带宽。见定理4 (https://arxiv.org/html/2607.21823#S2.E4)。 ###### 定理 1. (来自[47 (https://arxiv.org/html/2607.21823#bib.bib47)]的定理1、2;式4 (https://arxiv.org/html/2607.21823#S2.E4)依赖于K和L使用相同数据表示X的假设。)令 K_{G(σ)} 为表示X对应带宽 d_X σ 的高斯RBF核的Gram矩阵,其中 d_X 是表示X中数据样本间的中位欧几里得距离,令 L 为表示X对应某个半正定核的Gram矩阵。那么: CKA(K_{G(σ)}, L) = CKA(K_lin, L) + O(1/σ²) 当 σ→∞ (3) 式3 (https://arxiv.org/html/2607.21823#S2.E3)中的残差上界为 C(ρ/σ)²,当 ρ/σ ≤ 2 时,其中 C 是不依赖于表示X的有限常数,ρ 是式4 (https://arxiv.org/html/2607.21823#S2.E4)定义的表示偏心性。 ρ = diam(X) / d_X (4) ## 3 结果
相似文章
Bernstein-Schur 核:基于草图调制和径向随机化的随机特征
本文介绍了Bernstein–Schur核,这是一类介于平移不变模板和点积模板之间的非平稳核,并通过草图化有限调制和随机化完全单调径向因子,提供了一种随机特征构造方法。该方法能够生成无偏估计量,其算子范数界限由本征维度控制,并且实验在一个有偏核示例上验证了该方法。
边界方差膨胀导致高斯过程中的采集偏差
本文识别了有界域上高斯过程中边界诱导的采集偏差背后的几何机制,展示了核截断如何独立于目标函数膨胀后验方差并扭曲采集函数。作者引入了一种无函数诊断方法,以量化不同采集类别中的这种偏差。
面向理解高维贝叶斯优化的自动化核发现
论文介绍了Kernel Discovery,这是一个LLM驱动的进化框架,用于高维贝叶斯优化,它搜索更广泛的核空间并在基准测试上取得了最先进的结果。
群不变谱嵌入
本文提出将对称性融入谱嵌入的亲和核中,证明了在商流形上不变图拉普拉斯算子的收敛性,并改善了样本复杂度。
商参数空间上的PAC-Bayes界:几何诱导的隐式偏差先验
本文提出在商参数空间上进行PAC-Bayesian分析,以消除参数对称性带来的KL贡献,并构建一个几何诱导的先验,该先验逼近理想的后验匹配先验,从而得到更紧的泛化界。在傅里叶回归和查询-键注意力机制上的实验表明,KL散度和证据值显著降低。