面向低维结构学习的鲁棒子空间约束二次模型

arXiv cs.LG 论文

摘要

本文提出了一种鲁棒的子空间约束二次模型,用于从高维数据中学习低维结构,能够适应重尾噪声。我们开发了一种带有回溯线搜索的梯度算法,实验表明该方法在鲁棒性和重建精度上均有所提升。

arXiv:2605.20300v1 Announce Type: new 摘要:本文提出了一种鲁棒的子空间约束二次模型(SCQM),用于从高维数据中学习低维结构。该模型基于子空间约束二次矩阵分解(SQMF)框架,能够适应广泛的噪声分布,包括广义高斯和径向拉普拉斯模型。这种泛化能力使得模型在重尾和轻尾噪声下均能表现出可靠的性能,从而显著增强了在不同数据场景下的鲁棒性。为了高效求解由此产生的非凸优化问题,我们开发了一种基于梯度的算法,并配备了回溯线搜索策略,确保了稳定且高效的收敛。此外,我们对$\ell_p^p$和$\ell_2$损失函数进行了敏感性分析,阐明了它们在不同噪声特性下的不同行为。大量数值实验验证了理论分析,并表明所提出的方法在鲁棒性和重建精度方面始终优于现有方法。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:22

# 鲁棒子空间约束二次模型用于低维结构学习  
来源:https://arxiv.org/html/2605.20300  

郑翟,北京师范大学珠海校区文理学院统计系;李晓辉,烟台大学数学与信息科学学院。  

###### 摘要  

本文提出了一种鲁棒子空间约束二次模型(SCQM),用于从高维数据中学习低维结构。该模型基于子空间约束二次矩阵分解(SQMF)框架,能够适应更广泛的噪声分布,包括广义高斯和径向拉普拉斯模型。这一泛化能力使得模型在重尾噪声和轻尾噪声下均能可靠运行,从而显著增强了跨不同数据场景的鲁棒性。为有效求解由此产生的非凸优化问题,我们开发了一种配备回溯线搜索策略的梯度算法,确保稳定且高效的收敛。此外,我们还对 \(\ell_p^p\) 和 \(\ell_2\) 损失函数进行了敏感性分析,阐明了它们在不同噪声特征下的不同行为。大量数值实验验证了理论分析,并表明所提方法在鲁棒性和重构精度方面始终优于现有方法。  

## I. 引言  

从高维数据中学习低维结构仍然是数据分析、机器学习和信号处理中的一个基本挑战。传统方法,包括局部线性拟合[1](https://arxiv.org/html/2605.20300#bib.bib1)、核密度估计(KDE)[2](https://arxiv.org/html/2605.20300#bib.bib2)、线性矩阵分解、流形拟合[3](https://arxiv.org/html/2605.20300#bib.bib3)以及主曲线和主曲面[4](https://arxiv.org/html/2605.20300#bib.bib4),通常依赖于数据位于线性子空间并受高斯噪声扰动的假设。虽然这些假设有助于开发高效算法,但在实际场景中往往不切实际。实践中,数据可能位于复杂的非线性流形上,并受到重尾噪声或异常值的影响。平坦性假设通常导致模型只关注数据中较小、局部的区域。然而,当缩小关注范围至这些区域时,可能没有足够的样本有效应用这些算法,从而导致有偏估计。这种局限性会造成显著的信息损失,并降低模型性能。为克服这些挑战,必须开发能够适应更广泛数据结构的模型,既能捕捉真实世界数据的复杂非线性本质,又能对噪声和异常值保持鲁棒。这样的模型将能够提供更准确、更具泛化性的结果,并在实际应用中展现增强的性能。  

为解决这一局限性,流形学习和非线性分解模型相继被提出。其中,二次矩阵分解(QMF)[5](https://arxiv.org/html/2605.20300#bib.bib5)和子空间约束二次矩阵分解(SQMF)[6](https://arxiv.org/html/2605.20300#bib.bib6)因其能够融入二阶信息并近似弯曲流形而受到关注。通过在线性子空间模型[7](https://arxiv.org/html/2605.20300#bib.bib7), [8](https://arxiv.org/html/2605.20300#bib.bib8)的基础上增加二次项,这些方法可以同时捕捉切方向和曲率,从而提升重构精度和可解释性。特别是,子空间约束二次矩阵分解(SQMF)为学习低维切空间和法空间以及它们之间的二次映射提供了一个原则性框架。  

现有的二次分解模型通常依赖于平方欧氏损失或弗罗贝尼乌斯范数,两者均假设噪声服从高斯分布。尽管这些假设提供了计算上的简便性,但它们使得模型对异常值和设定错误高度敏感。为了减轻异常值的影响,典型的二次分解模型会引入一个惩罚项来惩罚二次项的贡献,试图防止过拟合。然而,这种方法也带来了自身的挑战,例如选择合适惩罚参数的困难任务。弗罗贝尼乌斯范数损失可能不适用的另一个关键原因是其假设与实际噪声分布特征之间的不匹配。在实际应用中——如图像分析、传感器数据处理和鲁棒表示学习——数据通常包含重尾、稀疏或脉冲性噪声。这些类型的噪声会严重降低模型性能并导致有偏估计。弗罗贝尼乌斯范数损失中常用的高斯噪声假设无法捕捉许多真实场景中噪声的真实性质。这种差异凸显了在二次分解模型中需要更灵活、更鲁棒的损失函数,这些函数应专门设计以应对实践中遇到的各种复杂噪声模式。这样的损失函数将提高模型处理这些噪声复杂性的能力,最终提升实际应用中的性能和鲁棒性。  

针对这些挑战,我们提出了一种鲁棒的子空间约束二次学习框架,该框架允许更广泛的噪声分布,包括广义高斯族和拉普拉斯族。这种灵活性使得模型能够适应轻尾和重尾噪声,同时保持二次流形表示的表达能力。因此,所提模型在高斯假设失效的实际场景中提供了增强的鲁棒性和准确性。从优化的角度来看,我们将经典的弗罗贝尼乌斯范数公式 \(\|\cdot\|_{\rm F}^2\) 扩展到基于替代范数的矩阵分解,例如逐元素的 \(\ell_{1,1}\) 范数和混合的 \(\ell_{2,1}\) 范数。为了求解由此产生的优化问题,我们提出了一种基于梯度下降的方法。由于映射的二次结构和正交约束,优化问题仍然是非凸的。为解决这个问题,我们推导了卡鲁什-库恩-塔克(KKT)条件,并开发了一种在施蒂费尔流形上的黎曼梯度下降算法,通过保持正交性的更新来确保可行性和收敛性。  

本文的主要贡献如下:  
- • 我们提出了一个广义的子空间约束二次框架,将现有的 SQMF 模型扩展到更广泛的损失函数类别,并为所有变量(包括潜在坐标)推导了显式梯度。  
- • 我们基于隐函数定理提供了理论分析,解释了为什么 \(\ell_p^p\) 损失和非平方欧几里得范数能提升鲁棒性。  
- • 我们开发了一种高效的黎曼梯度下降算法,在施蒂费尔流形上进行保持正交性的更新。  
- • 大量数值实验表明,所提方法在存在异常值的情况下显著提升了鲁棒性和重构精度。  

本文结构如下:第二部分(https://arxiv.org/html/2605.20300#S2)介绍了子空间约束二次模型,详细阐述了其公式和相关可辨识性性质。我们还提供了一个包含 \(\mathbb{R}^2\) 中圆形的简单示例,以展示模型的有效性。第三部分(https://arxiv.org/html/2605.20300#S3)重点推导了关于自由变量和正交约束的梯度,展示了 KKT 条件,并概述了所提出的优化算法。第四部分(https://arxiv.org/html/2605.20300#S4)对与 \(c\)、\(\Theta\) 和投影相关的子问题(关于 \(\tau\))进行了凸性分析。第五部分(https://arxiv.org/html/2605.20300#S5)提供了针对 \(\ell_p^p\) 和 \(\ell_2\) 损失函数的敏感性分析。第七部分(https://arxiv.org/html/2605.20300#S7)通过数值实验验证了理论结果,最后第八部分(https://arxiv.org/html/2605.20300#S8)讨论了未来研究的有前景方向。  

### I-A. 相关工作  

由于我们的工作利用子空间约束二次矩阵分解框架来学习潜在流形结构,因此它与广泛类别的流形拟合和去噪方法密切相关。这些方法旨在恢复嵌入在高维观测中的低维几何结构,通常是在噪声和采样不规则的情况下。代表性技术包括局部线性拟合方法,如局部主成分分析(LPCA)[1](https://arxiv.org/html/2605.20300#bib.bib1);基于核密度估计(KDE)[9](https://arxiv.org/html/2605.20300#bib.bib9)及其对数变体(LOG-KDE)[10](https://arxiv.org/html/2605.20300#bib.bib10)的岭估计方法;切空间聚合方法如流形拟合(MFIT)[11](https://arxiv.org/html/2605.20300#bib.bib11);以及高阶回归技术包括移动最小二乘法(MLS)[12](https://arxiv.org/html/2605.20300#bib.bib12)。为了进行全面比较,我们重点关注跨越这些类别的七种代表性方法。  

岭估计构成了非参数流形估计最具影响力的范式之一。岭方法并非显式参数化流形,而是隐式地将其定义为满足估计概率密度函数特定微分条件的一组点。特别地,基于 KDE 的岭估计从观测数据构造平滑密度估计,并将流形识别为梯度与 Hessian 矩阵主特征空间对齐、而其余曲率方向呈凹性的子集。这种公式允许直接从数据几何中恢复流形,而无需显式嵌入或坐标图。在实践中,岭集很少具有闭式解,通常采用迭代过程如子空间约束均值漂移(SCMS)[4](https://arxiv.org/html/2605.20300#bib.bib4), [13](https://arxiv.org/html/2605.20300#bib.bib13)算法来追踪岭结构。LOG-KDE 变体通过将岭条件应用于密度的对数来进一步修改此框架,从而产生不同的曲率特征和切空间估计,通常能在密度变化的区域提升鲁棒性。  

除了岭技术之外,还有几种方法通过直接利用局部切空间或法空间信息来重构流形。一个突出的例子是流形拟合(MFIT),它通过强制局部估计的法空间之间的一致性来估计流形。MFIT 使用空间自适应权重聚合从附近点的邻域获得的法方向,并将流形定义为加权法向投影为零的点的集合。这种方法提供了一种将局部几何信息融合为全局一致流形估计的原则性方式,并且当法方向可以从含噪数据中可靠估计时特别有效。  

高阶流形估计方法旨在通过显式建模局部曲率来超越线性或一阶近似。其中,移动最小二乘法(MLS)框架是研究最广泛的之一。MLS 首先估计每个查询点周围的局部切空间,然后在此局部坐标系中进行加权多项式回归。拟合的多项式捕捉了高阶几何特征,并通过将查询点投影到多项式表面上获得流形估计。由于其灵活性和强逼近性质,MLS 非常适合具有非平凡曲率的光滑流形,尽管代价是计算复杂度增加和对参数选择的敏感性。  

另一条密切相关的路线是通过融入显式几何基元来扩展局部线性模型。球面主成分分析(SPH),也称为球面小片,通过拟合低维球面结构而不是仿射子空间来增强局部 PCA [1](https://arxiv.org/html/2605.20300#bib.bib1)。该方法首先将数据投影到维数比内在维数高一维的局部估计仿射子空间中,然后在该空间内拟合一个球体。通过球面几何建模曲率,当底层流形表现出近似恒定曲率时,SPH 提供了比线性方法更精确的近似。  

与上述主要依赖局部几何估计和基于投影的重构的方法不同,我们的方法采用带有显式子空间约束的广义二次近似视角。通过整合二次结构和子空间正则化,所提框架桥接了流形学习和数据近似,使得能够鲁棒地恢复潜在流形,同时保持计算效率和可扩展性。这种区别使得我们的方法能够补充现有的局部拟合和去噪方法,特别是在全局结构和潜在表示为主要关注点的场景中。  

## II. SCQM 及其公式  

在本节中,我们介绍广义的 SCQM 模型,并探讨各种损失函数,突出它们合适的用例和场景。我们还提供一个简单例子来展示 SCQM 相对于传统线性局部拟合模型的优势,说明 SCQM 如何更好地捕捉复杂模式并在实际应用中提升性能。  

### II-A. 带子空间约束的二次拟合模型  

我们将经典的二次矩阵分解推广到超出弗罗贝尼乌斯范数目标的范围,允许使用更广泛的损失函数。这使得能够对以下形式的模型进行估计:  

\[
x_i = f(\tau_i) + \epsilon_i, \qquad i=1,\dots,n,
\]  

其中噪声项 \(\epsilon_i\) 不限于高斯分布。相反,我们允许 \(\epsilon_i\) 服从重尾或轻尾分布。一个代表性例子是广义高斯分布,其密度为  

\[
p(\epsilon) \propto \exp\bigl(-\|\epsilon\|_p^{\,p}/\eta\bigr), \quad x\in\mathbb{R}^D,
\]  

当 \(p=2\) 时包含高斯模型,当 \(p=1\) 时包含拉普拉斯模型。我们还考虑由多元径向拉普拉斯分布建模的各向同性、旋转不变噪声:  

\[
p(\epsilon) \propto \exp(-\|\epsilon\|_2/\eta).
\]  

当噪声分布已知时,映射 \(f(\cdot)\) 的最大似然估计(忽略加法常数)归结为优化问题:  

\[
\min_{f,\{\tau_i\}} \sum_{i=1}^n \ell\bigl(x_i - f(\tau_i)\bigr),
\]  

其中 \(\ell(\cdot)\) 是与假设噪声模型相关的负对数似然。典型的选择包括 \(\|r\|_p^p\)、\(\|r\|_2\) 和 \(\|r\|_2^2\),分别对应广义高斯、径向拉普拉斯和高斯噪声模型。该公式建立

相似文章

捕捉移动子空间:超越平稳性的低秩老虎机

arXiv cs.LG

本文研究了分段平稳的低秩线性上下文老虎机,提出了SPSC算法,该算法实现了与内在秩(而非环境维度)成比例的动态遗憾,并刻画了在标量反馈下子空间恢复的辨识边界。

基于非对称RoBoSS损失函数的稀疏鲁棒几何孪生支持向量机

arXiv cs.LG

本文提出一种新的非对称鲁棒有界稀疏平滑(aR)损失函数,用于l1范数惩罚的几何孪生支持向量机(aRSGTSVM),以处理带有标签噪声和特征噪声的分类与回归任务,实现特征选择并提高鲁棒性。在合成数据集、UCI数据集以及中国股市指数跟踪上的实验表明了其优越性。

无子空间可追踪:低秩训练中的不可辨识性与优化器状态

arXiv cs.LG

本文通过实验证明,在GaLore等低秩训练方法中,梯度的前r维子空间除了一个小的可复现核心外是不可辨识的,估计器噪声主导了表观旋转。文章分析了这对优化器状态传输的影响,并引入了LDAdam,它在困惑度上优于GaLore。