CuBAS:基于信息几何曲率的监督分类自适应采样方法

arXiv cs.LG 论文

摘要

介绍CuBAS,一种用于监督分类中自适应数据选择的信息几何框架,利用数据流形的局部曲率识别信息丰富的样本,在30个基准数据集上实现了更高的准确率。

arXiv:2607.03145v1 公告类型:新提交 摘要:训练集的信息量与其规模同样重要,然而大多数采样策略忽视了数据分布的内在几何结构。我们提出CuBAS(基于曲率的自适应采样),一种基于q态Potts马尔可夫随机场(MRF)模型的监督分类自适应数据选择的信息几何框架。核心观点是,标记数据集可视为一个统计流形,通过二阶与一阶观测Fisher信息之比估计的局部曲率,能够忠实编码数据分布的几何复杂度。我们在标记数据上构建k近邻图,并从Potts充分统计量推导出每个顶点的封闭形式曲率分数。该曲率信号将图划分为两个互补区域:低曲率区域(对应平滑、均匀的聚类)和高曲率区域(集中在决策边界附近,对分类具有不成比例的信息量)。通过从两个区域选择节点,CuBAS构建了紧凑且信息量最大的训练子集。在超过60个基准数据集上的实验评估表明,与随机采样和基于不确定性的基线方法相比,在各种标注预算和分类器架构下均取得了一致且统计显著的改进。CuBAS计算高效(与k-NN图的边数成线性关系),在统计流形的微分几何上有理论基础,并且可从数据流形的局部形状算子角度进行解释。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:41

# CuBAS:面向监督分类的基于信息几何曲率的自适应采样
来源:https://arxiv.org/html/2607.03145
Alexandre Luis Magalhães Levada
圣卡洛斯联邦大学
13565-905,巴西圣卡洛斯市
[email protected]

###### 摘要

训练集的信息量与规模同等重要,然而大多数采样策略仍对数据分布的内在几何结构视而不见。为填补这一空白,我们提出 CuBAS(基于曲率的自适应采样),一种面向监督分类的自适应数据选择的信息几何框架,其理论基础是q状态Potts马尔可夫随机场(MRF)模型。核心洞见在于:带标签的数据集可视为一个统计流形,在此流形上,通过二阶观测Fisher信息与一阶观测Fisher信息之比估算出的局部曲率,能够忠实地编码底层数据分布的几何复杂度。具体而言,我们在带标签数据上构建一个k近邻图,并从Potts充分统计量中推导出每个顶点处的闭式曲率得分,从而避免了代价高昂的特征分解或核密度估计。该曲率信号自然地将图划分为两个互补区域:低曲率区域,对应平滑、均匀的聚类,这些区域可由少量原型样本高效表示;高曲率区域,集中在决策边界和拓扑复杂结构周围,这些区域对分类具有极高的信息价值。通过以一种有原则、几何感知的方式从两个区域中选择节点,CuBAS构建了紧凑但信息量最大的训练子集。在涵盖表格、图像和生物领域的30个基准数据集上的广泛实证评估表明,在多种标注预算和分类器架构下,CuBAS在分类准确率上相较于随机采样和基于不确定性的基线方法取得了持续且统计上显著的改进。我们的方法计算高效(与k-NN图的边数呈线性关系),在理论上植根于统计流形的微分几何,并且可直接通过数据流形的局部形状算子进行解释。因此,CuBAS为监督学习的启发式采样提供了一种有原则、可扩展且几何感知的替代方案。

## 1 引言

现代监督学习的显著成功不仅得益于日益精进的学习算法,也得益于大规模标注数据集的可获得性。然而,分类器的有效性更多地取决于其训练样本的**质量**和代表性,而非数量。大型数据集往往包含大量冗余、噪声观测、类别不平衡以及许多对定义底层决策边界贡献甚微的样本。这一观察自然引出一个基本问题:**如何识别带标签数据集中对分类最具信息量的样本?** 随着数据集在规模和复杂性上持续增长,解决这个问题变得愈发重要。尽管大量努力被投入到设计更具表达能力的分类器中,但相对较少的注意力被放在有原则的机制上,即通过反映数据内在几何组织的方式来选择信息量大的训练样本[Wilson, 1972 (https://arxiv.org/html/2607.03145#bib.bib1)]。传统的采样和实例缩减技术,包括随机子采样、原型选择和实例加权,通常是启发式的,主要输入空间内操作,对相邻样本之间的统计关系利用有限[Garcia et al., 2012 (https://arxiv.org/html/2607.03145#bib.bib2)]。因此,它们常常无法区分真正信息量大的边界样本与位于均匀区域中的冗余观测。

基于图的学习的最新进展表明,将数据集表示为图为捕捉样本间的局部和全局关系提供了一个强大的框架[Zhu et al., 2003 (https://arxiv.org/html/2607.03145#bib.bib3), Belkin et al., 2006 (https://arxiv.org/html/2607.03145#bib.bib4)]。图表示自然编码了邻域交互,并已成为流形学习、半监督学习、图神经网络和谱方法中的基础工具。从这个角度看,一个样本的信息量不仅由其个体属性决定,还取决于其在图拓扑中的结构角色。特别是,位于类别过渡或异质邻域附近的顶点通常比嵌入在均匀区域中的顶点携带更多判别性信息。尽管取得了这些进展,现有的基于图的采样策略很少利用由图上的统计交互诱导的微分几何结构,而是依赖于固定的相似性度量或纯组合标准。

几何机器学习近年来作为一种统一范式出现,它利用数据的几何结构来设计更鲁棒、可解释且统计高效的学习算法[Bronstein et al., 2017 (https://arxiv.org/html/2607.03145#bib.bib5)]。几何学习不是将观测视为欧氏特征空间中的孤立点,而是通过流形、图或其他非欧氏域来表示数据,允许算法显式地利用邻域关系、拓扑和曲率[Papillon et al., 2025 (https://arxiv.org/html/2607.03145#bib.bib6)]。这一视角推动了流形学习、图神经网络、几何深度学习以及信息几何的显著进展,表明融入几何先验通常能带来更好的泛化能力和对复杂数据更忠实的表示[Weber, 2025 (https://arxiv.org/html/2607.03145#bib.bib7)]。与大多数主要关注学习特征表示或图嵌入的现有几何学习方法不同,本文提出的方法利用几何来解决另一个同等重要但性质不同的基本问题:识别最具信息量的训练样本。通过将带标签的k-NN图建模为由Potts马尔可夫随机场诱导的统计流形,并利用基于Fisher信息的曲率量化局部几何复杂度,CuBAS将自适应采样转化为一个几何推理问题。因此,所提出的方法将几何机器学习的范围扩展到了表示学习之外,表明微分几何量也能为样本选择、冗余减少和分类器训练提供有原则的标准。

信息几何为弥合这一差距提供了自然的数学框架。通过将统计模型视为配备Fisher信息度量的黎曼流形,可以借助曲率和其他微分几何量来刻画概率分布的局部几何[Amari, 2016 (https://arxiv.org/html/2607.03145#bib.bib8), Nielsen, 2020 (https://arxiv.org/html/2607.03145#bib.bib9)]。曲率提供了统计模型局部变化速度的定量度量,使其成为样本信息量的天然描述符。令人惊讶的是,尽管具有坚实的理论基础,信息几何作为监督学习中自适应采样和数据缩减的机制,受到的关注相对较少。

选择信息量大的样本的问题已在多个范式下得到广泛研究,包括主动学习、课程学习以及实例或原型选择。主动学习旨在通过根据不确定性、间隔或预期模型变化标准查询信息量大的未标注样本来最小化标注工作量[Tong and Koller, 2002 (https://arxiv.org/html/2607.03145#bib.bib10), Settles, 2010 (https://arxiv.org/html/2607.03145#bib.bib11)]。虽然在交互式设置中非常有效,但这些方法固然地依赖于分类器,并且主要设计用于标签不可用的场景。课程学习采用互补的视角,根据预定义的难度概念逐步呈现训练样本[Bengio et al., 2009 (https://arxiv.org/html/2607.03145#bib.bib12)]。尽管在许多深度学习应用中取得成功,课程策略通常依赖于启发式的样本复杂度度量,缺乏严谨的几何解释。实例和原型选择方法试图通过基于距离、密度或边界保持的标准来减少数据集冗余[Wilson, 1972 (https://arxiv.org/html/2607.03145#bib.bib1), Garcia et al., 2012 (https://arxiv.org/html/2607.03145#bib.bib2), Liu and Motoda, 2002 (https://arxiv.org/html/2607.03145#bib.bib13), Aggarwal, 2014 (https://arxiv.org/html/2607.03145#bib.bib14), Olvera-López et al., 2010 (https://arxiv.org/html/2607.03145#bib.bib15), de Haro-García et al., 2019 (https://arxiv.org/html/2607.03145#bib.bib16)]。然而,这些方法通常在原始特征空间中使用固定度量操作,并未显式考虑由类别交互引起的统计几何。同样,基于图的方法融入了邻域信息,但很少提供局部统计复杂性或边界锐度的有原则的表征[Zhou et al., 2003 (https://arxiv.org/html/2607.03145#bib.bib17), Belkin et al., 2006 (https://arxiv.org/html/2607.03145#bib.bib4), Zhang et al., 2022 (https://arxiv.org/html/2607.03145#bib.bib18)]。

本文提出了一种根本不同的视角。我们不是通过分类器不确定性、局部密度或启发式边界估计来衡量样本重要性,而是将信息量定义为由带标签图诱导的统计流形的内在几何属性。具体来说,我们使用q状态Potts马尔可夫随机场对该图进行建模,其局部交互定义了一个以逆温为参数的概率流形。在此框架内,一阶和二阶Fisher信息自然诱导出流形的度量和曲率,从而能够构建一个局部分量算子,用以量化每个顶点周围的几何复杂度。因此,样本选择变成了识别高统计曲率区域的问题,在这些区域中,类别交互最强,信息量最大。

基于这一几何公式,我们提出了**基于曲率的自适应采样(CuBAS)**算法,这是一种基于图的、与模型无关的采样策略,它根据局部信息曲率将带标签数据集分解为互补的子集。高曲率样本主要位于决策边界和异质邻域附近,而低曲率样本对应于数据流形上平滑、均匀的区域。与现有采样技术不同,CuBAS直接从底层统计模型的几何中推导出其选择标准,提供了一个统一框架,同时捕捉了边界感知、冗余减少和噪声过滤。

本文的主要贡献总结如下:

- •我们引入了一个新颖的基于图的信息几何框架,将带标签数据集建模为由q状态Potts马尔可夫随机场诱导的统计流形,提供了图拓扑与微分几何之间的严格联系。
- •我们推导了Potts模型的一阶和二阶Fisher信息的闭式表达式,并展示了它们如何诱导一个局部形状算子,该算子量化了与每个图顶点相关的统计曲率。
- •我们提出了CuBAS,一种计算高效的曲率驱动自适应采样算法,通过局部几何分析而非启发式或依赖分类器的标准来识别信息量大的样本。
- •我们通过使用多样化的基准数据集集合和多种分类算法进行实验证明,CuBAS始终产生具有更强社区结构的图分解,并且相比传统的随机采样取得了更高的分类准确率。

本文其余部分组织如下。第2节回顾了q状态Potts马尔可夫随机场以及用于参数估计的最大伪似然过程。第3节阐述了所提出的信息几何框架,推导了Fisher信息张量,并介绍了基于曲率的自适应采样方法。第4节在基准数据集上进行了广泛的实验评估,并分析了所提出方法的几何性能和分类性能。最后,第5节总结全文并讨论了未来研究的有前景的方向。

## 2 理论基础

本节介绍了所提出的**基于曲率的自适应采样(CuBAS)**框架的理论基础。我们的方法建立在三个互补的数学组件之上,这些组件建立了基于图的统计建模与微分几何之间的联系。首先,我们回顾各向同性q状态Potts马尔可夫随机场(MRF),它提供了一个概率模型来描述k近邻图中相邻标签之间的交互。其次,我们介绍了用于有效估计Potts模型逆温参数的最大伪似然(MPL)估计过程。最后,我们总结了构成我们信息几何分析基础的微分几何概念,包括度量张量、曲率张量和形状算子。这些概念提供了所需的数学工具来描述由Potts模型诱导的统计流形的局部几何,并最终定义了CuBAS用于识别信息量大的样本的基于曲率的标准。所提出的框架源自概率图模型与信息几何的融合。Potts MRF捕捉带标签图上的局部统计依赖性,最大伪似然提供了高效的参数估计过程,而微分几何则提供了量化每个邻域统计复杂度的几何描述符。

### 2.1 各向同性Potts马尔可夫随机场

**Potts模型**是一个离散的**马尔可夫随机场(MRF)**,其中每个随机变量取有限个状态C = {1, 2, …, q}中的一个。最初为研究相互作用的自旋系统而引入,Potts模型后来已演变成为一个用于对离散变量之间的上下文依赖性进行建模的通用概率框架。其定义性特征是显式编码对相邻位置之间状态一致的偏好,使得复杂的全局结构能够从简单的局部规则中涌现。因此,Potts模型自然地捕捉了聚类、空间相干性和相变等现象,这些是许多涉及结构化数据的问题的核心。由于这种富有表现力且可解释的公式,该模型已在数学[Ge et al., 1996 (https://arxiv.org/html/2607.03145#bib.bib19), Adams, 2000 (https://arxiv.org/html/2607.03145#bib.bib20), Jin and Zhang, 2004 (https://arxiv.org/html/2607.03145#bib.bi

相似文章

CAT-Flow: 用于流匹配的曲率自适应步长

arXiv cs.LG

本文提出了CAT-OV和CAT-OT两种轻量级、无需训练的算法,它们基于曲率自适应调整流匹配采样中的步长,提升图像质量并将生成步数最多减少40%。