平滑亲和矩阵如何影响t-SNE中的邻域保持

arXiv cs.LG 论文

摘要

本文研究了通过逐行幂变换平滑t-SNE中的亲和矩阵如何影响邻域保持,发现锐化改善最近邻的保持,而平滑增强更广泛的局部邻域。

arXiv:2608.17190v1 Announce Type: new 摘要:降维方法对于可视化高维数据至关重要,t-SNE因其对局部邻域保持的重视而成为最广泛使用的方法之一。t-SNE的一个核心组件是亲和矩阵,它以对称概率的形式表达成对相似性,t-SNE的优化问题正是在此基础上定义。我们研究了该概率分布的锐度如何影响不同尺度下的邻域保持。我们引入了一种由参数gamma控制的逐行幂变换,可以在保持稀疏性和秩序的同时,平滑或锐化亲和矩阵的每一行。我们证明这种变换等效于重新缩放高斯带宽,从而改变困惑度。然而,由于概率分布的锐度随点变化,固定的gamma会导致点依赖的有效困惑度,这与改变全局困惑度不同。实证上,我们发现锐化改善非常近邻的保持,而平滑改善更广泛的局部邻域的保持,在中局部范围内优于包括多尺度方法在内的替代亲和构造。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:24

# 平滑化亲和矩阵如何影响t-SNE中的邻域保持
来源:https://arxiv.org/html/2608.17190
###### 摘要

降维方法对于可视化高维数据至关重要,而t-SNE因其对局部邻域保持的重视,成为应用最广泛的方法之一。t-SNE的核心组件是*亲和矩阵*,它以对称化概率的形式表达成对相似性,t-SNE的优化问题即定义在该矩阵之上。我们研究了这种概率分布的“尖锐度”如何影响不同尺度下的邻域保持。我们引入了一种由参数$\gamma$控制的按行幂变换,该变换可以在保持稀疏性和秩顺序的同时,平滑化或锐化亲和矩阵的每一行。我们证明此变换等效于缩放高斯带宽,从而等效于改变困惑度。然而,由于概率分布的尖锐度因点而异,固定的$\gamma$会导致点依赖的有效困惑度,这使其区别于改变全局困惑度。经验上,我们发现锐化改善了极近邻的保持,而平滑化改善了更广泛局部邻域的保持,在中等局部范围内优于包括多尺度方法在内的其他亲和矩阵构造方法。

###### 关键词:

t-SNE 亲和矩阵 邻域保持

## 1 引言

**研究动机。** 机器学习模型在推理和预测方面非常有效,但用户通常仍希望直接检查数据,以识别模式和获取补充模型输出的见解。可视化可以支持此类探索,但当数据是高维时(即每个观测由许多特征描述),这变得困难。降维方法通过将数据投影到二维空间来缓解这一问题,之后我们可以在散点图中可视化数据。

(图1说明)
图1:(a) 重绘自 Novak 等人 (2026) [17],展示了多种前沿降维方法在局部与全局邻域保持方面的表现(此处分别通过RnX和log-RnX曲线下的AUC进行测量,详见其论文)。此处展示了一个数据集,该论文还包含另外七个数据集。如图所示,t-SNE在保留局部结构方面明显优于其他降维方法。(b) 来自 Heiter 等人 (2024) [8],在小鼠细胞数据[19]的t-SNE投影上演示了邻域保持在不同嵌入间存在显著差异。颜色对应于 $k=200$ 的邻域重叠度。

遗憾的是,将数据投影到二维通常意味着只能保留原始结构的一部分。已有大量研究致力于开发有效的降维方法以可视化高维数据。在这些方法中,t-分布随机邻域嵌入(t-SNE)[21]是最广泛采用的非线性降维技术之一[7]。其广泛使用的一个主要原因是它关注局部邻域结构:在高维空间中接近的点在嵌入中也被鼓励保持接近。t-SNE以良好保留局部邻域结构而闻名[17],图1(a)提供了来自文献的说明。尽管t-SNE在局部保持基准测试中通常优于其他方法,但其邻域保持分数在绝对意义上通常较低,并且误差可能在嵌入中分布不均。图1(b)展示了这一效应的示例。有观点反复指出,(局部)结构保持的低可靠性在解释嵌入上的表观结构时会产生问题,因为这些结构可能是由降维方法人为创造,而非源于数据中的可靠信号[4]。

**研究目标。** 如图1(a)所示,其他方法(例如PaCMAP[23]、自编码器[17])在全局结构保持方面优于t-SNE,并且大多数研究似乎都集中在改进t-SNE的全局结构保持上。然而,同样有趣的是探究*是否可能进一步改进局部结构保持*,例如使簇子结构的检查更可靠、更有用。据我们所知,目前尚无明确研究探讨是否可能改进或超越t-SNE的邻域保持。为此,我们研究t-SNE如何在其高维亲和矩阵中编码局部邻域关系,并探索修改亲和得分的影响。

**研究方法。** 为了更好地理解是什么引导了t-SNE的局部保持行为,我们专注于其高维亲和矩阵。t-SNE首先将高维距离转换为邻域概率,形成亲和矩阵 $P$。然后优化嵌入,使得低维概率尽可能复现这些高维亲和度。在 $P$ 构建之后,优化仅由亲和度驱动。这使得 $P$ 成为t-SNE的核心组件:它编码了哪些邻域关系被强调以及它们如何强烈地影响嵌入。因此,亲和矩阵的改变可以改变哪些局部结构被保留或丢失。在这项工作中,我们研究亲和矩阵平滑度的改变如何影响t-SNE的邻域保持。

标准t-SNE使用点特定的高斯带宽来构建亲和矩阵,并且选择这些带宽使得每个点都具有相同的困惑度。因此,t-SNE在固定全局困惑度的同时调整了局部距离尺度。困惑度为 $2^{H(P_i)}$,其中 $H(P_i)$ 是条件概率行的香农熵,通常被解释为有效邻居数[21]。然而,我们观察到通常只有少数邻居主导每个点的概率分布,即分布是“尖锐的”,导致少数最近邻主导吸引力。此外,分布的尖锐度因点而异。我们通过应用一个由参数 $\gamma$ 控制的幂变换来影响这种尖锐度,该变换可以平滑(或进一步锐化)亲和矩阵的每一行,同时保留原始邻域支持和秩顺序。这提供了一种受控的方式来研究亲和尖锐度对最终嵌入的影响。

**理论与实证结果。** 我们证明该变换等效于改变有效的高斯带宽,从而等效于改变困惑度,但与增加全局困惑度不同,它产生了点依赖的有效困惑度。经验上,我们发现改变 $\gamma$ 在不同尺度上对邻域保持的影响不同:锐化改善了极近邻的保持,而平滑化改善了更广泛局部邻域和全局结构的保持。这种效应在较低困惑度时最为明显(此时原始亲和行最尖锐),并且随着困惑度的增加,效应逐渐减小。仅通过调整困惑度无法复制这些改进,因为平滑化为不同点分配了不同的有效邻域大小,而不仅仅是增加所有点的困惑度。我们还表明,$\gamma$ 平滑化在中等局部邻域范围内优于其他亲和矩阵构造方法。平滑化不影响可扩展性,因为亲和矩阵中(非零)邻居的数量保持不变。

**论文结构。** 我们首先在第2节讨论相关工作。在第3节,我们回顾t-SNE,引入由 $\gamma$ 控制的亲和矩阵平滑化操作,并描述其对不同数据点有效困惑度的影响。第4节展示了平滑化对邻域保持影响的实证研究。第5节总结了主要结论。补充材料,包括PDF格式的附录、源图片和复现代码,提供于 https://github.com/aida-ugent/smooth_affinity_tsne.git。

## 2 相关工作

t-分布随机邻域嵌入(t-SNE)[21]使用来自高斯核的高维邻域概率,然后使用重尾学生t分布优化一个概率与之匹配的低维嵌入。Kobak 和 Berens [10] 将t-SNE描述为揭示局部结构特别有效的方法。更广泛的转录组学和细胞计量学基准也报告了t-SNE相比于UMAP[16]、TriMap[1]和PaCMAP[23]等方法具有较强的局部邻域保持能力。同样,Novak等人[17]使用独立的局部和全局结构保持分数比较了流行的降维方法,发现t-SNE在所评估方法中实现了最强的局部结构保持。同时,这些研究也表明局部保持并非完美:即使强大的t-SNE嵌入也可能遗漏许多高维邻居[4]。这促使人们分析t-SNE流程中哪些部分控制局部邻域保持。

存在大量改进t-SNE实际使用的工作。Barnes-Hut t-SNE使用树状近似降低原始算法的计算成本[22],而FIt-SNE使用插值和快速傅里叶变换技术进一步加速计算[15]。openTSNE提供了模块化实现,使得大规模和实验性t-SNE使用更便捷[18]。其他研究探讨了初始化、学习率、早期放大和迭代调度等优化选择[3,5,10]。这些工作表明,t-SNE的质量和可用性强烈依赖于优化执行的方式。我们的研究与这些研究互补:我们保持优化过程固定,研究高维亲和分布如何影响嵌入。

与我们工作最接近的是关于高维亲和矩阵构造和邻域尺度选择的研究。在标准t-SNE中,邻域尺度由目标困惑度控制,使得困惑度成为亲和矩阵构造中的一个核心设计选择。一些研究质疑这种单尺度构造是否足够。多尺度随机邻域嵌入通过平均多个带宽上的基于softmax的相似性来构建多尺度相似性,目标是提高跨尺度的嵌入质量并减少对单一尺度参数的依赖[13]。无困惑度t-SNE遵循类似的动机,通过在宽度递增的高斯核上构建邻域,避免了对用户指定困惑度的需要[6]。多尺度内核也用于单细胞转录组学的实际操作流程中[10]。一些实现则为所有点固定单个高斯带宽[18]。其他变体修改了相似性内核本身。双重学生t-SNE将高维相似性从高斯类型替换为学生t类型,改变了优化前邻域的表示方式[6]。重尾内核变体则通过改变其自由度来修改低维学生t内核,表明更重的尾部可以减少拥挤并揭示更精细的簇结构[11]。

我们的分析最接近于这类亲和矩阵构造文献,但提出了一个更具体的问题:在标准t-SNE亲和矩阵构建之后,仅改变按行概率质量分布的效果是什么?我们使用按行幂变换作为受控扰动,该变换在改变亲和尖锐度的同时保留了邻域支持和秩顺序。这使我们能够孤立地研究局部邻域保持是否仅取决于存在哪些邻居,还是也取决于这些邻居被赋予权重的强弱。

## 3 研究方法

本节详细描述所提出的平滑化操作。本节结构如下。我们首先回顾t-SNE以及我们后续要变换的条件概率的构建。然后引入一个幂变换,可以在不改变存在哪些邻居或它们的顺序的情况下平滑(或锐化)每个条件行。最后,我们证明该变换等效于改变高斯分布的带宽,并引入*有效困惑度*的概念,即由输入困惑度 $\rho$ 和平滑化参数 $\gamma$ 参数化的所得分布的困惑度。这产生了一个t-SNE的广义变体,使我们能够研究亲和矩阵的平滑度如何影响嵌入中的邻域保持。

### 3.1 标准t-SNE亲和矩阵构建

t-SNE通过三个主要概念构建:(1) 将高维成对距离映射为(对称化的)概率,收集在亲和矩阵中;(2) 在低维空间使用t分布定义相似性内核(这也是前缀“t”的来源);(3) 定义整体目标,即低维和高维概率之间的KL散度。下面我们依次回顾。

**从距离到条件概率。** 第一步将高维空间中的成对距离映射为表示相似性的概率:设 $X = \{x_1, x_2, \ldots, x_n\}$ 为高维数据,其中 $x_i \in \mathbb{R}^m$。对于每个点 $x_i$,在其他点上定义一个条件概率分布。选择 $x_j$ 作为 $x_i$ 邻居的条件概率为

$$
p_{j|i} = \frac{\exp(-\beta_i d_{ij}^2)}{\sum_{m \neq i} \exp(-\beta_i d_{im}^2)}, \quad \beta_i = \frac{1}{2\sigma_i^2} \tag{1}
$$

其中 $p_{i|i}=0$ 且 $d_{ij} = \|x_i - x_j\|$。参数 $\beta_i$(或等价地,$\sigma_i$)控制分布的尖锐度。困惑度被定义为 $\text{Perp}(P_i) = 2^{H(P_i)}$,其中 $H(P_i) = -\sum_j p_{j|i} \log_2 p_{j|i}$ 是条件概率分布 $P_i$ 的香农熵。困惑度可以解释为与每个点相关的有效邻居数量。在标准t-SNE中,通过为每个点 $x_i$ 二分查找合适的 $\beta_i$(即 $\sigma_i$),使得困惑度等于用户指定的值 $\rho$(通常在5到50之间)。这确保了每个点都有一个具有“适当”大小的局部邻域。对称化联合概率 $p_{ij}$ 通常计算为 $p_{ij} = (p_{j|i} + p_{i|j}) / (2n)$。

相似文章

使用 Householder 矩阵探索过度平滑

arXiv cs.LG

本文介绍了 HouseGNN,一种使用 Householder 反射和 GroupSort 来解决过度平滑问题的图神经网络,证明了每一层都保持节点级别的欧几里得范数,并展示了在深度增加时改进的行为。

神经丛扩散中的过度平滑作为表示退化

arXiv cs.LG

本文利用箭图理论和几何不变量理论,分析了神经丛扩散(NSD)中的过度平滑现象,将其视为一种表示退化。文章提出了受矩映射启发的正则化方法,并探讨了在非均匀丛维数下缓解异质图基准测试中该问题的可能性。

梯度平滑:耦合逐层更新以改进优化

arXiv cs.LG

介绍了深度方向梯度增强(Depth-wise Gradient Augmentation),这是一种通用的优化范式,沿着深度维度转换块级优化器更新。该方法,即梯度平滑(Gradient Smoothing),提升了包括Transformer和扩散模型在内的多种架构的优化和泛化性能。