scShapeBench: 从高维scRNAseq数据中发现几何结构

arXiv cs.LG 论文

摘要

介绍scShapeBench,一个用于高维单细胞数据形状检测的基准数据集,以及scReebTower,一种使用扩散几何和Reeb图将数据形状分类为聚类、轨迹、多分支和原型的基线方法。

arXiv:2605.12662v1 公告类型:新 摘要:高维点云数据出现在许多科学领域,尤其是单细胞生物学。这些数据集的形状或拓扑结构决定了可提取的信息类型。例如,聚类数据支持细胞类型识别,轨迹结构支持转变分析,而原型结构则捕捉细胞行为的连续体。现有的分析流程通常假设特定的形状。标准的Seurat流程将UMAP可视化与Louvain聚类相结合,因此假设数据是聚类的,而Monocle和SPADE等工具则假设树状结构,MIOFlow和Conditional Flow Matching等基于流的模型则针对轨迹。因此,选择使用哪个流程通常留给生物信息学家,他们在选择分析策略之前会目视检查数据集。随着主动式AI科学家的兴起,自动形状检测对于选择下游分析流程变得越来越重要。为解决这个问题,我们引入了scShapeBench,一个用于形状检测的基准数据集,包含合成和专家标注的单细胞数据集。合成数据集从具有受控方差的真实骨架图中采样。真实单细胞数据集从多种来源收集,并由专家标注为四个类别:聚类、单轨迹、多分支和原型。我们还引入了scReebTower,一种基线方法,它使用扩散几何提取Reeb图,并将可视化与流程选择联系起来。我们提供了拓扑感知评估指标,并在合成和真实数据上将scReebTower与PAGA和Mapper进行了比较。我们的结果表明,scReebTower优于现有基线。总体而言,我们的贡献涵盖了基准数据集、评估指标以及单细胞数据自动形状检测的基线方法。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:17

# scShapeBench: 从高维单细胞RNA测序数据中发现几何结构

来源: https://arxiv.org/html/2605.12662

Andrew J. Steindl¹ & João Felipe Rocha¹¹¹ 脚注标记: ¹ & Brian Tshilengi Di Bassinga¹ & Zachary Warren¹  
Matthew Scicluna² & César Miguel Valdez Córdova² & Shabarni Gupta³ & Leire Torices³  
Daniel Neumann⁴ & Timothy J. Mann⁴ & Ihuan Gunawan⁴ & Dhananjay Bhaskar⁵  
John G. Lock⁴ & Christine L. Chaffer³ & Guy Wolf² & Smita Krishnaswamy¹  
¹耶鲁大学  
²米拉研究所 / 蒙特利尔大学  
³加文医学研究所  
⁴新南威尔士大学生物医学科学学院  
⁵威斯康星大学麦迪逊分校  
[email protected]  
[email protected]  
[email protected]

###### 摘要

高维点云数据出现在许多科学领域,尤其是单细胞生物学。这些数据集的“形状”或拓扑结构,反映了可以从数据集中提取的信息类型。例如,在对数据集进行静态分析时,聚类数据允许提取细胞类型或细胞状态。连续轨迹结构允许进行连续转变或轨迹分析,而其他形状(如原型形状)则允许提取涵盖一系列行为的细胞连续体。尽管存在各类分析流程,但它们通常预设了数据中的形状。例如,标准的Seurat流程将UMAP可视化与Louvain聚类相结合,这假定了数据是聚类的。Monocle和Spade等工具假定树状形状,而MIOFlow和条件流匹配等流模型则适用于轨迹。决定将哪个流程应用于数据的哪一部分,通常是生物信息学家的任务,他们会在选择流程前先进行可视化并对数据进行定性分析。然而,随着智能体AI科学家的出现,自动化数据形状检测变得尤为重要,特别是要将其分类为与下游分析流程相关的类别。为此,我们引入了scShapeBench,这是一个基准数据集,包含合成数据集和由单细胞专家标注的数据集,专门用于形状检测任务。合成数据集是从带有噪声的“真实骨架图”中采样得到的。真实单细胞数据集则从多种来源整理,并由专家进行标注,分为四类:聚类、单轨迹、多分支和原型。此外,我们提供了一个基线方法scReebTower,以弥合数据可视化和流程选择之间的差距。scReebTower利用扩散几何来提取Reeb图。我们提供了新的拓扑感知指标,用于在合成数据上评估scReebTower以及现有方法PAGA和Mapper。在单细胞数据上,我们整理了专家对形状的标注,并展示了这些方法的评估结果。我们的比较表明scReebTower优于其他基线方法。总体而言,我们的贡献包括基准数据集、评估指标以及一种用于高维单细胞数据自动形状检测的新型基线方法。

## 1. 引言

生物学、神经科学和机器学习中出现的高维数据集通常具有内在的低维结构,这对于其解释至关重要。分析此类数据集的研究者会面临一个直接的问题:数据是组织成离散的细胞类型、连续的分化轨迹、循环过程,还是某种组合?简而言之:数据具有什么**形状**,以及应该使用哪些工具来相应地提取信息?

这个问题之所以重要,是因为针对每种形状都存在专门的分析方法,而将方法与形状相匹配对于恢复生物信号至关重要(图1 (https://arxiv.org/html/2605.12662#S1.F1))。标准的Seurat (Satija等人,2015 (https://arxiv.org/html/2605.12662#bib.bib31)) 流程假设数据具有聚类结构,这是受到对完全分化的细胞类型(如循环血细胞(PBMC)中的B细胞和T细胞)进行测量的启发。Monocle 3 (Cao等人,2019 (https://arxiv.org/html/2605.12662#bib.bib29)) 和SPADE (Anchang等人,2016 (https://arxiv.org/html/2605.12662#bib.bib49)) 则受分支过程(如造血过程)或当治疗反应产生分叉时的情形所启发。MIOFlow (Huguet等人,2022 (https://arxiv.org/html/2605.12662#bib.bib30)) 和TrajectoryNet (Tong等人,2020 (https://arxiv.org/html/2605.12662#bib.bib48)) 假设存在连续轨迹,这种轨迹出现在从原发灶到转移灶的转变或其他疾病相关转化中。尽管这些是这些方法的动机,但仅仅知道测量基于血细胞并不一定意味着存在聚类结构;它密切依赖于在测量条件下细胞中活跃的过程。例如,血细胞是在对治疗或病毒感染做出反应吗?最终的决定通常最好由数据本身来提供。

然而,形状并不能轻易地从原始高维数据中直接读取。虽然有许多工具可以将数据的几何结构处理为可视化结果,但缺乏能够提取出数据形状的简单解释的工具。目前,形状检测是一个手动过程:生物信息学家检查低维嵌入结果,并通过领域专业知识和视觉直觉的混合来选择方法。在没有这种直觉的情况下,默认选择几乎总是Seurat (Satija等人,2015 (https://arxiv.org/html/2605.12662#bib.bib31)) 的聚类流程,无论数据是否真正具有聚类结构,由此导致的后果是,编码在轨迹、循环或混合几何结构中的真实生物信号经常被遗漏。

请参见说明文字

图1:流程选择是单细胞数据分析中的一个常见挑战。尽管存在适当的方法,但基于点云结构的下游分析的无监督选择仍然是一个尚未得到广泛解决的问题。这种手动步骤是任何自动化分析系统的瓶颈。自动化这种选择需要一种能够以量化且符合数学原理的方式检测数据内在形状或拓扑的方法。虽然某些方法,如PAGA (Wolf等人,2019 (https://arxiv.org/html/2605.12662#bib.bib32)) 或Mapper (Singh等人,2007 (https://arxiv.org/html/2605.12662#bib.bib3)),旨在提供数据的简化表示,但它们在帮助自动化单细胞数据形状检测方面的有效性尚未得到系统测试。事实上,据我们所知,这个问题尚未被数学化地提出,并且也没有为此目的存在评估指标。

我们将**单细胞形状检测**问题定义为:从高维点云 \(X\) 中恢复一个图 \(S\),使得 \(S\) 反映数据的底层拓扑结构(见图2 (https://arxiv.org/html/2605.12662#S2.F2))。为了支持这项工作,我们引入了 scShapeBench,这是一个基准测试框架,包括:

1.  **一个带有真实拓扑标签的合成数据集。** 我们提供从已知拓扑的真实图中生成的合成点云,涵盖四种形状类别,并控制噪声、维度和采样密度的变化。这使得可以通过与生成图直接比较来精确评估拓扑正确性。
2.  **一个由专家标注的 scRNAseq 语料库。** 我们整理了一个包含 102 个真实世界 scRNAseq 数据集的集合,并由 9 位专家生物学家和生物信息学家对其形状进行了标注。这使得可以在无法获得真实拓扑标签但标注提供了可靠参考的情况下评估形状恢复效果。完整的标注数据集将随附结构化的数据表发布在 Hugging Face 上。
3.  **拓扑感知的评估指标。** 我们定义了用于比较恢复的图骨架与参考结构的指标,包括图编辑距离和持久性相似度。对于缺乏真实图标签的真实世界数据集,我们评估恢复的骨架是否与领域专家标注的拓扑类别匹配。
4.  **标准化的评估协议。** 我们定义了一个一致的评估接口(输入点云,输出图),应用统一的预处理,比较所有形状上的一组现有方法,并发布一个可重现的评估流程,供任何新开发的方法使用。
5.  **一个基线方法。** 我们引入了 scReebTower,它从扩散映射构建 Reeb 图 (Reeb, 1946 (https://arxiv.org/html/2605.12662#bib.bib36))。scReebTower 在 scShapeBench 上达到了最先进的性能,并改善了基线方法,表明该基准测试不仅仅是诊断性的,而且能够促进更好的方法开发。

## 2. 背景

在本节中,我们定义并解释与单细胞形状检测问题相关的图论、扩散几何和拓扑数据分析中的概念。

### 2.1 图论

**图。** 一个图 \(G=(V, E)\) 包含一组顶点 \(V\) 和一组边 \(E\),其中每条边连接一对顶点。由于 \(E\) 是一个集合,不允许有重复的边:任何一对顶点之间最多有一条边。这种图通常被称为**简单图**。**多重图**通过将边集替换为多重集来推广简单图,允许同一对顶点之间存在多条边。

**简化图。** 存在无限多个图,它们仅在路径上是否存在二次节点(度为2的节点)上有所不同。由于这些节点不改变图的整体分支或连通结构,通常可以方便地将其移除。对于一个图 \(G\),令 \(\widetilde{G}\) 表示通过收缩所有内部顶点度数为2的最大路径而得到的**简化图**。这保留了分支点、悬挂边、环和连通分量,同时移除了冗余顶点。

### 2.2 扩散几何

扩散几何通过研究扩散过程(例如在从数据构建的图上的热量传播)来研究数据的内在几何结构。这是在流形学习的背景下通过扩散映射 (DMs) (Coifman and Lafon, 2006 (https://arxiv.org/html/2605.12662#bib.bib43)) 引入的。

**核函数。** 核函数将数据点 \(x_n\) 之间的成对距离转换为亲和度,生成一个加权图,其中邻近的点获得较大的权重,距离远的点获得较小的权重。在整项工作中,我们使用自适应高斯核:

\[ w_{ij} = \exp\left(-\frac{\|x_i - x_j\|^2}{\sigma_i \sigma_j}\right), \tag{1} \]

其中 \(\sigma_i\) 是一个局部尺度参数,它根据点 \(x_i\) 周围的数据密度进行调整。将这些亲和度收集到矩阵 \(W\) 中,其中 \([W]_{ij} = w_{ij}\),就得到了数据的**亲和度矩阵**。

**扩散算子。** 对 \(W\) 进行行归一化得到行随机矩阵 \(P\),即**扩散算子**:

\[ P = D^{-1}W, \tag{2} \]

其中 \(D\) 是对角度矩阵,满足 \(D_{ii} = \sum_j W_{ij}\)。元素 \(P_{ij}\) 表示在数据图上的马尔可夫随机游走中,从 \(x_i\) 一步转移到 \(x_j\) 的概率。幂 \(P^t\) 编码了 \(t\) 步转移概率:

\[ P_{ij}^t = \Pr(x_t = x_j \mid x_0 = x_i), \tag{3} \]

其中每一行 \(P_{i,:}^t\) 给出了从 \(x_i\) 开始的 \(t\) 步扩散分布。

**扩散映射与特征向量。** \(P^t\) 各行之间的 \(L^2\) 距离定义了**扩散距离**,它通过图扩散而不是欧氏几何来衡量相似性。\(P\) 的谱分解在几何上实现了这个距离,特征向量 \(\phi_0, \phi_1, \ldots, \phi_n\) 按特征值大小排列:\(1 = |\lambda_0| \ge |\lambda_1| \ge |\lambda_2| \ge \cdots\)。这些特征向量作为频率逐渐升高的调和函数。由于 \(P\) 是马尔可夫矩阵,\(\lambda_0 = 1\);对于连通图,对应的主右特征向量是常数,而特征值1的多重性反映了不连通的分量。第一个非平凡的扩散特征向量 \(\phi_1\),即 Fiedler 向量,是最低频率的非恒定模式,并在图上平滑变化。在本文中,其水平集揭示了点云的底层形状。

**扩散凝聚。** 扩散凝聚是 Huguet 等人 (2023 (https://arxiv.org/html/2605.12662#bib.bib9)) 和 Brugnone 等人 (2019 (https://arxiv.org/html/2605.12662#bib.bib10)) 开发的一种方法,它提供了一种通过将扩散算子作用于数据来实现数据系统粗粒化的方法。在每次迭代中,它将每个原始数据向量 \(X_i\) 替换为其 \(t\) 步扩散邻居的加权平均值:\(X^{(t)} = P^t X\)。然后根据凝聚后的数据点 \(X^{(t)}\) 计算一个新的扩散算子。这个过程被 Huguet 等人 (2023 (https://arxiv.org/html/2605.12662#bib.bib9)) 证明最终会收敛到一个单点,从而遍历所有数据粒度。因此,它作为一种连续的分层聚类方法。我们将此过程的迭代次数记为 \(\ell\)。

### 2.3 拓扑数据分析

拓扑数据分析 (TDA) 使用代数拓扑的工具研究数据的形状,目标是恢复诸如连通分量、环和分支等特征。

请参见说明文字

图2:单细胞形状恢复框架。形状恢复的目标是推断出高维数据底层组织结构的图表示。(a) 一个潜在图 \(G\) 描述了数据的底层组织结构。(b) 从该结构中采样得到观测到的含噪高维点云 \(X\)。(c) 形状恢复方法从观测数据构建一个图 \(S\),可能沿着路径引入额外的二次顶点。(d) 通过抑制二次顶点来简化图,得到简化图 \(\widetilde{S}\)。

**持久同调。** 持久同调跟踪当尺度参数变化时,拓扑特征(如连通分量和环)如何出现和消失,从而提供形状的多尺度摘要。它构建一个**过滤**——一个不断增长的空间序列——并记录每个特征的(出现,消失)尺度,通常可视化为**持久图**或条形码。寿命长的特征被解释为真正的结构,而寿命短的特征则归因于噪声。对于图来说,一个自然的选择是**边长过滤**:边从最短到最长依次添加,这会导致分量合并(消失)和环的形成(出现)。触发这些事件的边长给出了出现和消失的尺度,从而将显著的环和聚类与虚假的区分开来。

**Morse 函数。** Morse 函数是空间上的一个光滑实值函数,其临界点是明确定义且孤立的。

**Reeb 图。** Reeb 图总结了 Morse 函数的水平集的连通分量如何在空间上演化。水平集的连通分量被表示为节点,而边则追踪当扫描函数值时这些分量如何合并或分裂。

我们的主要挑战是从含噪数据中恢复简化图,而提出的方法 scReebTower 使用扩散几何来揭示这种结构。我们在附录A (https://arxiv.org/html/2605.12662#A1) 中讨论类似问题的相关工作。

## 3. 问题形式化

令 \(X \in \mathbb{R}^{n \times m}\) 是一个高维点云,例如来自 scRNAseq 数据的细胞-基因矩阵。我们将 \(X\) 视为从一个潜在的几何结构中噪声地、非均匀地采样得到的样本,该潜在结构具有一个图表示 \(G\)。

出于本文的目的,我们将数据集的**形状**定义为

相似文章

ShapeCodeBench:合成形状场景中感知到程序重建的可再生基准

Hugging Face Daily Papers

ShapeCodeBench是一个用于感知到程序重建的合成基准,模型需从光栅图像生成可执行的绘图程序,评估指标包括精确匹配和像素准确率。该基准通过种子随机数生成器实现可再生性,当前模型仍获得较低的精确匹配率,表明还有改进空间。

单细胞CRISPR扰动的几何一致性揭示调控架构并预测细胞应激

Hugging Face Daily Papers

# 论文页面 - 单细胞CRISPR扰动的几何一致性揭示调控架构并预测细胞应激 来源:[https://huggingface.co/papers/2604.16642](https://huggingface.co/papers/2604.16642) ## 摘要 尽管基因组工程在序列层面已达成卓越精度,预测扰动后细胞将占据的转录组状态仍是未解难题。单细胞CRISPR筛选可测量细胞偏离未扰动状态的程度,但这一效应幅度忽略了一个根本问题:细胞是否协同移动?若一个扰动将细胞沿共同轨迹一致推进,而另一个将其分散到表达空间各处,即使幅度相同,结果也可能截然不同。