CohortHijack:单细胞注释对伴随细胞移除的鲁棒性

arXiv cs.LG 论文

摘要

这篇arXiv论文介绍了CohortHijack,一种鲁棒性审计方法,通过从单细胞查询队列中移除非目标细胞,来测试在不改变目标细胞表达谱的情况下,注释工具可能如何被操纵。研究表明,在保留目标细胞的同时,结构化移除和搜索策略可以改变主流流程中的精炼标签,从而将查询队列组成识别为一个攻击面。

arXiv:2608.05900v1 公告类型:新 摘要:许多单细胞注释工具会利用邻近细胞或簇级投票来细化初始细胞标签。我们研究在不改变目标细胞的情况下,这种细化过程是否可能被操纵。我们提出了CohortHijack,一种鲁棒性审计方法,它从查询队列中移除选定的非目标细胞,同时保留目标表达谱、基础预测和训练好的模型。我们在PBMC3K和Paul15上,使用逻辑回归和校准的线性SVM分类器,评估了随机和结构化移除方法,以及贪心搜索、多起点搜索和束搜索。在Paul15上,结构化移除始终比随机移除更有效。多起点搜索改变了24.33%的线性SVM目标和19.67%的逻辑回归目标,同时仅移除了队列的一小部分,并将平均附带变化保持在0.4%以下。消融实验证实,当禁用邻近细化时,该效应消失。我们还评估了CellTypist的多数投票,其中独立预测在所有评估中保持不变,但在少量伴随细胞移除后,细化标签发生了变化。这些发现将查询队列组成识别为单细胞注释中一个保持目标不变的攻击面。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:53

# CohortHijack:单细胞注释对伴随细胞移除的鲁棒性

来源:https://arxiv.org/html/2608.05900
Arash Vashagh∗和Yasmin Vashagh†, ∗新不伦瑞克大学计算机科学学院,加拿大新不伦瑞克省弗雷德里克顿 E3B 5A3, †Farzanegan Amin 2高中,伊朗伊斯法罕 \{arash\.vashagh@unb\.ca, yasmin\.vashagh@gmail\.com\}

###### 摘要

许多单细胞注释工具会利用邻近细胞或簇级投票来优化初始细胞标签。我们研究这种优化是否可以在不改变目标细胞的情况下被操纵。我们引入了CohortHijack,这是一种鲁棒性审计方法,它在保留目标表达谱、基础预测和已训练模型的同时,从查询队列中移除选定的非目标细胞。我们使用逻辑回归和校准线性SVM分类器,在PBMC3K和Paul15上评估了随机和结构化移除方法,以及贪心搜索、多起点搜索和束搜索。在Paul15上,结构化移除始终比随机移除更强。多起点搜索在移除少量队列细胞且保持平均附带变化低于0.4%的情况下,改变了24.33%的线性SVM目标和19.67%的逻辑回归目标。消融实验证实,当邻域优化被禁用时,该效应消失。我们还评估了CellTypist多数投票,其中独立预测在所有评估中保持不变,但在少量伴随细胞移除后优化标签发生了变化。这些发现表明,查询队列组成是单细胞注释中一个保持目标不变的攻击面。

## I 引言

单细胞RNA测序能够在单细胞水平上测量基因表达,并支持对复杂组织、免疫群体、发育过程和疾病状态的研究。现代分析流程通常包括归一化、降维、聚类、可视化和细胞类型注释[1 (https://arxiv.org/html/2608.05900#bib.bib1),2 (https://arxiv.org/html/2608.05900#bib.bib2)]。由于大型数据集可能包含数千或数百万个细胞,手动注释速度较慢且可能因专家而异。因此,自动细胞类型注释已成为单细胞分析的重要组成部分[3 (https://arxiv.org/html/2608.05900#bib.bib3),4 (https://arxiv.org/html/2608.05900#bib.bib4),5 (https://arxiv.org/html/2608.05900#bib.bib5)]。

现有注释方法使用不同形式的先验知识和参考信息。有些方法将查询细胞映射到注释好的参考数据集上,而其他方法则使用概率模型、标记基因、整合方法或共识预测[4 (https://arxiv.org/html/2608.05900#bib.bib4),6 (https://arxiv.org/html/2608.05900#bib.bib6),7 (https://arxiv.org/html/2608.05900#bib.bib7),8 (https://arxiv.org/html/2608.05900#bib.bib8)]。诸如Symphony之类的参考映射方法将查询细胞置于稳定的参考表示中,并将已知注释迁移到新数据集[9 (https://arxiv.org/html/2608.05900#bib.bib9)]。其他框架则结合注释、整合和标签优化来改善跨数据集的预测[10 (https://arxiv.org/html/2608.05900#bib.bib10),11 (https://arxiv.org/html/2608.05900#bib.bib11)]。这些方法表明,细胞的最终注释不仅取决于其自身的基因表达,还可能取决于周围的细胞、邻域结构或簇级信息。

队列信息可以通过纠正孤立或不确定的预测来改善注释。共识方法结合多个注释算法的输出,而基于邻域和微环境的方法则使用邻近细胞或局部细胞组成[8 (https://arxiv.org/html/2608.05900#bib.bib8),12 (https://arxiv.org/html/2608.05900#bib.bib12)]。然而,这种依赖性也带来了鲁棒性问题。如果查询队列因某些细胞被移除而发生变化,邻域图、簇分配、局部类别频率和优化标签也可能发生变化。因此,即使目标细胞的基因表达谱保持不变,其最终注释也可能不同。

在常规单细胞分析中,队列组成的变化可能发生。质量控制期间可能移除低质量细胞,采样过程中可能丢失稀有细胞,并且在下游分析之前可能缩减大型数据集。先前的研究表明,随机子采样可能会丢弃稀有群体或扭曲单细胞数据集的结构。这促使人们开发更仔细选择细胞的方法,要么为了保留细胞多样性,要么为了保留对下游分析具有高价值的细胞[13 (https://arxiv.org/html/2608.05900#bib.bib13),14 (https://arxiv.org/html/2608.05900#bib.bib14)]。这些研究侧重于保持全局数据集质量,但没有检验一个精心选择的小型移除细胞集是否可以改变某个特定的、未变化目标细胞的注释。

对抗性攻击为研究这类最坏情况行为提供了有用的框架。早期工作表明,微小的输入扰动可以导致准确的机器学习模型输出不正确的预测[15 (https://arxiv.org/html/2608.05900#bib.bib15),16 (https://arxiv.org/html/2608.05900#bib.bib16)]。后来的研究则研究了针对模型效用、隐私和可解释性的攻击,以及防御和保持目标的攻击(即改变外部上下文而非目标输入)[17 (https://arxiv.org/html/2608.05900#bib.bib17),18 (https://arxiv.org/html/2608.05900#bib.bib18),19 (https://arxiv.org/html/2608.05900#bib.bib19)]。在单细胞分析中,adverSCarial评估了RNA测序分类器对基因表达输入的对抗性扰动的脆弱性[20 (https://arxiv.org/html/2608.05900#bib.bib20)]。此类攻击会修改目标细胞的特征。相比之下,本文研究的脆弱性保留目标细胞不变,仅改变周围的查询队列。

一个相关的想法出现在针对基于图学习的攻击中。当边、邻近节点或图结构发生变化时,图分类器可能会受到影响[21 (https://arxiv.org/html/2608.05900#bib.bib21),22 (https://arxiv.org/html/2608.05900#bib.bib22)]。这些研究表明,预测可能依赖于关系上下文,而不仅仅依赖于目标节点的特征。然而,它们没有研究单细胞注释流程、细胞移除约束、生物邻域或标签优化系统。因此,伴随细胞移除对未变化的单细胞目标的影响仍未得到充分探索。

另一方面,注释可靠性对于身份不确定或模糊的细胞尤为重要。最近的研究提出了共识投票、分层拒绝和训练动态分析来识别低置信度注释、可能的标记错误和中间细胞状态[23 (https://arxiv.org/html/2608.05900#bib.bib23),24 (https://arxiv.org/html/2608.05900#bib.bib24)]。

我们引入了*CohortHijack*,这是一种鲁棒性审计方法,它移除选定的非目标伴随细胞,并检验目标的优化注释是否发生变化。与基于特征的攻击不同,CohortHijack保留目标表达向量、参考标签、分类器和模型参数。

我们研究了随机移除、最近邻移除、同类移除、贪心搜索、多起点贪心搜索和束搜索。受控实验使用了两个单细胞数据集、两个冻结分类器家族和三个随机种子。我们还改变了邻域大小、上下文权重和投票规则,以确定脆弱性的来源。最后,我们使用CellTypist多数投票[2 (https://arxiv.org/html/2608.05900#bib.bib2)]验证了相同的威胁模型,在该模型中,目标的独立预测保持不变,而其队列优化标签可能在移除少量伴随细胞后发生变化。图1 (https://arxiv.org/html/2608.05900#S1.F1)说明了普通队列依赖注释与CohortHijack审计之间的区别。

参见图注 图1:CohortHijack威胁模型概览。在普通注释下,目标细胞使用其自身的表达谱和来自完整查询队列的上下文信息进行分类。CohortHijack移除一小组非目标伴随细胞,并重新计算依赖队列的优化结果。目标表达向量、基础分类器和模型参数保持不变,但由于邻域或聚类上下文已改变,最终优化注释可能会改变。我们的工作有三个贡献。首先,我们将伴随细胞移除定义为对优化后单细胞注释的一种保持目标的威胁。其次,我们开发了结构化和基于搜索的移除方法,并同时衡量目标变化和附带变化。第三,我们在受控流程和CellTypist多数投票中验证了这一威胁。111代码和复现脚本:https://github.com/arashVsh/CohortHijack

## II 方法

本节介绍CohortHijack评估框架,包括注释流程、移除策略、搜索方法、评估指标和CellTypist验证。我们使用*audit*表示总体评估协议,使用*attack*表示为改变目标标签而选择的移除集。

### II-A 问题设定

设D=\{\(xi,yi\)\}i=1n\\mathcal\{D\}=\\\{\(\\mathbf\{x\}\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{n\}表示包含nn个细胞的单细胞数据集。向量xi∈Rd\\mathbf\{x\}\_\{i\}\\in\\mathbb\{R\}^\{d\}包含细胞ii的已处理特征,yi∈Yy\_\{i\}\\in\\mathcal\{Y\}是其参考细胞类型标签。集合Y\\mathcal\{Y\}包含预处理后保留的所有细胞类型。我们使用分层分割将D\\mathcal\{D\}划分为不相交的训练集和测试集。在鲁棒性审计期间,测试集被视为查询队列。

对于索引为tt的选定目标细胞,CohortHijack移除S\\mathcal\{S\}个非目标测试细胞。目标细胞永远不会包含在移除集中,因此t∉St\\notin\\mathcal\{S\}。受攻击的查询队列为DS=Dtest∖S\\mathcal\{D\}\_\{\\mathcal\{S\}\}=\\mathcal\{D\}\_\{\\mathrm\{test\}\}\\setminus\\mathcal\{S\}。目标特征向量、训练好的分类器和基础预测保持不变。只有可用于依赖队列优化阶段的细胞发生了变化。

### II-B 数据处理与基础分类

我们使用Scanpy提供的PBMC3K和Paul15数据集。移除支持不足的类别,并对大类进行上限限制以减少类别不平衡并控制运行时间。然后我们创建分层的训练集和测试集。

对于非负计数数据,每个细胞进行文库大小归一化和对数变换。保留高度可变基因,并在降维之前对所选特征进行缩放。已经过变换且包含负值的数据集不再重新归一化。对于这些数据集,根据表达方差选择基因。然后应用主成分分析来获得低维表示。

我们训练多项逻辑回归和校准线性支持向量机(SVM)。两个分类器均使用类别平衡。线性SVM经过校准以输出类别概率。

设C=\|Y\|C=\|\\mathcal\{Y\}\|为保留细胞类型的数量。冻结的基础分类器为细胞ii生成概率向量pi=\(pi1,...,piC\)\\mathbf\{p\}\_\{i\}=\(p\_\{i1\},\\ldots,p\_\{iC\}\),其中∑c=1Cpic=1\\sum\_\{c=1\}^\{C\}p\_\{ic\}=1。其独立预测为y^ibase=arg⁡maxc⁡pic\\hat\{y\}^\{\\,\\mathrm\{base\}\}\_\{i\}=\\arg\\max\_\{c\}p\_\{ic\}。

### II-C 依赖队列的优化

对于每个测试细胞,我们在PCA特征空间中构建欧几里得最近邻图。设Nk\(i\)\\mathcal\{N\}\_\{k\}\(i\)表示距离细胞ii最近的kk个测试细胞的索引(不包括细胞自身)。

邻居jj的置信度定义为qj=maxc⁡pjcq\_\{j\}=\\max\_\{c\}p\_\{jc\}。对于置信度加权优化,分配给类别cc的邻域支持为

hic=∑j∈Nk\(i\)qjpjc∑j∈Nk\(i\)qj\.h\_\{ic\}=\\frac\{\\sum\_\{j\\in\\mathcal\{N\}\_\{k\}\(i\)\}q\_\{j\}p\_\{jc\}\}\{\\sum\_\{j\\in\\mathcal\{N\}\_\{k\}\(i\)\}q\_\{j\}\}\.\(1\)
对于均匀投票,式(1)中的所有qjq\_\{j\}值都替换为1。基础概率和邻域支持按如下方式组合:

ric=αpic\+λhic∑l=1C\(αpil\+λhil\),r\_\{ic\}=\\frac\{\\alpha p\_\{ic\}\+\\lambda h\_\{ic\}\}\{\\sum\_\{\\ell=1\}^\{C\}\\left\(\\alpha p\_\{i\\ell\}\+\\lambda h\_\{i\\ell\}\\right\)\},\(2\)
其中α\\alpha是基础预测权重,λ\\lambda是上下文权重。优化后的标签为y^i=arg⁡maxc⁡ric\\hat\{y\}\_\{i\}=\\arg\\max\_\{c\}r\_\{ic\}。

移除S\\mathcal\{S\}后,保留细胞的基础概率向量被重新使用,无需重新训练。在DS\\mathcal\{D\}\_\{\\mathcal\{S\}\}上重新计算邻域图和优化概率。这隔离了查询队列组成的影响。

### II-D 目标选择

对于每个数据集、分类器和随机种子,我们首先识别干净优化预测正确的测试细胞。这些细胞按最大优化概率排序。从低置信度但注释正确的细胞中形成候选集,然后无放回地采样目标。

该策略将审计重点放在更可能依赖队列上下文的注释正确的细胞上。相同的目标清单在后续搜索和消融实验中重复使用,以便在匹配目标上比较各方法。

### II-E 伴随细胞移除

对于移除比例ρ\\rho,请求的移除数量为b=max⁡\(1,round⁡\(ρ\(ntest−1\)\)\)b=\\max\(1,\\operatorname\{round\}\(\\rho\(n\_\{\\mathrm\{test\}\}\-1\)\)\),其中ntestn\_\{\\mathrm\{test\}\}是测试队列的大小。

#### II-E1 随机移除

随机基线均匀无放回地采样bb个非目标细胞。每个目标-预算组合在多个重复的随机移除集上评估。

#### II-E2 同类移除

同类移除形成一个池,其中包含干净优化标签与目标细胞干净优化标签相同的非目标细胞。从该池中无放回地采样最多bb个细胞。该方法移除支持目标当前类别的细胞,但不使用与目标的距离。

#### II-E3 最近细胞移除

最近细胞移除计算目标细胞与PCA空间中每个其他测试细胞之间的欧几里得距离。移除距离最近的bb个非目标细胞。该方法直接改变目标的局部邻域。

### II-F 基于搜索的移除

搜索方法一次针对一个目标优化移除集。其候选池包含目标细胞干净的一阶邻居以及这些邻居的邻居。如有必要,还会根据PCA空间中的距离补充额外的细胞。

对于目标的干净优化标签,设ctc\_\{t\}表示其对应的类别索引。我们在移除S\\mathcal\{S\}后测量其边际为mt\(S\)=rtct\(S\)−maxc≠ct⁡rtc\(S\)m\_\{t\}\(\\mathcal\{S\}\)=r\_\{tc\_\{t\}\}^\{\(\\mathcal\{S\}\)\}\-\\max\_\{c\\neq c\_\{t\}\}r\_\{tc\}^\{\(\\mathcal\{S\}\)\},其中rtc\(S\)r\_\{tc\}^\{\(\\mathcal\{S\}\)\}是在DS\\mathcal\{D\}\_\{\\mathcal\{S\}\}上重新计算的优化概率。负边际意味着另一个类别已超越原始类别。

候选移除按字典序排名。目标翻转优先于非翻转。在翻转状态相同的结果中,优先选择mt\(S\)m\_\{t\}\(\\mathcal\{S\}\)值较低的结果,其次是较低的附带翻转。

相似文章

超越基因重建:通过互补转录组视图学习细胞表征

arXiv cs.LG

本文介绍了CoCoS,一种对比预训练框架,通过互补的转录组视图学习全细胞表征,解决了单细胞基础模型中掩码基因重建的局限性。在细胞类型注释和基因调控网络推断实验上,展示了具有竞争力的迁移性能。

CellBRIDGE: 通过交互感知对齐学习细胞轨迹

arXiv cs.LG

CellBRIDGE是一种新方法,通过引入配体-受体相互作用成本来模拟细胞间通讯,增强了对scRNA-seq轨迹推断的最优传输,改进了对齐并实现了可解释的计算机模拟扰动。