超越基因重建:通过互补转录组视图学习细胞表征
摘要
本文介绍了CoCoS,一种对比预训练框架,通过互补的转录组视图学习全细胞表征,解决了单细胞基础模型中掩码基因重建的局限性。在细胞类型注释和基因调控网络推断实验上,展示了具有竞争力的迁移性能。
arXiv:2608.00985v1 公告类型:新
摘要:单细胞转录组数据的快速增长使得基础模型得以发展,这些模型主要通过重建掩码表达值进行预训练。这一目标促使模型学习基因依赖性,但并未直接优化全细胞表征,而全细胞表征对许多下游任务至关重要。为弥补这一差距,我们提出了一种对比预训练框架,通过互补的转录组视图学习细胞表征。由于标准对比学习不易直接应用于单细胞预训练,我们从三个维度引入了具体适配——共表达引导的基因划分、表达感知的对比集构建以及能力门控的对比启动。具体而言,我们首先根据基因的共表达结构对每个细胞的基因进行划分,构建两个互补视图。然后,为防止模型利用基因集身份作为捷径,我们通过保持基因身份不变而置换表达值来构建困难负样本。最后,我们引入了一个能力感知控制器来确定对比目标的应用方式。在细胞类型注释和基因调控网络推断上的实验表明,在所评估的协议下具有竞争力的迁移性能。在六网络GRN评估中,我们的方法在比较的变体中记录了最高的平均AUROC和AUPRC点估计值,而得分最高的变体因单个网络而异。这些结果确立了互补视图对比学习作为超越基因重建的单细胞预训练的有效方向。
查看缓存全文
缓存时间: 2026/08/04 07:44
# 超越基因重建:通过互补转录组视角学习细胞表征
Source: https://arxiv.org/html/2608.00985
贾琪·熊\\equalcontrib2, 云图·胡\\equalcontrib3, 余征4, 一飞·石5, 欣悦·郭2, 佳欣·齐\\corresponding1
###### 摘要
单细胞转录组数据的快速增长推动了基础模型的发展,这些模型主要通过重建掩码表达值进行预训练。这一目标鼓励模型学习基因依赖性,但并未直接优化整体细胞表征,而后者对许多下游任务至关重要。为弥补这一差距,我们提出了一种对比预训练框架,通过互补转录组视图学习细胞表征。由于标准对比学习不能直接适用于单细胞预训练,我们从三个维度引入特定调整——共表达引导的基因划分、表达感知的对比集构建,以及能力门控的对比目标启动。具体而言,我们首先根据基因的共表达结构对每个细胞的基因进行划分,从而构建该细胞的两个互补视图。然后,为防止模型利用基因集身份作为捷径,我们通过在保持基因身份不变的情况下置换表达值来构建困难负样本。最后,我们引入一个能力感知控制器,以决定对比目标的应用方式。在细胞类型注释和基因调控网络推断上的实验表明,在所评估的协议下具有竞争力的迁移表现。在六网络GRN评估中,我们的方法在比较变体中记录了最高的平均AUROC和AUPRC点估计值,而最高得分变体在各个网络上有所不同。这些结果表明,互补视图对比学习是超越基因重建的单细胞预训练的一个有效方向。
## 引言
参见图1:CoCoS 的动机。(a) 掩码表达值预测通过基因级特征直接监督重建,但并未对整体细胞表征施加度量目标。(b) 直接迁移对比学习会引发两个转录组特有挑战:不受约束的表达扰动可能改变用于定义正样本对的细胞状态,而保留不同基因的负样本可能仅凭基因身份而非基因–值对应关系被区分。大规模单细胞转录组数据推动了基础模型的发展,这些模型主要通过掩码表达值预测进行预训练(Cui et al. 2024 (https://arxiv.org/html/2608.00985#bib.bib3); Theodoris et al. 2023 (https://arxiv.org/html/2608.00985#bib.bib4); Yang et al. 2022a (https://arxiv.org/html/2608.00985#bib.bib5); Hao et al. 2024 (https://arxiv.org/html/2608.00985#bib.bib6))。通过重建掩码值,这些模型学习基因级依赖性并捕获潜在的共表达结构。然而,该目标仅在单个基因上提供直接监督,且掩码表达值通常可以从有限的相关基因邻域推断出来,而无需表征完整的细胞状态(Xiong et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib2); Kotliar et al. 2019 (https://arxiv.org/html/2608.00985#bib.bib34))。因此,较强的重建性能并不一定转化为具有判别性和可迁移性的整体细胞表征,尽管这类表征对于细胞类型注释和基因调控网络推断等下游应用至关重要。
这种目标不匹配使得细胞级对比监督自然成为掩码重建的补充。然而,传统对比学习并不能直接迁移到单细胞转录组,因为会出现两个领域特有的挑战,如图1 (https://arxiv.org/html/2608.00985#Sx1.F1) 所示。首先,构建生物学有效的正样本对并非易事。与裁剪、缩放和颜色抖动等图像增强不同——这些增强可以在保留对象身份的同时改变低层外观(Chen et al. 2020 (https://arxiv.org/html/2608.00985#bib.bib7))——扰动基因表达值可能改变细胞身份或动态生物程序,而非保持相同的生物状态(Kotliar et al. 2019 (https://arxiv.org/html/2608.00985#bib.bib34))。其次,负样本集构建容易受到基因身份捷径的影响。传统对比学习通常将小批量中的其他样本视为负样本。然而,在稀疏转录组输入中,表达稀疏性和序列截断可能导致不同细胞保留不同的基因身份子集。因此,模型可以仅凭基因集组成来区分负样本细胞与锚点细胞,而无需学习基因与其表达值之间的对应关系。
为解决这些挑战,我们引入了 CoCoS,这是一个专门针对单细胞转录组定制的对比预训练框架。为了在不改变细胞身份的情况下构建生物学上有意义的正样本对,CoCoS 保持已测量的基因–值对不变,并使用共表达引导的基因划分来定义两个互补视图模板。所得输入仍锚定于同一个已测量细胞,避免了人为表达偏移,同时暴露互补的生物证据。为防止对比集构建中的基因身份捷径,CoCoS 将表达感知采样与同视图负样本以及身份匹配的困难负样本相结合,后者通过固定基因身份并置换其关联表达值来生成。由于原始输入和置换输入包含相同的基因,仅凭基因集组成无法区分,从而鼓励基于基因–值对应关系的判别。我们将这些组件分别称为*共表达引导的基因划分*和*表达感知的对比集构建*;其对应的挑战总结在图1 (https://arxiv.org/html/2608.00985#Sx1.F1) 中。
虽然这两个组件决定了模型对比什么,但有效的预训练还取决于何时引入对比监督。由于互补面板不共享基因 token,关联它们需要编码器认识到不同的基因集反映相同的潜在生物程序。然而,在预训练早期,这些跨基因依赖性尚未通过掩码表达重建学到。因此,立即应用对比目标可能鼓励模型使用更简单的技术线索(如文库大小或表达稀疏性)来对齐面板,而不是基于其生物学对应关系。为解决这个问题,CoCoS 引入了*能力门控的对比目标启动*。模型首先通过掩码表达建模学习基因级依赖性。一旦对保留细胞的无标签诊断指标表明重建能力和跨视图结构稳定,对比目标便逐步引入。这三个组件共同解决了正视图构建、负样本集设计和对比目标启动的关键挑战,使得从互补转录组视图进行细胞级对比预训练成为可能。
在下游单细胞任务上的实验表明,所评估协议下具有竞争力的迁移表现。两项受控分析分别表征了视图采样和对比调度,支持 CoCoS 在单细胞转录组预训练中用于整体细胞表征学习的有效性。
我们的主要贡献是:
- •我们识别出掩码表达值重建与整体细胞表征学习之间的不匹配,并刻画了将细胞级对比应用于单细胞预训练的三个要求:生物学有效的正视图、负样本中的基因身份捷径,以及对比监督的时序。
- •我们引入了 CoCoS,通过共表达引导的基因划分、表达感知的对比集构建和能力门控的对比目标启动来满足这些要求。
- •我们在细胞类型注释和基因调控网络推断上进行了广泛实验,以评估 CoCoS 的有效性。结果表明,适当约束的整体细胞对比监督比纯基于重建的方法能产生更具判别性和可迁移性的细胞表征。
## 相关工作
#### 单细胞基础模型。
掩码重建在生物基础模型中很常见:DNABERT 和 Nucleotide Transformer 预测掩码 DNA kk\-mer,MutBERT 建模概率基因组变异,RNA\-FM 预测掩码 RNA token(Ji et al. 2021 (https://arxiv.org/html/2608.00985#bib.bib36); Dalla-Torre et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib37); Long et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib38); Chen et al. 2022 (https://arxiv.org/html/2608.00985#bib.bib39))。它们的损失作用于被破坏的序列位置,尽管学习到的表征可以迁移到序列级任务。单细胞图谱则相反,将基因身份与稀疏细胞状态中的表达测量配对(Kotliar et al. 2019 (https://arxiv.org/html/2608.00985#bib.bib34))。大规模表达语料库推动了 scBERT、Geneformer、scGPT 和 scFoundation 的发展(Yang et al. 2022a (https://arxiv.org/html/2608.00985#bib.bib5); Theodoris et al. 2023 (https://arxiv.org/html/2608.00985#bib.bib4); Cui et al. 2024 (https://arxiv.org/html/2608.00985#bib.bib3); Hao et al. 2024 (https://arxiv.org/html/2608.00985#bib.bib6)),最近的基准工作考察了它们的迁移行为(Qi et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib1))。这些模型使用掩码基因或表达预测以及生成式建模来学习基因依赖性,但并未显式组织整体细胞嵌入的几何结构。
#### 单细胞表征学习。
除了基础模型之外,专门的表征学习方法还优化细胞嵌入以用于聚类、整合和图谱映射。对比聚类、CLEAR 和 Concerto 从增强图谱或配对编码器视图学习,但未将对比纳入掩码表达基础模型目标(Ciortan and Defrance 2021 (https://arxiv.org/html/2608.00985#bib.bib29); Han et al. 2022 (https://arxiv.org/html/2608.00985#bib.bib30); Yang et al. 2022b (https://arxiv.org/html/2608.00985#bib.bib31))。最近的大规模方法以不同形式将细胞级对比引入预训练。LangCell 将掩码基因建模与模态内和模态间对比目标相结合;TABULA 联合执行列式基因重建和行式细胞对比学习;scConcept 用不相交基因面板上的对比预训练替代重建(Zhao et al. 2024 (https://arxiv.org/html/2608.00985#bib.bib21); Ding et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib32); Bahrami et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib22))。因此,细胞级对比本身并非新事物。CoCoS 则保留掩码表达值预测,并联合设计共表达引导视图、具有固定身份值乱序的表达感知对比集,以及用于该设置的数据依赖对比目标启动。
#### 自适应训练。
课程按难度排序或过滤示例,基于能力和自适应的变体根据训练进度或模型状态改变暴露程度(Bengio et al. 2009 (https://arxiv.org/html/2608.00985#bib.bib13); Platanios et al. 2019 (https://arxiv.org/html/2608.00985#bib.bib14); Kong et al. 2021 (https://arxiv.org/html/2608.00985#bib.bib15))。GradNorm 和 Auto\-λ\\lambda 则持续重新加权活跃损失(Chen et al. 2018 (https://arxiv.org/html/2608.00985#bib.bib12); Liu et al. 2022 (https://arxiv.org/html/2608.00985#bib.bib16))。CoCoS 控制一个不同的变量:一个固定的、保留的、无标签的队列触发先前不活跃的对比目标,同时掩码值重建保持活跃。这是数据依赖的目标启动,而非样本课程或通用多任务损失平衡。
参见图2:CoCoS\-GPC 概述。共表达引导的划分和表达感知采样形成两个不相交视图,由共享 Transformer 进行掩码和重建。配对的同细胞视图定义正样本,而同视图和跨视图的批内示例以及固定身份值乱序共同构成对比集。一个无标签哨兵跟踪平滑的基因程序一致性、重建误差和表征多样性;一旦就绪状态持续存在,控制器便激活对比目标并逐步增加其权重,此前该权重保持为零。
## 方法
掩码值重建直接监督单个基因值,但不监督整体细胞表征的几何结构。CoCoS 通过三个协调操作增强掩码值重建。共表达引导的基因划分形成互补视图;表达感知的对比集构建将加权采样与身份匹配的困难负样本相结合;能力门控的对比目标启动仅在掩码预测器满足无标签就绪标准后激活细胞级对齐。所得到的实例化是 CoCoS\-GPC。图2 (https://arxiv.org/html/2608.00985#Sx2.F2) 总结了该框架,以下小节按训练顺序介绍骨干网络和这些操作。
### 骨干网络与掩码预训练
设 M=\{\(gi,xi\)\}i=1N\\mathcal\{M\}=\\\{\(\\mathbf\{g\}\_\{i\},\\mathbf\{x\}\_\{i\}\)\\\}\_\{i=1\}^\{N\} 表示包含 NN 个细胞的预训练数据集。对于细胞 ii,gi=\(gi1,gi2,...,gini\)\\mathbf\{g\}\_\{i\}=\(g\_\{i1\},g\_\{i2\},\\ldots,g\_\{in\_\{i\}\}\) 是其基因身份序列,其中 gij∈Gg\_\{ij\}\\in\\mathcal\{G\},G\\mathcal\{G\} 表示基因词汇表。对齐的表达序列 xi=\(xi1,xi2,...,xini\)\\mathbf\{x\}\_\{i\}=\(x\_\{i1\},x\_\{i2\},\\ldots,x\_\{in\_\{i\}\}\) 包含对应的连续表达值。
对于掩码值预测,我们采样一组掩码位置 Ωi⊆\{1,...,ni\}\\Omega\_\{i\}\\subseteq\\\{1,\\ldots,n\_\{i\}\\\},并将这些位置上的表达值替换为掩码序列 x~i\\tilde\{\\mathbf\{x\}\}\_\{i\}。我们使用 scBenchmark(Qi et al. 2025 (https://arxiv.org/html/2608.00985#bib.bib1)) 中的 Transformer 骨干来编码基因身份和掩码表达值。在大小为 BB 的小批量中,掩码值重建损失为
Lmlm=1∑i=1B\|Ωi\|∑i=1B∑j∈Ωi\(fθ\(gi,x~i\)j−xij\)2,\\mathcal\{L\}\_\{\\mathrm\{mlm\}\}=\\frac\{1\}\{\\sum\_\{i=1\}^\{B\}\|\\Omega\_\{i\}\|\}\\sum\_\{i=1\}^\{B\}\\sum\_\{j\\in\\Omega\_\{i\}\}\\left\(f\_\{\\theta\}\(\\mathbf\{g\}\_\{i\},\\tilde\{\\mathbf\{x\}\}\_\{i\}\)\_\{j\}\-x\_\{ij\}\\right\)^\{2\},(1)其中 fθf\_\{\\theta\} 表示 Transformer 编码器及其掩码值预测层,fθ\(gi,x~i\)jf\_\{\\theta\}\(\\mathbf\{g\}\_\{i\},\\tilde\{\\mathbf\{x\}\}\_\{i\}\)\_\{j\} 是位置 jj 处的预测表达值。然而,由于该重建目标没有为整体细胞表征提供显式监督,它不能直接优化用于判别性和可迁移性下游应用的细胞嵌入。
### 我们的方法:CoCoS
共表达引导的基因划分。在单细胞预训练中,构建生物学有效的正样本对并非易事,因为扰动表达值可能改变潜在的细胞状态。CoCoS 则是将每个相似文章
CohortHijack:单细胞注释对伴随细胞移除的鲁棒性
这篇arXiv论文介绍了CohortHijack,一种鲁棒性审计方法,通过从单细胞查询队列中移除非目标细胞,来测试在不改变目标细胞表达谱的情况下,注释工具可能如何被操纵。研究表明,在保留目标细胞的同时,结构化移除和搜索策略可以改变主流流程中的精炼标签,从而将查询队列组成识别为一个攻击面。
BioM-JEPA:单细胞中图连接基因块的联合嵌入预测
BioM-JEPA 引入了一种联合嵌入预测架构,通过预测图连接基因块而非单个基因来学习单细胞表示,在扰动响应任务中展现出更高的效率和下游性能。
迈向通用基因调控网络推断:在单细胞基础模型中解锁可泛化的调控知识
本文提出了一种利用单细胞基础模型进行通用基因调控网络(GRN)推断的新范式,并引入了虚拟值扰动和梯度轨迹方法来提炼调控知识。
COAST:用于空间转录组学基因表达预测的上下文感知差分学习
COAST是一个上下文感知的差分学习框架,用于从H&E组织病理学图像预测空间基因表达,采用联合绝对和带符号差分回归来捕捉空间关系。
自监督跨表示学习中的一致性驱动协同演化
本文介绍了CoCoEvolve,一种自监督方法,通过在表示之间强制实现一一对应的一致性,提升跨图表、表格和代码的跨表示理解,并具有训练时和测试时的协同演化目标。