CoDiffGRN: 通过BEELINE-KGC基准和共进化离散扩散重新思考基因调控网络推断
摘要
本文介绍了CoDiffGRN,一个用于基因调控网络推断的共进化离散扩散框架,以及一个新的归纳评估基准BEELINE-KGC。它在新型调控发现中取得了最先进的性能。
arXiv:2607.13120v1 公告类型:新
摘要:从单细胞转录组数据推断基因调控网络(GRN)对于生物学发现至关重要,然而现有方法存在与现实需求根本上的不匹配。研究人员通常寻找一小部分高置信度的调控相互作用进行实验验证,这些相互作用往往涉及之前未见过的基因。然而,当前的基准依赖于使用全局分类指标的转导分割,而主流模型在归纳设置下难以泛化。为弥补这一差距,我们将GRN推断重新表述为一个归纳的、以排名为中心的图补全问题,并引入\textbf{\benchmark},这是一个新的基准,它结合了归纳基因保留分割和知识图谱补全指标,以更好地评估排名靠前的预测。在此基础上,我们提出\textbf{\method},这是第一个共进化离散扩散框架,它联合建模生物学上一致的离散化基因表达状态和调控相互作用,以实现稳健的归纳泛化和改进的排名靠前的调控发现。我们还引入了TF-ALL子图采样(TASS)以实现可扩展的训练。在{\benchmark}上的大量实验表明,{\method}建立了新的最先进性能,在新调控发现方面显著优于现有方法,消融研究进一步验证了我们设计的有效性。
查看缓存全文
缓存时间: 2026/07/16 04:21
# CoDiffGRN:通过BEELINE-KGC基准和协同进化离散扩散重新思考基因调控网络推断
来源:https://arxiv.org/html/2607.13120
宋嘉泽 北京大学 jzsong25@stu\.pku\.edu\.cn &赵润浩 国防科技大学 runhaozhao@nudt\.edu\.cn &徐明皓 北京大学 minghao\.xu@stu\.pku\.edu\.cn &崔斌 北京大学 bin\.cui@pku\.edu\.cn &张文涛 北京大学 wentao\.zhang@pku\.edu\.cn
###### 摘要
从单细胞转录组数据中推断基因调控网络(GRNs)对生物学发现至关重要,但现有方法与实际需求存在根本性错位。研究人员通常寻求一小批高置信度的调控相互作用进行实验验证,这往往涉及到先前未见过的基因。然而,当前的基准依赖于使用全局分类指标的直推式划分,而主流模型在归纳式设置下难以泛化。为弥合这一差距,我们将GRN推断重新定义为归纳式、以排序为中心的图补全问题,并引入BEELINE-KGC——一个新基准,它采用归纳式基因留出划分,并结合知识图谱补全指标,以更好地评估排名靠前的预测。在此基础上,我们提出CoDiffGRN,这是首个协同进化离散扩散框架,它联合建模生物上一致的离散化基因表达状态和调控相互作用,以实现稳健的归纳泛化和改进的排名靠前调控发现。我们还引入了TF-ALL子图采样(TASS)以实现可扩展的训练。在BEELINE-KGC上的大量实验表明,CoDiffGRN达到了新的最先进性能,在新调控发现方面显著优于现有方法,消融研究进一步验证了我们设计的有效性。
## 1 引言
基因调控网络通过编码转录因子(TFs)与靶基因之间的复杂相互作用,决定了细胞身份和生理功能\[37 (https://arxiv.org/html/2607.13120#bib.bib1),8 (https://arxiv.org/html/2607.13120#bib.bib2),14 (https://arxiv.org/html/2607.13120#bib.bib3),39 (https://arxiv.org/html/2607.13120#bib.bib4)\]。虽然单细胞RNA测序(scRNA-seq)的出现通过解决整体水平的信号平均\[21 (https://arxiv.org/html/2607.13120#bib.bib9)\]从根本上推动了GRN推断,但所得数据以高度异质性和稀疏性著称\[34 (https://arxiv.org/html/2607.13120#bib.bib10),20 (https://arxiv.org/html/2607.13120#bib.bib11)\]。为应对这些挑战,近期的进展已从经典统计方法转向图神经网络,特别是图自编码器架构\[7 (https://arxiv.org/html/2607.13120#bib.bib20),25 (https://arxiv.org/html/2607.13120#bib.bib21),46 (https://arxiv.org/html/2607.13120#bib.bib22),15 (https://arxiv.org/html/2607.13120#bib.bib23),42 (https://arxiv.org/html/2607.13120#bib.bib24),36 (https://arxiv.org/html/2607.13120#bib.bib25)\]。尽管有这些架构上的进步,我们认为计算GRN推断在两个方面与实际生物学发现存在根本性的错位:
首先,存在评估错位。当前标准基准如BEELINE\[29 (https://arxiv.org/html/2607.13120#bib.bib29)\]在直推式设置下评估GRN推断,即所有基因在训练期间都被观测到。然而,发现新模块或稀有细胞类型的调控机制本质上需要对未见基因进行归纳泛化\[9 (https://arxiv.org/html/2607.13120#bib.bib30),11 (https://arxiv.org/html/2607.13120#bib.bib31)\]。此外,这些基准将GRN推断形式化为一个二分类任务,用AUROC和AUPRC来衡量。但在实践中,生物学家依赖AI模型来优先考虑一小批高置信度的新相互作用,以进行昂贵的实验验证。像AUROC这样的全局指标容易受低排名边缘的影响,使得它们很难代表最终推动科学发现的Top-K排序质量。
参见图注图1:当前限制与我们提出解决方案的概览。\(a\)当前基准与归纳泛化和Top-K排序质量的实际需求不匹配,而现有方法在面对未见基因和固定的边缘转变时表现下降。\(b\)我们的BEELINE-KGC引入了一个基于归纳、排序的评估协议,CoDiffGRN利用细胞簇离散化、带有TASS的协同进化离散扩散。*缩写*,G.T.:真实标签,N.S.:负样本。其次,存在基因层面的归纳泛化差距。在现实的归纳设置下,现有的基于GAE的方法严重依赖于预定义的先验图。当留出基因在推断过程中断开连接时,它们会丢失关键的上下文信号,并遭受严重的性能下降(图1 (https://arxiv.org/html/2607.13120#S1.F1)a)。最近的基于扩散的方法部分缓解了这种拓扑孤立,但仍无法有效泛化到未见基因,因为scRNA-seq数据的高度异质性和稀疏性阻止了可靠的特征对应,并可能导致特征坍塌。
更根本的是,当前方法未能捕捉基因调控的条件性质。调控相互作用并非孤立事件,而是取决于调控因子和靶基因的配对状态。在扩散过程中对所有边缘应用统一的转变,而不考虑其端点基因的活性状态,违反了GRNs的这一基本原则。
为解决这些局限性,我们引入了一个新的评估范式以及一个新颖的生成框架。首先,我们提出BEELINE-KGC,它是BEELINE的系统性扩展,强制执行了**归纳式基因留出划分**。通过将评估重新定义为知识图谱补全任务\[4 (https://arxiv.org/html/2607.13120#bib.bib32)\],BEELINE-KGC使用Hits@K和平均倒数排名(MRR)直接衡量调控预测的Top-K排序一致性。在这一严格的协议下,现有的最先进模型表现出严重的泛化瓶颈。
在建模方面,我们提出CoDiffGRN,这是首个用于GRN推断的基因调控协同进化离散扩散模型。CoDiffGRN建立在D3PM框架\[1 (https://arxiv.org/html/2607.13120#bib.bib34)\]之上,脱离了依赖先验的范式,旨在实现稳健的归纳泛化。为了缓解未见基因上的特征坍塌,我们引入了一种**基于细胞簇的离散化**策略,将scRNA-seq图谱转换为生物上一致的离散状态,使得未见基因在扩散过程中能够继承先验分布结构。
为了捕捉基因调控的条件性质,我们引入了一个联合的节点-边缘扩散过程,该过程在扩散动力学层面上直接建模离散化基因表达状态和网络拓扑的协同进化。通过设计一个**依赖于基因状态的转移矩阵**,边缘转换明确地以其端点基因的状态为条件,促进了Top-K调控发现所需的连贯邻域。此外,为了实现数据稀缺下的可扩展生成训练,我们引入了**TF-ALL子图采样(TASS)**,这是一种数据增强策略,在保持TF-靶标完整性的同时,大幅提升了可扩展性和泛化能力。
在BEELINE-KGC上的综合实验结果显示,CoDiffGRN达到了最先进的性能,并一致优于现有模型。广泛的消融研究考察了所提出的基因调控协同进化离散扩散和TASS框架的贡献。这些结果共同支持了我们的方法在提升基于KGC的排序性能方面的有效性,从而能够实现更准确、更可靠的生物学发现。
## 2 相关工作
GRN推断的评估协议。BEELINE\[29 (https://arxiv.org/html/2607.13120#bib.bib29)\]建立了GRN推断的标准,主要采用直推式以边缘为中心的划分和全局指标如AUROC和AUPRC\[18 (https://arxiv.org/html/2607.13120#bib.bib35)\]。为了提升判别敏感性,负采样已从随机选择\[26 (https://arxiv.org/html/2607.13120#bib.bib15),43 (https://arxiv.org/html/2607.13120#bib.bib17)\]发展为启发式策略\[36 (https://arxiv.org/html/2607.13120#bib.bib25),46 (https://arxiv.org/html/2607.13120#bib.bib22)\]。然而,这些协议与实际生物学发现存在根本性错位:直推式设置忽略了对未见基因泛化的必要性,而全局指标未能优先考虑实验验证所需的Top-K候选。在这项工作中,我们引入BEELINE-KGC来弥补这一差距,通过将评估重新定义为归纳式KGC任务,利用基于排序的指标(Hits@K,MRR)来评估Top-K调控预测。
基因调控网络推断方法。早期的GRN推断依赖于统计关联方法如GENIE3\[17 (https://arxiv.org/html/2607.13120#bib.bib14)\]和GRNBoost2\[26 (https://arxiv.org/html/2607.13120#bib.bib15)\],或基于特征的深度学习模型如CNNC\[43 (https://arxiv.org/html/2607.13120#bib.bib17)\]和DeepSEM\[30 (https://arxiv.org/html/2607.13120#bib.bib19)\]。近来,图表示学习已成为主导范式,像GENELink\[7 (https://arxiv.org/html/2607.13120#bib.bib20)\]、GENELink+\[46 (https://arxiv.org/html/2607.13120#bib.bib22)\]和GNNLink\[25 (https://arxiv.org/html/2607.13120#bib.bib21)\]等基于GAE的框架利用先验调控图,而GCLink\[42 (https://arxiv.org/html/2607.13120#bib.bib24)\]和GRNFormer\[15 (https://arxiv.org/html/2607.13120#bib.bib23)\]等方法引入了对比学习和基于VGAE的框架。近期,像RegDiffusion\[47 (https://arxiv.org/html/2607.13120#bib.bib26)\]、DigNet\[35 (https://arxiv.org/html/2607.13120#bib.bib27)\]和Planet\[41 (https://arxiv.org/html/2607.13120#bib.bib28)\]等生成模型应用了连续和离散扩散过程\[16 (https://arxiv.org/html/2607.13120#bib.bib33),1 (https://arxiv.org/html/2607.13120#bib.bib34)\]来建模基因调控的演化性质。
然而,现有方法存在关键局限:传统方法难以处理有噪声的单细胞数据,而基于图的模型往往依赖于先验图连通性。此外,当前的生成框架在归纳场景下难以应对特征坍塌,未能捕捉基因与调控之间关键的协同进化,并且面临严重的数据稀缺问题。在这项工作中,我们提出CoDiffGRN,它采用细胞簇离散化和联合离散扩散来建模调控动力学,并专门设计了TASS来应对数据稀缺的挑战。
## 3 面向实际发现的重新思考:BEELINE-KGC基准
表1:BEELINE-KGC基准的统计数据。对于每种细胞类型和参考网络,我们报告了细胞数量、源TF数量以及归纳式划分下的边缘计数。数值以TF+500(TF+1000)的形式显示。*缩写*,S.TFs:源TF。细胞类型#细胞特异性非特异性#S.TFs#基因#训练#验证#测试#S.TFs#基因#训练#验证#测试hESC75834 (34)815 (1260)3535 (5995)505 (544)505 (545)283 (292)753 (1138)2546 (3531)447 (543)448 (543)hHEP42530 (31)874 (1331)7724 (12466)1107 (1546)1108 (1546)322 (332)825 (1217)2993 (3490)568 (930)568 (931)mDC38320 (21)443 (684)536 (903)110 (145)110 (145)250 (254)634 (969)2115 (2704)476 (607)476 (607)mESC42188 (89)977 (1385)22694 (33645)3459 (4575)3460 (4575)516 (522)890 (1214)4677 (5738)1108 (1146)1108 (1146)mHSC-E107129 (33)691 (1177)9286 (17825)1135 (2075)1136 (2075)144 (147)442 (674)1002 (1370)211 (295)212 (295)mHSC-GM88922 (23)618 (1089)5796 (10901)784 (1617)784 (1617)82 (88)297 (526)496 (925)123 (216)124 (217)mHSC-L84716 (16)525 (640)3354 (3887)522 (646)522 (647)35 (37)164 (192)175 (217)52 (50)52 (50)细胞类型#细胞STRINGLOF/GOF#S.TFs#基因#训练#验证#测试#S.TFs#基因#训练#验证#测试hESC758343 (351)511 (695)2862 (3433)697 (858)698 (858)–––––hHEP425409 (414)646 (874)4960 (6269)1281 (1367)1282 (1367)–––––mDC383264 (273)479 (664)3277 (4066)769 (916)769 (916)–––––mESC421495 (499)638 (785)5099 (5830)1331 (1324)1332 (1325)34 (34)775 (1099)3322 (4851)423 (445)424 (446)mHSC-E1071156 (161)291 (413)950 (1330)210 (248)211 (248)–––––mHSC-GM88992 (100)201 (344)505 (1108)121 (101)122 (102)–––––mHSC-L84739 (40)70 (81)89 (101)24 (26)24 (27)–––––
我们引入BEELINE-KGC,这是一个全面的基准,旨在弥合计算GRN推断与真实生物学发现之间的差距。BEELINE-KGC建立在BEELINE\[29 (https://arxiv.org/html/2607.13120#bib.bib29)\](CC BY-NC 4.0)的实验scRNA-seq数据集集合之上,建立了一个针对现实实验室约束的严格评估框架。
### 3.1 形式化与问题设定
我们将基因调控网络形式化为一个有向图 \(\mathcal{G} = (\mathcal{V}, \mathcal{E})\),其中节点 \(v \in \mathcal{V}\) 代表基因,边 \((u, v) \in \mathcal{E}\) 表示调控相互作用。我们将 \(\mathcal{V}\) 划分为转录因子(\(\mathcal{V}_{TF}\))和靶基因(\(\mathcal{V}_{tgt}\))。在转录因子中,我们进一步区分**源TF**(\(\mathcal{V}_{src} \subseteq \mathcal{V}_{TF}\)),定义为在真实标签中至少有一条观测到的出边的调控因子。
对应的scRNA-seq数据用一个表达矩阵 \(\mathbf{X} \in \mathbb{R}^{N \times F_X}\) 表示,其中 \(\mathbf{X}_{i,j}\) 表示基因 \(v_i \in \mathcal{V}\) 在细胞 \(j \in \{1, \dots, F_X\}\) 中的表达水平。给定表达矩阵 \(\mathbf{X}\) 和观测到的相互作用子集 \(\mathcal{E}_{\text{obs}}\),GRN推断的主要目标是通过预测 \(\mathcal{E} \setminus \mathcal{E}_{\text{obs}}\) 中的潜在连接,恢复未观测到的调控结构。
### 3.2 面向实际GRN发现的统一框架
标准GRN推断基准采用直推式设置,并依赖全局指标如AUPRC。然而,这一范式与真实生物学发现的实际需求根本不同,实际需求要求对新型调控因子进行**归纳泛化**,并在有限的实验预算下实现**高Top-K排序质量**。
支柱1:归纳式基因留出划分。在现实的发现场景中,研究人员主要关注通过识别新型或未注释转录因子的下游调控靶标来表征它们,这需要模型能够泛化到未见调控因子的归纳式设置\[31 (https://arxiv.org/html/2607.13120#bib.bib36),38 (https://arxiv.org/html/2607.13120#bib.bib37),45 (https://arxiv.org/html/2607.13120#bib.bib38),44 (https://arxiv.org/html/2607.13120#bib.bib39),28 (https://arxiv.org/html/2607.13120#bib.bib40),2 (https://arxiv.org/html/2607.13120#bib.bib41),9 (https://arxiv.org/html/2607.13120#bib.bib30),11 (https://arxiv.org/html/2607.13120#bib.bib31)\]。为了模拟这一点,我们从 \(\mathcal{V}_{src}\) 中提取一个子集作为留出转录因子(\(\mathcal{V}_{\mathrm{hold}}\))相似文章
迈向通用基因调控网络推断:在单细胞基础模型中解锁可泛化的调控知识
本文提出了一种利用单细胞基础模型进行通用基因调控网络(GRN)推断的新范式,并引入了虚拟值扰动和梯度轨迹方法来提炼调控知识。
EGRL:边生成引导的关系感知学习用于RNA-蛋白质相互作用预测
介绍了EGRL,一种用于RNA-蛋白质相互作用预测的图神经网络框架,通过边生成和多关系注意力提升冷启动泛化能力,在基准数据集上取得了有竞争力的结果。
GRAS:离散扩散中无训练奖励对齐的引导低方差提议与自适应选择
GRAS是一种用于离散扩散模型奖励对齐的无训练方法,通过降低引导提议中的方差并自适应选择粒子,在DNA和蛋白质设计任务中实现了最先进的结果。
基于离散扩散的约束代码生成
本文介绍了Constrained Diffusion for Code (CDC),这是一种无需训练的神经符号推理框架,它将约束满足直接集成到离散扩散模型的逆向去噪过程中,用于代码生成。CDC在功能正确性、安全性和语法方面持续提升约束满足率,在多个基准测试中优于现有的扩散模型和自回归基线。
DiffusionBench:迈向生成式扩散变换器的全面评估
介绍了DiffusionBench,这是一个统一的基准,用于全面评估生成式扩散变换器,支持多种生成任务,并提供标准化的训练与评估。