PerturbCellRL: 验证器引导的强化学习用于单细胞扰动预测
摘要
PerturbCellRL 提出一种强化学习框架,通过使用细胞级验证器作为奖励对预训练的单细胞转录组生成器进行后训练,从而在分布匹配之外提升扰动预测的生物学一致性。
arXiv:2606.27752v1 公告类型:新
摘要:单细胞扰动模型可以通过预测细胞对干预的转录响应来减少昂贵的湿实验筛选。尽管最近的生成模型提升了群体水平预测,但生成的单个细胞并未明确检查其生物学一致性。我们提出 PerturbCellRL,这是一种强化学习框架,使用一组细胞级验证器作为奖励对预训练的单细胞转录组生成器进行后训练。这些验证器定义了四种奖励:Pearson top-k 相似度、RMSE top-k 邻近度、DE Spearman 和 Pathway activity。Pathway activity 验证器奖励其通路响应与已知扰动生物学匹配的细胞。我们在多个遗传和化学扰动基准上评估了 PerturbCellRL。在这些基准上,PerturbCellRL 在奖励对齐的评估指标和一个保留评估指标上优于预训练的 flow-matching 生成器。此外,PerturbCellRL 在群体水平指标上与最先进的方法保持竞争力。总之,这些结果将可信的单细胞预测构建为验证器引导的生成对齐,从匹配表达分布转向对单细胞扰动效应进行明确生物学一致性检查的预测。
查看缓存全文
缓存时间: 2026/06/29 05:25
# PerturbCellRL:基于验证器引导的强化学习用于单细胞扰动预测
来源:https://arxiv.org/html/2606.27752
Dongxia Wu∗ 斯坦福大学 斯坦福,加利福尼亚州 dowu@stanford\.edu &Mingyu Li∗ 北京大学 北京,中国 mingyulics@stu\.pku\.edu\.cn &Yuhui Zhang 斯坦福大学 斯坦福,加利福尼亚州 yuhuiz@stanford\.edu &Anurendra Kumar 斯坦福大学 斯坦福,加利福尼亚州 anurendk@stanford\.edu &Emma Lundberg 斯坦福大学 斯坦福,加利福尼亚州 emmalu@stanford\.edu &Serena Yeung\-Levy 斯坦福大学 斯坦福,加利福尼亚州 syyeung@stanford\.edu &Emily B\. Fox 斯坦福大学 斯坦福,加利福尼亚州 ebfox@stanford\.edu
###### 摘要
单细胞扰动模型可以通过预测细胞对干预措施的转录组响应,减少昂贵的湿实验室筛选。虽然最近的生成模型改进了群体水平预测,但生成的单个细胞并未经过明确的生物学一致性检查。我们提出*PerturbCellRL*,这是一个强化学习(RL)框架,它使用一套细胞水平的验证器作为奖励,对预训练的单细胞转录组生成器进行后训练。这些验证器定义了四种奖励:Pearson top-kksimilarity、RMSE top-kkproximity、DE Spearman和Pathway activity。Pathway activity验证器奖励其通路响应与已知扰动生物学一致的细胞。我们在多个遗传和化学扰动基准上评估*PerturbCellRL*。在这些基准上,*PerturbCellRL*在奖励对齐的评估指标和一个保留评估指标上,相比于预训练的流匹配生成器有所改进。此外,*PerturbCellRL*在群体水平的指标上与最先进的方法保持竞争力。总之,这些结果将可信赖的单细胞预测框架构建为验证器引导的生成对齐,超越了匹配表达分布的目标,转向对单细胞扰动效应进行明确生物学一致性检查的预测。
††footnotetext:∗共同第一作者。
## 1 引言
单细胞转录组技术使得测量遗传扰动如何重塑细胞状态成为可能Norman等人\(2019 (https://arxiv.org/html/2606.27752#bib.bib12)\);Replogle等人\(2022 (https://arxiv.org/html/2606.27752#bib.bib4)\)。这些数据支持计算生物学中一个日益重要的目标:在运行昂贵的湿实验室实验之前,构建能够预测转录响应的*in silico*扰动模型。这样的模型可以加速靶点发现、药物筛选、组合扰动设计和治疗优先级排序。最近的虚拟细胞愿景强调,有用的生物模拟器不仅应生成逼真的测量值,还应支持在干预下可靠的科学推理Bunne等人\(2024 (https://arxiv.org/html/2606.27752#bib.bib44)\);Johnson等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib46)\)。
单细胞RNA-seq中的扰动预测很困难,因为观测数据稀疏、嘈杂、高维且通常未配对。对于一个扰动cc,我们观察到对照细胞和扰动细胞的群体,但未观察到同一个物理细胞在扰动前后的响应。这使得任务本质上是分布式的:模型只能学习如何在对照状态和扰动条件下生成目标表达分布。流匹配非常适合这种设置,因为它从简单的基础分布中学习连续的生成动力学。我们利用一个单细胞流匹配生成器,该生成器以对照状态和扰动为条件预测扰动后的表达分布。scDFMYu等人\(2026 (https://arxiv.org/html/2606.27752#bib.bib13)\)及相关模型提供了强大的分布式基线Bunne等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib3)\);Klein等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib6)\),但它们的训练目标主要奖励群体水平的一致性。
请参阅标题图1:概述。当前的单细胞扰动生成器可能产生不可信的单个响应。例如,生成的细胞可能表现出与已知通路方向不一致的扰动效应。我们设计了一套具有生物学意义的验证器,扮演三个角色:(1)作为*评估器*评估单细胞生物学一致性,(2)作为*奖励信号*通过RL对齐生成,以及(3)作为*验证模块*通过测试时缩放改进样本。
然而,分布式的真实性本身并不意味着生成的细胞谱可信Viñas Torné等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib2)\)。一个生成的群体可能与聚合的目标统计量匹配,但单个样本与合理的处理响应、差异表达基因排名、判别性扰动特征或通路水平响应仍可能对齐不良Schubert等人\(2018 (https://arxiv.org/html/2606.27752#bib.bib98)\)。这些失败很重要,因为下游分析在优先级排序扰动、解释机制或选择候选进行后续实验时,通常检查单个生成的细胞或选定的亚群。我们提出单细胞验证器作为生物护栏:它们检查每个生成的谱是否与合理的靶标响应兼容,而不仅仅是匹配群体水平统计量。
我们进一步提出*PerturbCellRL*:用于可信赖单细胞转录组预测的强化学习(RL)。关键思想是将生物验证器转化为奖励函数,用于后训练预训练的生成模型。我们的验证器套件使用四个奖励对每个生成的细胞进行评分:Pearson top-kk相似性、RMSE top-kk接近性、DE Spearman和Pathway活动。这些奖励测量目标对齐、群体放置、转录排名和通路水平的生物学一致性。由于这些验证器可能是不可微的,并且在生成器外部计算,RL为将它们用作直接优化信号提供了一种自然机制Zheng等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib75)\);Liu等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib71)\)。
*PerturbCellRL*使用预训练的流匹配生成器作为基础模型,并用奖励目标的加权和对其生成动力学进行后训练。在训练时,模型在一个对照状态和扰动条件下生成多个可能的扰动状态,用验证器套件对其评分,并更新生成器以增加高奖励细胞的概率,同时对预训练策略进行正则化。在推理时,我们使用通路活动验证器进行最佳-NN选择,因为它可以从基因扰动类型中标注,而无需知道真实处理响应:生成多个候选响应,评分并过滤,以选择最生物学合理的预测Snell等人\(2024 (https://arxiv.org/html/2606.27752#bib.bib78)\)。这使评估、训练和推理时选择围绕相同的透明生物学检查统一起来。
我们在多个遗传和化学扰动基准上评估*PerturbCellRL*。在这些基准上,*PerturbCellRL*在奖励对齐的评估指标和一个保留评估指标上,相比于预训练的流匹配生成器有所改进。最佳-NN选择进一步提高了生物学一致性,表明验证器引导的测试时缩放可以从采样的候选响应中提取更好的预测。重要的是,这些奖励增益并不以牺牲分布质量为代价:*PerturbCellRL*在现有的群体水平评估指标上与最先进的扰动模型具有竞争力。
总之,我们的工作识别了现有单细胞扰动建模的一个关键局限:在单细胞水平上缺乏对生物学一致性的明确强制。我们通过将具有生物学意义的评估器通过RL纳入模型来解决这一局限,这显著提高了生成细胞表达的可信度。我们进一步表明,这些增益可以通过测试时缩放放大。最后,我们的奖励为社区提供了新的基准指标。总体而言,我们的结果将基因表达生成从“分布上良好”推进到“生物学上一致”,支持药物发现和个性化医疗的下游目标,并减少对昂贵湿实验室实验的依赖。
## 2 相关工作
#### 基于大规模生成建模的单细胞扰动预测。
单细胞扰动预测旨在推断细胞转录组在遗传或化学干预下如何变化。这个问题受到了广泛关注,这得益于大规模扰动数据集的日益可用以及生成建模的进步。
在数据方面,Norman等人\(2019 (https://arxiv.org/html/2606.27752#bib.bib12)\)、ComboSciPlexMathur等人\(2022 (https://arxiv.org/html/2606.27752#bib.bib11)\)和Virtual Cell ChallengeRoohani等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib99)\)提供了具有挑战性的遗传和化学扰动基准。scPerturbPeidli等人\(2024 (https://arxiv.org/html/2606.27752#bib.bib52)\)强调了更广泛可用的协调单细胞扰动数据。
在建模方面,早期的深度生成方法(如scVI)建立了单细胞转录组的概率表示学习Lopez等人\(2018 (https://arxiv.org/html/2606.27752#bib.bib65)\)。随后的扰动预测方法使用了条件自编码器、图神经网络、Transformer架构和分布生成模型,来预测在未见过的扰动或细胞上下文下的响应Lotfollahi等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib8)\);Roohani等人\(2024 (https://arxiv.org/html/2606.27752#bib.bib9)\);Adduri等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib7)\);Bereket和Karaletsos \(2023 (https://arxiv.org/html/2606.27752#bib.bib82)\);Rampášek等人\(2019 (https://arxiv.org/html/2606.27752#bib.bib83)\)。最近,最先进的方法开始采用流匹配Lipman等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib39),2024 (https://arxiv.org/html/2606.27752#bib.bib33)\);Liu等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib63)\),这为条件生成提供了自然框架。这在扰动预测中特别适用,模型以对照状态和扰动标签为条件生成扰动细胞Yu等人\(2026 (https://arxiv.org/html/2606.27752#bib.bib13)\);Klein等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib6)\);Zhang等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib17)\)。在这项工作中,我们建立在这一系列流匹配模型上,特别使用scDFMYu等人\(2026 (https://arxiv.org/html/2606.27752#bib.bib13)\)作为基础生成器,并通过在强大的流匹配骨干之上的验证器引导后训练进一步改进它。
#### 用于生物对齐的强化学习和测试时缩放。
虽然生成模型可以产生类似表达的细胞谱,但将生物先验纳入其预测仍然具有挑战性。这个问题在单细胞扰动预测中尤其重要,因为生成的细胞可能看起来像表达谱,但其扰动效应在生物学上不一致。一个可信的预测应该匹配观察到的群体水平表达模式,正确地对差异表达基因进行排序,并避免稳定基因的不必要漂移。然而,这些目标通常是不可微的,使得直接优化变得困难。
一个有前景的解决方案是RL,它最近被用于将扩散和流模型与人类偏好或任务特定奖励对齐Black等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib69)\);Fan等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib70)\);Liu等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib71)\);Xue等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib73)\);Li等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib74)\);Wu等人\(2026 (https://arxiv.org/html/2606.27752#bib.bib1)\)。流和扩散模型带来了额外的挑战,因为精确样本似然通常是难以处理的。先前的工作如FlowGRPO和MixGRPO将此问题建模为马尔可夫决策过程,而最近的方法如DiffusionNFTZheng等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib75)\)引入了用于在线RL的前向过程目标,提高了训练效率和稳定性。在这项工作中,我们将这种对齐视角适应于转录组扰动预测,其中奖励来自生物验证器,而不是视觉或人类偏好分数。
此外,当验证器可用时,可以通过采样多个候选并选择得分最高的输出来改进推理,这是一个被称为测试时缩放的新兴方向。这种最佳-NN策略广泛应用于验证器引导的推理系统Cobbe等人\(2021 (https://arxiv.org/html/2606.27752#bib.bib76)\);Lightman等人\(2023 (https://arxiv.org/html/2606.27752#bib.bib77)\);Snell等人\(2024 (https://arxiv.org/html/2606.27752#bib.bib78)\),并且也被探索为扩散模型中的测试时缩放Ma等人\(2025 (https://arxiv.org/html/2606.27752#bib.bib72)\)。在*PerturbCellRL*中,最佳-NN选择使用与RL后训练相同的归一化奖励。
## 3 问题形式化
我们考虑转录组空间中的单细胞扰动预测。令ui∈RGu\_\{i\}\\in\\mathbb\{R\}^\{G\}表示一个归一化的对照细胞表达向量,跨越GG个基因,令ci∈Cc\_\{i\}\\in\\mathcal\{C\}表示一个扰动,例如基因过表达、CRISPR激活或化学处理。目标是学习一个条件生成器,它可以产生一个扰动后的表达谱
yi∼πθ\(⋅∣ui,ci\),y\_\{i\}\\sim\\pi\_\{\\theta\}\(\\cdot\\mid u\_\{i\},c\_\{i\}\),\(1\)其中yi∈RGy\_\{i\}\\in\\mathbb\{R\}^\{G\}是对应于对照细胞uiu\_\{i\}在条件cic\_\{i\}下生成的扰动转录组。
在大多数单细胞扰动筛选中,对照细胞和扰动细胞作为未配对的群体被观测到。对于一个扰动条件cc,令\{yc,jobs\}j=1nc\\\{y^\{\\mathrm\{obs\}\}\_\{c,j\}\\\}\_\{j=1\}^\{n\_\{c\}\}表示在该条件下观测到的真实扰动细胞。由于同一个物理细胞在扰动前后未被测量,模型学习的是群体水平的条件生成,而不是配对的细胞水平响应。
#### 基础生成模型。
我们使用scDFMYu等人\(2026 (https://arxiv.org/html/2606.27752#bib.bib13)\)作为基础生成模型,因为它在学习群体水平扰动预测方面取得了强大性能。遵循条件流匹配,scDFM学习一个速度场vθ\(xt,t,ui,ci\)v\_\{\\theta\}\(x\_\{t\},t,u\_\{i\},c\_\{i\}\),该速度场以对照表达和扰动为条件,将高斯基础样本映射到扰动表达状态。给定一个对照细胞uiu\_\{i\}、扰动cic\_\{i\}、高斯基础样本x0∼N\(0,I\)x\_\{0\}\\sim\\mathcal\{N\}\(0,I\)和一个观测到的扰动细胞yci,jobsy^\{\\mathrm\{obs\}\}\_\{c\_\{i\},j\},标准流匹配目标可以写为
LFM\(θ\)\\displaystyle\\mathcal\{L\}\_\{\\mathrm\{FM\}\}\(\\theta\)=Eui,ci,x0,yci,jobs,t‖vθ\(xt,t,ui,ci\)−\(yci,jobs−x0\)‖22,\\displaystyle=\\mathbb\{E\}\_\{\\begin\{subarray\}\{c\}u\_\{i\},c\_\{i\},x\_\{0\},\\\\ y^\{\\mathrm\{obs\}\}\_\{c\_\{i\},j\},t\\end\{subarray\}相似文章
GenCircuit-RL: 基于层次化验证的强化学习基因电路设计
GenCircuit-RL 提出了一个基于层次化验证奖励的强化学习框架,通过代码生成进行基因电路设计,相比二元奖励提升了14-16个百分点,并提供了包含4,753个电路的 SynBio-Reason 基准。
CellBRIDGE: 通过交互感知对齐学习细胞轨迹
CellBRIDGE是一种新方法,通过引入配体-受体相互作用成本来模拟细胞间通讯,增强了对scRNA-seq轨迹推断的最优传输,改进了对齐并实现了可解释的计算机模拟扰动。
迈向通用基因调控网络推断:在单细胞基础模型中解锁可泛化的调控知识
本文提出了一种利用单细胞基础模型进行通用基因调控网络(GRN)推断的新范式,并引入了虚拟值扰动和梯度轨迹方法来提炼调控知识。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
MechRL:强化学习代理用于机制可解释性中的电路发现
提出了 MechRL,一种利用强化学习自动发现 transformer 语言模型中电路的方案。经过多任务训练的 PPO 代理发现了与已知典型电路匹配的注意力头电路,并能泛化到一项保留任务上。