CellRFT: 用于单细胞扰动建模的强化微调
摘要
CellRFT引入了一个强化微调框架,该框架使用生物评估作为直接训练反馈,以改进单细胞扰动模型,解决了代理训练损失与生物评估标准之间的不匹配问题。
arXiv:2609.19970v1 公告类型:新
摘要:预测细胞对扰动的反应有助于研究基因功能、疾病机制和治疗策略。尽管单细胞扰动建模取得了进展,但现有模型通常优化代理损失,这些损失不能直接反映用于评估的生物标准,因此更好的数据拟合不一定产生更好的生物预测。为了解决这一不匹配问题,我们引入了 \textbf{CellRFT},一个使用生物评估作为直接训练反馈的强化微调框架。CellRFT使用策略梯度优化从生成的细胞群的非可微评估中学习,并通过分层奖励聚合整合多种生物奖励。全面实验展示了CellRFT在不同预训练模型上的适用性以及在改进扰动预测方面的有效性,揭示了优化一个生物标准可能有助于或妨碍其他标准,并表明互补奖励可以改进超出直接优化的标准,提供了一种探索生物指标如何塑造模型行为的方法,有可能为评估设计提供信息。代码将公开发布。
查看缓存全文
缓存时间: 2026/09/18 09:13
# CellRFT:单细胞扰动建模的强化微调 来源:https://arxiv.org/html/2609.19970 严杰¹,†,刘丽²,†,郭涵泽³,胡嘉欣¹,何厚信¹,齐晓宁 (https://orcid.org/0000-0003-3447-2842)¹,王浩然¹,⁴,李聪¹,张忠元⁵,王勇¹,⁴,* ¹中国科学院 ²北京大学 ³中国人民大学 ⁴中国科学院大学 ⁵中央财经大学 ###### 摘要 预测细胞对扰动的响应支持基因功能、疾病机制和治疗策略的研究。尽管单细胞扰动建模取得了进展,现有模型通常优化代理损失,而这些损失并不直接反映用于评估的生物标准,因此更好的数据拟合未必带来更好的生物预测。为解决这种不匹配问题,我们引入了**CellRFT**——一个以生物评估作为直接训练反馈的强化微调框架。CellRFT使用策略梯度优化,从对生成的细胞群落的不可微评估中学习,并通过层次化奖励聚合整合多个生物奖励。全面的实验证明了CellRFT在不同预训练模型上的适用性及其在改进扰动预测方面的有效性,揭示了优化一个生物标准可能有助于或阻碍其他标准,并表明互补奖励可以改善超出直接优化目标的标准。这为探究生物指标如何影响模型行为提供了一种方法,并有望为评估设计提供参考。代码将公开。 ¹¹脚注:通讯作者:[[email protected]](mailto:[email protected]) ²²脚注:这些作者对本工作贡献均等。 ## 1 引言 预测细胞对遗传和化学扰动的响应,将实验覆盖范围扩展到可行筛选之外 (Bunne et al., 2024 (https://arxiv.org/html/2609.19970#bib.bib6); Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)),支持基因功能和疾病机制的研究以及治疗策略的发现 (Dixit et al., 2016 (https://arxiv.org/html/2609.19970#bib.bib8); Bunne et al., 2024 (https://arxiv.org/html/2609.19970#bib.bib6))。扰动模型通常使用重构 (Lotfollahi et al., 2019 (https://arxiv.org/html/2609.19970#bib.bib16))、去噪 (Yuan et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib27)) 或分布匹配 (Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)) 损失进行训练,然后使用如 Cell-Eval (Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)) 等工具在表达保真度、受影响基因恢复率和扰动区分度上进行评估。这些代理损失并不直接优化生物标准,从而产生了**训练-评估目标不匹配**的问题,即更好的数据拟合未必能改善生物预测 (Zhu et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib29); Ahlmann-Eltze et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib2))。 \(a\)参考说明 \(b\) 图 1:**训练-评估目标不匹配**。\(a\) 标准流程优化代理目标,如重构和去噪,其改进未必带来更高的生物保真度。CellRFT 代之以使用生物评估反馈通过强化学习指导模型更新。\(b\) CellRFT 在 Replogle 数据集上微调 PerturbDiff (Scratch) (Yuan et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib27))。得到的模型 \(+\text{CellRFT}\) 改进了表 1 (https://arxiv.org/html/2609.19970#S3.T1) 中定义的所有 13 个评估指标。 直接从生物评估学习可以减少这种不匹配,但许多指标涉及不可微的阈值或排名。要使用此类反馈,强化学习 (RL) 微调提供了一条无需通过评估器求导的潜在途径,并且在语言模型 (Ouyang et al., 2022 (https://arxiv.org/html/2609.19970#bib.bib20); Guo et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib10); Srivastava and Aggarwal, 2025 (https://arxiv.org/html/2609.19970#bib.bib23)) 和基于扩散的图像生成 (Black et al., 2024 (https://arxiv.org/html/2609.19970#bib.bib4); Liu et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib15); Zheng et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib28)) 中已有成功应用。在扰动预测中,诸如受影响基因恢复率之类的指标评估的是跨细胞的响应,因此要求对单个输出评分的 RL 公式不能直接适用。这些指标还评估不同的生物属性,因此将它们作为奖励联合使用需要理解优化一个指标是否有助于或损害其他指标——这是一个任务特定的问题,目前仍未得到充分探索。 为了解决这些挑战,我们提出了 **CellRFT**——一个将生物评估引入单细胞扰动模型优化并考察奖励选择如何塑造预测性能的强化微调框架(图 1(a) (https://arxiv.org/html/2609.19970#S1.F1.sf1))。CellRFT 使用策略梯度 RL 来优化生物奖励,而无需通过评估指标求导。为了弥合单个生成轨迹与群落级评估之间的差距,它为每个扰动生成多个候选细胞集,并将每个集的相对奖励反馈共享给其组成轨迹。为了整合多个生物标准,CellRFT 使用层次化奖励聚合,先在评估类别内平均,然后跨类别平均,从而使每个类别无论其指标数量多少,都具有相等的总权重。我们进一步通过系统比较单个奖励、类别组合和聚合规则,以及分析优化每个奖励如何影响其他评估标准,来研究奖励整合问题。全面的实验证明了 CellRFT 在不同预训练模型上的适用性,以及通过直接生物反馈提高扰动预测的有效性。图 1(b) (https://arxiv.org/html/2609.19970#S1.F1.sf2) 说明了 PerturbDiff (Scratch) 上的这些改进,其中 CellRFT 改进了所有 13 个报告的评估指标。实验进一步揭示,优化一个生物标准可能有助于或阻碍其他标准,而互补奖励可以共同改善超出直接优化目标的标准。理解这些相互作用可以为训练奖励的选择以及评估生物预测的标准的选择提供参考。 总之,我们的贡献有三点: - •我们引入了 **CellRFT**,一个将生物评估转化为单细胞扰动模型直接训练反馈的强化微调框架,解决了训练目标与生物评估标准之间的不匹配问题。 - •我们揭示了生物奖励在优化过程中如何相互增强或冲突,表明不同的评估标准可以从共享训练目标中受益,并为设计互补奖励提供参考。 - •全面的实验证明了 CellRFT 在不同预训练模型上的适用性及其在提高扰动预测方面的有效性,并展示了奖励组成和聚合如何平衡各生物标准的改进。 ## 2 相关工作 ### 2.1 单细胞扰动建模 单细胞扰动预测旨在从对照细胞、指定扰动和细胞背景中推断扰动后的基因表达谱。为了表示扰动对细胞状态的影响,scGen (Lotfollahi et al., 2019 (https://arxiv.org/html/2609.19970#bib.bib16)) 在潜在表达空间中学习位移。CPA (Lotfollahi et al., 2023 (https://arxiv.org/html/2609.19970#bib.bib17)) 进一步在该空间中分离扰动和细胞协变量,允许它们的效果重新组合以预测新条件下的情况。为了泛化到未见的遗传扰动,GEARS (Roohani et al., 2024 (https://arxiv.org/html/2609.19970#bib.bib21)) 使用基因-基因关系在观测和未观测的扰动目标之间共享信息。除了表示这些条件效应外,从单细胞测量中学习需要处理非配对观测:测序会破坏被测量的细胞,因此同一个细胞无法在扰动前后被观测到。CellOT (Bunne et al., 2023 (https://arxiv.org/html/2609.19970#bib.bib5)) 通过学习对照和扰动群落之间的最优传输映射来解决这个问题,而 STATE (Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)) 则使用群落匹配目标学习响应。扩散和流模型为这些响应分布提供了灵活的生成公式:Squidiff (He et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib11)) 学习去噪过程,CellFlow (Klein et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib13)) 学习条件流。PerturbDiff (Yuan et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib27)) 将扩散扩展到细胞分布空间,以捕捉相同观测条件下可能响应分布中的变异。 尽管它们的建模策略不同,但这些方法通常优化代理目标,如重构、去噪或分布匹配,而非用于评估的生物标准。这种训练-评估目标不匹配意味着训练损失的改善不一定能转化为更好的生物预测,这促使人们直接使用生物评估作为训练反馈。 ### 2.2 强化学习与生物评估 强化学习 (RL) 通过将评估反馈纳入训练并将优化导向任务级目标,在多个领域推动了重大进展。在基于语言的辅助和推理中,仅基于似然的训练不能确保输出遵循用户指令、正确解决问题或作为代码成功执行。RL 引入人类偏好判断、答案验证和执行结果作为奖励,改善了指令遵循、推理准确性以及软件工程任务的完成 (Ouyang et al., 2022 (https://arxiv.org/html/2609.19970#bib.bib20); Guo et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib10); Cao et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib7))。在视觉生成中,去噪和流匹配损失并不直接衡量图像是否满足感知偏好或准确描绘提示中指定的对象和关系。优化源自偏好模型和多模态评估器的奖励可以改善视觉质量和组合一致性,使训练更接近用于判断生成图像的标准 (Black et al., 2024 (https://arxiv.org/html/2609.19970#bib.bib4); Liu et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib15); Zheng et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib28))。在分子设计中,重现已知化学结构并不能确保有用化合物所需的活性和理化性质。基于属性的 RL 奖励引导优化朝向这些要求,丰富了预测目标活性的候选分子,并且当与合成约束结合时,支持了经实验验证的抗生素的发现 (Olivecrona et al., 2017 (https://arxiv.org/html/2609.19970#bib.bib19); Swanson et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib24))。 在扰动建模中,具有生物学意义的预测应捕获整体转录响应、恢复受干预影响的基因并区分不同扰动的效果。为了评估这些属性,先前的研究开发并采用了互补的指标:表达保真度 (Lotfollahi et al., 2019 (https://arxiv.org/html/2609.19970#bib.bib16); Bunne et al., 2023 (https://arxiv.org/html/2609.19970#bib.bib5))、差异表达恢复率 (Zhu et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib29)) 和扰动区分度 (Wu et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib26); Roohani et al., 2025 (https://arxiv.org/html/2609.19970#bib.bib22))。尽管 Cell-Eval 与 STATE 一同发布,将这些评估维度整合到一个通用套件中 (Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)),但相应的指标应如何联合指导模型优化仍未解决。将它们用作生物奖励需要理解优化一个标准是增强还是损害其他标准上的性能。 最相关的工作,与我们同期开发的是 **D²R²** (Fan et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib9)) 和 **PerturbCellRL** (Wu et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib25))。两者都旨在提高预测细胞的生物一致性,将 RL 与调控关系或通路知识相结合以指导预测。相比之下,CellRFT 提供了一个互补的视角,研究了两个仍未得到充分探索的问题:如何将常用的 Cell-Eval 指标整合到 RL 训练中,以及它们的互补性和冗余性应如何指导统一生物目标的构建。 ## 3 方法 本节首先介绍问题表述和生物评估标准,然后介绍 CellRFT 及其训练过程。 ### 3.1 问题表述与生物评估 #### 问题定义。 对于细胞背景 \(c\)(例如,细胞类型或批次)和扰动 \(\tau\),考虑非配对的对照群落 \(X_{\mathrm{ctrl}} \in \mathbb{R}^{N_{\mathrm{ctrl}} \times |\mathcal{G}|}\) 和扰动群落 \(X_{\mathrm{pert}} \in \mathbb{R}^{N_{\mathrm{pert}} \times |\mathcal{G}|}\),其中行代表细胞,列代表基因 \(\mathcal{G}\)。扰动建模旨在学习一个条件生成器 \(p_{\theta}(\cdot \mid X_{\mathrm{ctrl}}, c, \tau)\),其预测的细胞分布 \(\widehat{P}_{c, \tau}\) 近似真实的扰动细胞分布 \(P_{c, \tau}\),即 \(\widehat{P}_{c, \tau} \approx P_{c, \tau}\),同时最大化预测 \(\widehat{X} \in \mathbb{R}^{N \times |\mathcal{G}|}\) 的期望生物奖励: \[ \max_{\theta}\; \mathbb{E}_{\widehat{X} \sim p_{\theta}(\cdot \mid X_{\mathrm{ctrl}}, c, \tau)} \!\left[ r \!\left( \widehat{X}; X_{\mathrm{ctrl}}, X_{\mathrm{pert}}, c, \tau \right) \right], \] 其中 \(r\) 是奖励函数,当较大的值表示更好的性能时由生物评估指标本身给出,否则为其负值。 #### 生物评估。 常用的指标可在与 STATE 一同发布的 Cell-Eval (Adduri et al., 2026 (https://arxiv.org/html/2609.19970#bib.bib1)) 中找到。这些指标从三个互补的角度评估预测与真实细胞群落之间的一致性:(i) 全局响应保真度,衡量预测在跨细胞平均的整体表达响应方面的再现程度;(ii) 差异表达保真度,关注显著受影响基因及其响应模式的恢复;(iii) 扰动区分度。
相似文章
PerturbCellRL: 验证器引导的强化学习用于单细胞扰动预测
PerturbCellRL 提出一种强化学习框架,通过使用细胞级验证器作为奖励对预训练的单细胞转录组生成器进行后训练,从而在分布匹配之外提升扰动预测的生物学一致性。
Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training
The paper introduces CD-RFT, a method to decouple the shared control bottleneck in RL post-training by regularizing a novel control coefficient, improving multi-task capability on models like Qwen2.5-7B and Llama-3.2-3B.
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。
RASFT:面向推理的滚动自适应监督微调
RASFT是一种新颖的大型语言模型监督微调框架,它根据模型自身的推理能力调整专家监督,在数学和代码推理基准测试中相比标准SFT和强化学习方法取得了更好的性能。
当RL在SFT后失效:恢复模型可塑性以实现稳健的SFT到RL交接
本文研究了在大型语言模型的先SFT后RL流程中,过度监督微调(SFT)后模型可塑性的丧失问题,并提出了一种名为Rejuvenation的方法,该方法通过基于基线的模型融合和定向神经元重置来恢复可塑性,从而持续提升RL性能。