GenCircuit-RL: 基于层次化验证的强化学习基因电路设计

arXiv cs.AI 论文

摘要

GenCircuit-RL 提出了一个基于层次化验证奖励的强化学习框架,通过代码生成进行基因电路设计,相比二元奖励提升了14-16个百分点,并提供了包含4,753个电路的 SynBio-Reason 基准。

arXiv:2605.14215v1 Announce Type: new 尽管合成生物学已经取得了数十年的进展,但基因电路设计仍然是一个劳动密集型、依赖专家经验的过程。我们通过代码生成来研究这一问题:模型使用 pysbol3 编写 Python 代码,以合成生物学开放语言 (SBOL) 构建基因电路,SBOL 是一种支持自动化验证的形式化表示。我们提出了 GenCircuit-RL,这是一个围绕层次化验证奖励构建的强化学习框架,将正确性分解为从代码执行到任务特定拓扑检查的五个层次,并采用四阶段课程,将优化压力从代码生成转移到功能推理。我们还介绍了 SynBio-Reason,这是一个包含 4,753 个电路的基准,涵盖六种典型电路类型和九项任务(从代码修复到全新设计),并包含留出的生物元件用于分布外评估。层次化验证在功能推理任务上的任务成功率比二元奖励提高了 14 到 16 个百分点,并且课程学习是实现强设计性能所必需的。所得到的模型能够生成拓扑正确的电路,泛化到新的生物元件,并重新发现合成生物学文献中的经典设计。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:22

# GenCircuit-RL: 基于分层验证的强化学习用于基因线路设计 来源:https://arxiv.org/html/2605.14215 ###### 摘要 尽管合成生物学已发展数十年,基因线路设计仍然是一个耗时且依赖专家经验的过程。我们通过代码生成来研究这一问题:模型用 pysbol3 库生成 Python 代码,以构建符合合成生物学开放语言(SBOL)格式的基因线路——这种形式化表示支持自动验证。我们提出 GenCircuit-RL,一个围绕分层验证奖励构建的强化学习框架,将正确性分解为五个层次,从代码执行到任务特定的拓扑检查,并采用四阶段课程学习,将优化重心从代码生成转移到功能推理。此外,我们还引入了 SynBio-Reason 基准,包含 4,753 个线路,涵盖六种典型线路类型和九项任务,从代码修复到从头设计,并预留了部分生物元件用于分布外评估。分层验证奖励在功能推理任务上将任务成功率提高了 14 到 16 个百分点(相比二元奖励),而课程学习则是实现强设计性能的必要条件。训练出的模型能够生成拓扑正确的线路,泛化到新生物元件,并重新发现合成生物学文献中的经典设计。 机器学习,ICML,合成生物学,基因线路设计,强化学习,代码生成 ## 1 引言 基因线路设计是语言模型辅助的理想目标,因为它兼具形式化规范、组合结构以及在大设计空间中的困难搜索。合成生物学家通过将启动子、核糖体结合位点、编码序列和终止子等标准化元件组装成实现逻辑、记忆和振荡功能的线路,来工程化可编程的细胞行为(Gardner 等,2000a;Elowitz 和 Leibler,2000a;Nielsen 等,2016a)。这些线路已支持生物传感、治疗和生物生产等应用(Xu 等,2024;Saltepe 等,2018;Tellechea-Luzardo 等,2023;Sedlmayer 等,2018),但其设计仍然依赖于反复的设计-构建-测试-学习循环和大量专家干预(附录 B.2)。 SBOL 为基因线路提供了一种形式化、机器可读的表示(McLaughlin 等,2020)。它以支持自动验证的格式编码了组合结构和调控关系;附录 G.3 给出了 pysbol3 的具体示例。这种形式化结构与可执行验证的结合,使得基因线路设计成为从可验证反馈中强化学习(RLVF)的一个有用场景。挑战在于生成的线路可能在多个层面失败:代码可能无法执行,生成的 SBOL 可能无效,结构可能畸形,注释可能不一致,或者线路可能实现错误的功能。二元奖励将这些不同的失败模式压缩为单一结果,对语法错误的线路和仅缺失最终功能标准的线路给予相同的信号,从而削弱了在推理密集型任务上的学习效果。因此,我们将验证分解为五个层次:执行、有效性、结构、语义和功能。每个层次依赖于前一层次的成功,因此一个在结构上失败的线路仍然能因通过执行和有效性而获得分数。我们将这种奖励与一个课程学习配对,该课程按任务强调的验证层次分阶段组织,从代码基础到结构组装、功能推理再到从头设计。 我们做出以下贡献: - • SynBio-Reason,语言模型在基因线路推理上的首个协议,包含 4,753 个线路,来自程序化生成、Cello 遗传设计工具(Nielsen 等,2016a)以及合成生物学文献中的经典线路。它涵盖九项任务,涉及代码修复、翻译、功能推理和从头设计,每个线路均配有可执行的 pysbol3 代码用于自动评估。 - • GenCircuit-RL,一个结合分层验证奖励与课程学习的训练框架。我们将验证形式化为与不同失败模式对应的五个层次,并使用四阶段课程学习,将优化压力从代码生成转移到任务特定正确性。训练采用组相对策略优化(GRPO)以适应不同课程阶段中回报的变化。 - • 实证分析表明,分层奖励在功能推理任务上比二元奖励提高了 14 到 16 个百分点,课程学习是实现强设计性能的必要条件,训练模型在保留的阻遏蛋白-启动子对上的成功率达到 52.6%,并且这些趋势在包括 Llama-3.1-8B 和 Gemma-3-12B 在内的模型家族中可复现(附录 E.15)。 ## 2 设定与 SynBio-Reason SynBio-Reason 为评估语言模型通过代码生成进行基因线路推理提供了全面的测试平台。它包含程序化生成的线路(具有保证的基准真实值,用于训练和分布内评估)、精选的真实世界线路(用于分布外评估)以及来自文献的经典黄金标准线路。每个线路都配有参考的 PySBOL 代码,支持基于执行的评估和代码级分析。 ### 2.1 基因线路 一个基因线路由以下基本生物元件组成:启动子(P)启动转录,核糖体结合位点(RBS)控制翻译效率,编码序列(CDS)编码蛋白质产物,终止子(T)停止转录。元件通常按 P→RBS→CDS→T 组装成表达盒。通过阻遏蛋白或激活蛋白介导的盒间调控相互作用,可以实现所需功能的程序。一个盒表达的阻遏蛋白可以结合并抑制另一个盒的启动子,产生负调控;相反,激活蛋白可以增强其目标启动子的转录,产生正调控。 我们生成一个包含六种已知属性线路类型的数据集,支持可验证评估。表达盒建立基本的 SBOL 理解。逻辑门通过真值表验证测试功能推理。前馈环和双稳态开关评估对调控拓扑和反馈的理解。振荡器代表最复杂的线路,而级联线路以多层布尔函数匹配 Cello 的复杂度。附录 B.1 提供了详细描述。 ### 2.2 代码生成动作空间 SBOL 为遗传设计提供了标准化表示。一个 SBOL 文档包含表示生物实体(DNA、RNA、蛋白质、小分子)的 Component 对象、表示关系(例如,一个表达盒 Component 包含引用其组成启动子、RBS、CDS 和终止子的 SubComponent 对象)、指定拓扑顺序的 Constraint 对象以及描述调控关系的 Interaction 对象。每个元件都带有序列本体(SO)术语指示生物角色(启动子 Component 的角色为 SO:0000167)和系统生物学本体(SBO)术语指定相互作用类型(抑制 Interaction 的角色为 SBO:0000169 表示一个 Component 抑制另一个)。 我们将基因线路推理表述为在 Component 抽象级别上的代码生成。电子设计自动化中的类似发现(Zhang 等,2025)表明,在功能子电路级别(例如电流镜、差分对)而非单个晶体管进行设计,能显著降低搜索空间复杂度,同时使智能体动作更符合人类设计直觉。在基因线路中,对单个碱基对进行推理同样棘手,但像 RBS 和 CDS 这样的 Component 构成了功能单元,合成生物学家用它们来推理线路逻辑和调控流。生成领域特定的序列化格式(例如原始的 RDF/XML 格式的 SBOL)会大量增加模型学习与科学推理正交的低级语法约定的负担。 给定一个描述任务和上下文的提示 x,模型生成 Python 代码 ĉ,使用 pysbol3 库程序化地构建目标 SBOL 文档。执行此代码产生文档 d̂ = exec(ĉ),然后通过验证函数 V(d̂, x) ∈ [0,1] 与基准真实值进行评估。这种表述利用了预训练数据中 Python 的丰富性,避免了 RDF 序列化格式的稀疏性,同时反映了从业者的工作流程。针对 pysbol3 API 编程将语法正确性(例如命名空间管理)委托给库,并产生可解释、可修改的产物。最后,执行回溯提供了结构化的反馈信号,有助于迭代自我纠正。 ### 2.3 程序化线路生成 我们程序化地生成 SBOL 线路和相应的 pysbol3 代码,基于功能等价性而非精确代码匹配进行评估结果。我们的 48 个生物元件库具备足够的组合多样性,可为所有线路类型生成有意义的训练数据(包括双稳态开关,以及最多 5 节点振荡器和 4 层级联),生物现实性根植于充分表征的组件,并支持使用保留元件进行分布外评估。它包含来自 iGEM Registry 和 Cello 表征集合的启动子(组成型和诱导型)、核糖体结合位点、编码序列(报告基因、阻遏蛋白、激活蛋白)、终止子和操纵子。十个正交的阻遏蛋白-启动子对被组织成训练组(5 对:LacI, TetR, cI, PhlF, SrpR)和保留组(5 对:BM3R1, AmtR, QacR, BetI, AmeR),用于分布外评估。完整规格见附录 C.1.1。 #### 2.3.1 程序化生成协议 元件按训练组和保留组划分,每种线路类型的程序化线路生成算法(附录 C.3.1)仅从训练组元件中抽取。我们通过四个参数形式化线路复杂度:调控深度 d(从输入到输出的最长路径)、最大扇入 f(每个启动子的调控输入数)、反馈指示符 b(是否存在环路)和节点数 n(表达盒数量)。形式化定义和复杂度类别分布见附录 C.3.1。在生成过程中,我们根据复杂度类别的分布(如表 13 在附录 C.3.2 中所示)采样线路,以确保平衡表示。 ### 2.4 真实世界线路 为了评估泛化能力,我们利用 Cello 遗传设计工具中经过实验表征的线路进行分布外评估(使用保留元件),并精选一组合成生物学文献中具有历史意义的线路用于设计能力验证。 ##### Cello 线路语料库。除了程序化线路,我们还评估了来自 Cello 设计工具(Jones 等,2022)的 111 个实验验证的线路,涵盖大肠杆菌和酿酒酵母,根据所使用的阻遏系统划分为 71 个分布内和 40 个分布外线路。分布外线路使用保留的阻遏蛋白(BM3R1, AmtR, QacR, BetI, AmeR),测试模型是否将抽象的调控原则“阻遏蛋白 X 抑制启动子 pX”应用于新系统。附录 C.1.2 提供了完整规格。 ##### Literature-91 黄金标准。我们精选了 91 个来自 2000-2024 年开创性出版物的线路,包括 Gardner 双稳态开关和 Elowitz 阻遏振荡器(Elowitz and Leibler, 2000a),作为针对领域专家设计线路的“重新发现”任务。Literature-91 集包括 50 个原始经典线路(表达盒、逻辑门、双稳态开关、振荡器、FFL)和 41 个扩展复杂线路(级联线路、群体感应、光响应、Cello 设计、先进振荡器)。完整列表见附录 G.1。对于每个线路,我们创建了规范的 SBOL3 表示(捕获调控拓扑)、构建该线路的相应 pysbol3 代码、自然语言描述以及线路行为的基准真实值。 ##### 基于扰动的增强。真实世界线路反映了实际约束和设计选择,但数量有限。为了扩展训练数据,我们应用四种扰动算子修改种子线路。同功能元件替换:将一个元件替换为相同类型且特性类似的另一个元件(例如将一个正交阻遏蛋白-启动子对替换为另一个),保留线路拓扑和功能,但改变定量行为。保持类别替换:将一个元件替换为相同类型但特性不同的另一个元件,可能改变功能(例如将组成型启动子替换为诱导型启动子)。拓扑增强:根据可用元件添加调控边(例如添加冗余抑制边)。拓扑消融:移除调控边,通常破坏线路功能(例如从双稳态开关中移除一条抑制边会破坏双稳定性)。从 91 个 Literature-91 种子和 71 个分布内 Cello 线路,我们生成了 810 个扰动变体:每个种子线路 5 个变体,涵盖所有算子以及 1-3 个扰动的链长。40 个 OOD Cello 线路保持未扰动。消融线路会标注任何功能缺陷,为线路调试任务创建训练示例。附录 C.7 提供了详细的扰动规格。 ### 2.5 任务 九项任务被组织成三组:程序化训练任务(T1-T7)、Cello 评估任务(T8-T9)以及用于掩码预测和从头设计的 Literature-91 评估任务。附录 C.4.1–C.4.3 提供了完整规格。表 1 总结了任务组成。我们严格执行拆分分离。Cello 线路通过基于元件的图同构与程序化训练集去重,程序化 t

相似文章

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。

组合合成:通过原子分解与重组扩展代码RLVR

Hugging Face Daily Papers

介绍原子分解与重组(ADR),一种通过分解和重组原子元素来生成新颖且具有挑战性的可验证代码任务的框架,从而为大型语言模型实现可扩展的基于可验证奖励的强化学习。

@tanayj: https://x.com/tanayj/status/2072766211256119475

X AI KOLs Timeline

本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。