利用生物动力学知识先验进行数据稀缺的生物过程建模
摘要
本文首次系统研究了将生物动力学常微分方程(ODE)知识注入神经网络用于生物过程建模的方法,比较了模拟预训练和架构级先验,发现它们在数据稀缺情况下可相互替代且有效。
arXiv:2607.20539v1 Announce Type: new
摘要:尽管深度学习加速了药物发现,但其对生物制造的影响却相当有限。原因是数据稀缺。生物反应器实验成本高,需要数天到数周时间,而且很少以公开形式共享,导致每项研究工作只有少量实验。然而,该领域本身拥有丰富的先验知识。生物动力学常微分方程(ODE)模型几十年来一直用于描述微生物生长,但如何将这些知识注入神经网络尚未得到系统研究。我们首次系统研究了如何将这种ODE知识注入神经网络,比较了在模拟ODE曲线上预训练通用解码器的数据级先验与将ODE嵌入解码器的架构级先验。在11个数据集和7种微生物上,两者均持续优于无先验基线。我们的核心发现是两者可以相互替代。在模拟上预训练的通用解码器与在真实数据上训练的完全生物结构化解码器表现相当。因此,模拟预训练为生物过程数据稀缺下的深度学习提供了一种简单、数据高效的方案。
查看缓存全文
缓存时间: 2026/07/24 05:11
# 利用生物动力学知识先验应对数据匮乏的生物过程建模
来源: https://arxiv.org/html/2607.20539
###### 摘要
尽管深度学习加速了药物发现,但其对生物制造的影响却相当有限。原因在于数据匮乏。生物反应器实验成本高、耗时长(数天至数周),且很少以公开形式分享,导致每项研究工作仅拥有少量实验数据。然而,该领域本身拥有丰富的先验知识。生物动力学常微分方程(ODE)模型已用于描述微生物生长数十年,但如何将这些知识注入神经网络尚未得到系统研究。
我们提出了首个系统性的研究,探讨如何将这种 ODE 知识注入神经网络,比较了*数据级先验*(在模拟的 ODE 曲线上预训练通用解码器)与*架构级先验*(将 ODE 嵌入解码器内部)。在 11 个数据集和 7 种微生物物种上,这两种方法均一致优于无先验基线。我们的核心发现是,两者是*可替代的*。在模拟数据上预训练的通用解码器能够匹配在真实数据上训练的完全生物结构化解码器。因此,模拟预训练为生物过程数据匮乏场景下的深度学习提供了一种简单且数据高效的方案。
生物过程, 生物动力学 ODE, 模拟预训练, 人工智能驱动的科学
## 1 引言
参见图注 图 1: 任务概览及本文比较的两种生物动力学先验注入通道。(a) 任务:给定环境条件 e (例如,温度、pH、底物、培养基) 和一组可选的早期观测值 C,预测生物反应器状态轨迹 ŷ(t) (细胞密度或等效测量值)。(b) 两种注入通道:*模拟预训练*从参数化的生物动力学 ODE 生成合成曲线,并用于预训练通用解码器;而*架构级先验*将 ODE 直接嵌入解码器的前向传播中。第 3 节形式化了共享编码器-解码器骨干网络上的这两种通道。
#### 生物过程人工智能的瓶颈
深度学习推动了药物发现早期阶段的重大进展。用于生物分子结构预测、从头蛋白质设计、抗生素发现和细胞模拟的近期系统,如今为分子设计、靶点识别和先导化合物优化做出了实质性贡献。
相比之下,生物制造的下游阶段——即候选分子必须在生物反应器中规模化生产——受到的机器学习关注要少得多。生物反应器实验通常需要数天到数周,消耗大量试剂,并且每种新产品或菌株都需要通过反复试验来重新调整培养条件。在实验运行前预测生物反应器状态(例如细胞密度、底物浓度和产物滴度)将直接缩短周期时间并减少样品消耗,从而为机器学习在这一阶段确立实质性作用。
#### 研究空白
三个结构性因素导致生物过程建模在机器学习社区中研究不足:*实验性质导致的数据匮乏*:每次培养在时间和试剂上都成本高昂,因此任何单个小组能积累的数据本质上有限。*工业机密性*:过程数据被视为商业机密,极少有数据集能够进入公开的、经过整理的形式。*方法层面的碎片化*:其结果是,不同小组的数据集服务于不同目标,方法之间的直接比较很少进行;一个小组的结果很少能迁移到其他小组的数据。这些因素共同解释了为何迄今为止机器学习在生物过程预测方面的进展并不均衡。存在有前景的单数据集案例研究,但统一的经验基线很少见。
#### 生物动力学 ODE 模型
相比之下,微生物生长动力学已被生物动力学 ODE 模型描述了数十年。这些模型以封闭形式描述了细胞水平的动力学。一旦从文献中拟合出生物体特异性参数,就可以为任何生物体合成模拟曲线。这使得生物动力学 ODE 在数据匮乏的环境中成为一种稀有资源:先验知识具有数学精确性、可跨生物体移植且可免费获取。仍然开放的问题只有一个设计问题:*应该将这些知识如何注入神经网络?*
#### 两种先验注入通道
我们考虑两条正交的通道,用于将生物动力学 ODE 知识注入神经网络,遵循物理信息机器学习中偏差注入的广义分类。第一种是*模拟预训练*(数据级先验),其中我们从生物动力学 ODE 生成大型合成数据集,预训练一个解码器,然后在真实数据上微调;在合成数据上预训练在其他数据匮乏场景中已被证明是一种成功的策略。第二种是*架构级先验*,其中 ODE 本身作为模板、混合模型或神经常微分方程骨干网络,嵌入模型的前向传播中。
以往的工作通常只专注于其中一种通道。这两条路径是互补的、可替代的,还是其中一种严格更优,尚未得到研究,尽管它们针对的是相同的基础知识。据我们所知,本文是首个在单一任务、数据集套件和共享骨干网络下对这两种通道进行实证比较的研究。我们还回答了关于*如何构建有效的模拟数据集*(例如,选择哪个 ODE 家族、哪种参数分布以及多少数据量)这一实际问题。图 1 总结了任务及我们比较的模型系列。
我们的贡献总结如下。
1. 据我们所知,这是首个实证研究,在单一任务、共享骨干网络和统一评估下,比较了将生物动力学领域知识注入神经网络的两种通道,即*模拟预训练*和*架构级先验*,涵盖 11 个数据集和 7 种微生物物种。
2. 在这些数据集中,生物动力学先验一致地提升了性能:两种通道都优于无先验基线,并且提升幅度与先验强度单调相关。
3. 模拟预训练是更有效的通道:与其配对的通用神经解码器能够匹配完全生物结构化解码器的性能,表明这两种通道是可替代的,且模拟是更数据高效的路径。
4. 最后,我们提供了构建模拟数据集的实用方案,包含三个发现:随机模拟失败,具有广泛参数采样的复合生物动力学模拟效果最佳,并且预训练至少与联合训练一样有效。
## 2 相关工作
#### 用于生物过程预测的数据驱动机器学习/深度学习
经典的机器学习方法,如 PLSR、SVR、高斯过程和 XGBoost,以及前馈 MLP(例如,用于 CHO mAb 滴度预测),已被稳定应用于生物过程预测。序列模型,如 Bonanni 等人用于 E. coli OD600 预测的 LSTM(这是我们 GRU 基线的基础),以及 Deep Set 或自编码器表示,扩展了相同的数据驱动范式。这些工作将输入-输出映射视为黑箱;生物动力学领域知识很少被显式整合。
#### 生物动力学模型
用于微生物生长的机理 ODE 可以追溯到几十年前。Monod 的饱和动力学、Gompertz/Zwietering、Baranyi & Roberts 的延迟动力学,以及 Luedeking-Piret 产物形成模型,通过耦合的质量平衡 ODE 共同描述了生物质、底物和产物动力学,并可扩展到大型过程模拟器,如 IndPenSim。它们的主要应用在于过程控制验证或软传感器基准测试;将生物动力学 ODE 作为神经网络的训练先验很少受到系统性的关注。
#### 生物动力学信息深度学习
现有方法分为三条路线。PINN(损失级)将生物动力学 ODE 残差作为辅助损失。混合模型(架构级)用神经网络替换质量平衡 ODE 上的反应动力学,或用神经网络估计时变参数。神经常微分方程/通用微分方程(求解器级)在前向传播中放置 ODE 求解器。所有这些工作都将单一的整合路径应用于单一过程;我们解决的空白是在单一任务、数据集套件和共享骨干网络上对两个核心通道(数据级模拟预训练和架构级整合)进行系统性比较。
## 3 方法
### 3.1 生物反应器状态预测
公共生物过程数据集主要来自微生物生长实验,而且分批补料记录很少以经过整理的形式共享,因此我们在本文中将任务公式限制为分批微生物培养。我们将此场景下的生物反应器状态预测形式化为一个条件轨迹回归任务。每次培养运行 i 由一个静态的*环境条件*向量 eᵢ ∈ ℝᵈᵉ 描述,该向量编码了培养参数,如温度、pH、初始底物浓度和培养基组成。可选地,一组*上下文观测值* Cᵢ = {(tₖ, yᵢ,ₖ)}ₖ₌₁ᴷⁱ 提供了在相同培养过程中收集的最多 Kᵢ 个早期测量值;Cᵢ 可能为空。模型预测在任何查询时间 t 的生物反应器状态 ŷᵢ(t) ∈ ℝ,其中 y 表示细胞密度或等效测量值(如 OD600)。监督信息由在培养采样时间网格 Tᵢ = {t₁, ..., t_{Tᵢ}} 上的真实观测值 yᵢ(tⱼ) 提供。
本文中的每个模型将预测器分解为相同的两阶段映射,
zᵢ = Encoder(eᵢ, Cᵢ), ŷᵢ(t) = Decoder(zᵢ, t), (1)
其中 zᵢ ∈ ℝᵈᶻ 是由共享编码器(EnvEncoder + ContextEncoder;参见附录 C)产生的每次培养的潜在表示。只有解码器在不同基线之间有所不同,这使得架构先验成为跨模型变化的唯一来源。
模型针对轨迹回归损失进行训练
Lᵢ = (1/Tᵢ) ∑ⱼ₌₁ᵀⁱ ℓ(ŷᵢ(tⱼ), yᵢ(tⱼ)), (2)
其中 ℓ(·,·) 是一个逐点回归损失。最简单的具体实例是平方误差 ℓ(ŷ, y) = (ŷ - y)²,它产生均方误差(MSE)损失。本文比较的所有基线都共享这种轨迹回归形式;ℓ 的具体选择和评估指标在第 4 节中定义。
### 3.2 注入生物动力学先验的模型
#### 基于组件的混合家族
本文中的每个注入先验的基线都符合一个统一的模板:一个生物动力学先验加上一个小的神经校正,
ŷᵢ(t) = fₚᵣᵢₒᵣ(t; θᵢ) + ε · gθ(state, t, zᵢ), (3)
其中 θᵢ = ParamHead(zᵢ) 且 ε ∈ {0.01, 0.1}。这里 fₚᵣᵢₒᵣ 是一个生物动力学模板(封闭形式或 ODE 解),gθ 是小的神经残差,而 θᵢ 收集了由 ParamHead 从潜在变量 zᵢ 发出的生物体特异性动力学参数(例如,μₘₐₓ, Kₛ, K, k_d)。标量 ε 控制神经校正的影响:小的 ε 有利于先验,而大的 ε 有利于神经网络。在此模板内,我们实例化了四种代表性架构,其先验强度从左到右增加。
#### MLP
我们从无先验的一端开始。此基线是公式 3 中 fₚᵣᵢₒᵣ ≡ 0 的极限情况,其中解码器是一个 4 层全连接 ReLU 网络,没有 ODE 结构。相似文章
多路径自适应门控瓶颈潜变量ODE与拉曼数据融合用于细胞培养过程预测
本文提出了一种门控瓶颈潜变量ODE结合多路径即时微调与拉曼数据融合的方法,以改进哺乳动物细胞培养过程的多日预测,在真实生物反应器数据上取得了更好的性能。
SciML 在现实中的应用:结构先验何时有益、何时有害的诊断研究
本文评估了五种宏观经济预测模型族,发现 ARIMA 和神经常微分方程 (Neural ODE) 等约束较少的模型优于物理信息神经网络 (PINN) 等优先考虑结构约束的模型,表明结构先验在不匹配时可能扮演错误正则化器的角色。
不确定性下的证据引导神经架构选择用于个体化血糖预测
提出EVIDENT框架,该框架整合贝叶斯训练与基于证据的排序进行神经架构选择,并在1型糖尿病的个体化血糖预测中演示,系统地选择泛化可靠的轻量模型。
将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比
# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略:
基于超网络的大语言模型知识注入的缩放定律
本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。