DrugGen 2:一种疾病感知的语言模型,用于增强药物发现
摘要
DrugGen-2通过监督学习和强化学习(GRPO)微调GPT-2,在疾病本体和靶点蛋白质序列条件下生成小分子,实现了药物发现中更高的多样性和结合亲和力。
查看缓存全文
缓存时间: 2026/07/10 10:10
论文页面 - DrugGen 2: 一种面向疾病的语言模型,助力药物发现
来源:https://huggingface.co/papers/2607.08404
摘要
DrugGen-2通过对GPT-2进行监督学习和强化学习(使用GRPO)的微调,生成基于疾病本体论和靶点蛋白序列的小分子,相比基线模型,在分子多样性和结合亲和力方面表现出更优的性能。
当前的计算药物设计方法通常专注于生成针对特定靶点或一般分子性质的分子,往往忽视了疾病背景对靶点行为和治疗结果的影响。为弥补这一空白,我们引入了DrugGen-2,一种新颖的生成模型,能够同时基于疾病本体论和靶点蛋白序列设计小分子。DrugGen-2通过微调预训练的GPT-2(https://huggingface.co/papers?q=GPT-2)模型而开发,该模型在包含已批准药物及其相关疾病和靶点的精选数据集上进行训练,采用两步策略:先进行监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning),然后通过组相对策略优化(https://huggingface.co/papers?q=group%20relative%20policy%20optimization)(GRPO)进行强化学习(https://huggingface.co/papers?q=reinforcement%20learning)。这一过程由奖励函数引导,优化化学有效性(https://huggingface.co/papers?q=chemical%20validity)、新颖性、多样性以及高预测结合亲和力(https://huggingface.co/papers?q=binding%20affinity)。在针对糖尿病肾病相关的五个蛋白靶点进行评估时,DrugGen-2显著优于基线模型(DrugGPT和DrugGen)。它展现出生成独特分子的更优能力,与已批准药物具有更高的结构相似性,并在所有靶点上实现了更好的预测结合亲和力。分子对接(https://huggingface.co/papers?q=Molecular%20docking)分析进一步支持了这些发现,识别出具有强结合潜力的候选配体,包括预测亲和力(-9.917、-9.485和-9.367)超过参考药物(如血管紧张素转换酶的依那普利,-8.283)的化合物。通过将疾病特定背景融入分子生成(https://huggingface.co/papers?q=molecular%20generation),DrugGen-2推进了AI辅助的药物发现,为零起点设计和药物重定位提供了强大工具,充分考虑了疾病与分子靶点之间的复杂相互作用。
查看arXiv页面(https://arxiv.org/abs/2607.08404)查看PDF(https://arxiv.org/pdf/2607.08404)项目页面(https://huggingface.co/spaces/alimotahharynia/DrugGen-2)GitHub0(https://github.com/alimotahharynia/DrugGen-2)添加到集合(https://huggingface.co/login?next=%2Fpapers%2F2607.08404)
在你的代理中获取此论文:
hf papers read 2607.08404
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
alimotahharynia/DrugGen-2 文本生成 • 0.1B • 更新于约2小时前 • 182(https://huggingface.co/alimotahharynia/DrugGen-2)
引用此论文的数据集1
alimotahharynia/approved_disease_target_drug 查看器 • 更新于约2小时前 • 154k • 47(https://huggingface.co/datasets/alimotahharynia/approved_disease_target_drug)
引用此论文的Space1
包含此论文的集合0
没有包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
通过口袋条件扩散和属性感知优化生成可开发的3D分子
本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。
基因表达指导的联合控制生成式模型用于精准分子设计
本文提出JoPMol,一种联合控制的精准分子生成模型,整合基因表达谱、分子结构文本和化学性质,生成个性化候选药物,性能优于现有最先进方法。
基于自然语言引导的生成器无关的蛋白粘合剂设计短名单筛选方法
本文探讨了使用大型语言模型生成排名策略,从候选池中筛选蛋白粘合剂,在从头设计工作流中相较于基线方法显示出适度的性能提升。
DrugSAGE:自演化智能体经验实现高效最先进的药物发现
DrugSAGE是一个框架,能够积累并复用跨任务记忆,高效构建最先进的药物发现模型,在保留任务上比基线智能体性能提升10-30%。
将零散证据转化为生命科学发现决策
OpenAI 在 Codex 中推出的全新生命科学模型“GPT-Rosalind”通过协调多个专业子代理,将遗传学、转录组学、安全性和知识产权数据融合为单一证据支持的决策,自主对哮喘药物靶点进行排序。