AutoProteinEngine:用于蛋白质工程中多模态AutoML的大语言模型驱动智能体框架
摘要
介绍了AutoProteinEngine(AutoPE),这是一个由大语言模型驱动的智能体框架,使不具备深度学习专业知识的生物学家能够通过自然语言执行蛋白质工程中的多模态AutoML,展示了相比零样本和手动微调方法的性能提升。
arXiv:2411.04440v1 公告类型:cross
摘要:蛋白质工程对于生物医学应用非常重要,但传统方法往往效率低下且资源密集。虽然深度学习(DL)模型已显示出潜力,但对于没有专业计算知识的生物学家来说,将其训练或应用于蛋白质工程仍然具有挑战性。为了解决这一差距,我们提出了AutoProteinEngine(AutoPE),一个利用大型语言模型(LLM)进行蛋白质工程多模态自动机器学习(AutoML)的智能体框架。AutoPE创新性地允许没有DL背景的生物学家使用自然语言与DL模型交互,降低了蛋白质工程任务的入门门槛。我们的AutoPE独特地将LLM与AutoML相结合,以处理蛋白质序列和图两种模态的模型选择、自动超参数优化以及从蛋白质数据库自动检索数据。我们通过两个真实世界的蛋白质工程任务评估了AutoPE,证明其相比传统零样本和手动微调方法有显著性能提升。通过弥合DL与生物学家领域专业知识之间的差距,AutoPE使研究人员无需大量编程知识即可利用DL。我们的代码可在https://github.com/tsynbio/AutoPE获取。
查看缓存全文
缓存时间: 2026/08/06 07:43
# 面向蛋白质工程多模态AutoML的大语言模型驱动智能体框架 Source: https://arxiv.org/html/2411.04440 Yungeng Liu1,2,††\\dagger†,Zan Chen1,††\\dagger†,Yu Guang Wang1,3,Yiqing Shen4,\*, 1Toursun Synbio, Shanghai, China2City University of Hong Kong, Hong Kong SAR 3Shanghai Jiao Tong University, Shanghai, China4Johns Hopkins University, Baltimore, USA ††\\dagger†Equal Contribution\.\*Corresponding Author:Yiqing Shen \(yiqingshen1@gmail\.com (https://arxiv.org/html/2411.04440v1/[email protected])\) ###### 摘要 蛋白质工程在生物医学应用中至关重要,但传统方法往往效率低下且资源密集。虽然深度学习(DL)模型已展现出潜力,但对于缺乏专业计算知识的生物学家而言,将这些模型训练或应用到蛋白质工程中仍然充满挑战。为解决这一问题,我们提出了AutoProteinEngine(AutoPE),一个利用大语言模型(LLMs)进行多模态自动化机器学习(AutoML)的智能体框架,专门用于蛋白质工程。AutoPE的创新之处在于,它允许没有深度学习背景的生物学家使用自然语言与深度学习模型交互,从而降低了蛋白质工程任务的门槛。我们的AutoPE独特地将LLMs与AutoML相结合,以处理蛋白质序列和图两种模态的模型选择、自动超参数优化以及从蛋白质数据库自动检索数据。我们通过两个真实世界的蛋白质工程任务对AutoPE进行了评估,结果表明,与传统零样本和手动微调方法相比,AutoPE取得了显著的性能提升。通过弥合深度学习与生物学家领域专业知识之间的鸿沟,AutoPE使研究人员无需大量编程知识即可利用深度学习。我们的代码可在https://github.com/tsynbio/AutoPE获取。 AutoProteinEngine:面向蛋白质工程多模态AutoML的大语言模型驱动智能体框架 ## 1 引言 蛋白质工程专注于设计和优化具有增强及定制功能的蛋白质,在药物发现、酶优化和生物材料设计等广泛的生物医学应用中发挥着关键作用(Brannigan and Wilkinson 2002 (https://arxiv.org/html/2411.04440v1#bib.bib2);Carter 2011 (https://arxiv.org/html/2411.04440v1#bib.bib4))。传统的蛋白质工程方法,如定向进化和理性设计,往往受到效率低、成功率低和资源需求高的制约(Goldsmith and Tawfik 2012 (https://arxiv.org/html/2411.04440v1#bib.bib9))。深度学习(DL)模型,如ESM系列(Lin et al. 2023 (https://arxiv.org/html/2411.04440v1#bib.bib13);Verkuil et al. 2022 (https://arxiv.org/html/2411.04440v1#bib.bib18);Rives et al. 2021 (https://arxiv.org/html/2411.04440v1#bib.bib16))和AlphaFold系列(Jumper et al. 2021 (https://arxiv.org/html/2411.04440v1#bib.bib10);Evans et al. 2021 (https://arxiv.org/html/2411.04440v1#bib.bib8))模型,提升了蛋白质结构预测、蛋白质-蛋白质相互作用理解以及蛋白质工程中其他任务的效率和准确性。然而,针对特定蛋白质工程任务训练或微调这些深度学习模型,对缺乏专业编码和机器学习知识的生物学家来说,构成了重大挑战(Yang et al. 2019 (https://arxiv.org/html/2411.04440v1#bib.bib22))。具体来说,深度学习模型的复杂架构要求对DL原理有深入理解,才能有效地解释和修改。优化模型性能还需调整超参数,这一过程严重依赖机器学习的经验和直觉。此外,将蛋白质数据准备为模型输入往往需要专门的预处理技术。最后,蛋白质数据的多模态特性进一步增加了复杂性,因为蛋白质可以以序列和蛋白质图两种格式表示,这给模型训练和优化增加了额外难度。 尽管自动化机器学习(AutoML)(Waring et al. 2020 (https://arxiv.org/html/2411.04440v1#bib.bib19))已被引入以减少训练DL模型的人工投入(Xiao et al. 2022 (https://arxiv.org/html/2411.04440v1#bib.bib21);Chen et al. 2021 (https://arxiv.org/html/2411.04440v1#bib.bib5)),现有的AutoML框架仍然需要大量的深度学习和编程专业知识。这限制了缺乏计算背景的生物学家使用这些框架(Luo et al. 2024 (https://arxiv.org/html/2411.04440v1#bib.bib14))。此外,这些框架通常为通用任务设计,因此缺乏蛋白质工程的领域特定知识,限制了其处理蛋白质序列和蛋白质图的能力。为应对这些挑战,我们提出了一个利用大语言模型(LLMs)的智能体框架,专门用于蛋白质工程的多模态AutoML。LLMs的优势在于可以以对话方式与模型交互,这能降低用户的学习曲线(Zhang et al. 2024 (https://arxiv.org/html/2411.04440v1#bib.bib23);Shen et al. 2024 (https://arxiv.org/html/2411.04440v1#bib.bib17))。我们的方法旨在弥合DL模型与生物学家领域专业知识之间的鸿沟,在整合处理多模态蛋白质数据所需领域特定知识的同时,实现更高效、更易用的蛋白质工程工作流。 本研究的主要贡献有三个方面。首先,我们提出了一个创新的基于LLM的智能体框架,专门用于蛋白质工程任务的多模态AutoML,即AutoProteinEngine(AutoPE)。据我们所知,这是首次尝试构建面向蛋白质工程的多模态AutoML框架,能够同时处理蛋白质序列和蛋白质图。值得注意的是,AutoPE允许用户通过与框架的对话交互来执行AutoML任务。其次,为进一步提升性能,我们提出了一个自动超参数优化模块,通过LLM进行超参数搜索。最后,我们提出了一种自动数据检索方法,能够利用自然语言描述,从PDB和UniProt等蛋白质数据库中无缝检索数据。 参见图注图1:AutoProteinEngine(AutoPE)框架概览。该图展示了AutoPE的端到端工作流,集成了用于蛋白质工程任务的LLM驱动的AutoML。该框架由三个主要组件组成:(1)用户友好的聊天界面,用于自然语言任务描述和数据输入;(2)AutoML模块,负责任务验证、数据预处理、模型选择,以及自动HPO模块,用于自动化超参数搜索;(3)自动数据检索模块,用于从UniProt和PDB等数据库获取蛋白质相关数据。它支持多模态蛋白质数据(蛋白质序列和结构),并在整个工作流中提供交互式反馈。 ## 2 方法 ### 2.1 LLM驱动的AutoML AutoPE的核心是其AutoML模块,该模块包含一个核心AutoML组件,可自动化蛋白质工程任务的任务验证、数据预处理、模型选择与配置以及模型训练(Erickson et al. 2020 (https://arxiv.org/html/2411.04440v1#bib.bib7))。该模块由LLM驱动,提供了一个用户友好的界面,使没有大量计算专业知识的用户(如生物学家)能够用自然语言指定他们的任务。 用户用自然语言描述其蛋白质工程任务,例如“我需要训练一个模型来预测给定蛋白质序列的突变”。然后,LLM评估该输入,以判断其是否符合AutoPE的能力范围。这一任务验证阶段通过一个包含蛋白质工程任务上下文和AutoPE功能的提示(prompt)来实现。具体来说,LLM被指示根据模型选择阶段可用的模型库来判断任务是否属于有效类别,例如蛋白质稳定性预测、蛋白质-蛋白质相互作用预测、酶活性预测或蛋白质突变。如果任务不够明确或超出AutoPE的范围,它会通过对话澄清或改进请求。 任务验证通过后,LLM分析输入,在行动前制定计划。该计划包括数据预处理策略、模型选择和配置阶段,后者从预定义模型库(如ESM系列、AlphaFold)中选择模型。LLM使用基于相关文献的检索增强生成(RAG)生成该计划,纳入蛋白质工程的领域特定知识,以确保任务的所有方面都得到处理。 在数据预处理阶段,如果输入数据不完整,AutoPE的数据检索模块就会发挥作用。它通过访问在线资源(包括PDB(蛋白质数据银行)和UniProt数据库)来补充数据。这一过程也由LLM指导,LLM根据任务需求制定合适的数据库查询。 在数据集完整且计划制定完成后,AutoPE进入模型选择和配置阶段。AutoPE通过从预定义模型库中选择和配置适当的模型来执行计划。对于涉及多模态数据(包括蛋白质的序列和图表示)的任务,AutoPE实现了一种晚期融合方案。具体来说,它结合不同模态的嵌入,使AutoPE能够利用序列和结构数据中的互补信息。 在训练阶段,LLM被提示通过融入模型特定的优化来改进预定义的通用训练框架。这包括选择合适的损失函数、根据所选模型和数据集大小确定最佳批大小和学习率,以及实施早停和模型检查点以防止过拟合。LLM还应用任务特定的数据增强技术,例如对序列数据进行随机突变或对结构数据进行图扰动。对于基于Transformer的模型(如ESM),它根据任务类型微调注意力机制或预测头。AutoPE的整体框架如图1 (https://arxiv.org/html/2411.04440v1#S1.F1)所示。 ### 2.2 自动超参数优化 为了进一步提升AutoPE的性能和可用性,我们引入了一个自动超参数优化(HPO)模块,该模块支持通过用户的自然语言指导进行HPO搜索,并提供更好的结果解释。Auto HPO模块的核心包含两个阶段,即树结构帕森估计器(TPE)和异步连续减半算法(ASHA)(Watanabe 2023 (https://arxiv.org/html/2411.04440v1#bib.bib20);Li et al. 2018 (https://arxiv.org/html/2411.04440v1#bib.bib11))。TPE算法通过对配置产生良好性能的概率进行建模来优化超参数配置,定义为x∗=argmaxxl\(x\)g\(x\)x^{\*\}=\\arg\\max\_\{x\}\\frac\{l\(x\)\}\{g\(x\)\}italic\_x start\_POSTSUPERSCRIPT ∗ end\_POSTSUPERSCRIPT = roman\_arg roman\_max start\_POSTSUBSCRIPT italic\_x end\_POSTSUBSCRIPT divide start\_ARG italic\_l \( italic\_x \) end\_ARG start\_ARG italic\_g \( italic\_x \) end\_ARG,其中x∗x^{\*}italic\_x start\_POSTSUPERSCRIPT ∗ end\_POSTSUPERSCRIPT表示最优超参数配置,l\(x\)l\(x\)italic\_l \( italic\_x \)和g\(x\)g\(x\)italic\_g \( italic\_x \)分别是高绩效和低绩效配置的似然函数。TPE方法使AutoPE能够高效地探索超参数空间,聚焦于更可能产生改进性能的区域。作为TPE的补充,ASHA调度器通过多保真度方法优化资源分配,描述如下: risubscriptri\\displaystyle r\_\{i\}italic\_r start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT =rmin⋅ηiabsent⋅subscriptrsuperscriptηi\\displaystyle=r\_\{\\min\}\\cdot\\eta^\{i\}= italic\_r start\_POSTSUBSCRIPT roman\_min end\_POSTSUBSCRIPT ⋅ italic\_η start\_POSTSUPERSCRIPT italic\_i end\_POSTSUPERSCRIPT (1)nisubscriptni\\displaystyle n\_\{i\}italic\_n start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT =⌊nηi⌋absentnsuperscriptηi\\displaystyle=\\left\\lfloor\\frac\{n\}\{\\eta^\{i\}}\\right\\rfloor= ⌊ divide start\_ARG italic\_n end\_ARG start\_ARG italic\_η start\_POSTSUPERSCRIPT italic\_i end\_POSTSUPERSCRIPT end\_ARG ⌋ TT\\displaystyle Titalic\_T =∑i=0⌊logη\(n\)⌋ni⋅ri,absentsuperscriptsubscripti0subscriptηn⋅subscriptnisubscriptri\\displaystyle=\\sum\_\{i=0\}^\{\\lfloor\\log\_\{\\eta\}\(n\)\\rfloor\}n\_\{i\}\\cdot r\_\{i\},= ∑ start\_POSTSUBSCRIPT italic\_i = 0 end\_POSTSUBSCRIPT start\_POSTSUPERSCRIPT ⌊ roman\_log start\_POSTSUBSCRIPT italic\_η end\_POSTSUBSCRIPT \( italic\_n \) ⌋ end\_POSTSUPERSCRIPT italic\_n start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT ⋅ italic\_r start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT ,其中,risubscriptrir\_\{i\}italic\_r start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT表示第iiiitalic\_i次迭代时的资源分配,nisubscriptnin\_\{i\}italic\_n start\_POSTSUBSCRIPT italic\_i end\_POSTSUBSCRIPT表示被评估的配置数量,TTTitalic\_T是总计算预算。ASHA允许提前终止表现不佳的实验,将资源动态重新分配给更有前景的配置。 AutoPE利用Ray\.Tune(Liaw et al. 2018 (https://arxiv.org/html/2411.04440v1#bib.bib12))管理HPO过程,其中LLM在启动优化之前总结和验证用户输入。在HPO之前,AutoPE与用户交互以确认超参数设置或建议额外配置,这使研究人员能够利用其领域知识,同时受益于LLM在复杂超参数空间中导航的能力。在HPO过程中,AutoPE在整个优化过程中提供反馈,传达进展和结果,将数值指标(如MSE或F1分数)转换为用户友好的自然语言摘要,如图2 (https://arxiv.org/html/2411.04440v1#S2.F2)所示。这增强了优化过程的可解释性,使用户能够深入了解不同超参数配置的性能趋势。超参数优化过程中的资源管理同样通过LLM交互来实现。用户可以通过自然语言命令指定计算偏好,例如分配给每次试验的GPU数量。 ### 2.3 自动数据检索 AutoPE的自动数据检索模块简化了蛋白质工程任务中预训练和微调模型所需关键蛋白质相关数据的获取。它提供了用户友好的设计,可通过自然语言查询指定数据需求。用户可以请求各种格式的数据,包括蛋白质序列、PDB结构、UniProt ID或一般蛋白质描述,LLM负责解释这些请求。例如,如果用户输入“我需要人胰岛素(human insulin)的序列和结构数据”,LLM会处理这个自然语言查询,并将其转化为具体的数据检索任务。具体来说,它会识别关键元素,如蛋白质名称(胰岛素)、生物体(人)以及所需数据类型(序列和结构)。在解析用户请求后,自动数据检索模块
相似文章
TourSynbio-Search:一种大语言模型驱动的蛋白质工程统一搜索方法智能体框架
本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。
AutoTrainess:自主教语言模型改进语言模型
AutoTrainess 提出了一种语言模型智能体框架,通过将人工工作流外部化为明确的接口(包括规划、数据准备、训练、评估和日志记录)来自动化后训练过程,在 PostTrainBench 上相较于仅 CLI 的基线实现了显著提升。
Pepti-Agent:用于多肽设计与优化的人工智能代理
Pepti-Agent是一个用于治疗性多肽设计的闭环AI框架,它利用MCP工具和LLM控制器,基于多属性配置文件迭代优化序列,解决了溶解度、溶血性和非特异性吸附等约束条件。
用于三维框架系统自动化结构分析的智能体大语言模型
本文提出了一种基于自然语言输入的三维框架系统自动化结构分析的智能体大语言模型框架,通过多智能体流水线在十个代表性三维框架上实现了90%的准确率。
使用大型语言模型驱动的代理系统自动发现生物系统的常微分方程
本文介绍了MEDA,一个由LLM和符号回归驱动的代理框架,用于自动发现生物动态系统的常微分方程(ODE)模型。它检索背景知识,提出候选ODE,并在典型模型检索、外推和开放式发现任务中评估这些模型,展示了强大的结构恢复能力和生物学上合理的模型。