TourSynbio-Search:一种大语言模型驱动的蛋白质工程统一搜索方法智能体框架

arXiv cs.AI 论文

摘要

本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。

arXiv:2411.06024v1 公告类型:cross 摘要:蛋白质相关数据库和科学文献的指数级增长,加上对高效生物信息检索日益增长的需求,使得蛋白质工程研究迫切需要统一且易用的搜索方法。我们提出了TourSynbio-Search,一种由TourSynbio-7B蛋白质多模态大语言模型(LLM)驱动的新型生物信息学搜索智能体框架,旨在应对在快速扩展的蛋白质数据库和相应的在线研究文献中进行信息检索所面临的日益严峻的挑战。该智能体的双模块架构由PaperSearch和ProteinSearch组件组成,能够跨多个生物数据库全面探索科学文献和蛋白质数据。TourSynbio-Search的核心采用智能体系统,可解释自然语言查询、优化搜索参数,并在UniProt、PDB、ArXiv和BioRxiv等主要平台上执行搜索操作。该智能体处理直观自然语言查询的能力降低了技术门槛,使研究人员无需具备深厚的生物信息学专业知识即可高效访问和分析复杂的生物数据。通过文献检索和蛋白质结构可视化方面的详细案例研究,我们证明了TourSynbio-Search在简化生物信息检索和提高研究生产力方面的有效性。该框架在弥合复杂生物数据库与研究人员之间的可访问性差距方面取得了进展,有望加速蛋白质工程应用的发展。我们的代码可在以下网址获取:https://github.com/tsynbio/Toursynbio-Search
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:43

# TourSynbio-Search:用于蛋白质工程的统一搜索方法的大型语言模型驱动代理框架

来源:https://arxiv.org/html/2411.06024

Yungeng Liu1,2, Zan Chen1, Yu Guang Wang1,3, Yiqing Shen1,4,\*  
1Toursun Synbio,中国上海  
2香港城市大学计算机科学系,中国香港  
3上海交通大学自然科学研究院,中国上海  
4约翰霍普金斯大学计算机科学系,美国马里兰州巴尔的摩  
\*通讯作者:[email protected]

###### 摘要

蛋白质相关数据库和科学文献的指数级增长,加上对高效生物信息检索需求的日益增加,使得在蛋白质工程研究中迫切需要统一、可访问的搜索方法。我们提出了TourSynbio-Search,一种由TourSynbio-7B蛋白质多模态大语言模型(LLM)驱动的新型生物信息学搜索代理框架,旨在应对在快速扩展的蛋白质数据库和相应在线研究文献中进行信息检索所面临的日益严峻的挑战。该代理的双模块架构由PaperSearch和ProteinSearch组件组成,能够跨多个生物数据库全面探索科学文献和蛋白质数据。TourSynbio-Search的核心采用了一个智能代理系统,该系统能够解释自然语言查询、优化搜索参数,并在包括UniProt、PDB、ArXiv和BioRxiv在内的主要平台上执行搜索操作。该代理处理直观自然语言查询的能力降低了技术门槛,使研究人员无需具备广泛的生物信息学专业知识即可高效访问和分析复杂的生物数据。通过文献检索和蛋白质结构可视化方面的详细案例研究,我们证明了TourSynbio-Search在简化生物信息检索和提高研究生产力方面的有效性。该框架在复杂生物数据库与研究人员之间架起了可访问性的桥梁,有望加速蛋白质工程应用的进展。我们的代码可在https://github.com/tsynbio/Toursynbio-Search获取。

###### 索引术语:

大语言模型(LLMs),多模态LLMs,搜索代理,信息检索

## I 引言

蛋白质相关数据和科学文献的指数级增长,给研究人员在获取和综合蛋白质工程应用相关信息方面带来了前所未有的挑战[1 (https://arxiv.org/html/2411.06024v1#bib.bib1)]。虽然传统的数据库接口提供了全面的覆盖,但往往需要专门的查询语法和跨多个平台的导航,从而给高效信息检索造成了障碍[2 (https://arxiv.org/html/2411.06024v1#bib.bib2)]。尽管检索增强生成(RAG)的最新进展已在一般信息检索任务中展现出可喜的成果,但这些方法在生物领域面临着独特的挑战[3 (https://arxiv.org/html/2411.06024v1#bib.bib3)]。具体而言,当前基于RAG的框架受制于两个关键局限:一是面对快速更新的蛋白质数据库和研究文献难以保持准确性,二是难以准确响应需要领域特定理解的复杂生物查询[4 (https://arxiv.org/html/2411.06024v1#bib.bib4)]。此外,现有的通用搜索框架缺乏处理精确蛋白质特定查询所需的专业理解,并且常常无法为复杂的生物信息请求提供准确的反馈[5 (https://arxiv.org/html/2411.06024v1#bib.bib5)]。这些挑战凸显了对一种将先进自然语言处理能力与专业化生物数据相结合的集成搜索解决方案的需求。

为解决上述局限,我们提出了TourSynbio-Search,一种基于TourSynbio-7B蛋白质多模态大语言模型(LLM)的新型搜索代理框架[6 (https://arxiv.org/html/2411.06024v1#bib.bib6)]。TourSynbio-7B将蛋白质序列直接作为自然语言处理,无需外部编码器,并在蛋白质相关理解任务上达到了最先进的性能[7 (https://arxiv.org/html/2411.06024v1#bib.bib7),8 (https://arxiv.org/html/2411.06024v1#bib.bib8)]。TourSynbio-Search的核心是一个三层代理架构,用于协调智能搜索操作。该架构由用于查询解释的LLM驱动的代理匹配层、用于搜索优化的参数精化层,以及用于协调跨多个来源数据检索的执行层组成。此外,为了提供对生物信息的全面访问,我们开发了一个双模块搜索框架,无缝集成了文献和蛋白质数据检索[9 (https://arxiv.org/html/2411.06024v1#bib.bib9),10 (https://arxiv.org/html/2411.06024v1#bib.bib10)]。PaperSearch模块支持从ArXiv和BioRxiv知识库检索科学文献,而ProteinSearch模块通过集成的PyMOL可视化功能,实现了对PDB和UniProt数据库蛋白质数据的高效访问。这种统一方法消除了研究人员单独导航多个平台的需求。

主要贡献包括三个方面:

- •我们提出了一种三层搜索代理,即TourSynbio-Search。它由采用LLM进行查询分析的代理匹配层、用于搜索优化的参数补充与确认层,以及协调数据检索操作的执行层组成[9 (https://arxiv.org/html/2411.06024v1#bib.bib9),10 (https://arxiv.org/html/2411.06024v1#bib.bib10)]。
- •我们提出了一种统一生物信息访问的双模块搜索框架,其中PaperSearch通过ArXiv[11 (https://arxiv.org/html/2411.06024v1#bib.bib11)]和BioRxiv[12 (https://arxiv.org/html/2411.06024v1#bib.bib12)]处理科学文献检索,而ProteinSearch管理来自PDB[13 (https://arxiv.org/html/2411.06024v1#bib.bib13)]和UniProt[14 (https://arxiv.org/html/2411.06024v1#bib.bib14)]的蛋白质数据获取,并具备集成可视化能力[15 (https://arxiv.org/html/2411.06024v1#bib.bib15)]。
- •我们提出了一种自适应查询处理机制,将自然语言输入转换为结构化数据库查询。它可以自动补充和验证搜索参数,并根据结果质量和用户反馈调整响应。

参见说明

图1:TourSynbio-Search框架架构概览。该框架实现了用于跨生物数据库信息检索的三层代理架构。代理匹配层采用TourSynbio-7B分析用户查询并确定适当的代理路由。参数补充与确认层将自然语言输入处理为结构化数据库查询,允许用户验证提取的参数。动作执行器层协调跨多个来源的数据检索操作,包括用于科学文献的arXiv和bioRxiv,以及用于蛋白质数据的PDB和UniProt。如果未找到匹配的代理,TourSynbio-Search将默认回退到与TourSynbio-7B的直接对话模式。该框架为每个数据源集成了专门的搜索策略,同时保持统一的用户界面,如示例查询所示:LLM驱动的蛋白质设计论文搜索。

## II 方法

### II-A Toursynbio-7B

我们搜索框架的核心是Toursynbio-7B,这是一种基于InternLM2-7B[16 (https://arxiv.org/html/2411.06024v1#bib.bib16),6 (https://arxiv.org/html/2411.06024v1#bib.bib6)]构建的、专注于蛋白质领域的专用多模态LLM。该模型在ProteinLMDataset上进行了微调。ProteinLMDataset是我们整理的精选数据集,包含174.6亿个token的多样化蛋白质相关内容,涵盖科学文献、蛋白质序列、结构数据以及跨多种语言的功能注释[17 (https://arxiv.org/html/2411.06024v1#bib.bib17)]。Toursynbio-7B的架构使得蛋白质序列可以被直接作为自然语言处理,无需外部编码器或嵌入。这一独特能力促进了蛋白质特定知识与通用语言理解的无缝集成,使其特别适合生物信息检索任务。

### II-B 搜索代理架构

我们的搜索代理架构扩展了TourSynbio-7B的能力,以解决蛋白质工程研究中的两个关键局限:蛋白质信息的实时获取和科学发展的自动跟踪。如图1 (https://arxiv.org/html/2411.06024v1#S1.F1)所示,该架构由三个主要组件组成:代理匹配、参数精化和执行,三者协同工作以提供全面的搜索功能。

遵循TourSynbio-Agent[6 (https://arxiv.org/html/2411.06024v1#bib.bib6)]的设计,代理匹配层作为框架的初始接口,决定传入查询是需要专门的代理干预,还是可以直接由TourSynbio-7B的基础能力处理。该层为每个相应的代理使用精心设计的分类提示词,例如用于蛋白质结构预测的ESMFold[18 (https://arxiv.org/html/2411.06024v1#bib.bib18)]和用于蛋白质设计的Chroma[19 (https://arxiv.org/html/2411.06024v1#bib.bib19)]。在TourSynbio-Search中,代理裁判搜索代理,即PaperSearch代理或ProteinSearch代理。分类过程利用精心设计的提示词,并通过思维链推理和少样本学习提示来增强,以准确地将查询路由到适当的代理。

为了确保精确的查询路由,我们实现了一种将预定义关键词与模糊匹配能力相结合的混合分类方法。例如,我们识别数据库特定术语,如“UniProt”和“ArXiv”,同时保持理解自然语言查询变体的灵活性。这种双方法提高了分类准确性,同时保持了自然的交互模式。代理匹配过程并行运行,同时评估多个潜在的代理路径以确定最佳响应策略。这种并行处理设计能够快速评估查询,并确保涉及多个代理专业知识的复杂查询被正确识别和路由。TourSynbio-7B生成相关代理的优先级列表,如图1 (https://arxiv.org/html/2411.06024v1#S1.F1)所示,从而实现了搜索框架不同专门组件之间的无缝协调。

参见说明

图2:TourSynbio-Search中双模块搜索界面的演示。界面分为三个主要部分:(1) 左侧的模型选择面板,允许用户选择合适的LLM配置和代理模式;(2) 中心的PaperSearch代理,展示文献检索能力、参数确认界面以及蛋白质工程论文的搜索结果;(3) 右侧的ProteinSearch代理,展示集成的蛋白质结构可视化和自动化数据检索功能。该界面展示了框架在处理文献和蛋白质数据查询时的统一方法,同时保持用户对搜索参数和结果呈现的控制。示例显示了实时搜索“TourSynbio”相关出版物以及蛋白质结构分析,展示了该框架通过其专门代理架构处理多种数据类型的能力。  
这是TourSynbio Search框架用于判断是否进入搜索代理的提示词,其中利用了CoT和少样本等技术来提高LLM解析的准确性。我们指定了LLM的分析过程,并为其提供了一个具体示例。通过该提示词,LLM将判断是否调用搜索代理。  
你是一名专业的信息提取助手,能够从输入中判断用户是否希望调用搜索功能。如果是,则返回True;否则返回False。  
如果用户希望进行搜索,我们应该从用户输入中解析以下信息:PDB ID、UniProt ID、论文关键词、ArXiv、BiorXiv。  
在分析过程中,请遵循以下思考过程:  
确定用户的需求或任务。  
根据用户的输入,判断其需求是否与搜索相关。  
如果用户的输入表明他们不希望使用搜索功能,或者无法分析其意图,则返回False;否则返回True。  
如果用户的输入未提供执行搜索所需的信息,则返回False;否则返回True。  
以下是一个参考示例:  
问:搜索三篇与CNN相关的论文。  
思考过程:用户希望搜索与“Attention is all you need”相关的论文,这与搜索相关;我们可以明确识别用户的意图,且指定搜索的论文数量为三篇。因此,我们确定用户希望调用论文搜索功能,返回True。  
答:True  
现在,请分析以下输入:  
问:

如果没有专门代理被识别为相关(分类输出中所有值为“False”),则代理默认使用TourSynbio-7B的基础对话能力。相反,检测到任何“True”值将触发专门代理路径,根据分类结果将查询定向到最合适的专家代理。当搜索代理(即PaperSearch或ProteinSearch)被激活时,TourSynbio-7B使用精心设计的提示词实现参数提取协议。该提取过程识别必要的搜索参数,如关键词、数据库偏好和特定搜索约束。LLM自动区分以论文为中心和以蛋白质为中心的查询,并将它们路由到PaperSearch或ProteinSearch代理进行专门处理。

为了优化搜索效率和准确性,我们加入了交互式参数精化界面。该确认阶段允许用户在查询执行前验证和修改提取的搜索参数。界面以结构化格式呈现解释后的搜索参数,使用户能够微调查询并确保其与研究目标一致。这种人在回路设计减少了计算开销,同时通过消除用户意图潜在误解来提高搜索精度。

这是TourSynbio Search框架用于解析用户输入的提示词。我们为PaperSearch和ProteinSearch实现了不同的解析策略约束。通过该提示词,LLM将返回用户输入中参数的解析结果。  
你是一名信息提取助手。你需要执行以下步骤:  
首先,从用户输入中提取用户希望使用的搜索类别,在PaperSearch和ProteinSearch之间进行选择。  
接下来,如果用户希望使用PaperSearch,你需要解析搜索关键词(query)和所需论文数量(paper_num)。按以下格式返回结果:“query: xxx, paper_num: y, Mode: 'paper'”。  
如果用户希望使用ProteinSearch,提取搜索关键词并按以下格式返回:“query: xxx, Mode: 'protein'”。  
示例:  
问:搜索三篇与CNN相关的论文  
答:query: 'CNN', paper_num: 3, Mode:

相似文章

Large Discovery Models: 基于实证的模型驱动开放式搜索

Hugging Face Daily Papers

本文介绍了 Large Discovery Model (LDM),这是一种循环架构,将生成模型与贝叶斯非参数替代模型耦合,以指导在分子和蛋白质等科学领域的不确定性感知搜索,相比现有方法实现了显著的性能提升。

面向多样化科学假设搜索的大语言模型方法

Hugging Face Daily Papers

本文提出了一种受并行回火启发的进化框架,该框架利用多温度采样和信息交换,提高了大语言模型生成科学假设的多样性和质量,并在分子发现、方程发现和算法发现等领域中得到了验证。