LabAgent:使用AI代理为科学发现定制任意研究枢纽
摘要
LabAgent是一个AI代理系统,旨在为科学发现定制研究枢纽,实现跨各种生物领域的可重复和连续实验室工作,并超越商业通用代理。
arXiv:2609.13437v1 公告类型:新
摘要:科学研究是一个强调继承的连续过程。前人开发的方法常被新研究者扩展,以探索更新颖和深入的科学问题。然而,实验室人员变动,如学生毕业,导致缺乏能够复现方法的人员。已投入大量努力和资源开发的方法无法延续。为解决这些限制,我们提出LabAgent,一个为实验室连续工作量身定制的复现与发现工具。LabAgent采用两种机制来确保所有技能可执行和可验证,并记录纠正方法和经验,允许直接纠正或避免类似错误。我们将LabAgent应用于生命科学领域的药物性质预测、生物医学问题分析、蛋白质变异效应预测和统计遗传学。LabAgent在每个领域均排名第一,超越商业通用代理,并准确复现已发表图表。总体而言,这些结果表明LabAgent能有效整合并合理扩展实验室知识。
查看缓存全文
缓存时间: 2026/09/15 08:54
# LabAgent:利用AI智能体为科学发现定制任何研究中心 来源:https://arxiv.org/html/2609.13437 Yikun Zhang 所属机构:东北大学计算机科学系 所属机构:MIT与哈佛大学Broad研究所EWSC中心 Jialin Chen 所属机构:耶鲁大学计算机科学系 Wanjia Zhao 所属机构:斯坦福大学计算机科学系 Rex Ying 所属机构:耶鲁大学计算机科学系 Wengong Jin 所属机构:东北大学计算机科学系 所属机构:MIT与哈佛大学Broad研究所EWSC中心 Hua Xu 所属机构:耶鲁大学计算生物学与生物信息学跨系项目 所属机构:耶鲁大学生物医学信息学与数据科学系 James Zou 所属机构:斯坦福大学生物医学数据科学系 Tianyu Liu\* 所属机构:耶鲁大学生物统计学系 所属机构:MIT与哈佛大学Broad研究所EWSC中心 所属机构:耶鲁大学计算生物学与生物信息学跨系项目 所属机构:耶鲁大学生物医学信息学与数据科学系 Hongyu Zhao\* 所属机构:耶鲁大学生物统计学系 所属机构:耶鲁大学计算生物学与生物信息学跨系项目 所属机构:通讯作者,联系邮箱:tianyu\.liu@yale\.edu; hongyu\.zhao@yale\.edu ###### 摘要 科学研究是一个强调传承的连续过程。前人开发的方法常被新研究者扩展,以探索更新颖、更深入的科学问题。然而,实验室人员的变动(如学生毕业)导致缺乏能够复现方法的人力。那些投入大量精力和资源开发的方法因此难以延续。为解决这些限制,我们提出了 **LabAgent**——一个专为实验室持续工作设计的复现与发现平台。LabAgent 采用两种机制:确保所有技能可执行和可验证,并记录修正方法和经验,从而直接纠正或避免类似错误。我们将 LabAgent 应用于生命科学领域的药物属性预测、生物医学问题分析、蛋白质变体效应预测和统计遗传学。在所有领域中,LabAgent 均位列商业通用智能体榜首,并成功精确复现已发表图表。总体而言,这些结果表明 LabAgent 能够有效整合并合理扩展实验室知识。 ###### 关键词 智能体AI,自动研究,智能体平台,计算生物学,蛋白质设计 ## 1 引言 计算方法已成为现代科学发现的核心,尤其在生物学领域(1 (https://arxiv.org/html/2609.13437#bib.bib1)、2 (https://arxiv.org/html/2609.13437#bib.bib2))。从单细胞转录组分析(3 (https://arxiv.org/html/2609.13437#bib.bib3)、4 (https://arxiv.org/html/2609.13437#bib.bib4))、药物属性预测(5 (https://arxiv.org/html/2609.13437#bib.bib5)、6 (https://arxiv.org/html/2609.13437#bib.bib6))、蛋白质变体效应预测(7 (https://arxiv.org/html/2609.13437#bib.bib45))到遗传关联图谱(8 (https://arxiv.org/html/2609.13437#bib.bib7)),研究者已构建了大量模型、算法和数据处理流程,并通过公共代码库、教程和数据集公开共享(9 (https://arxiv.org/html/2609.13437#bib.bib8))。这种开放共享的文化加速了生物学研究:某个实验室开发的方法可被全球同行复现、重用和扩展,使该领域能在先前工作基础上累积进展,而非每次从头开始。 然而在实践中,许多共享工作难以重用。即使代码公开且论文撰写严谨,复现其报告结果往往仍会失败(10 (https://arxiv.org/html/2609.13437#bib.bib9)),因为正确运行方法不仅依赖发布的代码。代码所遗漏的是一系列隐性知识:例如无人记录的预处理步骤、未固定的软件包版本,或仅针对特定数据集手工调整的参数。这些知识专属于产生它们的实验室,仅能通过仓库的细节、分散的议题讨论及个别研究者的记忆默默存续(11 (https://arxiv.org/html/2609.13437#bib.bib10))。随着实验室成员流动,这些知识逐渐流失,导致建立在实际工作基础上的继承能力随之丧失。 因此,另一个目标是构建一个系统,直接从实验室的公开成果(包括论文、代码、教程和议题讨论)中恢复这些知识。该系统应使他人能可靠运行和验证实验室的方法,并基于这些经过验证的方法取得新发现。 大语言模型(LLM)驱动的智能体或许能提供这样的系统。基于LLM的智能体能够阅读代码、调用工具、执行程序并查询外部知识,且已有越来越多智能体应用于科学工作流程。但每个智能体为不同目标设计,无一能提供此类系统所需的完整功能。 - **发现型智能体**(如Google的AI合作科学家)基于现有文献推理新假设,并能提出后续在实验中得到验证的想法(12-20 (https://arxiv.org/html/2609.13437#bib.bib11) 至 (https://arxiv.org/html/2609.13437#bib.bib19))。 - **工程型智能体**(如SWE-agent)能充分理解并执行代码,以解决软件仓库中的实际问题(21-26 (https://arxiv.org/html/2609.13437#bib.bib44) 至 (https://arxiv.org/html/2609.13437#bib.bib24))。 - **基准测试**(如PaperBench)证实这些能力可被量化(27-29 (https://arxiv.org/html/2609.13437#bib.bib25) 至 (https://arxiv.org/html/2609.13437#bib.bib27))。 生物医学研究提出了更严格的基准要求:智能体是否理解某项分析,并能组装出完成该分析的工作流?BiomniBench-DA在多种疾病领域重建已发表论文的分析流程,并根据专家标准对整个过程评分(30 (https://arxiv.org/html/2609.13437#bib.bib48))。GeneBench-Pro提出遗传学与组学领域的多阶段问题,仅对最终估计结果评分(31 (https://arxiv.org/html/2609.13437#bib.bib34))。这些基准各自捕捉了系统所需的能力,但均未围绕特定实验室已验证的方法及其执行流程组织。 发现型智能体依赖通用文献和公共数据库,而非特定实验室开发并验证的方法;工程型智能体孤立处理每项任务,未能将其所学转化为实验室可重用的知识或将其引入发现过程。其中最强大的AI合作科学家虽通过生成、辩论和演化循环运行专用智能体处理已发表文献,并产出经实验验证的假设(12 (https://arxiv.org/html/2609.13437#bib.bib11)),但它既不复现也不验证任何实验室的方法,所提假设仍需他人实现和测试。 因此,整合这些片段不仅需要更强的智能体,更需要一种打包实验室方法背后知识的方式,使其可被他人重用,而非为每个新任务重新构建。 **技能**是帮助智能体完成复现任务的关键因素之一。技能将任务的过程性知识(甚至包括方法通常省略的细节)封装为可重用单元,供智能体按需调用(32 (https://arxiv.org/html/2609.13437#bib.bib28))。在此形式下,知识变得显式且可执行,即使在实验室成员流动后也能存续。手动构建此类技能不具备扩展性,因为实验室的专门知识分布广泛,远超人力手动封装的范围。 近期研究开始自动构建技能库:从代码、文档和论文等异构科学资源中挖掘技能,通过执行验证和修复,并组织成自进化库以提升智能体在科学任务上的表现(33-36 (https://arxiv.org/html/2609.13437#bib.bib29) 至 (https://arxiv.org/html/2609.13437#bib.bib32))。然而,此类工作构建的是面向整个领域的技能库,其知识源于社区共享资源而非单一实验室自身的论文、代码和议题讨论。此外,其技能验证侧重可执行性和通用性,而非针对特定研究报告的复现结果,因此这类系统不复现目标方法,也不验证复现结果与原始结果是否一致。这些库也未能将复现过程中的错误和修正保留为指导后续复现的经验,导致每次复现都需重新开始,而非基于前次进展。最后,它们止步于提升任务性能,未能将实验室的已验证方法用于提出和测试新假设——而这正是重用本应促成的目标。 本文提出 **LabAgent**,一个多智能体框架,能直接从实验室的公开成果实例化特定于实验室的研究智能体。 - **探索智能体**阅读实验室的论文、代码仓库、教程和议题讨论,将其描述的方法与实现代码关联,并综合结果生成可执行技能。每个技能不仅记录方法功能,还记录其运行方式:包括论文省略的预处理步骤、仓库固定的软件包版本,以及用户已报告的故障模式。 - **复现智能体**则运用这些技能:给定新的复现目标,它从先前复现中检索协议和修正方案,组装一组角色专业化的智能体来规划、实现、运行和验证方法,然后将结果与原始研究的指标进行比对。验证基于科学结果本身,而不仅是“无报错”——一个完成但未恢复已发表数据的运行仍视为失败。当运行失败时,智能体将故障定位到特定技能及其失效步骤,修复技能后重试。执行日志、诊断和修正过程被写入持久记忆,使每次新复现都基于前次经验,而非从头开始。 基于通过验证的技能,LabAgent将实验室自身的已验证方法用于提出和测试新的科学假设,从而将科学智能体从任务中心化自动化推向重构实验室研究计划。 ## 2 结果 **LabAgent概述**。我们将LabAgent呈现为复现与发现的平台,并做出三项贡献: 1. **从代码到技能**:构建从实验室公共代码仓库到可执行技能的路径,仅当技能端到端运行后才纳入库。这样构建的库使手工构建的智能体比我们比较的任一商业平台更常落入已发表的误差范围内。 2. **经验记忆化**:将每次运行的经验存入记忆供后续运行读取。每次运行保留清除故障的命令,后续运行则直接调用这些命令。相比之下,商业平台不保留此类记录。 3. **领域适应性**:在生命科学四个领域应用这两种机制,不同领域的已发表记录有所缺失: - **药物属性预测**:方法已命名且代码公开,LabAgent根据各项发布数据重建了Therapeutics Data Commons的排行榜。 - **基因组与单细胞分析**:无公开方案,LabAgent通过一系列依赖决策完成开放分析,并恢复任务中未命名的干扰变量。 - **蛋白质变体效应预测**:无明确方法命名,LabAgent自主从数十种已发表预测器中选择。 - **统计遗传学**:无图表代码,LabAgent重建已发表图表背后的实验,并明确标注其与原图的两处差异。 基于此设计,LabAgent不仅能复现选定方法,还能搜索不同解决方案的组合并产生新发现。我们与最先进智能体平台的对比进一步支持了这一结论。我们在三个基准测试和两个案例研究中评估了该框架。 **图1** (https://arxiv.org/html/2609.13437#S2.F1)a展示了框架结构,智能体与记忆部分将在方法章节描述。 **图1:LabAgent框架** (a) LabAgent框架。目标以任务配置或附带代码仓库、数据集、指标和预算的论文形式传至探索智能体。该智能体搜索文献和代码,将可执行技能存入库中。复现智能体将目标路由至相应技能,加载其经验,并通过从机器探查到故障分析的六个角色处理。它将结果与已发表值比对,返回经过验证的指标、相关脚本、日志、配置以及改进后的技能。虚线路径表示重放已验证技能。持久记忆保存技能、证据、日志、故障与修复的诊断记录,所有阶段均可读写。 (b) 下游应用。结果中的五个场景,从公共排行榜上的药物属性预测到无发布图表代码的精细定位。 (c) 技能生成过程。当目标指定仓库时智能体直接读取,否则搜索代码。两种路径均生成草案,第二次模型调用依据标准检查。只有端到端运行的技能才能入库。 **从实验室代码复现药物属性排行榜**。我们首先选择正确答案已记录的场景:Therapeutics Data Commons的ADMET排行榜在22个数据集上对已发表方法进行排名,每个条目均公布数值及其分布。这22个数据集追踪化合物在体内的过程:6个评估其跨越肠壁进入血液的量,3个评估其进入血液后的分布,6个评估其被哪些细胞色素酶分解……
相似文章
AI智能体团队加速研究速度
使用智能体团队的AI系统,如谷歌的Co-Scientist和FutureHouse的Robin,可以在数小时内而不是数月内加速药物再利用研究,通过提出假设、设计实验和分析数据。
@TheTuringPost: AutoScientists – 一个由智能体组成的研究实验室 @哈佛大学的研究人员将智能体连接成一个自组织的科学…
哈佛大学研究人员提出 AutoScientists,一个没有中央协调器、能够形成自组织科学团队的多智能体系统,在 BioML-Bench 和优化任务上取得了强劲成果。
从提示到协议:实验室自动化的AI代理
本文介绍了一种AI代理,它将大型语言模型与实验室编排软件集成,使科学家能够使用自然语言创建、监控和管理自动化的实验室协议。在三个模拟实验室上的评估显示,该代理实现了97%的首次尝试协议生成成功率,并且所需的界面操作大幅减少。
训练AI科学家以复制研究
Inherent Labs推出了Faraday,一个270亿参数的AI科学家智能体,通过长期强化学习训练以复制科学研究,在论文复制任务上超越了Claude Opus 4.8和GPT-5.5。
一款专为研究目的设计的智能体
一位开发者介绍了一款新的研究型AI智能体,它具备详细规划、敏捷执行和可选循环,并指出目前缺少用于数据安全的沙箱。