DrugSAGE:自演化智能体经验实现高效最先进的药物发现

arXiv cs.LG 论文

摘要

DrugSAGE是一个框架,能够积累并复用跨任务记忆,高效构建最先进的药物发现模型,在保留任务上比基线智能体性能提升10-30%。

arXiv:2605.15461v1 Announce Type: new 摘要:构建用于药物发现的最先进(SOTA)预测模型需要在工具、架构和训练策略上进行昂贵搜索。当前的基于LLM的智能体可以通过大量试错找到SOTA解决方案,但它们不会保留过程中积累的经验,因此在每个新任务上都需要支付完整的搜索成本。我们提出DrugSAGE(Self-evolving Agent Experience,自演化智能体经验),一个框架,能够跨任务积累并复用经验,高效构建SOTA药物发现模型。DrugSAGE维护一个跨任务记忆,包含经过验证的技能、关于有效策略的统计证据,以及重复出现的错误及其修复记录。在某些情况下,DrugSAGE可以直接转移一个有效的解决方案而无需测试时搜索。在33个分子属性预测任务中,DrugSAGE在单任务设置下排名第一,在9个SOTA智能体中脱颖而出。通过从16个较小任务中积累记忆,DrugSAGE在跨任务评估设置下对17个保留任务实现了平均归一化得分0.935,并在零测试时搜索机制中性能优于所有基线智能体10%-30%。总之,我们的工作展示了跨任务记忆在药物发现中高效开发SOTA模型方面的优势。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:41

# DrugSAGE:自演化智能体经验推动高效最先进药物发现  
来源:https://arxiv.org/html/2605.15461  

Yikun Zhang¹,²,Xiwei Cheng¹,²¹¹footnotemark:¹,Tianyu Liu³¹¹footnotemark:¹,Yuanqi Du⁴,Wengong Jin¹,²  

¹东北大学  
²麻省理工学院与哈佛大学博德研究所  
³耶鲁大学  
⁴微软研究院新英格兰  

###### 摘要  

构建用于药物发现的最先进(SOTA)预测模型需要昂贵的工具、架构和训练策略搜索。当前基于LLM的智能体可以通过大量试错找到SOTA解决方案,但它们不会保留沿途积累的经验,因此每个新任务都要付出全部搜索成本。我们提出DrugSAGE(自演化智能体经验),一个跨任务积累和复用经验以高效构建最先进药物发现模型的框架。DrugSAGE维护一个跨任务记忆系统,包含经过验证的技能、关于有效策略的统计证据以及反复出现的错误及其修复记录。在某些情况下,DrugSAGE无需测试时搜索即可直接迁移经过验证的解决方案。在33个分子性质预测任务中,DrugSAGE在单任务设置下于九个最先进智能体中排名第一。利用从16个较小任务积累的记忆,DrugSAGE在跨任务评估设置的17个保留任务上实现了0.935的平均归一化分数,并在零测试时搜索模式下优于所有基线智能体10-30%。总之,我们的工作展示了跨任务记忆在药物发现中高效开发最先进模型方面的优势。  

## 1 引言  

由大型语言模型驱动的自主智能体日益能够端到端地执行科学研究任务[39]。在生物医学和药物发现领域,Biomni[16]和STELLA[18]等系统已证明基于LLM的智能体可以自动构建数据处理、特征提取和预测建模的工作流程。最近的工作如AutoResearch[19]更进一步,从组装功能性流水线转向主动搜索模型架构、训练配方和预处理策略,以在给定基准上实现最先进(SOTA)性能。实现SOTA准确性对药物发现尤为关键,因为不准确的预测直接转化为实验失败,这需要耗费数千美元和数月努力。然而,构建SOTA模型是一个昂贵的搜索问题[22]。智能体必须从文献中识别相关工具和代码库,将其适应到当前数据集,调整训练配置和超参数,并通过反复试错迭代,所有这些都消耗大量计算和令牌预算。当数据集变大、基础模型微调成本高昂、单次训练运行耗时数小时甚至数天时,这一成本会进一步增加[3]。缓慢的错误反馈使得当前智能体依赖的这种迭代搜索循环变得越来越不切实际。关键的是,大多数现有智能体在每个新任务上独立承担全部成本,在下一个任务开始前丢弃所有搜索经验。因此,它们在药物发现领域数千个不同的预测问题上实现SOTA性能的能力难以扩展。  

在这项工作中,我们提出DrugSAGE(自演化智能体经验),一个跨任务积累和复用经验以高效构建最先进解决方案的框架。DrugSAGE背后的关键观察是,许多药物发现任务具有当前智能体忽视的结构相似性。预测溶解度、结合亲和力和生物活性都涉及相同的输入/输出结构,仅在标签、数据集大小和评估指标上有所不同。当智能体发现某个分子特征化方法表现良好,或者某个特定训练配方能可靠改进一类模型时,没有理由丢弃这一知识。因此,DrugSAGE将每个任务视为并非孤立问题,而是丰富智能体未来任务的经验。它维护一个跨任务记忆,包含经过验证的技能、关于哪些策略通常更有效的统计证据,以及反复出现的失败模式及其修复记录。随着记忆增长,智能体的搜索范围缩小:在新任务上,DrugSAGE不再从头探索全部工具、架构和超参数空间,而是利用先前经验优先考虑可能成功的方法——在某些情况下,甚至无需额外搜索即可直接迁移一个经过验证的解决方案。  

我们在两个基准[15,28]上评估DrugSAGE,包含33个药物性质预测任务,涵盖吸收、分布、代谢、排泄、毒性、结合、溶解度、脂溶性和生物活性。在单任务设置中,DrugSAGE在包括AutoResearch系统、ML自动化智能体和科学发现智能体在内的八个基线智能体中排名第一。利用从16个较小任务积累的跨任务记忆,DrugSAGE在跨任务设置中对17个保留任务实现了0.935的平均分数,并在零测试时搜索模式下优于最佳基线10-30%。总之,本工作做出三项关键贡献:  

- •我们引入DrugSAGE,一个自主智能体,维护一个集成到基于MCTS的搜索循环不同阶段的跨任务记忆,并形式化保证记忆增强的选择策略保留了标准UCB的遗憾界。  
- •与先前工作如AutoResearch[19](其从用户提供或排行榜顶尖模型开始细化)不同,DrugSAGE通过搜索文献和GitHub仓库自动构建技能库,拓宽了搜索空间并消除了对人工策展起点的需求。  
- •我们展示了跨任务记忆实现了零测试时搜索模式:DrugSAGE-ZERO将经过验证的解决方案迁移到新任务而无需测试时搜索。尽管基线在测试时执行20次搜索迭代,DrugSAGE-ZERO仍优于所有基线智能体10-30%。  

## 2 相关工作  

**自动化算法发现智能体。** LLM的最新进展使智能体能够将机器学习中的模型开发自动化,视为在基准数据集上的搜索问题。早期尝试通过从现有开源模型进行检索增强生成来解决这个问题[13,26]。然而,后续工作通过搜索算法来应对[17,35]。最近,多种工作从几个维度改进了先前方法,包括引入智能体结构[41,21]、融入更好的搜索算法[5,11]以及外部知识[25]。DrugSAGE引入了结构化跨任务经验的积累,随着智能体解决连续任务而增长,使后续任务能够以零搜索成本直接检索经过验证的解决方案,或从经验验证的起点进行热启动。  

**智能体经验。** 越来越多的研究为LLM智能体配备持久且可演化的记忆,它们主要区别在于存储内容及其可操作性。情景记忆通过试错级记录帮助立即重试[31],而其他方法将不可执行的见解提炼到语义记忆中[42,6,33]。对于可操作的指导,系统通过维护仅追加的技能库[36]、归纳可复用工作流[38]、管理完整记忆生命周期[10]或通过多智能体反思演化共享知识[29]来发展程序记忆。最近的工作探索了跨任务智能体经验的积累,如[43,34,40]。DrugSAGE结合了两种互补的记忆机制:一个跨任务扩展的可执行技能库,与一个随执行加深的基于性能的记忆配对,从而实现更广泛的搜索覆盖和随时间推移更有针对性的复用。  

**科学发现智能体。** 近年来,随着LLM对代码、工具和科学上下文推理能力的增长,它们开始被实例化为科学发现智能体。一条工作线将LLM嵌入验证器驱动的假设搜索循环中。FunSearch[30]在程序演化循环中使用LLM作为演化算子,而随后大量工作将其能力扩展到程序发现之外[37,32,27]。除了假设搜索,另一种视角是构建编排工具的智能体,如Coscientist[4]和ChemCrow[23]。后续工作[16,18]进一步增强了智能体构建计算工作流的能力。最近,SAGA[8]在自动演化科学发现工作流的目标方面迈出了一步。最相关的工作是Agentomics[24],它构建了一个端到端实验智能体,探索针对给定生物医学数据集的机器学习建模策略。相比之下,DrugSAGE将此设置公式化为跨任务搜索问题,重复使用先前任务中经验验证的策略来播种经验条件化的MCTS,并避免冗余探索。  

## 3 方法论  

**问题定义。** 我们首先定义本文中使用的术语。  

- •**目标任务**为τ=(D_train,D_val,D_test,μ,B),其中D_*表示训练、验证和测试数据;μ是任务指标,如AUROC、AUPRC、RMSE或MAE;B是*搜索预算*,即智能体在迭代搜索过程中可以训练和验证的新候选解决方案数量。  
- •**技能库**K是经过验证的、任务相关的可执行技能集合,包括模型家族、数据集特定方法以及训练策略,如特征化、预处理、类别不平衡损失、采样、调优。  
- •**可执行解决方案**是从K中的技能构建的可运行模型,可能带有类型化编辑。它指定了整个流水线(例如,模型架构、特征化、训练过程),并且仅当能在沙箱中执行时才被包含。*最佳解决方案*是在*验证*集上根据给定任务μ获得最佳评分的解决方案。  
- •**搜索树**包含给定任务的所有可执行解决方案。搜索树中的每个*节点*是模型家族的一个特定实例。每个*边*包含其父节点的类型化编辑,包括模型架构、训练目标、数据处理和集成策略的变化。  

**概述。** DrugSAGE的目标是在搜索预算B内找到最佳解决方案。如图1 (https://arxiv.org/html/2605.15461#S3.F1)所示,DrugSAGE首先通过搜索文献构建可执行技能库K(§3.1 (https://arxiv.org/html/2605.15461#S3.SS1))。然后它维护一个跨任务的经验记忆Z(§3.2 (https://arxiv.org/html/2605.15461#S3.SS2))。当B>0时,DrugSAGE运行记忆增强的蒙特卡洛树搜索算法(MCTS)来搜索可执行解决方案,每一步都配备一个记忆组件(§3.3 (https://arxiv.org/html/2605.15461#S3.SS3))。当B=0时,DrugSAGE执行记忆路由,直接将经过验证的解决方案迁移而无需额外搜索(§3.4 (https://arxiv.org/html/2605.15461#S3.SS4))。我们将此设置称为DrugSAGE-Zero。  

参照标题  
图1:DrugSAGE概述。探索智能体从文献和仓库构建共享技能库K。跨任务记忆Z支持两种设置:经验条件化MCTS(B>0),其中Z引导每一步搜索并被其更新;以及零测试时路由(B=0),其中从Z检索经过验证的解决方案而无需任何新搜索。  

### 3.1 从文献到可执行技能  

科学智能体需要一个开放的搜索空间,但不是无约束的。DrugSAGE将文献和GitHub仓库视为可执行搜索空间的来源。在预算搜索开始之前,探索智能体将新方法添加到共享技能库K中。它遵循发现、落地和验证过程。发现阶段将任务扩展到多个专家视角查询,搜索文献,选择具有可用仓库的相关论文,并编写候选方法的任务记忆。落地阶段克隆选定的仓库,提取公共接口、模型类和使用示例的抽象语法树(AST)API快照,并让LLM使用该快照中观察到的符号编写基于SKILL.md的理解文档。验证阶段运行分级检查,从语法和导入解析到每个技能沙箱中的端到端执行,并在失败时自动修复。只有验证通过的技能才被纳入K。这样,搜索空间可以随领域发展而增长,同时保持可执行性。探索智能体的详细描述见附录H (https://arxiv.org/html/2605.15461#A8)。  

### 3.2 经验记忆  

智能体维护一个跨任务的持久记忆Z=(R,H,Q)。这些记忆为搜索树提供可复用的跨任务证据。解决方案记忆R记录不同模型在不同任务上的性能。此记忆中的每条记录描述搜索树中的一个节点,包括其模型家族、模型架构、超参数、训练过程、数据处理、训练目标、任务描述及其在验证集上的性能。每当新解决方案被添加到搜索树时,R都会更新。此记忆帮助DrugSAGE识别最有希望探索的解决方案。细化记忆H存储搜索树中每条边相关的信息。每条记录包含父节点和子节点的描述、任务描述、LLM建议的编辑(例如,模型架构、训练目标、数据处理的变化);理由(LLM

相似文章

SPADE:通过从稀疏数据中学习加速药物发现

arXiv cs.LG

本文介绍了 SPADE,这是一种用于药物发现的新颖算法,能够仅通过约 40 次测试便从稀疏数据中高效识别出高质量配体。与深度学习和贝叶斯优化方法相比,SPADE 展现了更优的样本效率和速度。

SAGE:基于智能体引导的随机提示优化

arXiv cs.CL

介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。