基于智能体工具规划的分子先导优化
摘要
TRACE是一种轨迹感知的LLM智能体,用于分子先导优化,通过对分子优化工具进行顺序决策,在保持分子相似性的同时改善ADMET性质。
arXiv:2605.28862v1 公告类型:新
摘要:药物发现是一个漫长且资源密集的过程,由多个阶段组成。在这些阶段中,先导优化在将早期命中化合物转化为可行的候选药物方面起着关键作用。这一阶段需要通过精细的结构修饰来改善与ADMET相关的性质,同时保留负责与疾病靶点结合亲和力的关键分子子结构。人工智能的最新进展在加速药物发现的各个方面显示出潜力;然而,现有的大多数先导优化方法依赖于一步式分子优化,未能考虑顺序设计决策的长期后果。为解决这一局限,我们提出了TRACE,一种轨迹感知的、基于LLM推理的分子先导优化智能体,它将工具选择形式化为一个关于行动轨迹的顺序决策问题。给定一个先导分子和优化目标,TRACE会对分子优化工具做出轨迹感知的决策,从而在结构约束下实现前瞻性优化。在多个ADMET优化任务上的实验表明,与基线模型相比,我们的智能体在保持分子相似性的同时,实现了更高的优化成功率、更大的性质改进和更高的有效性。
查看缓存全文
缓存时间: 2026/05/29 09:11
# 基于工具规划的分子先导化合物优化 来源:https://arxiv.org/html/2605.28862 ,Haobo Zhang密歇根大学安娜堡密歇根州美国haobozha@umich\.edu (https://arxiv.org/html/2605.28862v1/mailto:[email protected]),Ruohao Fan加州大学戴维斯分校生物化学与分子医学系戴维斯加州美国rhfan@health\.ucdavis\.edu (https://arxiv.org/html/2605.28862v1/mailto:[email protected]),Bin Chen密歇根州立大学药理学与毒理学系东兰辛密歇根州美国chenbi12@msu\.edu (https://arxiv.org/html/2605.28862v1/mailto:[email protected])和Jiayu Zhou密歇根大学安娜堡密歇根州美国jiayuz@umich\.edu (https://arxiv.org/html/2605.28862v1/mailto:[email protected]) ###### 摘要。药物发现是一个漫长且资源密集的过程,由多个阶段组成。在这些阶段中,先导化合物优化在将早期命中化合物转化为可行的药物候选分子方面发挥着关键作用。这一阶段需要通过微妙的结构修饰来改善ADMET相关性质,同时保留负责与疾病靶点结合亲和力的关键分子子结构。近期人工智能的进展在加速药物发现各个方面的应用中显示出前景;然而,大多数现有的先导化合物优化方法依赖于一步式分子优化,未能考虑连续设计决策的长期后果。为解决这一局限性,我们提出了TRACE,一个具有轨迹感知能力、基于大语言模型推理的分子先导化合物优化智能体,它将工具选择表述为行动轨迹上的序列决策问题。给定一个先导分子和一个优化目标,TRACE在分子优化工具上做出轨迹感知的决策,从而在结构约束下实现前瞻性优化。在多项ADMET优化任务上的实验表明,与基线模型相比,我们的智能体实现了更高的优化成功率、更大的性质改善和更高的有效性,同时保持了分子相似性。 ## 1. 引言 药物发现是一个漫长、昂贵且高风险的过程,跨越多个阶段(Paul 等,2010 (https://arxiv.org/html/2605.28862#bib.bib1)),包括靶点识别、命中发现、分子先导化合物优化以及下游临床前和临床评估(Jorgensen,2009 (https://arxiv.org/html/2605.28862#bib.bib2))。在这些阶段中,分子先导化合物优化在将先导分子精炼成适合临床开发的药物样候选物方面发挥着尤为关键的作用(Keserü 和 Makara,2009 (https://arxiv.org/html/2605.28862#bib.bib3))。在此阶段,候选分子必须通过*小的、局部的修饰*进行优化,以满足广泛的ADMET相关要求,同时保留负责结合亲和力和靶点参与的核心子结构。由于这些最终分子随后会接受临床前研究评估,若未能达到预期目标,可能会产生超乎寻常的科学和财务后果,因为化合物在管线中推进越远,开发成本急剧上升(Waring 等,2015 (https://arxiv.org/html/2605.28862#bib.bib4))。 尽管其重要性,先导化合物优化仍然异常困难。仅通过小的、局部的结构修饰来改善期望性质是困难的,因为此类变化必须在严格受限的化学空间中导航,以实现特定目标,同时保留其他关键性质。尽管每个目标都有经验法则指导,但即使经验丰富的药物化学家也常常依赖大量试错来逐步精炼满足所有标准的候选分子。这一过程耗时且难以规模化,使得先导化合物优化成为早期发现阶段的一个主要瓶颈(Hughes 等,2011 (https://arxiv.org/html/2605.28862#bib.bib5))。 近期人工智能的进展为转变现代药物发现工作流程提供了新机遇(Mialon 等,2023 (https://arxiv.org/html/2605.28862#bib.bib6);Schick 等,2023 (https://arxiv.org/html/2605.28862#bib.bib7))。特别是,大语言模型(LLM)已发展成为强大的智能体控制器,能够规划多步骤工作流、推理中间结果,并与特定领域的计算工具交互。与独立的、单一模型相比,智能体系统能够根据当前优化上下文动态选择和协调异构工具。越来越多的研究展示了这种使用工具的LLM智能体在药物发现不同阶段的潜力。例如,ChemCrow通过将LLM与一组专家设计的化学工具集成到统一界面中,实现药物设计的自主规划和执行(M. Bran 等,2024 (https://arxiv.org/html/2605.28862#bib.bib8))。类似地,CACTUS将LLM与标准化学信息学工具结合,支持分子性质评估(McNaughton 等,(https://arxiv.org/html/2605.28862#bib.bib9))。DrugAgent通过协调多个专门组件(如高通量筛选和药物-靶点相互作用模块)将智能体LLM应用于药物发现(Inoue 等,2025 (https://arxiv.org/html/2605.28862#bib.bib10);Hertzberg 和 Pope,2000 (https://arxiv.org/html/2605.28862#bib.bib15);Yamanishi 等,2008 (https://arxiv.org/html/2605.28862#bib.bib16))。在更广泛的工作流层面,LIDDIA展示了一个基于LLM的规划器能够协调计算机药物发现的多个阶段,包括生成、筛选和优化(Averly 等,2025 (https://arxiv.org/html/2605.28862#bib.bib11))。这些系统表明,LLM驱动的智能体能够有效编排多样化的工具并实时调整策略,这种能力非常适合现代药物发现管线的迭代性和决策密集性。 尽管取得了这些进展,大多数化学智能体专注于工具增强推理或端到端设计,并未明确将*先导条件化的优化*建模为一个专门的阶段。即使包含优化组件,它也被表述为更广泛管线中的种群级别通用突变,而非明确的、针对每个先导的约束精炼过程(Jensen,2019 (https://arxiv.org/html/2605.28862#bib.bib12))。为补充先前工作并刻画这一缺失的设置,我们评估了具有代表性的独立先导优化基线。然而,即使是强大的基线模型在逐分子基础上也可能不稳定:它们可能生成无效结构、对目标性质改善微乎其微,或违反结构约束,这表明没有单一优化模型能够在所有分子和目标上始终可靠。这激发了工具多样化的决策制定表述,其中多个功能相关但行为不同的优化器被协调起来,以提高鲁棒性和优化质量。然而,在每次优化步骤中并行执行多个工具会带来高昂的计算成本。这种优化效果与资源效率之间的张力激发了智能体策略的需求,即能够选择性协调多个工具,而非依赖穷举并行执行。 为解决这些局限性,我们引入了 **TRACE**(轨迹自适应化学编辑,TRajectory-Adjusted Chemical Editing),一个具有轨迹感知能力的LLM推理智能体,用于分子先导化合物优化,它将工具选择表述为在结构约束下对行动轨迹的序列决策,明确平衡有效性、鲁棒性和计算效率。 **我们的贡献**涵盖机器学习(ML)方法和实际药物发现需求。从*ML*角度,我们引入:(i) 一个*LLM引导的先导优化智能体*,在结构约束下协调一组异构优化工具;(ii) 一个*上下文内自我修正*机制,利用执行时的失败来精炼工具指令,稳定优化器;(iii) 一个*锚定多步进化探索*程序,逐步累积有利的修饰;以及 (iv) 一个*相似性引导的轨迹重用*策略,从历史经验中检索并继续有效的工具使用轨迹,以减少穷举并行工具执行的需求。从*药物发现*角度,我们的TRACE在相似性约束下实现了高有效性和成功率,同时在多个ADMET优化任务中提供了大幅度性质改善。 ## 2. 相关工作 大语言模型的最新进展已促使从独立模型向*智能体*系统的转变,这种系统能够将复杂任务分解为一系列工具执行步骤,并利用累积的上下文迭代调整其决策。这种范式在需要协调异构能力才能有效解决问题的领域显示出巨大潜力,包括软件工程和科学工作流。在药物发现中,近期研究探索了工具增强型LLM智能体。ChemCrow为LLM配备了化学专用工具,使模型能够访问外部知识并自主规划和执行药物发现的多步工作流(M. Bran 等,2024 (https://arxiv.org/html/2605.28862#bib.bib8))。CACTUS遵循类似理念,将标准化学信息学工具与LLM集成,支持分子性质评估(McNaughton 等,(https://arxiv.org/html/2605.28862#bib.bib9))。DrugAgent应用智能体LLM,协调多个专门组件用于ADMET预测、高通量筛选和药物-靶点相互作用预测(Inoue 等,2025 (https://arxiv.org/html/2605.28862#bib.bib10))。在更广泛的工作流层面,LIDDIA展示了一个基于LLM的规划器能够协调药物发现管线的多个阶段,包括生成、筛选和优化,形成端到端的智能体系统(Averly 等,2025 (https://arxiv.org/html/2605.28862#bib.bib11))。这些工作共同凸显了LLM驱动的智能体作为复杂多阶段发现管线灵活控制器的前景。然而,现有的智能体系统很少针对显式结构约束下的先导条件化优化。即使包含优化模块(Averly 等,2025 (https://arxiv.org/html/2605.28862#bib.bib11)),它也是作为种群级别突变而非围绕给定先导的局部精炼过程来实现的(Jensen,2019 (https://arxiv.org/html/2605.28862#bib.bib12))。 ## 3. 背景与任务定义 #### 作为约束问题的先导化合物优化。在药物发现中,先导化合物优化是指通过针对性的化学修饰改善候选分子药理学相关性质,同时保留原始先导化合物的核心结构特征的过程(Bemis 和 Murcko,1996 (https://arxiv.org/html/2605.28862#bib.bib17))。与无约束分子生成不同,先导化合物优化必须在高度受限的化学空间内操作:仅允许局部编辑,骨架的大幅变化通常是不希望的。因此,先导化合物优化充满挑战,因为小的结构变化可能对分子性质产生复杂且矛盾的影响。先导化合物优化的一项核心目标是改善ADMET性质,这些性质表征分子的吸收、分布、代谢、毒性和整体成药性(Veber 等,2002 (https://arxiv.org/html/2605.28862#bib.bib18))。总体而言,先导化合物优化最好被视为一个有约束的优化问题,其中性质改善必须与严格的结构和化学可行性要求相平衡(Jensen,2019 (https://arxiv.org/html/2605.28862#bib.bib12);Dey 等,2025 (https://arxiv.org/html/2605.28862#bib.bib13))。 #### 任务表述。在本工作中,我们通过一组作为代表性基准的单性质优化任务来研究先导化合物优化。每个任务由输入分子 \(m_0\) 和待改善的目标ADMET性质定义(Zhu 等,2023 (https://arxiv.org/html/2605.28862#bib.bib19))。目标是生成一个化学有效的分子 \(m\),该分子在目标性质上达到更高值(在毒性情况下为更低值),同时与输入先导分子保持结构相似。为强制结构保真度,我们在输入与输出分子之间施加显式的相似性约束。这一约束确保优化通过最小的局部编辑而非广泛的结构重排来实现,反映了原始骨架基本保留的实际先导优化场景。具体而言,使用基于摩根指纹的Tanimoto相似度来衡量结构相似性(Todeschini 和 Consonni,2008 (https://arxiv.org/html/2605.28862#bib.bib20)),仅保留满足 \(\mathrm{SIM} \geq 0.5\) 的分子作为有效优化结果。 #### 目标性质。我们考虑五个常用于评估先导化合物优化质量的ADMET相关终点。**pLogP** 表征分子亲脂性,影响吸收和渗透性。**QED** 提供对成药性的整体度量。**HIA**(人体肠道吸收)反映口服吸收的可能性。**BBBP**(血脑屏障渗透性)捕捉分布行为,特别是对于中枢神经系统靶点。**Mutagenicity**(致突变性)是一个毒性相关终点,较低值表示较低风险。这些性质共同涵盖了吸收、分布、毒性和整体成药性(Lipinski 等,2012 (https://arxiv.org/html/2605.28862#bib.bib14))。对于每个任务,除致突变性(优化目标是降低风险)外,均偏好较高值。因此,任务可总结如下:给定一个输入分子,生成一个结构相似的类似物,该类似物在改善指定ADMET性质的同时,遵守化学有效性和结构约束。 ## 4. 动机 先导化合物优化是药物发现的关键阶段,需要在严格的结构约束下改善分子性质。尽管AI辅助分子设计近期取得了进展,但有效自动化这一过程仍然具有挑战性。受这些挑战启发,我们分析了现有先导化合物优化工具的经验行为,并识别出几个关键观察结果,这些观察结果共同构成了采用多工具、轨迹感知智能体框架的动机。 #### 工具异构性。我们的第一个观察是,不同的先导化合物优化工具(Dey 等,2025 (https://arxiv.org/html/2605.28862#bib.bib13)),即使在整体基准指标上表现相当,但在单个分子层面上通常表现出截然不同的行为(图1 (https://arxiv.org/html/2605.28862#S4.F1))。给定相同的先导化合物,不同的工具可能提出不同的结构修饰:有些引入局部官能团变化,有些则倾向于更大的骨架改变,还有一些完全无法生成有效的化学结构。当性能在大规模测试集上取平均时,这些差异常常被掩盖,但在检查每个实例的结果(如性质改善、结构相似性和化学有效性)时会变得明显。这种逐分子异构性揭示了单工具优化的一个关键局限性。没有单一的优化器能够在所有先导和目标上始终可靠:一个在某个分子上成功的工具可能在另一个分子上失败或违反约束。因此
相似文章
先探后编:基于探针引导的LLM代理在基于结构的药物设计中的分子优化
本文介绍了 PROBE,一个利用 LLM 代理通过在编辑前探测口袋-配体复合物响应来迭代优化基于结构的药物设计中的配体的框架,其在 CrossDocked2020 上取得了最先进的结果。
TRACE:面向LLM智能体的自适应跨步证据聚合轨迹推理
TRACE是一个用于长周期LLM智能体轨迹的监控框架,它通过分诊-检查-判断(Triage-Inspect-Judge)循环来连接时间上相隔较远的动作证据,在规避性破坏检测任务上实现了高召回率和F1值。
ToolMol:用于多目标药物发现的进化式智能体框架
ToolMol是一个进化式智能体框架,结合了多目标遗传算法和基于LLM的操作符,用于设计小分子药物,在多个蛋白质靶点上实现了最先进的结合亲和力和类药性。
树上的智能体:面向多目标分子优化的路径协调
ATOM是一个多智能体框架,将分子优化建模为树状搜索,沿路径布置专门化的智能体,从而能够探索替代分子轨迹并在多目标基准测试中提高帕累托覆盖率。
从噪声轨迹到根因:面向智能体优化的结构化轨迹分析与因果提取
介绍STRACE,一个通过结构化轨迹分析与因果提取来构建高信噪比优化上下文以改进长周期智能体的框架,在形式化验证任务上超越基线。