树上的智能体:面向多目标分子优化的路径协调

arXiv cs.AI 论文

摘要

ATOM是一个多智能体框架,将分子优化建模为树状搜索,沿路径布置专门化的智能体,从而能够探索替代分子轨迹并在多目标基准测试中提高帕累托覆盖率。

arXiv:2606.00008v1 公告类型:新 摘要:多目标分子优化需要在相互冲突的目标下搜索广阔的化学空间,早期设计决策会严重制约后续结果。现有方法通常依赖于单一策略或固定标量化,这限制了它们表示不同权衡以及探索多个有前景设计轨迹的能力。我们提出ATOM,一个多智能体框架,将分子优化建模为树状搜索。每个节点对应一个原子操作,并托管一个专门针对特定目标或决策上下文的智能体。智能体沿树的不同路径进行协调,而非强制执行全局共识,从而使该方法能够维护并比较替代分子进化轨迹。全局记忆存储过去的优化行为,进一步支持目标间的平衡探索与利用。这种树状交互结构能够对分子设计中固有的长期依赖关系进行推理。在涉及活性、可合成性及ADMET相关属性的挑战性多目标基准测试上的实验表明,ATOM在帕累托覆盖和超体积指标上持续优于强基线。这些结果证明了路径式多智能体协调在分子优化中的有效性。代码可见于 https://anonymous.4open.science/r/ATOM-41CE。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:44

# 树上的智能体:多目标分子优化的路径协调

来源:https://arxiv.org/html/2606.00008

###### 摘要

多目标分子优化需要在相互冲突的目标下搜索广阔的化学空间,其中早期的设计决策会强烈约束后续的结果。现有方法通常依赖于单一策略或固定的标量化,这限制了它们表示多样化权衡以及探索多个有前途的设计轨迹的能力。我们提出ATOM,一个多智能体框架,将分子优化形式化为树形结构化搜索。每个节点对应一个原子操作,并托管一个针对特定目标或决策上下文特化的智能体。智能体沿着树的不同路径进行协调,而不是强制执行全局共识,从而使该方法能够维护和比较替代的分子进化轨迹。一个关于过去优化行为的全局记忆进一步支持跨目标的平衡探索与利用。这种树形结构化交互能够推理分子设计中固有的长期依赖关系。在涉及活性、可合成性和ADMET相关属性的具有挑战性的多目标基准测试上的实验表明,ATOM在Pareto覆盖率和超体积方面始终优于强基线。这些结果证明了路径多智能体协调在分子优化中的有效性。代码可在 https://anonymous.4open.science/r/ATOM-41CE 获取。

机器学习,ICML

## 1 引言

参考图例
图1:(a) 代表性分子性质之间的相关性较弱或相互冲突,说明了平衡多个目标的固有难度。(b) 我们的树形结构化框架协调专门化的智能体沿着不同的搜索路径,从而能够在不强制执行单一全局策略的情况下探索替代的分子进化轨迹。

多目标分子优化是早期药物发现中的核心任务 (De Rycke et al., 2018 (https://arxiv.org/html/2606.00008#bib.bib49); Yang et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib35); Liu et al., 2025b (https://arxiv.org/html/2606.00008#bib.bib36)),其目标是优化先导化合物以同时满足多个通常相互冲突的性质,如生物活性、类药性和可合成性 (He et al., 2021 (https://arxiv.org/html/2606.00008#bib.bib1))。传统方法,包括高通量筛选 (HTS) (Graff et al., 2021 (https://arxiv.org/html/2606.00008#bib.bib53)) 和基于模拟的方法 (Hsu et al., 2017 (https://arxiv.org/html/2606.00008#bib.bib51)),虽然有效,但通常需要大量时间和计算资源,限制了其可扩展性。受人工智能进步的推动,机器学习已成为加速分子发现的强大范式 (Hoffman et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib113))。

许多现有的多目标分子设计方法通过为各个目标分配预定义权重 (Maziarka et al., 2020 (https://arxiv.org/html/2606.00008#bib.bib60); Ji et al., 2021 (https://arxiv.org/html/2606.00008#bib.bib61); Xia et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib58)) 将问题简化为单目标形式。虽然这种策略在实践中可能有效,但它严重依赖于专家设计的权重,这些权重通常难以校准,并且当目标强烈冲突时,可能会将搜索偏向次优的权衡 (Xie et al., 2021 (https://arxiv.org/html/2606.00008#bib.bib63); Fromer and Coley, 2023 (https://arxiv.org/html/2606.00008#bib.bib59))。或者,基于Pareto的方法试图通过大规模采样后进行非支配排序来近似Pareto前沿 (Yasonik, 2020 (https://arxiv.org/html/2606.00008#bib.bib114); Verhellen, 2022 (https://arxiv.org/html/2606.00008#bib.bib115))。然而,这种两阶段流水线计算成本高昂,并且随着目标数量和候选分子的增加,可扩展性很差。

为了提高样本效率,贝叶斯优化和基于蒙特卡洛树搜索 (MCTS) 的方法已被广泛用于从头分子生成和多目标性质优化 (Yang et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib35); Southirathat et al., (https://arxiv.org/html/2606.00008#bib.bib3); Xie et al., 2021 (https://arxiv.org/html/2606.00008#bib.bib63); Gao et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib71))。尽管这些方法对不确定性有原则性的处理,但它们通常在高维化学空间中遭受可扩展性问题,以及高斯过程推理或深度树扩展带来的计算开销。这些限制阻碍了它们在现实多目标分子设计场景中的实际部署。

最近,大型语言模型 (LLMs) (OpenAI et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib66); Bai et al., 2023 (https://arxiv.org/html/2606.00008#bib.bib5); Dubey et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib109)) 的快速进展引发了它们在分子生成 (Brahmavar et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib116); Wang et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib117)) 和优化 (Yu et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib118); Ye et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib6)) 中应用的日益增长的兴趣。LLMs 为目标条件生成和跨异质分子性质的推理提供了一个灵活且可扩展的框架 (Nguyen and Grover, 2024 (https://arxiv.org/html/2606.00008#bib.bib7))。然而,现有的基于LLM的方法通常将多目标优化形式化为一个整体生成问题,缺乏在相互冲突的目标之间协调权衡的显式机制 (Liu et al., 2025a (https://arxiv.org/html/2606.00008#bib.bib8))。

在这项工作中,我们不将多目标分子优化视为学习单一最优策略,而是视为沿不同优化路径协调多个专门化的决策者。基于这一观点,我们提出ATOM(Agents on a Tree for multi-Objective Molecular optimization),一个多智能体框架,将分子优化形式化为树形结构化搜索。每个节点对应分子群体上的一个原子级操作,并托管一个针对特定目标或决策上下文特化的智能体。智能体沿着树的不同分支进行路径协调,而不是强制执行全局共识,从而能够显式比较替代的分子进化轨迹。为了支持长期协调,ATOM包含一个全局记忆,聚合历史优化行为和跨路径的高质量候选。这种共享上下文在平衡竞争目标下的探索与利用时,保留了智能体的专门化。由此产生的树形结构化交互促进了路径依赖化学空间中的长期推理和信用分配。

总之,我们的贡献如下:(i) 我们引入了一种路径的、树形结构化的多目标分子优化公式,显式建模了替代的分子进化轨迹。(ii) 我们提出ATOM,一个多智能体框架,其中专门化的智能体沿着不同路径进行协调,而不是坍缩为单个全局策略。(iii) 我们通过实验和理论证明,这种结构在具有挑战性的多目标基准测试中导致了优越的Pareto覆盖率和超体积。

## 2 相关工作

### 2.1 分子优化

分子优化是药物发现和材料科学中的核心问题,并已逐渐从手动实验转向数据驱动的计算方法 (Gao et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib71))。现有方法大致可分为两类:(1) 组合优化。传统方法将分子设计视为在离散的、指数级大的化学空间上的搜索问题 (Bohacek et al., 1996 (https://arxiv.org/html/2606.00008#bib.bib9); Stumpfe and Bajorath, 2012 (https://arxiv.org/html/2606.00008#bib.bib10))。常见技术包括蒙特卡洛树搜索 (MCTS) (Yang et al., 2023 (https://arxiv.org/html/2606.00008#bib.bib11))、遗传算法 (GA) (Jensen, 2019 (https://arxiv.org/html/2606.00008#bib.bib76); Fu et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib12)) 和强化学习 (RL) (Bohacek et al., 1996 (https://arxiv.org/html/2606.00008#bib.bib9); Stumpfe and Bajorath, 2012 (https://arxiv.org/html/2606.00008#bib.bib10))。虽然这些方法迭代地探索结构空间,但它们常常在高维搜索景观和评估复杂目标的过高计算成本上挣扎。(2) 分子设计中的生成模型。为了缓解离散搜索的挑战,最近的研究已转向生成建模 (Du et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib13))。这些模型学习化学数据的隐式概率分布以提出有效的候选分子,有效地集中了搜索空间。各种架构已被探索,包括变分自编码器 (VAEs) (Gómez-Bombarelli et al., 2018 (https://arxiv.org/html/2606.00008#bib.bib83); Jin et al., 2018 (https://arxiv.org/html/2606.00008#bib.bib84))、生成对抗网络 (GANs) (Guimaraes et al., 2017 (https://arxiv.org/html/2606.00008#bib.bib14))、基于流的模型 (Shi et al., 2020 (https://arxiv.org/html/2606.00008#bib.bib15)) 和扩散模型 (Hoogeboom et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib16); Schneuing et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib17))。

### 2.2 用于分子优化的LLMs

大型语言模型最近已被应用于以分子为中心的任务,包括性质预测和生成 (Luo et al., 2022 (https://arxiv.org/html/2606.00008#bib.bib89); Li et al., 2023 (https://arxiv.org/html/2606.00008#bib.bib18); Han et al., 2023 (https://arxiv.org/html/2606.00008#bib.bib91); Fang et al., 2023 (https://arxiv.org/html/2606.00008#bib.bib19); Wu et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib92))。几项工作将LLMs调整用于优化:MOLLEO使用LLMs作为遗传算子来改进交叉和变异 (Wang et al., 2024 (https://arxiv.org/html/2606.00008#bib.bib72));LICO应用上下文感知提示进行即时上下文分子细化,无需重新训练 (Nguyen and Grover, 2024 (https://arxiv.org/html/2606.00008#bib.bib7));DrugAssist提出了一个人类参与循环的优化框架,将人类洞察力与LLM推理相结合 (Ye et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib6))。尽管有这些进展,现有的基于LLM的方法通常将多目标优化视为一个单一的统一生成任务,或者为各个属性实例化智能体,但没有跨目标协调的机制。因此,目标之间的冲突很少被显式建模,这些方法无法可靠地发现协调的、全局有效的优化轨迹。相比之下,我们的工作将每个目标视为一个自主的化学感知智能体,并使用蒙特卡洛树搜索来规划协调的智能体动作,从而在分子设计中实现显式的权衡推理和优化路径的自动发现。

## 3 预备知识

我们研究离散化学空间上的多目标分子优化。令 \(\mathcal{X}\) 表示所有化学有效分子的集合,其中每个分子 \(x \in \mathcal{X}\) 由一个有效的SMILES字符串表示。每个分子 \(x\) 与一个 \(K\) 维目标向量 \(\mathbf{f}(x) = [f_1(x), \ldots, f_K(x)] \in \mathbb{R}^K\) 相关联,其中每个目标函数 \(f_k: \mathcal{X} \rightarrow \mathbb{R}\) 评估一个感兴趣的分子性质,例如靶点特异性生物活性、类药性 (QED) 或合成可及性 (SA)。这些评分函数通常不可微,被视为黑箱评估器。给定一个初始分子 \(x_0 \in \mathcal{X}\),目标是生成一组候选分子,共同优化这些目标。这被公式化为一个 \(K\) 目标最大化问题:

\[
\max_{x \in \mathcal{X}} \; \mathbf{f}(x). \tag{1}
\]

由于目标相互冲突,没有一个单一解对所有准则都是最优的。相反,我们的目标是识别一组多样化的权衡解。

###### 定义 3.1 (Pareto支配).
令 \(\mathcal{S} \subset \mathbb{R}^K\) 表示从候选分子获得的非空目标向量集。对于任意 \(X, Y \in \mathcal{S}\),我们说 \(Y\) *支配* \(X\),记作 \(Y \succ X\),如果

\[
Y \succ X \quad \Longleftrightarrow \quad \left\{
\begin{aligned}
&Y_k \geq X_k, \quad \forall k \in \{1, \ldots, K\}, \\
&\exists k' \in \{1, \ldots, K\} \ \text{s.t.}\ Y_{k'} > X_{k'}.
\end{aligned}
\right. \tag{2}
\]

一个目标向量 \(X \in \mathcal{S}\) 是*非支配的*,如果不存在 \(Y \in \mathcal{S}\) 使得 \(Y \succ X\)。

###### 定义 3.2 (Pareto前沿).
*第一Pareto前沿*,也称为*Pareto最优集*,由所有非支配解组成:

\[
\mathcal{S}_1 = \left\{ X \in \mathcal{S} \;:\; \nexists Y \in \mathcal{S} \ \text{s.t.}\ Y \succ X \right\}. \tag{3}
\]

后续的Pareto前沿通过递归地移除前面前沿中的解来定义。第 \(k\) 个Pareto前沿由下式给出:

\[
\mathcal{S}_k = \left\{ X \in \mathcal{S} \setminus \bigcup_{i=1}^{k-1} \mathcal{S}_i \;:\; \nexists Y \in \mathcal{S} \setminus \bigcup_{i=1}^{k-1} \mathcal{S}_i \ \text{s.t.}\ Y \succ X \right\}. \tag{4}
\]

## 4 方法

参考图例
图2:用于多目标分子优化的Agents-on-a-Tree框架,将路径MCTS规划与专门化智能体之间的知识介导协调相结合,以在冲突目标下改善Pareto覆盖率。

### 4.1 ATOM的算法框架

**多智能体属性特定优化。** 如图1所示,我们在提出的ATOM框架中实例化了一组专家智能体,其中每个智能体明确专门用于优化特定的分子性质。每个专家被实例化为一个LLM,如GPT-4o mini (OpenAI, 2024 (https://arxiv.org/html/2606.00008#bib.bib34)),并被分配一个与特定优化目标相对应的明确领域角色。具体来说,这些角色包括一个QED专家、一个SA专家,以及针对GSK3\(\beta\)和JNK3的靶点特异性专家,这些靶点与阿尔茨海默病密切相关。最近的研究表明,通过领域感知的提示工程可以显著增强LLM在生化和分子推理任务上的表现 (Luo et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib111); Li et al., 2025 (https://arxiv.org/html/2606.00008#bib.bib122))。受这些发现的启发,ATOM采用专家特定的提示模板,为每个智能体明确指定任务范围、优化目标、输入表示和期望的输出格式。这种设计在实现跨专家的功能解耦的同时,使每个专家能够专注于其特定目标。

相似文章

COAgents:用于学习和导航路径规划问题搜索空间的多智能体框架

arXiv cs.AI

COAgents是一个合作式多智能体框架,用于解决车辆路径问题,它将搜索过程建模为图,使用专门智能体进行节点选择、移动选择和跳跃以逃离局部最优。在CVRP和VRPTW基准测试上取得了最先进的结果,相比先前的基于学习的方法,将最佳已知解差距最多缩小了44%。

AgentCo-op: 基于检索的可互操作多智能体工作流合成框架

arXiv cs.AI

AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。