CAi Copilot:通过意图驱动的智能体工作流降低分子设计中的操作负担
摘要
本文介绍了 CAi Copilot,一个面向专家的智能体,由三个相互关联的层次组成,可将分子设计意图转化为可执行、可追踪的工作流,在 45 项任务中取得了最强性能。
arXiv:2608.06961v1 公告类型:新
摘要:早期分子设计是一个迭代过程,而不仅仅是生成分子的任务。研究人员将广泛目标转化为设计策略,优化候选分子,评估多种性质,并在合成和测试之前收集证据。AI 方法可以生成分子、优化多个目标、预测性质、对接化合物,并考虑合成可行性。然而,这些功能分散在专门的工具中。专家仍需协调每一步、判断中间结果并整合证据。因此,核心挑战在于将研究意图转化为基于科学工具的适应性、可追踪的运行流程。我们将这一挑战定义为从意图到证据的分子设计工作流执行,并提出了 CAi Copilot,一个面向专家的智能体,包含三个相互关联的层次。研究接口层将意图转化为可执行计划。智能体推理层利用中间结果指导每次运行。执行基座提供分子工具、指标、可复用实用程序和后端服务。在 45 项任务中,CAi 取得了最强的总体性能,结果得分为 84.59,超出次优结果 18.07 分。额外的基准测试检验了 CAi 如何协调生成、筛选和多标准评估,同时揭示了其在长周期执行方面的局限性。这些结果表明,CAi 将广泛的分子设计意图转化为透明、可追踪的工作流,将中间决策与候选级证据连接起来。
查看缓存全文
缓存时间: 2026/08/10 08:00
# CAi Copilot:通过意图驱动的智能体工作流降低分子设计中的操作负担
来源:https://arxiv.org/html/2608.06961
陈江宇 南京大学,南京,中国
尚英军 上海人工智能实验室,上海,中国
姚宇辉 上海人工智能实验室,上海,中国
陆来奥 南京大学,南京,中国
付天凡 上海人工智能实验室,上海,中国;南京大学,南京,中国
邹娜 上海人工智能实验室,上海,中国
###### 摘要
早期分子设计是一个迭代过程,而不仅仅是生成分子的任务。研究人员将宽泛的目标转化为设计策略,优化候选分子,评估多项性质,并在合成和测试之前收集证据。AI方法可以生成分子、优化多个目标、预测性质、对接化合物,并考虑合成可行性。然而,这些功能分散在专门工具中。专家仍需要协调每个步骤、判断中间结果并整合证据。因此,核心挑战在于将研究意图转化为适应性强、可追溯,并建立在科学工具基础上的运行流程。我们将这一挑战定义为“意图到证据”的分子设计工作流执行问题,并提出了CAi Copilot——一个面向专家的智能体,具有三个相互关联的层次。研究接口层将意图转化为可执行的计划。智能体推理层利用中间结果指导每次运行。执行底层提供分子工具、度量标准、可复用工具库和后端服务。在45项任务中,CAi取得了最优综合性能,结果得分为84.59,超出次优结果18.07分。额外的基准测试检验了CAi如何协调生成、筛选和多标准评估,同时揭示了其在长时程执行方面的局限。这些结果表明,CAi将宽泛的分子设计意图转化为透明、可追溯的工作流,将中间决策与候选级别的证据联系起来。
## 1 引言
一个分子候选物很少能从一个生成步骤中直接出现。早期设计反而涉及反复的提出、评估、过滤、排序和优化。研究人员必须在探索广阔化学空间的同时,平衡活性、选择性、合成难易度、安全性和类药性质[26,25]。这些目标往往最初是宽泛的研究意图,而非完全明确的任务。一个请求可能将骨架或种子分子与靶标、性质限制、排序规则和外部文件结合起来。因此,走向合成和生物学测试不仅仅需要候选物生成。研究人员还需要可执行的策略和足够的证据来比较候选物。
AI模型现在支持这一过程中的许多步骤。分子生成器探索骨架并优化结构,性质模型估计关键属性,对接方法评估靶标匹配度[6,20,27]。分子语言模型还将化学结构与文本指令和领域知识联系起来[7,8,30,29]。然而,每个模型通常只处理具有固定输入和输出的受限任务。面对宽泛的请求,研究人员仍必须选择正确的操作、准备输入、连接多样化的工具、审查结果,并在步骤失败或候选集薄弱时修改工作流。因此,强大的单个模型并不能解决工作流层面的问题。当前的分子设计方法虽然为单个任务提供了强大能力,却缺乏一个系统框架,将高层次的研究意图转化为协调执行和可追溯的、候选级别的证据来支持专家决策。
基于LLM的科学智能体为此类协调提供了基础。现有系统将语言推理与科学工具、数据库和代码执行相连接[12,11,2,3,17]。药物发现智能体也涵盖治疗推理、靶标分析和多阶段设计工作流[19,10,1]。然而,早期分子设计提出了独特的执行问题。设计意图可能包含不完整或上下文相关的约束。候选物开发涉及多种模型、文件格式、度量标准和计算后端。中间结果也可能改变后续步骤。最终建议必须建立在专家可以检查的证据之上。专家仍然对科学筛选和实验选择负责。一个合格的分子设计智能体应实现从研究意图到协调执行和候选级别证据的端到端转换,而不仅仅是孤立的工具使用和分子生成。
我们将这一场景定义为“意图到证据”的分子设计工作流执行问题,并提出了CAi Copilot。CAi将宽泛的设计意图转化为可执行的轨迹,包括候选分子、评估记录、排序和执行历史。三个相互关联的层次支持这一过程。研究接口层将分子上下文具体化,并将意图映射为工作流计划。智能体推理层指导每次运行,并根据中间结果更新计划。执行底层提供分子工具、度量标准、可复用工具库、领域技能和后端服务。这种分层使意图接地、工作流控制和科学执行变得明确。研究人员可以检查工作流,而计算工具负责重复的生成、评估和证据汇总。
本文的主要贡献总结如下:
- 我们将早期分子设计定义为“意图到证据”的工作流执行问题。这一视角将输出从孤立的分子集转变为带有候选级别证据的可追溯工作流记录。
- 我们提出了CAi Copilot,一个用于分子设计的三层智能体。CAi将意图接地、结果驱动控制、代码执行和多样化工具相连接。该框架统一了分子生成、验证、评估、过滤、排序和证据报告。
- 我们在45项设计任务、额外的基准测试和15个靶标特定案例上评估了CAi。研究涵盖了智能体执行和分子结果。结果表明了强大的“意图到证据”性能,并指出长时程执行是一个剩余局限。
## 2 问题定义
我们首先区分分子生成与分子设计工作流执行。分子生成将给定条件直接映射到候选结构。工作流执行以开放式研究意图为起点。这种执行必须组织分子操作、响应中间结果,并为专家审查收集证据。我们将任务形式化为
q = (I, C, Γ, T),(1)
其中I是设计意图,C是分子上下文,Γ保存设计约束和证据需求,T是可用的分子工具库。
给定q,智能体维护一个工作流计划P\_t以及先前的动作-观察对历史h\_t。在第t步,智能体选择并运行一个分子操作,然后更新剩余计划:
a\_t ~ π(·|h\_t, P\_t),
o\_{t+1} = Exec(a\_t; T),
P\_{t+1} = Update(P\_t, o\_{t+1})。(2)
这种更新使无效的分子输出、失败的操作或缺失的输入能够改变后续步骤。由此产生的动作-观察序列定义了执行轨迹τ。
输出将轨迹与候选级别的证据和明确的局限相结合:
E = {(m\_i, z\_i, r\_i, ρ\_i)}\_{i=1}^N,Y = (E, τ, L)。(3)
对于候选分子m\_i,z\_i存储计算得到的证据,r\_i给出候选排序,ρ\_i将每个报告的结果与支持性的执行记录相链接。集合L存储缺失的证据和失败的操作。设S\_I、S\_τ和S\_E分别表示意图满意度、轨迹有效性和证据接地性。一次成功运行必须满足这三个条件。在我们的评估中,这些条件涉及意图理解和分解、工作流执行与操作覆盖,以及输出有效性、证据一致性和目标满足度。这些方面提供了综合性能的分级证据,而严格成功则需要完全的任务级输出匹配。
## 3 智能体架构
CAi Copilot连接宽泛的设计意图与可执行的分子计算。研究请求可能省略工具选择和执行细节,而分子测试只会在工作流过程中揭示候选质量。固定的序列无法响应无效结构、未满足的标准、缺失输入或失败的操作。因此,CAi将意图接地、工作流控制和分子执行分开。同时,CAi将每个决策与工具操作和候选级别的证据相连接。
图1显示了三个层次如何协调工作流。研究接口层从设计请求构建具有显式依赖关系的计划。智能体推理层和执行底层随后形成一个反馈回路,将分子决策、工具运行和累积证据相连接。当可用工具允许时,推理层可以重新生成、优化、过滤或重新排序候选。执行持续进行,直到工作流获得请求的证据或记录未满足的需求。因此,三个层次将工作流规划与迭代分子设计联系起来,而不是充当独立的智能体或固定的流水线。
图1:CAi Copilot概览。三个协调层次将研究意图转化为可执行计划,根据分子观察修正工作流,并为专家审查构建候选级别的证据。
### 3.1 研究接口层
给定意图I、分子上下文C和需求Γ,研究接口层识别设计目标、可用输入、所需测试、排序规则和缺失输入。该层随后构建初始计划
P\_0 = Plan(I, C, Γ) = (V\_0, D\_0),(4)
其中V\_0包含可执行步骤,D\_0记录它们之间的链接。每个步骤具有以下形式:
v\_j = (g\_j, u\_j, x\_j, p\_j, e\_j),(5)
其中g\_j是局部目标,u\_j是分子操作,x\_j保存所需输入,p\_j给出输入需求,e\_j定义预期证据或完成信号。
计划记录的是步骤之间的链接、输入需求和预期证据,而不仅仅是工具列表。一个靶标感知的请求可能需要输入检查、候选生成、分子过滤、靶标测试和按多个指标排序。输入检查在执行前暴露不可用的操作,预期证据则将每个操作与设计目标联系起来。在执行过程中,u\_j映射到合适的工具契约,p\_j根据该契约中的输入需求进行检查,e\_j则贡献于未满足的证据需求。智能体可以修改初始计划,因为后续的分子结果可能改变步骤设置、链接或未完成的工作。
### 3.2 智能体推理层
智能体推理层控制闭环轨迹。在第t步,下一个操作取决于当前计划、先前步骤以及迄今收集的候选证据:
a\_t ~ π(·|h\_t, P\_t, E\_t),o\_{t+1} = Exec(a\_t; T)。(6)
由此产生的观察更新证据状态和剩余证据缺口:
E\_{t+1} = E\_t ⊕ Extract(o\_{t+1}, a\_t),
Δ\_{t+1} = Req(Γ) \ Cov(E\_{t+1}),
P\_{t+1} = Update(P\_t, o\_{t+1}, Δ\_{t+1})。(7)
这里,E\_t是截至第t步收集的证据。执行从E\_0 = ∅开始,除非C已经为先前候选提供了证据。运算符⊕将新的分子产物、计算值、警告和失败合并到候选记录中。Req(Γ)和Cov(E\_{t+1})分别表示所需证据和可用证据。它们的差异Δ\_{t+1}是剩余的证据缺口。这种基于证据的控制将生成与反复的优化和筛选联系起来。无效或重复的候选可能触发清洗或重新生成,而约束违规可能触发过滤或优化。部分结果仍然可用。缺失输入可能推迟测试或提示显式请求。因此,执行会动态响应中间分子结果,而不是遵循预定的固定工具序列。
### 3.3 执行底层
执行底层将智能体决策落实到分子计算中。推理层选择一个操作,底层确定该操作是否可以运行以及如何返回结果。每个工具T\_k ∈ T遵循执行契约
κ\_k = (X\_k, Y\_k, Pre\_k, Exec\_k),(8)
其中X\_k和Y\_k定义接受的输入和输出,Pre\_k列出先决条件,Exec\_k调用后端。契约明确将输入就绪状态和下游工具失败暴露给推理层。
底层提供用于分子生成和优化的工具、评估指标、可复用工具库和领域工作流技能。隔离的后端支持多样化的运行时设置、检查点、硬件、文件格式和长时间任务。每次工具调用返回一个标准观察,包括执行状态、分子产物、计算值、警告和错误。这种边界保持了推理的灵活性、分子操作的透明性和可检查性,以及完整运行的可复现性。
### 3.4 跨层证据与决策支持
证据是在所有三个层次中构建的,而不是在单独的组件中。每次观察更新候选记录(m\_i, z\_i, r\_i, ρ\_i),其中ρ\_i将报告的结果与支持性的动作和观察相连接。候选记录暴露了Γ中指标的工具派生值。过滤和排序应用请求的阈值、指标方向,以及相似文章
基于工作流归纳的多轮自主式科学文献搜索
本文介绍了PaperPilot,一个多轮文献搜索智能体,它构建可执行的有向无环图(DAG)搜索操作,并通过用户反馈优化工作流,在检索指标上相比基线模型取得了显著提升。
AgentCo-op: 基于检索的可互操作多智能体工作流合成框架
AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。
面向工作流生成的知识中心型智能体
本文介绍了一种知识中心型框架,用于生成ComfyUI工作流,该框架从真实工作流中提炼层次化知识(伪代码、骨架、策略),并利用大语言模型(LLM)执行从任务描述到可执行结构的推理,实现了更高的节点多样性和执行成功率。
基于智能体工具规划的分子先导优化
TRACE是一种轨迹感知的LLM智能体,用于分子先导优化,通过对分子优化工具进行顺序决策,在保持分子相似性的同时改善ADMET性质。
Agentic-Ideation:面向科学构想智能体的样本高效轨迹合成方法
提出了Agentic-Ideation框架,用于高效合成智能体轨迹以训练LLMs进行科学构想,实现了超过10倍的样本效率提升,并优于现有的基于工作流的基线方法。