EvoSci:一种受生物启发的多智能体框架,用于科学发现的演化

arXiv cs.AI 论文

摘要

EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。

arXiv:2605.24018v1 公告类型:新 摘要:大型语言模型(LLMs)在科学发现中展现出强大潜力,但现有方法在研究工作流设计和多角色协作机制方面仍面临重大挑战。为解决这些问题,我们提出了EvoSci,一种多智能体科学协作框架,将生物启发式进化与知识图谱建模相结合。为了迭代生成、评估和完善研究想法,EvoSci集成了多个角色型智能体,包括导师、研究者和评审者。通过结合协作推理、共享记忆和进化反馈,EvoSci显著增强了科学探索的连贯性和创造力。在真实研究主题上的实验表明,EvoSci在基于LLM的结构化同行评审和比较排名评估中显著优于强基线,获得了最高的总体同行评审分数(ICLR 4.90)和最高排名(Top-10 = 54)。这些结果证明了其在科学想法生成和持续发现方面的优越性。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:04

# EvoSci:一种受生物启发的多智能体科学发现演化框架  
来源:https://arxiv.org/html/2605.24018  
Xiaoyu Xiong,Yuqi Ren†\dagger,Deyi Xiong†\dagger  
TJUNLP Lab,天津大学计算机科学与技术学院,中国  
\{2025244184, ryq20, dyxiong\}@tju\.edu\.cn  

###### 摘要  
大型语言模型(LLMs)在科学发现中展现出强劲潜力,但现有方法在研究工作流设计与多角色协作机制方面仍面临重大挑战。为缓解这些问题,我们提出 EvoSci——一个多智能体科学协作框架,它将生物启发式演化与知识图谱建模相结合。为了迭代生成、评估和完善研究想法,EvoSci 集成了多个基于角色的智能体,包括导师、研究员和评审员。通过结合协作推理、共享记忆与演化反馈,EvoSci 显著提升了科学探索的连贯性与创造力。在真实研究主题上的实验表明,EvoSci 在基于 LLM 的结构化同行评审与对比排名评估中大幅超越强基线,取得了最高的综合同行评审分数(ICLR 4.90)和最佳排名(前10名数量 = 54)。这些结果证明了其在科研想法生成与持续发现方面的优越性。  

EvoSci:一种受生物启发的多智能体科学发现演化框架  
Xiaoyu Xiong,Yuqi Ren†\dagger,Deyi Xiong†\dagger  
TJUNLP Lab,天津大学计算机科学与技术学院,中国  
\{2025244184, ryq20, dyxiong\}@tju\.edu\.cn  
††footnotetext:†\dagger通讯作者。  

## 1 引言  
随着知识表示(Pan et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib23))、逻辑推理(Ke et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib14);Xu et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib35))以及复杂多模态信息集成(Han et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib9))方面的突破性进展,LLMs 正逐步重塑科学研究范式(Buehler 2024 (https://arxiv.org/html/2605.24018#bib.bib2))。在数学推理与定理证明(Trinh et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib30);Zhang and Xiong 2025 (https://arxiv.org/html/2605.24018#bib.bib39);Liu et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib19))、自动代码生成(Li et al. 2023 (https://arxiv.org/html/2605.24018#bib.bib17);Ren et al. 2023 (https://arxiv.org/html/2605.24018#bib.bib24);He et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib10);Yang et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib37))以及复杂数据分析(Sui et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib27))等传统 AI 驱动领域已取得显著进展。基于这些成功,研究人员正越来越多地探索 LLM 在更广泛科研流程中的潜力,包括从大规模科学语料中生成想法与假设(Kulkarni et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib16);Zhou et al. 2024b (https://arxiv.org/html/2605.24018#bib.bib44);Wang et al. 2024b (https://arxiv.org/html/2605.24018#bib.bib32);Yang et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib38);Wang et al. 2024a (https://arxiv.org/html/2605.24018#bib.bib31))、实验设计(Desai et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib4);Tian et al. 2021 (https://arxiv.org/html/2605.24018#bib.bib28);Noh et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib22);Tom et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib29))以及结果解读(Zheng et al. 2023 (https://arxiv.org/html/2605.24018#bib.bib42);Charness et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib3))。然而,科学发现并非一次性解决方案,而是一个渐进且不断演化的过程,由研究问题的持续完善与中间洞察的积累所驱动(Elliott 2012 (https://arxiv.org/html/2605.24018#bib.bib6))。同时,它本质上是协作性的,依赖于不同角色与视角的相互作用(Milojević 2014 (https://arxiv.org/html/2605.24018#bib.bib21))。但现有方法往往将 LLM 降级为刚性流程中的静态执行者,忽视了其在长周期探究与结构化协调方面的潜力。这引发了两个核心挑战:(1)如何引导 LLM 逐步深化科学问题?(2)如何开发有效的协作框架,使多个智能体能够参与持续的、动态的探索?  
为应对这些挑战,我们提出 EvoSci,一个由多个协作智能体驱动的进化科学框架,用于自动生成研究想法。受真实研究团队与生物进化的启发,EvoSci 将科学发现建模为一种长周期、迭代式的探索过程,包含四个阶段:问题空间构建、协作研究执行、研究想法评估以及生物启发式演化迭代。EvoSci 建立在明确定义的基于角色的智能体之上,包括一位导师、一组研究员和一位评审员,各自负责设想生成流程中的不同阶段。超越静态预定义流程,EvoSci 通过动态任务分解实现自适应协调——导师智能体根据中间反馈重新分配子任务,而角色感知分配确保每个智能体的行动在多轮交互中始终与其学科背景保持一致。此外,受生物进化的启发,我们通过跨不同领域的概念知识对齐与重组,迭代更新研究想法,从而增强科学探索的新颖性。  
为验证 EvoSci 的有效性和通用性,我们在多种科学场景中进行了系统实验。结果表明,EvoSci 持续生成比强基线更新颖、更具影响力的研究想法。配备 DeepSeek-v3 的 EvoSci 取得最高的同行评审总分(ICLR 4.90 / NeurIPS 3.95),大幅超越次优基线(4.68 / 3.72),并在基于 Elo 的排名指标上保持稳定优势(平均胜场 4.19,前十数量 47)。这些结果验证了 EvoSci 在总体研究质量与可靠相对性能方面均优于强基线。  
综上所述,我们的主要贡献如下:  
- • 我们将科学发现概念化为一个以问题为导向的过程,研究问题通过多智能体协作循环被动态生成并逐步完善。  
- • 我们构建了一个异构多智能体框架,模拟真实研究实验室,其中不同智能体在角色特定目标下运作。该框架基于来自真实科学家的数据集,能够更真实地模拟协作科研工作流。  
- • 我们实现了多轮反馈与生物启发式演化机制(选择、交叉、突变),以支持持续且开放式的科学探索。  

## 2 相关工作  
我们的工作与 AI 驱动科学发现及多智能体系统均有关联。限于篇幅与 LLM 范围,我们简要综述这两个主题。  

### 2.1 面向科学发现的 AI  
LLM 的最新进展使 AI 系统能够更深入地参与科学发现(Zheng et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib41);Xiong et al. 2026 (https://arxiv.org/html/2605.24018#bib.bib34))。早期系统主要辅助文献挖掘(Smalheiser and Swanson 1998 (https://arxiv.org/html/2605.24018#bib.bib25);Hristovski et al. 2005 (https://arxiv.org/html/2605.24018#bib.bib11))与实验设计(King et al. 2009 (https://arxiv.org/html/2605.24018#bib.bib15);Tian et al. 2021 (https://arxiv.org/html/2605.24018#bib.bib28)),而近期发展则旨在更全面地支持科学过程。值得注意的是,SciPIP 采用三种检索策略(语义、实体与共现)来增强假设生成(Wang et al. 2024b (https://arxiv.org/html/2605.24018#bib.bib32)),MOOSE 框架引入迭代反馈机制,从大规模网络语料中演化假设(Yang et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib38))。在此基础上,SciAgents 将多智能体推理与科学知识图谱相结合,自主生成、测试和优化假设(Ghafarollahi and Buehler 2025 (https://arxiv.org/html/2605.24018#bib.bib8)),而 CoScientist 进一步扩展了此类能力,在化学研究工作流中自主规划并执行实验程序(Jansen et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib13))。  
最近的系统已向端到端科学发现迈出更雄心勃勃的一步。例如,AI-Scientist(Lu et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib20);Yamada et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib36))与 CycleResearcher(Weng et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib33))几乎自动化了整个科研流程,从主题构思、文献探索、假设生成、实验模拟、论文撰写甚至到同行评审。然而,现有方法主要关注在固定初始主题下进行单轮研究,忽视了科学发现的演化和循环本质。这一缺口凸显了需要支持跨连续研究周期进行迭代改进与问题重构的框架。  

参见图注  
图 1:所提出的 EvoSci 框架整体工作流。EvoSci 从文献与领域知识的问题空间构建开始,然后通过基于角色的智能体进行协作研究执行,并利用评审员反馈进行迭代评估。生物启发式的演化循环在多个轮次中运行,利用反馈来重组、适应和完善研究方向。  

### 2.2 多智能体系统中的协作  
近期工作越来越趋向于采用多智能体系统(MAS)来缓解单一 LLM 的局限性,如幻觉(Huang et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib12))、弱长程推理(Ferrag et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib7))和知识陈旧(Zhang et al. 2023 (https://arxiv.org/html/2605.24018#bib.bib40))。MAS 建立在智能体 AI 范式之上(Durante et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib5)),组织多个具有专门角色和共同目标的 LLM 基础智能体。通过协调规划、劳动分工与相互评估,这些系统旨在实现比任何单一模型更可靠、更可扩展的认知表现(Zhou et al. 2024a (https://arxiv.org/html/2605.24018#bib.bib43);Li et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib18))。越来越多的研究将 MAS 应用于科学发现,证明了其在迭代和多步研究工作流中的潜力。VIRSCI 模拟了一个虚拟科学家团队,从事结构化的想法生成与评估(Su et al. 2025 (https://arxiv.org/html/2605.24018#bib.bib26)),而 ResearchAgent 则协调专门智能体进行文献分析、假设生成与实验规划(Baek et al. 2024 (https://arxiv.org/html/2605.24018#bib.bib1))。这些工作大多仍以任务或管道为导向,未能提供一个支持循环科学演化以及角色感知、跨学科协作的集成框架。  

## 3 EvoSci  
EvoSci 将科学发现建模为一个演化的、以问题为中心的过程,研究方向在长周期内被迭代探索、评估和完善。据此,EvoSci 包含四个核心组件:(1)由导师智能体引导的问题空间构建模块;(2)由首席研究员智能体领导的协作研究执行模块;(3)系统评估生成的研究想法的质量、新颖性与可行性的评估模块;(4)生物启发式演化迭代模块,支持研究方向的迭代优化。这些组件共同构成一个闭环工作流,用于迭代生成和完善跨学科研究想法。图 1 (https://arxiv.org/html/2605.24018#S2.F1) 展示了 EvoSci 的总体工作流。  

### 3.1 问题空间构建  
自动化科学想法生成的一个核心挑战在于构建一个结构化、高质量的问题空间,以支持跨学科边界的探索。本阶段旨在将初始研究主题转化为一个多样化的研究问题集合,这些研究问题既在语义上有根基,又在结构上可扩展。  

数据准备。我们构建了一个轻量级、多层级的知识图谱,以组织科学学科及其相关实体。首先从一组预定义的代表性学科开始,涵盖主要科学领域(如物理学、化学、生物学、医学、经济学),每个学科作为第一层节点。对于每个学科,我们利用其维基百科页面的摘要和超链接结构提取候选实体。一个基于 LLM 的分类器为每个实体分配语义类型(例如,*理论*、*模型*、*材料*、*现象*)并估计其与学科的相关性。只有相关实体被保留,并通过 *has_entity* 边连接到对应学科。为捕捉跨学科联系,我们计算实体嵌入表示之间的余弦相似度,如果相似度超过阈值,则添加跨实体边,即 \(s(e_i, e_j) = \cos(\mathrm{emb}(e_i), \mathrm{emb}(e_j)) > \tau\)。  

主题分析。给定一个核心研究主题 \(T\) 和一组目标学科 \(\mathcal{D}_{\mathrm{target}} = \{D_1, \dots, D_n\}\),系统首先利用基于 LLM 的分类器将 \(T\) 映射到知识图谱中的一个或多个核心学科,以确保后续探索锚定在清晰的科学语境中。为鼓励跨学科整合,我们采用问答架构,由来自真实科学家数据集(附录 A.1 (https://arxiv.org/html/2605.24018#A1.SS1))实例化的领域专家智能体参与。每个专家智能体都具备文献检索与阅读能力,并与导师智能体进行结构化讨论。通过这一过程,系统识别有前景的跨学科方向,并用从其探索轨迹中导出的领域特定实体更新知识图谱,从而支持下游想法生成的迭代演化。  

生物启发式实体演化。主题分析结束后,系统进入问题生成阶段,聚焦于主题 \(T\) 与所选学科 \(d \in \mathcal{D}_{\mathrm{target}}\) 的交集。对于学科 \(d\),\(\mathcal{E}_d\) 表示知识图谱中关联的实体集合,这些实体被聚类为语义实体簇 \(\mathcal{C}_d = \{\mathcal{C}_{d,1}, \dots, \mathcal{C}_{d,n}\}\)。

相似文章

EvoScientist:面向端到端科学发现的多智能体进化AI科学家

Papers with Code Trending

EvoScientist 是一个用于端到端科学发现的自适应多智能体框架,通过持久化记忆模块持续改进,由三个专业智能体组成,分别负责创意生成、实验执行和知识提炼。它在科学创意生成方面超越了7个当前最先进的系统,并通过多智能体进化提升了代码执行成功率。

EvoMaster:构建可进化大规模自主科学智能体的基础框架

Hugging Face Daily Papers

# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。