SpaCellAgent:自进化大语言模型多智能体轨迹分析框架

arXiv cs.AI 论文

摘要

SpaCellAgent 是一个自进化的大语言模型多智能体框架,能够从自然语言查询自动执行端到端的时空轨迹分析,实现分析效率提升超过40%,同时保持专家级别的性能。

arXiv:2607.07467v1 公告类型:新 摘要:空间和单细胞转录组学在揭示细胞动态方面具有变革性作用。作为重建细胞发育路径的基础范式,轨迹推断(TI)至关重要。然而,现有方法需要大量人工干预且需熟练掌握异构工具,这给高效的TI分析带来了重大障碍。为弥补这一差距,我们提出了SpaCellAgent,一种自主的大语言模型(LLM)多智能体框架,能够自动化端到端的时空分析和叙述生成。SpaCellAgent采用多智能体架构进行策略性工作流规划,一个动态工具编排引擎实现自适应算法选择,以及一个自进化模块通过反馈迭代优化性能。我们在六个异构数据集上评估了SpaCellAgent,这些数据集涵盖复杂的时间发育轨迹、多样的测序平台和空间分辨的组织结构。SpaCellAgent始终展现出超过40%的分析效率提升,同时保持与专家对齐的性能。通过将自然语言规范转化为优化的分析工作流并完全自动化管线,SpaCellAgent普及了先进的时空建模,并为计算生物学建立了一种可扩展的、智能体驱动的范式。代码和材料可在 https://github.com/LittleXH-shw/SpaCellAgent 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:57

# SpaCellAgent: 一种基于LLM的自进化多智能体框架,用于轨迹分析 来源:https://arxiv.org/html/2607.07467 (2026) ###### 摘要。空间和单细胞转录组学在解密细胞动态过程中具有变革性意义。作为重建细胞发育路径的基本范式,轨迹推断(TI)至关重要。然而,现有方法需要大量人工干预,并且需要熟练掌握异构工具,这给高效的TI分析带来了巨大障碍。为弥补这一差距,我们提出SpaCellAgent,一种自主的大语言模型(LLM)多智能体框架,可实现端到端的时空分析和叙事生成。SpaCellAgent利用多智能体架构进行策略性工作流规划,使用动态工具编排引擎进行自适应算法选择,并通过反馈迭代优化性能的自进化模块。我们在六个异构数据集上评估了SpaCellAgent,这些数据集涵盖了复杂的时间发育轨迹、多样的测序平台以及空间解析的组织架构。SpaCellAgent始终表现出超过40%的分析效率提升,同时保持与专家相当的性能。通过将自然语言规范转化为优化的分析工作流并完全自动化流水线,SpaCellAgent实现了高级时空建模的民主化,并为计算生物学建立了一种可扩展的、智能体驱动的范式。代码和材料可在 https://github.com/LittleXH-shw/SpaCellAgent 获取。轨迹推断,空间转录组学,scRNA-seq,大语言模型,多智能体系统 ††copyright:cc††journalyear:2026††doi:10.1145/3770855.3818914††conference:第32届ACM SIGKDD知识发现与数据挖掘会议V.2;2026年8月9–13日,韩国济州岛。††booktitle:第32届ACM SIGKDD知识发现与数据挖掘会议V.2 (KDD 2026),2026年8月9–13日,韩国济州岛††isbn:979-8-4007-2259-2/2026/08††ccs:计算方法 多智能体系统††ccs:应用计算 生物信息学††ccs:应用计算 转录组学

## 1. 引言

参考图片

图1.SpaCellAgent与传统工作流的对比。我们的框架利用LLM驱动的多智能体系统,将自然语言查询和空间数据自主转化为生物学见解。通过编排代码生成与执行,它取代了复杂、非标准化的传统工作流,形成精简、自动化的流水线。

单细胞RNA测序(scRNA-seq)通过实现单细胞分辨率的转录组图谱分析,彻底改变了我们对细胞多样性和发育过程的理解(Tanay and Regev,2017 (https://arxiv.org/html/2607.07467#bib.bib77))。该技术捕获了细胞群体内的异质性(Tang et al.,2009 (https://arxiv.org/html/2607.07467#bib.bib89)),揭示了稀有细胞类型(Shalek et al.,2013 (https://arxiv.org/html/2607.07467#bib.bib90))、过渡状态(Trapnell et al.,2014 (https://arxiv.org/html/2607.07467#bib.bib91))以及先前在整体测量中被掩盖的动态表达模式(Macosko et al.,2015 (https://arxiv.org/html/2607.07467#bib.bib92))。近年来,空间转录组学技术的快速发展使得在保留空间坐标的情况下分析基因表达成为可能,从而能够将细胞状态映射到其原生组织架构中(Rodriques et al.,2019 (https://arxiv.org/html/2607.07467#bib.bib29); Chen et al.,2022 (https://arxiv.org/html/2607.07467#bib.bib14))。这些方法提供了前所未有的洞察力,让我们理解细胞状态如何在时间和空间上演变(Scialdone et al.,2016 (https://arxiv.org/html/2607.07467#bib.bib93)),为发育轨迹(Papalexi and Satija,2018 (https://arxiv.org/html/2607.07467#bib.bib94))、疾病机制(Moffitt et al.,2018 (https://arxiv.org/html/2607.07467#bib.bib95))和组织稳态(Rao et al.,2021 (https://arxiv.org/html/2607.07467#bib.bib2); Schaum et al.,2018 (https://arxiv.org/html/2607.07467#bib.bib96))提供了全面的视角。然而,从如此高维的细胞状态中系统性地揭示分子机制需要复杂的分析流水线(Hu et al.,2021 (https://arxiv.org/html/2607.07467#bib.bib34))。在这一方法论领域中,轨迹推断(TI)成为研究细胞发育和推断细胞命运的关键工具,能够从静态快照中有效重建生物过程的连续进展(Cannoodt et al.,2016a (https://arxiv.org/html/2607.07467#bib.bib28))。为了实现细胞发育轨迹分析的操作化,已建立了多种计算方法,包括Monocle(Qiu et al.,2017 (https://arxiv.org/html/2607.07467#bib.bib4))、PAGA(Wolf et al.,2019 (https://arxiv.org/html/2607.07467#bib.bib5))、Slingshot(Street et al.,2018 (https://arxiv.org/html/2607.07467#bib.bib23))和扩散伪时间(DPT)(Haghverdi et al.,2016 (https://arxiv.org/html/2607.07467#bib.bib26))。这些方法基于不同的数学框架,从基于图的算法到主曲线拟合和扩散图,来推断细胞排序和分支结构。然而,尽管在理论上取得了进展,这些方法在不同数据维度和轨迹拓扑结构上的表现并不一致(Saelens et al.,2019 (https://arxiv.org/html/2607.07467#bib.bib16)),因此需要领域专家进行手动选择和启发式调参。大语言模型(LLM)的最新进展催生了一种范式转变:从以手动工具为中心的分析转向自主的LLM智能体驱动的探索(Wang et al.,2023 (https://arxiv.org/html/2607.07467#bib.bib97); Boiko et al.,2023 (https://arxiv.org/html/2607.07467#bib.bib98))。除了代码生成和复杂推理(Guo et al.,2025 (https://arxiv.org/html/2607.07467#bib.bib24); Achiam et al.,2023 (https://arxiv.org/html/2607.07467#bib.bib25)),LLM现在可以编排异构的计算工具,并通过将原始输出与有意义的见解连接起来,实现科学解释的民主化(M. Bran et al.,2024 (https://arxiv.org/html/2607.07467#bib.bib8); Dai et al.,2024 (https://arxiv.org/html/2607.07467#bib.bib99))。尽管具有这种变革潜力,将LLM智能体工作流整合到单细胞谱系重建中仍处于早期阶段,缺乏端到端的闭环解决方案。关键在于,现有方法缺乏自动化的自进化和迭代优化机制;它们的静态特性常常导致次优的推断结果,并带来繁重的人工负担。因此,迫切需要一种统一的框架,利用预训练LLM的生物学推理能力作为认知核心,自主编排TI工作流。为填补这些空白,我们引入了SpaCellAgent,一种自主的LLM驱动框架,执行端到端的空间分析和生物学叙事生成。与传统的静态、严格定义的流水线(Bacher and Kendziorski,2016 (https://arxiv.org/html/2607.07467#bib.bib101); Wagner and Klein,2020 (https://arxiv.org/html/2607.07467#bib.bib102))相比,SpaCellAgent引入了一种协作式多智能体架构,动态地将专业化角色分配给每个LLM,例如规划器、执行器、评估器和报告器。具体来说,规划器分析轨迹分析目标和拓扑数据属性,将谱系重建过程分解为可执行的里程碑;执行器通过动态工具编排引擎自主识别最优算法策略,生成稳健的实现代码。评估器评估重建谱系的质量,诊断特定的TI异常(如不合理分支和伪时间反转),同时综合纠正性反馈,通过自优化机制进行迭代改进。此外,SpaCellAgent集成了一个自进化模块,持续积累跨任务的重用错误修复和已验证的分析模板,实现持续改进和知识积累。广泛的基准测试表明,SpaCellAgent在拓扑保真度上优于最先进(SOTA)的基线方法,同时将分析时间减少了41.2%。关键在于,它在可扩展性和稳健性之间取得了平衡,提供了稳定且与专家相当的轨迹分析性能。总体而言,本研究的主要贡献可总结如下:
- •我们提出了SpaCellAgent,一种自主的多智能体框架,通过整合scRNA-seq和空间转录组学数据执行端到端的TI分析,并基于TI结果及其他下游分析生成可解释的生物学报告。
- •SpaCellAgent将数据驱动的策略选择与自进化优化机制相结合,使系统能够自主适应不同的生物学异质性,同时持续积累知识以优化分析的稳健性。
- •大量实验证明了SpaCellAgent与专家相当的性能,以及相比手动专家工作流41.2%的分析效率提升。因此,我们的SpaCellAgent显著缩短了复杂轨迹分析从数据到洞察的时间。

## 2. 相关工作

### 2.1. 单细胞和空间组学中的轨迹分析

细胞发育轨迹的计算重建经历了不同的方法论范式(Cannoodt et al.,2016a (https://arxiv.org/html/2607.07467#bib.bib28); Saelens et al.,2019 (https://arxiv.org/html/2607.07467#bib.bib16))。在scRNA-seq领域,基础工具奠定了沿潜在伪时间对细胞进行排序的假设(Haghverdi et al.,2016 (https://arxiv.org/html/2607.07467#bib.bib26))。Monocle率先使用最小生成树(MST)和反向图嵌入来解决分支谱系问题(Qiu et al.,2017 (https://arxiv.org/html/2607.07467#bib.bib4))。Slingshot引入了主曲线用于稳定的多谱系推断(Street et al.,2018 (https://arxiv.org/html/2607.07467#bib.bib23)),而PAGA则利用图抽象有效地调和了聚类与轨迹拓扑结构(Wolf et al.,2019 (https://arxiv.org/html/2607.07467#bib.bib5))。空间转录组学的出现催化了发育建模的范式转变,需要将物理拓扑结构整合到谱系重建中。最近的框架,如SpaceFlow(Ren et al.,2022 (https://arxiv.org/html/2607.07467#bib.bib9))和STORIES(Huizing et al.,2025 (https://arxiv.org/html/2607.07467#bib.bib10)),通过融入空间邻域约束来扩展TI,以建模组织尺度的基因表达梯度。尽管在这些方法论上取得了进展,现有的TI领域仍然碎片化,且严重依赖人工专业知识。研究人员常常受到异构计算生态系统的限制,需要依赖经验进行方法选择,并且低效地手动探索超参数空间。这种标准化缺失不仅阻碍了可重复性,也为领域科学家设置了难以逾越的障碍。为应对这些挑战,我们提出SpaCellAgent,一种LLM驱动的智能体框架,自主编排自适应算法选择和迭代代码优化,确保在不同生物学背景下进行稳健且可重复的分析。

### 2.2. 面向科学发现的LLM与智能体系统

LLM的出现,例如Gemini 2.5(Comanici et al.,2025 (https://arxiv.org/html/2607.07467#bib.bib103)),引发了代码生成、自然语言推理和复杂任务分解方面的范式转变。基于这些能力,通用多智能体架构,如ChatDev(Qian et al.,2024 (https://arxiv.org/html/2607.07467#bib.bib11)),展示了专业化智能体如何协作以自主执行复杂的软件工程任务。最近,这种智能体驱动的范式已显著扩展到物理学领域,像ChemCrow(M. Bran et al.,2024 (https://arxiv.org/html/2607.07467#bib.bib8))这样的框架成功证明了LLM在自动化材料属性预测和编排化学合成方面的有效性。然而,在生物医学和生物信息学中,此类工作流的应用主要局限于文本任务,如文献检索和假设构建(Mathur et al.,2025 (https://arxiv.org/html/2607.07467#bib.bib22); Xiao et al.,2024 (https://arxiv.org/html/2607.07467#bib.bib13))。驱动闭环、经验性数据分析的潜力,特别是针对多步骤计算生物学工作流,仍然在很大程度上未被探索。现有的LLM智能体框架主要针对通用软件工程或文本处理进行了优化,缺乏生物学数据分析所需的领域特定能力。具体来说,它们不支持异构TI分析算法的自主编排,也不具备处理高维、噪声组学数据所需的错误恢复机制。迄今为止,能够执行端到端闭环轨迹分析任务的统一框架仍然缺失。我们的SpaCellAgent填补了这一空白,建立了LLM驱动的自主框架,动态优化算法选择,通过强大且自我优化的工作流提供端到端的TI分析。

## 3. 初步

参考图片

图2.SpaCellAgent的框架。规划器将用户查询分解为执行器可执行的步骤,而评估器则强制执行语法和生物学有效性的双重验证。然后报告器综合最终生物学见解。箭头使用颜色编码:蓝色(规划器的输入)、橙色(执行器的输入)和绿色(评估器用于自优化和自进化的反馈)。经过验证的计划被存档到双层记忆中以驱动自进化。

### 3.1. 细胞数据中的轨迹推断分析

形式上,设一个单细胞数据集表示为D={X,S}。基因表达谱由矩阵X∈R^(N×G)表示,其中N表示细胞数量,G表示基因数量。每个行向量xi∈R^G对应于细胞i的高维表达向量。在空间转录组学的背景下,每个细胞还关联一个空间坐标向量si∈R^D(通常D=2适用于组织切片),形成空间坐标矩阵S∈R^(N×D)。一种常见且有利的方法是将细胞关系建模为图G=(V,E),其中节点V代表细胞。邻接矩阵A∈{0,1}^(N×N)基于scRNA-seq数据的成对转录组相似性构建。对于空间转录组学,则通过整合表达矩阵与物理坐标来构建,从而能够捕捉局部流形结构。TI的主要目标是从这些静态快照中重建动态发育过程。数学上,这可以形式化为学习一个映射f:(X,S)→T

相似文章