SP-Mind:用于空间蛋白质组学分析的自主推理智能体

arXiv cs.AI 论文

摘要

SP-Mind是一个自主AI智能体,统一了空间蛋白质组学分析流程,将自然语言查询转换为端到端的分析工作流,无需微调,并在新的SP-Bench基准测试中取得了最先进的性能。

arXiv:2606.24235v1 Announce Type: new 摘要:空间蛋白质组学能够在组织架构内以单细胞分辨率表征蛋白质表达,在理解肿瘤微环境和指导精准医疗方面发挥关键作用。然而,当前的分析流程仍然分散,需要专家手动协调异构工具,限制了研究的可扩展性和可重复性。我们提出了SP-Mind,这是第一个旨在统一空间蛋白质组学分析流程的自主AI智能体,从原始多重组织成像到下游表型发现。SP-Mind配备了专家精选的生物学分析技能和专门的计算工具,无需任务特定的微调即可将自然语言查询转换为端到端的分析工作流。为了严格评估其能力,我们引入了SP-Bench,这是一个涵盖多种组织类型的综合基准测试,包含18个不同类别的102个任务。通过在SP-Bench和已建立的下游任务上进行广泛评估,与现有的开源生物医学智能体基线相比,SP-Mind取得了最先进的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:45

# SP-Mind:空间蛋白质组学分析的自主推理智能体  
来源:https://arxiv.org/html/2606.24235  

###### 摘要  
空间蛋白质组学能够在单细胞分辨率下表征组织微环境中的蛋白表达,在理解肿瘤微环境和指导精准医疗中发挥关键作用。然而,当前的分析工作流仍然碎片化,需要专家手动编排异构工具,限制了研究的可扩展性和可重复性。我们提出 SP-Mind,这是首个自主 AI 智能体,旨在统一空间蛋白质组学分析流程——从原始多重组织成像到下游表型发现。SP-Mind 配备了专家策划的生物学分析技能和专门的计算工具,能够将自然语言查询转化为端到端分析工作流,且无需任务特定的微调。为严格评估其能力,我们推出了 SP-Bench,一个全面的基准测试,涵盖多种组织类型,包含 18 个不同类别的 102 个任务。通过在 SP-Bench 和已建立的下游任务上的广泛评估,SP-Mind 在与现有开源生物医学智能体基线的比较中达到了最先进水平。  
机器学习, ICML  

## 1 引言  
参考图注  
图 1:SP-Mind 框架与性能评估。空间蛋白质组学工作流和 SP-Mind 架构的简要说明(左和中)。在 SP-Bench、细粒度定量和细胞注释上的基准测试结果显示了 SP-Mind 相较于基线智能体的最先进性能(右)。  

最近多重组织成像的进展使得能够在单细胞分辨率下同时检测数十种蛋白质(Goltsev et al., 2018 (https://arxiv.org/html/2606.24235#bib.bib53); Giesen et al., 2014 (https://arxiv.org/html/2606.24235#bib.bib54); Lin et al., 2018 (https://arxiv.org/html/2606.24235#bib.bib55))。这揭示了组织的“分子社会学”:不同细胞类型如何空间组织、相互作用,并共同塑造疾病结局(Bodenmiller, 2024 (https://arxiv.org/html/2606.24235#bib.bib49); Bussi and Keren, 2024 (https://arxiv.org/html/2606.24235#bib.bib19))。此类见解对于精准肿瘤学和免疫治疗至关重要(Quail and Walsh, 2024 (https://arxiv.org/html/2606.24235#bib.bib50))。提取这些见解需要一个多阶段计算流程:图像配准、伪影校正、细胞分割、标记物定量、表型分析和空间分析(Bussi and Keren, 2024 (https://arxiv.org/html/2606.24235#bib.bib19))。手动编排这些阶段容易出错,且在大规模上不切实际。  

近期的计算流程已将平台特定工具(例如,用于 CODEX、IMC)整合到端到端工作流中,实现了可复现的批量处理(Schapiro et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib11); Magness et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib23); Buckup et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib24))。然而,仍然存在两个基本局限(Bussi and Keren, 2024 (https://arxiv.org/html/2606.24235#bib.bib19)):(a) 依赖于专家的配置:用户必须根据成像平台和组织背景手动选择工具和调整参数;(b) 静态执行:这些系统无法动态适应多样化的分析查询。  

面对这些挑战,一个关键问题浮现:我们能否构建一个自主智能体,它能够理解用户意图、选择合适的工具和配置,并执行端到端的空间蛋白质组学分析?在本文中,我们提出 SP-Mind 来解决这个问题。SP-Mind 是一个自主推理智能体,配备了两个核心组件:(1) 一个包含 10 多个专用工具的模块化库,覆盖从图像预处理到空间分析的完整空间蛋白质组学流程;(2) 专家策划的技能模板,编码了工具选择和参数配置的领域知识。除此之外,SP-Mind 采用 ReAct 风格的推理循环,迭代地观察执行输出、诊断故障并自我纠正。单个自然语言查询即可触发 SP-Mind 自动链接工具、完成分析并交付可解释结果。  

为严格评估智能体空间蛋白质组学分析,我们推出了 SP-Bench,一个包含 102 个任务、18 个类别和 4 个难度级别的综合基准测试。在 SP-Bench 上,SP-Mind 实现了 68.9% 的执行准确率,比最强基线高出 13 个百分点。我们还进一步在下游任务(包括细胞定量和注释)上验证了 SP-Mind,显示出相较于现有方法的一致改进。我们的贡献总结如下:  

- • 我们首次系统地定义并形式化了自动化空间蛋白质组学分析的问题,并提出了 SP-Mind,首个用于端到端空间蛋白质组学分析的自主 AI 智能体,配备专用工具和专家策划的技能模板,以解决该问题。  
- • 我们推出了 SP-Bench,首个用于评估智能体空间蛋白质组学工作流的全面标准化基准测试。  
- • 我们在 SP-Bench 和下游任务上展示了最先进的性能,并通过广泛的消融实验验证了我们设计选择的有效性。  

## 2 相关工作  

##### 空间蛋白质组学工作流  
空间蛋白质组学具有巨大的医学潜力。然而,将原始多重成像数据转化为生物学见解需要一个复杂、多阶段的计算工作流,涉及信号校准(Peng et al., 2017 (https://arxiv.org/html/2606.24235#bib.bib12))、高精度图像配准(Muhlich et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib13))、细胞分割(Yapp et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib14))和表型定量/分类(Bussi and Keren, 2024 (https://arxiv.org/html/2606.24235#bib.bib19))。为管理这种复杂性,该领域已开始采用自动化方法,将各个处理阶段封装进容器化环境(Boettiger, 2015 (https://arxiv.org/html/2606.24235#bib.bib21)),并由工作流管理系统(如 Nextflow (Di Tommaso et al., 2017 (https://arxiv.org/html/2606.24235#bib.bib22)))编排。MCMICRO(Schapiro et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib11))、TRACERx-PHLEX(Magness et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib23))和 MARQO(Buckup et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib24))体现了这一范式,提供了链接已建立的空间蛋白质组学和下游分析工具的端到端流程。尽管这些框架在通量和可重复性方面表现出色,但它们固有的程序刚性限制了其应对生物组织异构性和实际分析需求的“自适应智能”(Bussi and Keren, 2024 (https://arxiv.org/html/2606.24235#bib.bib19))。  

##### 生物医学 AI 智能体  
基于大语言模型(LLM)的 AI 智能体的出现,已从根本上改变了自主推理、规划和工具利用。基础框架如 ReAct(Yao et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib9))、CodeAct(Wang et al., 2024b (https://arxiv.org/html/2606.24235#bib.bib10))和 AutoGen(Wu et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib27)),以及近期的综述(Xi et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib25); Wang et al., 2024a (https://arxiv.org/html/2606.24235#bib.bib26)),已标准化了一种包含三个核心组件的智能体架构:(1) 数据导向的观察,(2) LLM 驱动的推理,(3) 基于代码的动作执行。在生物医学领域,该范式已被适配用于创建专门的“AI 科学家”(Gao et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib51); Qi et al., 2026 (https://arxiv.org/html/2606.24235#bib.bib52))。例如 SciAgents(Ghafarollahi and Buehler, 2025 (https://arxiv.org/html/2606.24235#bib.bib28))、BioDiscoveryAgent(Roohani et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib29))、CRISPR-GPT(Qu et al., 2026 (https://arxiv.org/html/2606.24235#bib.bib30))和 GeneGPT(Jin et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib31)),通过自动化高度领域特定的工作流来体现这一点。近期的更广泛方法,包括 Biomni(Huang et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib32))和 ToolUniverse(Gao et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib33)),开创了通用型生物医学 AI 助手。然而,尽管有这些进展,一个关键空白仍然存在:没有现有的生物医学智能体能够编排端到端的空间蛋白质组学分析流程。  

##### 智能体基准测试  
自主智能体的快速普及使得需要严格的评估框架来衡量其推理和工具使用能力。在通用领域,基准测试如 SWE-Bench(Jimenez et al., 2023 (https://arxiv.org/html/2606.24235#bib.bib38))、GAIA(Mialon et al., 2023 (https://arxiv.org/html/2606.24235#bib.bib36))、AgentBench(Liu et al., 2023 (https://arxiv.org/html/2606.24235#bib.bib35))、MMAU(Sakshi et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib37))和 ToolBench(Qin et al., 2023 (https://arxiv.org/html/2606.24235#bib.bib34))已建立了编码、评估多步规划和通用 API 交互的黄金标准。在生物医学领域,也出现了并行工作来评估领域特定能力,例如 SciBench(Wang et al., 2023 (https://arxiv.org/html/2606.24235#bib.bib40))、LAB-Bench(Laurent et al., 2024 (https://arxiv.org/html/2606.24235#bib.bib39))、BixBench(Mitchener et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib18))用于科学问题解决,以及 MedAgentBench(Jiang et al., 2025 (https://arxiv.org/html/2606.24235#bib.bib41))用于临床决策。然而,现有基准测试在复杂的空间生物学工作流方面存在显著的盲区。迄今为止,尚无针对整体空间蛋白质组学分析工作流的基准测试存在。  

## 3 SP-Mind 智能体  

我们提出 SP-Mind,一个由 LLM 驱动的推理智能体,用于端到端空间蛋白质组学分析。给定用户描述分析目标(如细胞分割、标记物定量或完整流程)的查询,SP-Mind 自主地将任务分解为可执行步骤,调用适当的计算工具,并将结果综合为可解释的输出。该框架旨在处理现代空间生物学工作流的全部复杂性,这些工作流通常需要串联多个专用操作,并仔细注意中间数据格式。SP-Mind 在沙盒化执行环境中运行,具有可配置的权限级别,支持交互式探索和完全自主的批处理。  

算法 1 SP-Mind 技能增强智能体框架  
0: Q: 用户查询(任务规范);T: 工具库;S: 技能库;K: 关键词映射;σ: 会话状态  
0: R: 包含生成产物的最终响应  
1: // 任务条件技能注入  
2: s* ← ∅  
3: 对于每个 (spath, keywords) ∈ K do  
4: 如果 ∃ k ∈ keywords 使得 k ⊆ Q 则  
5: s* ← LoadSkill(spath, S)  
6: 跳出循环  
7: 结束如果  
8: 结束循环  
9: P ← BuildPrompt(T) ⊕ s*  
10: obs ← InitContext(Q, P, σ)  
11: 当 未超时() 时执行  
12: // 推理步骤  
13: τ ← Reason(obs, P, s*)  
14: 如果 IsComplete(τ) 则  
15: 返回 GenerateResponse(τ, σ)  
16: 结束如果  
17: // 执行:代码生成或工具调用  
18: a ← GenerateAction(τ)  
19: r ← ExecuteInSandbox(a)  
20: // 观察:用结果更新状态  
21: obs ← obs ∪ {(τ, a, r)}  
22: σ ← UpdateSession(σ, r)  
23: 结束循环  
24: 返回 TimeoutResponse(obs, σ)  

### 3.1 智能体架构与推理  

SP-Mind 实现了一个 ReAct 风格的推理循环(Yao et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib9)),迭代遍历(1)观察、(2)思考 和(3)执行 的循环,直到任务完成(智能体为用户生成文本/视觉摘要)。在观察阶段,智能体吸收用户提供的任务规范和先前动作的执行输出,将后续推理建立在具体的计算状态上;智能体架构提供自动上下文压缩来管理长时程交互。遵循数据优先的推理协议,智能体在承诺分析动作之前优先检查数据结构和分布,从而减少由于错误指定的阈值导致的级联错误。在思考阶段,智能体执行显式的思维链推理来解释观察、诊断失败并规划后续步骤;这一深思熟虑的过程通过专门的推理块外部化,为复杂的多步工作流提供了可解释的决策轨迹。在执行阶段,智能体通过混合代码执行策略采取行动:SP-Mind 不是仅通过预定义的 API 模式调用工具,而是采用 CodeAct 风格范式(Wang et al., 2024b (https://arxiv.org/html/2606.24235#bib.bib10)),允许其生成并执行任意 Python 脚本、运行 shell 命令、执行文件操作以及动态组合工具调用。这种执行灵活性使智能体能够进行组合分析,并在预构建工具不足时实现自定义逻辑。  

执行状态通过双层记忆架构在推理周期中持续存在。在对话层,会话标识符维护跨轮次的对话历史,使智能体能够引用先前的推理和用户澄清。在计算层,沙盒化执行环境保留文件系统状态,这对多步计算生物学任务至关重要。关于我们智能体的更多细节见附录 A (https://arxiv.org/html/2606.24235#A1)。  

### 3.2 模块化空间蛋白质组学工具集成  

SP-Mind 整合了覆盖空间蛋白质组学分析流程的已建立计算工具。每个工具都被封装为具有标准化接口的 Python 函数,能够实现无缝编排,同时保持与底层基于容器的可执行文件(Docker、Singularity)的互操作性。  

##### 图像预处理。  
在下游分析之前校正照明伪影和自发荧光。  
工具:BaSiC 用于平场和暗场照明轮廓估计,能够校正大面积组织切片上的渐晕和不均匀照明(Peng et al., 2017 (https://arxiv.org/html/2606.24235#bib.bib12))。Backsub 用于逐像素背景减法,按曝光时间缩放,以减少多循环 OME-TIFF 图像中的标记串扰和自发荧光(Schapiro et al., 2022 (https://arxiv.org/html/2606.24235#bib.bib11))。

相似文章

Mind DeepResearch 技术报告

Hugging Face Daily Papers

# 论文页面 - Mind DeepResearch 技术报告 来源:[https://huggingface.co/papers/2604.14518](https://huggingface.co/papers/2604.14518) ## 摘要 MindDR 是一个高效的多智能体深度研究框架,通过协作式三智能体架构与专门设计的四阶段训练流程,在多个基准测试中取得优异成绩。我们提出 Mind DeepResearch(MindDR),一个高效的[多智能体深度研究框架](https://hug

SPINE:用智能体AI弥合虚实鸿沟

arXiv cs.AI

SPINE是一个智能体框架,能够系统化地调试和部署双臂机器人,减少对专家标定的依赖,并提升跨平台的操作化成功率。