SciForge: 一款面向科学发现的AI原生多模态工作台
摘要
SciForge 是一个开源的、AI原生的多模态科学发现工作台,集成了搜索、推理、工作流执行和证据治理功能,通过八个端到端用例(包括基因发现和蛋白质设计)进行了展示。
arXiv:2607.16038v1 公告类型:新
摘要:科研工作日益跨越异构制品——论文、代码、数据集、科学文件格式、模型输出、图表、手稿和团队决策——然而通用型AI助手很少将这些对象保存为连贯且可审计的研究状态。我们提出SciForge——一个面向研究的原生AI多模态工作台,它将图形界面保留给人类判断,而搜索、解析、模型路由、工作流执行、绘图、写作和演示生成等任务作为模块化的智能体可访问服务运行。SciForge围绕五大支柱构建:(i) \emph{目标范围科学决策治理}用于\textbf{目标导向}的研究,配备审查关口和共享审查界面;(ii) \emph{先翻译后推理}用于\textbf{多模态}输入,在智能体推理之前通过领域翻译器路由科学对象;(iii) \emph{证据治理}用于\textbf{可审计}的可追溯性,将声明与来源链和审计结果关联;(iv) \emph{协作团队科学}用于\textbf{协作}研究,支持多角色决策治理,团队共享工作区计划在后续版本中推出;(v) \emph{真实应用场景}用于\textbf{实践}影响,通过八个端到端用户案例展示,重点演示包括针对基因发现的多日智能体研究冲刺、AI引导的从头蛋白质设计、分子优化以及从基因组到BGC的发现。该系统结合了薄交互层、情境研究能力模式、智能体运行时与工作流引擎、证据有向无环图审计边车以及科学模型路由器。SciForge目前作为桌面应用程序运行,支持移动端监督;未来版本将深化团队协作。该系统为开源,可访问 https://github.com/AGI4Sci/SciForge
查看缓存全文
缓存时间: 2026/07/20 09:23
# SciForge:面向科学发现的AI原生多模态工作台 **来源**: https://arxiv.org/html/2607.16038 **上海人工智能实验室** **写作**: SciForge 使用 DeepSeek-v4-pro (文本) 和 gpt-image-2 (图表),由人类指导与验证 ###### 摘要 科学研究工作日益跨越多种异构工件——论文、代码、数据集、科学文件格式、模型输出、图表、稿件以及团队决策——然而通用型AI助手很少将这些对象保留为一致且可审计的研究状态。我们提出 SciForge,一个多模态的研究原生AI工作台,它将图形界面保留给人类判断,而搜索、解析、模型路由、工作流执行、绘图、写作和演示生成则作为模块化的、可由Agent访问的服务运行。SciForge 围绕五大支柱构建:(i) **目标范围的科学决策治理**,用于目标导向研究,包含评审关卡和共享评审界面;(ii) **先翻译后推理**,用于多模态输入,在Agent推理前将科学对象通过领域翻译器进行路由;(iii) **证据治理**,用于可审计的可追溯性,将声明与溯源链和审计发现相连接;(iv) **协作式团队科学**,用于协同研究,支持多角色决策治理,计划在后续版本中提供共享团队工作区;(v) **实际应用场景**,用于体现实际影响,通过八个端到端用户案例展示,旗舰演示包括用于基因发现的多日Agentic研究冲刺、AI引导的从头蛋白质设计、分子优化以及从基因组到BGC的发现。该系统结合了薄交互层、情境化研究能力模式、Agent运行时与工作流引擎、证据DAG审计侧车以及科学模型路由器。SciForge 目前作为桌面应用运行,支持移动端监督;未来版本将深化团队协作。该系统开源,可在 https://github.com/AGI4Sci/SciForge 获取。 **关键词**: SciForge, AI工作台, 科学发现, Agent工作流, 证据感知AI, 多模态科学, 研究自动化 参照图1: SciForge 概览:一个实时的科学研究线索(左)及其可检查的证据DAG(右)。在此目标发现示例中,源断言、推理节点和声明通过支持边和矛盾边保持连接,同时研究者仍可看到节点级别的溯源和审计指标。 ## 1 引言 ### 1.1 背景与动机 科学发现正变得越来越计算化、多模态化和协作化。单个研究项目可能涉及学术论文、实验协议、命令行工具、笔记本、基因与变异文件、蛋白质序列、三维结构、分子记录、单细胞矩阵、生成的图表、稿件草稿、幻灯片以及小组决策。这些对象并非独立文件。稿件中的一项声明可能依赖于原始数据集、预处理脚本、模型运行、可视化参数、文献段落,以及后来人类关于证据是否足够使用的决定。因此,核心瓶颈已不再仅仅是模型或工具的访问,而是缺乏一个持久的环境来将科学对象、Agent行为、人类决策和证据轨迹组织成一个连贯的研究状态。 最近的AI系统在文献检索与综合、假设生成、编码、实验和科学写作方面展示了令人印象深刻的能力[paperQA2024, openScholar2024, googleCoScientist2025, sakanaAIScientist2024, yamada2025aiscientistv2, agentLaboratory2025, ghareeb2026robin, huang2025biomni]。同时,具备桌面和终端能力的科学工作台显示了将执行过程保持靠近本地文件、远程服务器和HPC环境的重要性[anthropicClaudeScience2026, omicOSOverview2026, omicsClaw2026, operonGitHub2026, claudePrism2026]。然而,大多数现有系统仍侧重任务特定智能、对话式协助或本地执行表面。它们很少将完整的研究过程视为**目标导向**、**多模态**、**可审计**且**协作**的工作流,其中科学数据、Agent推理、生成的工件和稿件声明随时间保持连接。 这一差距之所以重要,是因为科学AI Agent必须满足通用型助手所不具备的四项相互关联的需求。**目标导向**的研究设计需要持久的目标、评审关卡以及跨越轮次、工具和协作者共享的决策记录——而非会话范围的对话。**多模态**输入需要原生的科学文件处理:FASTA序列、PDB/mmCIF结构、SMILES字符串、变异文件和细胞组学表格,若不经过领域特定翻译,无法直接提示。**可审计**的证据轨迹必须将每个结论链接到其支持数据、脚本、模型、参数、论文或专家翻译,并在图表或行动需要人工PI批准时发出警告;这些要求与已建立的FAIR和可重现计算原则一致[wilkinson2016fair, sandve2013reproducible]。**协作**治理使得团队决策、目标范围审批、跨会话交接以及多位研究者对声明和证据的共享评审成为可能。第3节展示了SciForge的架构——用于多模态“先翻译后推理”的科学模型路由器、用于可审计溯源证据DAG和项目DAG,以及用于协作科学的多角色决策治理——如何从结构上而非通过临时提示来满足每一项需求。 我们提出**SciForge**,一个用于科学发现的多模态研究原生AI工作台。SciForge被设计为本地优先的研究操作环境,而非单个模型的包装器。其架构将交互表面、研究能力模式、带有证据治理的核心引擎、科学模型路由器以及本地优先基础设施组织成一个层次化的工作台;第3节详细描述每一层。 ### 1.2 贡献 SciForge的核心科学贡献针对当前研究AI系统中的四个基本缺口: - **多模态入口**。通过“先翻译后推理”实现端到端的科学文件处理:四类原生科学对象——蛋白质序列(.faa; .fasta/.fa)、蛋白质结构(.pdb/.cif/.mmcif)、分子(.smi/.smiles)和单细胞转录组学(通过Cell2Sentence[rizvi2025c2s])——通过领域专家翻译器(Esm2Text[lin2023esm2], Prot2Text[abdine2023prot2text], BioT5+[pei2024biot5], C2S)进行路由,在主要Agent推理之前返回结构化的专家观察。翻译器输出是证据候选,而非经过验证的事实;人类仍负责判断。 - **证据治理**。每个Agent动作——文件读取、模型调用、工具调用、脚本执行——都会将结构化溯源信息(软件版本、参数、环境、随机种子)附加到线程级别的证据快照。一个只读审计侧车检查这些快照并揭示潜在缺口而不会阻塞Agent的工作,将声明链接到具体的数据、脚本、模型和参数。一个目标范围的项目DAG将研究目标、证据快照和评审决策组织成共享的、可审计的结构,支持候选和认证发布关卡,其溯源词汇基于W3C PROV数据模型[w3cprov2013]。 - **协作科学**。SciForge支持多角色协作研究,其中审阅者/批准者角色、基于IM的协调渠道(Zulip、Discord、微信、飞书)和共享评审界面支持跨会话交接和团队级别的决策治理。项目DAG使协作评审工作流可审计:研究者审查证据快照、记录角色归属的评审项,并通过可追溯的人工-PI监督推进工件通过候选/认证发布关卡。 - **实际影响**。SciForge通过端到端科学工作流得到验证,涵盖生物合成基因簇(BGC)发现、AI引导的蛋白质和分子设计(包含实验评估标准)、自动期刊风格图表生成、多格式文档解析以及从研究工件生成的AI辅助演示——每项都附有明确的证据轨迹、审计发现和治理检查点,详见第4节。SciForge代码库,包括证据DAG审计工作器、决策记录合约、Agent技能和科学模型路由器,已在 https://github.com/AGI4Sci/SciForge 开源。 ## 2 相关工作 ### 2.1 基于GUI的科学工作台 基于GUI的科学工作台,包括桌面和Web应用,通过人类可用的工作空间使AI辅助变得可访问。Claude Science是最接近的广泛商业参考:它被描述为科学家AI工作台,具有桌面、本地、SSH和HPC面向的执行、科学技能、专家Agent、生成的工件以及用于引用和计算的审阅Agent[anthropicClaudeScience2026]。ClaudePrism侧重于工作流中的稿件方面,结合了原生桌面环境与本地LaTeX编译、Python环境、Claude Code会话和科学写作技能[claudePrism2026]。Web工具如Elicit和Consensus为文献检索、综合和研究Agent风格的评审提供了精美的界面[elicit2026, consensus2026]。这些系统展示了可用研究界面的重要性,但它们通常以单一模型家族、单一工作流领域或单一用户会话为中心。SciForge则将GUI视为薄层,用于人类对本地、模块化、多Agent研究基质的判断。 ### 2.2 终端工作台 面向终端的工作台优先考虑靠近本地文件、远程服务器和HPC环境的执行。OmicOS提供一个`omicos`核心二进制文件,可作为本地守护进程运行,提供浏览器UI或作为`omicos cli`,分析代码在共享IPython内核中运行,原始数据保持在本地[omicOSOverview2026, omicOSServe2026, omicOSCLI2026]。OmicsClaw遵循本地优先的多组学设计,提供CLI、TUI、桌面、Web后端和SSH远程执行表面,共享一个Agent循环[omicsClaw2026]。Operon针对生物信息学工作流,跨桌面和远程集群环境,使用持久终端会话,使作业在数据和调度器所在的位置执行[operonGitHub2026]。这些系统在本地和远程执行方面很强,但通常暴露工具和工作流,而非统一层用于多模态科学路由、研究决策表面、团队监督以及稿件到工件的连续性。 ### 2.3 AI科学家与研究Agent 以文献为中心的Agent建立了自动化科学的检索和综合层。FutureHouse通过Web/API平台暴露用于文献检索、深度评审、先例搜索和化学规划的Agent[futureHousePlatform2025],而PaperQA2、OpenScholar和ScholarQA研究基于检索的科学问答和文献综合[paperQA2024, openScholar2024, scholarQA2025]。端到端研究Agent将范围扩展到检索之外,进入构思、实现、实验、分析和稿件制作。AI Scientist和AI Scientist-v2自动化了机器学习研究循环的实质性部分,Agent Laboratory组织了专门的研究角色,数据到论文系统将结构化数据集转化为人类可验证的稿件[sakanaAIScientist2024, yamada2025aiscientistv2, agentLaboratory2025, ifargan2025datatopaper]。AI Co-Scientist和Robin研究多Agent假设生成、辩论、排序和发现工作流在生物医学环境中的应用[googleCoScientist2025, ghareeb2026robin]。领域接地系统将语言Agent与科学工具或实验工作流结合。ChemCrow和Coscientist集成了化学规划和执行工具[bran2024chemcrow, boiko2023coscientist];Biomni、CRISPR-GPT和Virtual Lab针对生物医学分析、基因编辑设计和协作纳米抗体设计[huang2025biomni, qu2026crisprgpt, swanson2025virtuallab];SciAgents探索多Agent图推理用于材料发现,A-Lab通过自主材料合成部分闭环[ghafarollahi2025sciagents, szymanski2023alab]。像DiscoveryWorld和ScienceAgentBench这样的基准也表明,当前Agent在端到端发现和现实科学编码任务上仍然脆弱[jansen2024discoveryworld, chen2025scienceagentbench]。总的来说,这些系统展示了专门化科学Agent的能力,但较少关注一个持久本地工作台,在此工作台中异构数据、代码、图表、决策、证据和生成的工件在一个受治理的工作空间中保持连接。 ### 2.4 比较与定位 虽然每个系统类别都解决了AI辅助研究生命周期的一个不同方面,但SciForge旨在将它们统一到一个单一工作台内。比较涵盖五个关键维度:执行、模型治理、证据质量、研究连续性和目标导向的研究设计。 **执行架构**。像Claude Science和ClaudePrism这样的GUI工作台提供精美的交互体验,但通常限制于一个模型供应商和一个本地会话。终端工作台——OmicOS采用混合守护进程加浏览器模型,OmicsClaw采用多表面CLI,Operon采用持久终端会话——擅长在数据和调度器所在的位置运行代码,但它们暴露的是工具和管道,而非统一的研究工作台。SciForge通过提供一个供人类判断的GUI,同时保持一个本地优先的工作空间(执行可跨桌面、SSH和HPC环境)来桥接这两个世界。 **模型治理**。所审查的公开资料通常强调单一供应商家族或手动在不同工具间切换。SciForge的科学模型路由器将多供应商路由与一个故意狭窄的“先翻译后推理”文件入口路径相结合,覆盖四种模态类别:蛋白质序列(Esm2Text[lin2023esm2])、蛋白质结构(Prot2Text[abdine2023prot2text])、分子(BioT5+[pei2024biot5])和单细胞转录组学(Cell2Sentence[rizvi2025c2s]);不支持的格式则失败关闭。文献通过检索、PDF锚定和来源归属来处理,而非作为科学模态翻译器。我们在审查的类别中未发现这种相同的集成组合被记录为一级特性。 **证据质量与治理**。基准报告了在现实科学任务上的显著失败率[jansen2024discoveryworld, chen2025scienceagentbench];在我们审查的公开文档材料中,未观察到将声明-证据审计轨迹、W3C PROV对齐的溯源和质量关卡集成在同一个研究工作台中的组合。SciForge通过一个以PROV-DM对齐的图(序列化为PROV-JSON)[w3cprov2013, huynh2013provjson]为后盾的证据DAG,审计运行、风险摘要和显式质量关卡,将声明贯穿其中。这一治理层旨在使Agent输出可检查、可审计。 **研究连续性**。许多被审查的系统强调会话式交互。SciForge通过有作用域的自由文本记录(范围、标签、配置......)维护以目标为中心的研究记忆,但该段落似乎被截断了。我们需要继续翻译。由于用户输入只到"scope, tags, confi"就结束了,但根据上下文,应该是描述目标范围的研究记忆。我们保留原文句子并合理补充翻译它,但注意不要添加不在原文中的内容?原文是"SciForge maintains goal‑centered research memory as scoped free‑text records (scope, tags, confi" 然后突然结束。输出时我们也应该保持原样,因为用户输入截断了。我们按原文输出,不补全。 注意:用户输入的最后是"scope, tags, confi"没有闭合括号。我们按原文翻译,括号内部分保持英文?不,应该翻译,但confi可能是configuration的缩写。我们翻译为“(范围、标签、配置”。由于原文不完整,我们保持原样。 输出时注意不要包含任何额外内容,只翻译给定的文本。# SciForge:面向科学发现的AI原生多模态工作台 **来源**: https://arxiv.org/html/2607.16038 **上海人工智能实验室** **写作**: SciForge 使用 DeepSeek-v4-pro (文本) 和 gpt-image-2 (图表),由人类指导与验证 ###### 摘要 科学研究工作日益跨越多种异构工件——论文、代码、数据集、科学文件格式、模型输出、图表、稿件以及团队决策——然而通用型AI助手很少将这些对象保留为一致且可审计的研究状态。我们提出 SciForge,一个多模态的研究原生AI工作台,它将图形界面保留给人类判断,而搜索、解析、模型路由、工作流执行、绘图、写作和演示生成则作为模块化的、可由Agent访问的服务运行。SciForge 围绕五大支柱构建:(i) **目标范围的科学决策治理**,用于目标导向研究,包含评审关卡和共享评审界面;(ii) **先翻译后推理**,用于多模态输入,在Agent推理前将科学对象通过领域翻译器进行路由;(iii) **证据治理**,用于可审计的可追溯性,将声明与溯源链和审计发现相连接;(iv) **协作式团队科学**,用于协同研究,支持多角色决策治理,计划在后续版本中提供共享团队工作区;(v) **实际应用场景**,用于体现实际影响,通过八个端到端用户案例展示,旗舰演示包括用于基因发现的多日Agentic研究冲刺、AI引导的从头蛋白质设计、分子优化以及从基因组到BGC的发现。该系统结合了薄交互层、情境化研究能力模式、Agent运行时与工作流引擎、证据DAG审计侧车以及科学模型路由器。SciForge 目前作为桌面应用运行,支持移动端监督;未来版本将深化团队协作。该系统开源,可在 https://github.com/AGI4Sci/SciForge 获取。 **关键词**: SciForge, AI工作台, 科学发现, Agent工作流, 证据感知AI, 多模态科学, 研究自动化 参照图1: SciForge 概览:一个实时的科学研究线索(左)及其可检查的证据DAG(右)。在此目标发现示例中,源断言、推理节点和声明通过支持边和矛盾边保持连接,同时研究者仍可看到节点级别的溯源和审计指标。 ## 1 引言 ### 1.1 背景与动机 科学发现正变得越来越计算化、多模态化和协作化。单个研究项目可能涉及学术论文、实验协议、命令行工具、笔记本、基因与变异文件、蛋白质序列、三维结构、分子记录、单细胞矩阵、生成的图表、稿件草稿、幻灯片以及小组决策。这些对象并非独立文件。稿件中的一项声明可能依赖于原始数据集、预处理脚本、模型运行、可视化参数、文献段落,以及后来人类关于证据是否足够使用的决定。因此,核心瓶颈已不再仅仅是模型或工具的访问,而是缺乏一个持久的环境来将科学对象、Agent行为、人类决策和证据轨迹组织成一个连贯的研究状态。 最近的AI系统在文献检索与综合、假设生成、编码、实验和科学写作方面展示了令人印象深刻的能力[paperQA2024, openScholar2024, googleCoScientist2025, sakanaAIScientist2024, yamada2025aiscientistv2, agentLaboratory2025, ghareeb2026robin, huang2025biomni]。同时,具备桌面和终端能力的科学工作台显示了将执行过程保持靠近本地文件、远程服务器和HPC环境的重要性[anthropicClaudeScience2026, omicOSOverview2026, omicsClaw2026, operonGitHub2026, claudePrism2026]。然而,大多数现有系统仍侧重任务特定智能、对话式协助或本地执行表面。它们很少将完整的研究过程视为**目标导向**、**多模态**、**可审计**且**协作**的工作流,其中科学数据、Agent推理、生成的工件和稿件声明随时间保持连接。 这一差距之所以重要,是因为科学AI Agent必须满足通用型助手所不具备的四项相互关联的需求。**目标导向**的研究设计需要持久的目标、评审关卡以及跨越轮次、工具和协作者共享的决策记录——而非会话范围的对话。**多模态**输入需要原生的科学文件处理:FASTA序列、PDB/mmCIF结构、SMILES字符串、变异文件和细胞组学表格,若不经过领域特定翻译,无法直接提示。**可审计**的证据轨迹必须将每个结论链接到其支持数据、脚本、模型、参数、论文或专家翻译,并在图表或行动需要人工PI批准时发出警告;这些要求与已建立的FAIR和可重现计算原则一致[wilkinson2016fair, sandve2013reproducible]。**协作**治理使得团队决策、目标范围审批、跨会话交接以及多位研究者对声明和证据的共享评审成为可能。第3节展示了SciForge的架构——用于多模态“先翻译后推理”的科学模型路由器、用于可审计溯源证据DAG和项目DAG,以及用于协作科学的多角色决策治理——如何从结构上而非通过临时提示来满足每一项需求。 我们提出**SciForge**,一个用于科学发现的多模态研究原生AI工作台。SciForge被设计为本地优先的研究操作环境,而非单个模型的包装器。其架构将交互表面、研究能力模式、带有证据治理的核心引擎、科学模型路由器以及本地优先基础设施组织成一个层次化的工作台;第3节详细描述每一层。 ### 1.2 贡献 SciForge的核心科学贡献针对当前研究AI系统中的四个基本缺口: - **多模态入口**。通过“先翻译后推理”实现端到端的科学文件处理:四类原生科学对象——蛋白质序列(.faa; .fasta/.fa)、蛋白质结构(.pdb/.cif/.mmcif)、分子(.smi/.smiles)和单细胞转录组学(通过Cell2Sentence[rizvi2025c2s])——通过领域专家翻译器(Esm2Text[lin2023esm2], Prot2Text[abdine2023prot2text], BioT5+[pei2024biot5], C2S)进行路由,在主要Agent推理之前返回结构化的专家观察。翻译器输出是证据候选,而非经过验证的事实;人类仍负责判断。 - **证据治理**。每个Agent动作——文件读取、模型调用、工具调用、脚本执行——都会将结构化溯源信息(软件版本、参数、环境、随机种子)附加到线程级别的证据快照。一个只读审计侧车检查这些快照并揭示潜在缺口而不会阻塞Agent的工作,将声明链接到具体的数据、脚本、模型和参数。一个目标范围的项目DAG将研究目标、证据快照和评审决策组织成共享的、可审计的结构,支持候选和认证发布关卡,其溯源词汇基于W3C PROV数据模型[w3cprov2013]。 - **协作科学**。SciForge支持多角色协作研究,其中审阅者/批准者角色、基于IM的协调渠道(Zulip、Discord、微信、飞书)和共享评审界面支持跨会话交接和团队级别的决策治理。项目DAG使协作评审工作流可审计:研究者审查证据快照、记录角色归属的评审项,并通过可追溯的人工-PI监督推进工件通过候选/认证发布关卡。 - **实际影响**。SciForge通过端到端科学工作流得到验证,涵盖生物合成基因簇(BGC)发现、AI引导的蛋白质和分子设计(包含实验评估标准)、自动期刊风格图表生成、多格式文档解析以及从研究工件生成的AI辅助演示——每项都附有明确的证据轨迹、审计发现和治理检查点,详见第4节。SciForge代码库,包括证据DAG审计工作器、决策记录合约、Agent技能和科学模型路由器,已在 https://github.com/AGI4Sci/SciForge 开源。 ## 2 相关工作 ### 2.1 基于GUI的科学工作台 基于GUI的科学工作台,包括桌面和Web应用,通过人类可用的工作空间使AI辅助变得可访问。Claude Science是最接近的广泛商业参考:它被描述为科学家AI工作台,具有桌面、本地、SSH和HPC面向的执行、科学技能、专家Agent、生成的工件以及用于引用和计算的审阅Agent[anthropicClaudeScience2026]。ClaudePrism侧重于工作流中的稿件方面,结合了原生桌面环境与本地LaTeX编译、Python环境、Claude Code会话和科学写作技能[claudePrism2026]。Web工具如Elicit和Consensus为文献检索、综合和研究Agent风格的评审提供了精美的界面[elicit2026, consensus2026]。这些系统展示了可用研究界面的重要性,但它们通常以单一模型家族、单一工作流领域或单一用户会话为中心。SciForge则将GUI视为薄层,用于人类对本地、模块化、多Agent研究基质的判断。 ### 2.2 终端工作台 面向终端的工作台优先考虑靠近本地文件、远程服务器和HPC环境的执行。OmicOS提供一个`omicos`核心二进制文件,可作为本地守护进程运行,提供浏览器UI或作为`omicos cli`,分析代码在共享IPython内核中运行,原始数据保持在本地[omicOSOverview2026, omicOSServe2026, omicOSCLI2026]。OmicsClaw遵循本地优先的多组学设计,提供CLI、TUI、桌面、Web后端和SSH远程执行表面,共享一个Agent循环[omicsClaw2026]。Operon针对生物信息学工作流,跨桌面和远程集群环境,使用持久终端会话,使作业在数据和调度器所在的位置执行[operonGitHub2026]。这些系统在本地和远程执行方面很强,但通常暴露工具和工作流,而非统一层用于多模态科学路由、研究决策表面、团队监督以及稿件到工件的连续性。 ### 2.3 AI科学家与研究Agent 以文献为中心的Agent建立了自动化科学的检索和综合层。FutureHouse通过Web/API平台暴露用于文献检索、深度评审、先例搜索和化学规划的Agent[futureHousePlatform2025],而PaperQA2、OpenScholar和ScholarQA研究基于检索的科学问答和文献综合[paperQA2024, openScholar2024, scholarQA2025]。端到端研究Agent将范围扩展到检索之外,进入构思、实现、实验、分析和稿件制作。AI Scientist和AI Scientist-v2自动化了机器学习研究循环的实质性部分,Agent Laboratory组织了专门的研究角色,数据到论文系统将结构化数据集转化为人类可验证的稿件[sakanaAIScientist2024, yamada2025aiscientistv2, agentLaboratory2025, ifargan2025datatopaper]。AI Co-Scientist和Robin研究多Agent假设生成、辩论、排序和发现工作流在生物医学环境中的应用[googleCoScientist2025, ghareeb2026robin]。领域接地系统将语言Agent与科学工具或实验工作流结合。ChemCrow和Coscientist集成了化学规划和执行工具[bran2024chemcrow, boiko2023coscientist];Biomni、CRISPR-GPT和Virtual Lab针对生物医学分析、基因编辑设计和协作纳米抗体设计[huang2025biomni, qu2026crisprgpt, swanson2025virtuallab];SciAgents探索多Agent图推理用于材料发现,A-Lab通过自主材料合成部分闭环[ghafarollahi2025sciagents, szymanski2023alab]。像DiscoveryWorld和ScienceAgentBench这样的基准也表明,当前Agent在端到端发现和现实科学编码任务上仍然脆弱[jansen2024discoveryworld, chen2025scienceagentbench]。总的来说,这些系统展示了专门化科学Agent的能力,但较少关注一个持久本地工作台,在此工作台中异构数据、代码、图表、决策、证据和生成的工件在一个受治理的工作空间中保持连接。 ### 2.4 比较与定位 虽然每个系统类别都解决了AI辅助研究生命周期的一个不同方面,但SciForge旨在将它们统一到一个单一工作台内。比较涵盖五个关键维度:执行、模型治理、证据质量、研究连续性和目标导向的研究设计。 **执行架构**。像Claude Science和ClaudePrism这样的GUI工作台提供精美的交互体验,但通常限制于一个模型供应商和一个本地会话。终端工作台——OmicOS采用混合守护进程加浏览器模型,OmicsClaw采用多表面CLI,Operon采用持久终端会话——擅长在数据和调度器所在的位置运行代码,但它们暴露的是工具和管道,而非统一的研究工作台。SciForge通过提供一个供人类判断的GUI,同时保持一个本地优先的工作空间(执行可跨桌面、SSH和HPC环境)来桥接这两个世界。 **模型治理**。所审查的公开资料通常强调单一供应商家族或手动在不同工具间切换。SciForge的科学模型路由器将多供应商路由与一个故意狭窄的“先翻译后推理”文件入口路径相结合,覆盖四种模态类别:蛋白质序列(Esm2Text[lin2023esm2])、蛋白质结构(Prot2Text[abdine2023prot2text])、分子(BioT5+[pei2024biot5])和单细胞转录组学(Cell2Sentence[rizvi2025c2s]);不支持的格式则失败关闭。文献通过检索、PDF锚定和来源归属来处理,而非作为科学模态翻译器。我们在审查的类别中未发现这种相同的集成组合被记录为一级特性。 **证据质量与治理**。基准报告了在现实科学任务上的显著失败率[jansen2024discoveryworld, chen2025scienceagentbench];在我们审查的公开文档材料中,未观察到将声明-证据审计轨迹、W3C PROV对齐的溯源和质量关卡集成在同一个研究工作台中的组合。SciForge通过一个以PROV-DM对齐的图(序列化为PROV-JSON)[w3cprov2013, huynh2013provjson]为后盾的证据DAG,审计运行、风险摘要和显式质量关卡,将声明贯穿其中。这一治理层旨在使Agent输出可检查、可审计。 **研究连续性**。许多被审查的系统强调会话式交互。SciForge通过有作用域的自由文本记录(范围、标签、配置
相似文章
EvoSci:一种受生物启发的多智能体框架,用于科学发现的演化
EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。
重新思考智能体时代的科学发现
本文介绍了SCION,一个智能体科学操作系统,它通过研究执行计划(REP)和分层多智能体执行,集成了AI工具用于科学发现。该系统在材料分析、分子设计和蛋白质筛选等应用中表现出色,超越了现有的自主研究智能体基线。
IdeaForge:基于知识图谱的多智能体框架,用于跨方法论创新分析与专利权利要求生成
本文介绍了IdeaForge,一个利用知识图谱跨方法论分析创新并生成专利权利要求的多智能体框架。
SciPaths:预测科学发现的路径
介绍了SciPaths,这是一个用于预测实现目标科学发现所需的关键贡献的基准,并评估了前沿和开放权重语言模型,发现从贡献反向推理到关键构建块的能力仍有显著提升空间。
EvoScientist:面向端到端科学发现的多智能体进化AI科学家
EvoScientist 是一个用于端到端科学发现的自适应多智能体框架,通过持久化记忆模块持续改进,由三个专业智能体组成,分别负责创意生成、实验执行和知识提炼。它在科学创意生成方面超越了7个当前最先进的系统,并通过多智能体进化提升了代码执行成功率。