将分析严谨性引入科学中的代理AI:Brain Researcher神经影像数据分析平台

arXiv cs.AI 论文

摘要

Brain Researcher是一个代理平台,通过强制执行分析严谨性、提高工具选择准确性和确保可重复性来增强AI驱动的神经影像数据分析。该研究展示了显著的性能提升,并将方法论判断集成到工作流程中。

arXiv:2608.19902v1 公告类型:新 摘要:AI代理可以执行科学分析,但分析输出只有在权衡了替代方案并将主张限制在证据支持的范围内时,才成为可辩护的主张。代理可能会重复失败,包括选择性分析、过早宣布成功以及优化不完美的标准。我们提出Brain Researcher,一个代理研究工具,在神经影像研究人员的计算环境中运行,遵循可接受分析、必要检查和主张范围的规则。在基准测试中,Brain Researcher将七个模型的首选工具选择准确性提高了70.2个百分点(无它时23.3%,有它时93.6%),可验证的基础从4.6%提高到22.0%。在协作主导和自我进化的研究中,多重宇宙分析揭示了分析选择的敏感性,科学审查将主张分类为接受、合格、修订、阻止、拒绝或延迟。通过将决策与证据和来源联系起来,Brain Researcher将方法论判断嵌入到工作流程中,而不是之后。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:10

# 将分析严谨性引入科学领域的智能体AI:用于神经影像数据分析的Brain Researcher平台
来源:https://arxiv.org/html/2608.19902
\\无编号

智能体AI可以执行科学分析,但只有在权衡了备选方案并将主张限定于证据所能支持的范围后,分析输出才能成为站得住脚的论断。智能体可能会重复失败模式,包括选择性分析、过早宣称成功以及优化不完美的评估标准。我们提出Brain Researcher,这是一个在神经影像研究者计算环境中运行的智能体研究框架,遵循可接受分析、必要检查和主张范围等规则。在基准测试中,Brain Researcher将七种模型在首个工具选择上的准确率提升了70.2个百分点(使用前为23.3%,使用后达93.6%),可验证的依据性从4.6%提升至22.0%。在协作者主导和自主演化的研究中,多宇宙分析揭示了分析选择的敏感性,而科学审查将主张分类为接受、附条件接受、修改、阻止、拒绝或推迟。通过将决策与证据和溯源性相关联,Brain Researcher将方法论判断嵌入工作流程之中,而非置于其后。

Nicholas Lu 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Xinhui Li 附属机构:神经影像与数据科学转化研究三机构中心(TReNDS),乔治亚州立大学,佐治亚理工学院,埃默里大学,佐治亚州亚特兰大,美国 Jocelyn A. Ricard 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Ce Ju 附属机构:法国国立信息与自动化研究所,法国原子能委员会,巴黎-萨克雷大学,法国帕莱索 Huan H. Wang 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Christian Kindermann 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Jeanette A. Mumford 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Steven Dillmann 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 James Kent 附属机构:德克萨斯大学奥斯汀分校,德克萨斯州奥斯汀,美国 Alejandro de la Vega 附属机构:德克萨斯大学奥斯汀分校,德克萨斯州奥斯汀,美国 Sanmi Koyejo 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Vince D. Calhoun 附属机构:神经影像与数据科学转化研究三机构中心(TReNDS),乔治亚州立大学,佐治亚理工学院,埃默里大学,佐治亚州亚特兰大,美国 Joshua W. Buckholtz 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 Juan Helen Zhou 附属机构:新加坡国立大学,新加坡 Steffen Bollmann 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国 附属机构:昆士兰大学,昆士兰州布里斯班,澳大利亚 Russell A. Poldrack 附属机构:斯坦福大学,加利福尼亚州斯坦福,美国

###### 关键词

神经成像;科学智能体;可重复性;研究基础设施;分析灵活性

科学常常通过将其曾经的前沿纳入基础设施而取得进步:例如对基因组进行测序或预处理大脑扫描,这些曾标志着科学实践边缘的活动,已成为更大工作流程中的常规步骤。AI智能体可能代表着这一进程的下一阶段。它们越来越能够解读目标、调用外部工具、观察中间结果并选择后续行动(5 (https://arxiv.org/html/2608.19902#bib.bib2); 52 (https://arxiv.org/html/2608.19902#bib.bib26); 27 (https://arxiv.org/html/2608.19902#bib.bib45); 30 (https://arxiv.org/html/2608.19902#bib.bib15); 41 (https://arxiv.org/html/2608.19902#bib.bib20))。然而,科学研究并不仅仅是流程的序列,执行一项分析也不等同于建立一个主张。这一区别在神经成像领域尤为重要,因为大型、异构的数据集会进入具有多个合理选择的漫长分析流水线。关于预处理、分区、混杂调整和模型规范的决定可以实质性地改变结果(45 (https://arxiv.org/html/2608.19902#bib.bib21); 36 (https://arxiv.org/html/2608.19902#bib.bib35); 20 (https://arxiv.org/html/2608.19902#bib.bib11); 9 (https://arxiv.org/html/2608.19902#bib.bib6));当七十个团队分析同一神经影像数据集时,没有两个团队使用相同的工作流程,且他们的结论差异显著(6 (https://arxiv.org/html/2608.19902#bib.bib3))。

神经成像领域也发展出了计算自动化方面最为成熟的开放科学生态系统之一。BIDS和OpenNeuro标准化了数据的组织和共享(46 (https://arxiv.org/html/2608.19902#bib.bib22); 39 (https://arxiv.org/html/2608.19902#bib.bib19));fMRIPrep自动化了功能磁共振成像的预处理(21 (https://arxiv.org/html/2608.19902#bib.bib12));Nipype将软件包集成为可重复的工作流程(26 (https://arxiv.org/html/2608.19902#bib.bib13))。BIDS统计模型(Statistical Models)和FitLins将这种标准化扩展到机器可读的统计模型及其执行(12 (https://arxiv.org/html/2608.19902#bib.bib1); 40 (https://arxiv.org/html/2608.19902#bib.bib36)),而引导式多宇宙分析使替代工作流程更易于导航(13 (https://arxiv.org/html/2608.19902#bib.bib7))。这些工具共同使流程及其替代方案越来越具备可重用性和可比性。然而,它们并未将选定的路线与支持该主张所需的证据和方法论条件绑定在一起。因此,挑战不单纯是自动化神经成像分析,而是要确保自动化不会模糊分析得以支持主张的方法论条件。

使用工具的智能体既带来了机遇也带来了风险。它们可以连接分析的各个分散阶段,并在观察中间结果后进行调整,但成功的命令执行并不能保证分析在科学上有效。智能体可能选择不合适的工具,忽视数据或模型的不兼容性,过早停止,或者优化一个与预期主张不一致的标准。这些失败与人类执行的科学中那些有问题的研究实践类似(48 (https://arxiv.org/html/2608.19902#bib.bib49); 32 (https://arxiv.org/html/2608.19902#bib.bib50)),并因过早宣布任务完成(29 (https://arxiv.org/html/2608.19902#bib.bib52); 33 (https://arxiv.org/html/2608.19902#bib.bib51))和奖励黑客(reward hacking)(50 (https://arxiv.org/html/2608.19902#bib.bib53); 22 (https://arxiv.org/html/2608.19902#bib.bib54))而加剧。因此,科学智能体需要的不仅是工具访问权限:它们需要可靠的路由、与方法论条件关联的证据、对替代方案的明确暴露,以及形式化检查与研究者判断之间清晰可见的边界。

在此,我们介绍Brain Researcher,一个由研究者管理、领域特定的智能体框架,它在神经影像研究者现有的计算环境内运行。Brain Researcher旨在保留而非取代科学判断:它将研究者能够事先陈述的部分进行操作化,并将其余部分记录以供检查。对于前瞻性治理的分析,研究者指定问题、可接受的分析、必要检查以及任何所得主张的范围。工具注册表和Brain Researcher知识图谱将分析路线与证据和方法条件相关联;模型上下文协议服务器中介模型操作;执行和审查层返回一个审计包,其中链接了提交的计划、工具调用、产物、证据和主张判定(图1 (https://arxiv.org/html/2608.19902#S1.F1);补充方法 S1)。多宇宙分析揭示了对合理规范的敏感性(51 (https://arxiv.org/html/2608.19902#bib.bib25)),而承诺卡和主张卡保留了在观察结果之前和之后的决定。在自主演化研究中,中间证据只能在研究者定义的行动空间内引导轨迹,该空间指定了可接受的分析、数据集和评估预算;每个后续分析在执行前都已冻结。那些难以形式化的判断仍由研究者掌握。

我们在三种场景中评估了Brain Researcher。首先,一个配对的七模型工具调用基准测试和一个独立的证据引用基准测试,检验该框架是否能改善上游的工具选择和证据引用。其次,三项由协作者主导的研究,检验多宇宙分析和显式约束是否能使主张的敏感性和状态可见。第三,两个自主演化研究片段,检验一个阶段的证据是否可以被带入冻结的后续分析中。这些评估共同考察了,当方法论承诺、证据和主张范围被明确化并可审计时,AI辅助是否变得更强大、更站得住脚。

## 1结果

参考说明图1:Brain Researcher:面向可审计神经影像研究的以工作空间为中心的基础设施。Brain Researcher在研究者现有计算环境内运行,并将神经影像分析作为结构化的、*可审计的*操作呈现:每一个选择、检查和输入在发生时都被记录,因此完成的分析的冻结记录可以被运行者以外的人阅读和审计,而无需重新执行它。(a)工具生态系统:用于预处理、建模、元分析、机器学习、质量控制和报告的成熟神经成像软件,每个软件都由机器可读规范表示,并在版本固定的容器中执行。(b)每个规范声明其输入、输出、参数、版本、证据锚点和验证规则;规则检查器在每次拟议调用运行前根据这些条款进行测试,并记录哪些条款通过或失败。(c)片段工作流程:研究者在承诺门控处提出问题并批准计划,有效动作被分派到版本固定的执行器,产生的审计包(包含提交的计划、工具版本、查阅的证据、产物、日志、溯源性以及每个主张通过的检查)馈送审查层,该层将带有条件标签的主张写回记忆。这个审计包使得分析可审计:完成的运行是一个完全可检查的研究对象,而非一次性的结果,可导出为紧凑的主张卡,审阅者可以逐个字段重新打开。方法论判断仍属于研究者;系统在每个阶段使其可见。参考说明图2:BR-KG:用于有根据、可审计的神经影像推理的溯源性链接语义整合。BR-KG将现有本体库、知识库、数据资源和文献整合到一个图谱中(745,949个节点,2,461,469条边;2026-07-07发布快照),并与OpenNeuro词汇表(ONVOC)(44 (https://arxiv.org/html/2608.19902#bib.bib27))对齐,该词汇表将异构术语规范化为共享标识符,以便查询在不同来源间得到一致解析。中心图谱通过类型化关系链接神经成像概念(任务、对比、认知构念)、神经表征(脑区、统计图)和研究资源(数据集、工具),并附带文献证据。关键的是,有来源支持的事实带有明确的溯源性(它们的来源,以及在可能的情况下,一字不差的引用支持文本和依据标签),因此检索到的主张可以追溯到支持它的研究和段落,而非仅凭信任;覆盖是部分性的且有跟踪,这正是使得此处检索*可审计*的关键。下游面板展示了其价值:有依据的问答和跨越概念-任务-图谱路径的多跳推理,每一跳都可检查到其底层的节点、边和引用的证据,这使得审查层可以在接受建议之前附加其方法论条件检查(队列、范式、预处理、统计模型)。

### 1.1Brain Researcher将研究问题转化为可审计的主张记录

Brain Researcher的核心是一次运行的完整、可审计记录:一个持久的*片段*,将问题与其汇集的证据、研究者认为可接受的分析、提交的计划、执行、审查以及带条件标签的结论相关联(补充方法 S2)。两个带日期的记录可以锚定它。一张*承诺卡*在分析运行前写好,固定问题、允许的备选方案以及成功和失败标准,并通过内容哈希密封,以便计划的任何后续更改都可被检测到。一张*主张卡*在事后由审查层写好,记录所得主张、其分配的状态、范围以及它通过和未通过的检查;补充材料包含一个具体的示例,基于公开的Neurosynth数据构建,读者可以打开并逐字段检查(补充方法 S8.5.1;附录 G)。然后,审阅者可以在不重新执行分析的情况下重新打开和审计记录。在下文报告的协作者主导和自主演化的评估中,每个被评估的主张都被分配六种状态之一(接受、附条件接受、修改、阻止、拒绝或推迟),每种状态都由明确的裁定规则定义。例如,当研究者询问两个组在功能连接测量上是否存在差异时,承诺卡记录队列、受试者组和估计器(由研究者输入或从数据集中解析),并固定必须在运行前通过的检查(对齐的受试者组、满秩设计矩阵、无跨折特征泄漏)。如果该差异随后仅在某些可接受的规范中成立,则该主张被记录为附条件接受,并附上其条件。这些方法论决策属于研究者;Brain Researcher记录每一个决策并强制执行其蕴含的检查。

### 1.2Brain Researcher改善工具调用和证据引用

我们首先分离出该基础设施对科学审查前两个决策的影响:选择正确的分析工具和引用可验证的证据。工具调用基准测试将每个请求与一个隐藏的评分目标配对,并报告Correct route/tool@k(分析族和所需能力的全有或全无匹配)、Capability@k(分级能力覆盖)和Handoff score@k(提出的路线是否足够完整以执行,所需输入是否齐全,以便可以交给下游执行器并在无缺口的情况下运行)(补充方法 S11.1.1);三个条件盲LLM评审者为任何达到所需能力的响应评分,无论该响应是通过Brain Researcher调用还是等效的可执行路线实现的,因此测得的增益反映了达到这些能力,而非因提及Brain Researcher的特定工具而得分。两种条件均使用相同的七个前沿模型(4 (https://arxiv.org/html/2608.19902#bib.bib38); 43 (https://arxiv.org/html/2608.19902#bib.bib39); 25 (https://arxiv.org/html/2608.19902#bib.bib40); 54 (https://arxiv.org/html/2608.19902#bib.bib41); 14 (https://arxiv.org/html/2608.19902#bib.bib42); 42 (https://arxiv.org/html/2608.19902#bib.bib43); 1 (https://arxiv.org/html/2608.19902#bib.bib44))和通用工具,无BR条件仅缺少Brain Researcher的注册表(补充方法 S5)、知识图谱和约束层。在60个工具调用任务和七个模型中,不使用与使用Brain Researcher的得分分别为:首个动作正确路线/工具选择 23.3% 对比 93.6%(使用BR 95%置信区间 88.8–97.1,任务聚类),平均Capability@1 49.8% 对比 94.5%,以及移交充分性 47.4% 对比 76.1%。每个任务的参考路线在任一条件运行前已固定,并与一位不参与Brain Researcher系统开发的合著者共同整理;等效

相似文章

Ressearch AI

Product Hunt

Ressearch AI 是一个 AI 驱动的工作区,旨在实现可重现的科学研究。

AutoResearch AI:迈向人工智能驱动的研究自动化以实现科学发现

arXiv cs.AI

本综述审视了人工智能驱动的研究自动化(AutoResearch)这一新兴领域,分析了AI系统如何从孤立的任务辅助转向完整的工作流级别的科学发现。它定义了从人类引导的‘Vibe Research’到AI主导系统的光谱,并提出了五个评估科学可信度的维度。

AutoResearch AI:迈向AI驱动的科学发现研究自动化

Hugging Face Daily Papers

一篇综述论文,探讨了AI从特定任务助手到工作流级研究自动化工具的转变,将AutoResearch定义为AI驱动的科学工作流自动化的光谱,并分析了自主性、可重复性和问责制方面的挑战。