auto-psych: 利用智能体驱动的理论发现与实验自动化心智科学
摘要
auto-psych 是一个基于智能体的系统,它利用LLM智能体生成假设、设计实验并分析来自众包参与者的数据,从而自动化计算认知科学中的理论发现与实验。该系统在经典的心理学范式中展示出比人类推导的理论更快、更优的理论生成能力。
arXiv:2606.26460v1 公告类型: 新
摘要: 基于人工智能的科学自动化正变得越来越可行,通过使用智能体来生成假设、设计实验和分析数据。然而,数据收集是这一流程中的主要瓶颈。心理学,特别是计算认知科学,由于理论常以代码形式呈现,并且众包平台能够实现大规模程序化的人类数据收集,因此特别适合从AI实验中获得收益。在此,我们将自动化发现技术应用于计算认知科学中生成理论的项目,通过一个基于智能体的系统独立地通过众包调查实验收集人类数据。作为测试平台,我们使用认知心理学中的一个经典案例研究:判断哪些硬币抛掷序列在主观上看起来更随机。我们的系统auto-psych使用嵌套的基于智能体的发现循环来生成人类行为的解释性理论。内循环推测、拟合和批评概率认知模型;外循环设计实验来测试这些模型,在线启动实验,并分析数据。该系统能够通过系统实验从合成数据中快速可靠地恢复真实理论,但嵌套结构对模型性能至关重要。此外,在三组独立的人类实验序列中,该系统发现的理论比从科学文献中生成的理论更贴合数据。因此,这项工作展示了在计算认知科学中实现自动化数据收集和理论发现的可行性。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 利用智能体驱动的理论发现与实验实现心智科学的自动化 来源:https://arxiv.org/html/2606.26460 \[Scale=0\.85\] Kushin Mukherjee 斯坦福大学心理学系 Daniel Wurgaft 斯坦福大学心理学系 Linas Nasvytis 斯坦福大学心理学系 Michael Y\. Li 斯坦福大学计算机科学系 Noah D\. Goodman 斯坦福大学心理学系 斯坦福大学计算机科学系 Michael C\. Frank 斯坦福大学心理学系 ###### 摘要 基于AI的科学自动化正日益可行,通过使用智能体来生成假设、设计实验和分析数据。然而,数据收集是这一流程中的主要瓶颈。心理学,特别是计算认知科学,因其理论常以代码形式呈现,且众包平台能够大规模地进行程序化人类数据收集,因而完全有条件从AI实验中受益。本文中,我们将自动化发现技术应用于计算认知科学中理论生成的项目,通过一个基于智能体的系统,利用众包调查实验独立收集人类数据。作为一个测试平台,我们使用了认知心理学中的一个经典案例研究:判断哪些硬币抛掷序列在主观上显得更随机。我们的系统,auto-psych,利用嵌套的智能体驱动发现循环来生成人类行为的解释性理论。内循环负责推测、拟合和批判概率认知模型;外循环则设计实验来测试这些模型,在线启动实验并分析数据。该系统能够通过系统性实验,从合成数据中快速可靠地恢复真值理论,但嵌套结构对模型性能至关重要。此外,在三个人类实验的独立序列中,该系统找到的理论比从科学文献中生成的理论更能拟合数据。这项工作因此证明了在计算认知科学中进行自动化数据收集和理论发现的可行性。 ## 1 引言 图1:一种用于自动化认知科学的智能体驱动发现循环。在*外循环*中,一个LLM智能体通过提出候选刺激来设计实验,这些刺激随后根据其对*模型注册表*的期望信息增益进行排序。选定的刺激被实现为一个jsPsych实验,并部署到Prolific上的参与者。收集到的人类数据被传递到*内循环*。在内循环中,首先将每个注册模型拟合到数据上。然后一个批判智能体执行后验预测检查:它对从最佳现成模型模拟的数据集提出并计算检验统计量,并将此参考分布与对人类数据计算的值进行比较。一个理论家智能体利用此批判来提出新的概率模型。拟合最佳的模型被保留到模型注册表中。在实践中,我们在外循环中还有一个额外的理论家智能体,在首次之后的迭代中,在设计实验之前提出模型。 科学过程常被描述为一个迭代循环,研究者在此循环中推测理论,设计特定的实验来检验该理论,然后根据证据调整其理论 (Godfrey-Smith, 2009 (https://arxiv.org/html/2606.26460#bib.bib30))。111这种理想化的特征描述可能适用于科学家解释个别现象层面,而非描述整个科学领域的进展 (Kuhn, 1962 (https://arxiv.org/html/2606.26460#bib.bib68))。 AI工具已经能够协助这一循环中的每个步骤——帮助创建理论、设计实验以及分析和解释数据 (Romera-Paredes et al., 2024 (https://arxiv.org/html/2606.26460#bib.bib55); Jagadish et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib35); Davies et al., 2021 (https://arxiv.org/html/2606.26460#bib.bib56); Jumper et al., 2021 (https://arxiv.org/html/2606.26460#bib.bib57); Li et al., 2024a (https://arxiv.org/html/2606.26460#bib.bib33); Schmidgall et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib67); Gandhi et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib54))。AI系统能否完成发现循环的所有部分?这样的进步可能导致科学过程日益自动化,并加快朝着重要应用取得进展的步伐 (Musslick et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib1); Jagadish et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib35))。基于大型语言模型的智能体系统现在可以使用计算工具并与数据收集平台集成,使得这一目标越来越可行。作为迈向这一目标的一步,本文开发了一个自动化计算认知科学中完整模型发现循环的框架。近年来,在开发基于语言模型的工作流以覆盖各个科学领域方面取得了进展,但这些项目侧重于从现有数据集中进行模型发现。在已知数据集上进行迭代模型测试和提炼的模式有时被称为"Box循环"(以统计学家George Box命名)(Blei, 2014 (https://arxiv.org/html/2606.26460#bib.bib28))。由于不需要新数据,语言模型智能体可以快速提出、拟合和批判模型 (Li et al., 2024a (https://arxiv.org/html/2606.26460#bib.bib33); b (https://arxiv.org/html/2606.26460#bib.bib32); Gandhi et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib54))。然而,科学过程的一个关键部分是在有针对性的实验范式下收集*新*数据来检验理论。因此,当前AI驱动的科学需要一个"实验室内循环"模型 (Swanson et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib27); Ghareeb et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib22)),这限制了迭代速度,因为需要科学家来执行实验。端到端的科学自动化一直是机器学习研究的一个主要目标,其中AI代理可以在*没有*人类参与循环的情况下运行实验。例如,一个用于计算研究的自动化系统将每个问题分解为一系列步骤——构思产生、新颖性检查、实验和论文撰写 (Lu et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib36));通过并行执行此工作流并在每一步进行比较和剪枝,最终产生了一篇通过人类评审的智能体生成论文 (cf. Beel et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib12))。即使对于*计算机模拟*系统,减少数据收集瓶颈对于快速迭代也至关重要 (Karpathy, 2026 (https://arxiv.org/html/2606.26460#bib.bib25))。心理学中的实验需要人类参与者,但许多研究通过亚马逊 Mechanical Turk 和 Prolific 等众包平台在线进行 (Buhrmester et al., 2018 (https://arxiv.org/html/2606.26460#bib.bib47); Palan and Schitter, 2018 (https://arxiv.org/html/2606.26460#bib.bib51))。这类实验通常使用基于模板的网页框架 (De Leeuw, 2015 (https://arxiv.org/html/2606.26460#bib.bib40)),这意味着它们可以由人工代理创建并通过应用程序编程接口 (API) 部署。正如自主机器学习研究依赖于小规模训练运行一样,自主心理学可以利用快速且廉价的在线行为实验。 计算认知科学是心理学的一个子领域,可能从自动化实验中获得最大收益。大量工作已经致力于将该领域的理论形式化。特别是,贝叶斯传统中的概率模型为描述关于心智的实质性假设提供了一种统一语言 (Griffiths et al., 2024 (https://arxiv.org/html/2606.26460#bib.bib52))。这些理论可以用多种高度表达力和良好文档化的概率编程语言(例如,Stan, PyMC, Pyro)来表示 (Goodman, 2013 (https://arxiv.org/html/2606.26460#bib.bib43); Bingham et al., 2019 (https://arxiv.org/html/2606.26460#bib.bib50); Carpenter et al., 2017 (https://arxiv.org/html/2606.26460#bib.bib49); Patil et al., 2010 (https://arxiv.org/html/2606.26460#bib.bib48)),这意味着它们可以由编程代理生成并使用标准统计方法相互比较。虽然先前的工作已经自动生成并比较了此类型的认知模型 (Rmus et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib34)),但其工作流程尚未整合到一个完整的人类实验循环中。 在本文中,我们实现了一个用于计算认知科学的自动化理论发现和实验循环 (图1 (https://arxiv.org/html/2606.26460#S1.F1)),我们称之为 auto-psych。我们从简单的测试平台开始:心理学文献中一个研究充分的问题——什么使得一个硬币抛掷序列看起来更随机或更不随机 (Bar-Hillel and Wagenaar, 1991 (https://arxiv.org/html/2606.26460#bib.bib24); Ayton and Fischer, 2004 (https://arxiv.org/html/2606.26460#bib.bib23); Kahneman and Tversky, 1972 (https://arxiv.org/html/2606.26460#bib.bib18); Griffiths and Tenenbaum, 2003 (https://arxiv.org/html/2606.26460#bib.bib38); Griffiths et al., 2018 (https://arxiv.org/html/2606.26460#bib.bib39))。主观随机性是一个引人注目的心理学问题,因为我们有强烈的直觉,比如说,HTHTHTHT 是一个*不那么*随机的序列,而 HTTHHHTH 则不然,尽管对于一个公平的硬币来说两者概率相等。使用这个问题作为我们的案例研究,我们开发了一个基于智能体的科学发现框架来创建计算理论。该系统的核心是两个嵌套循环:一个外循环,提出概率认知模型、设计在线实验并收集和分析数据("实验室内循环"),以及一个内循环,批判认知模型并迭代地改进它们(Box 循环)。我们展示了我们的系统通过迭代实验可靠地恢复了真相模型(行为代理)。然后我们让我们的代理在人类参与者上运行一系列实验,发现了强大的理论。在讨论中,我们反思了该系统的前景以及自主科学代理的潜在缺点。 ## 2 相关工作 近期许多发展集中于自主计算发现,区分了单智能体系统 (Karpathy, 2026 (https://arxiv.org/html/2606.26460#bib.bib25); Jiang et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib6)) 和协调不同角色的智能体集合的多智能体系统 (Gao et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib7); Swanson et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib27))(我们在此遵循的方法)。这两个传统中的工作都开发了自动生成、批判和修订统计模型的方法 (Li et al., 2024a (https://arxiv.org/html/2606.26460#bib.bib33); b (https://arxiv.org/html/2606.26460#bib.bib32); Éltető et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib64); Agarwal et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib63)),以及对其实验规划能力进行基准测试 (Kon et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib5))。类似的方法在结构生物学领域取得了积极成果,帮助预测蛋白质结构和生化相互作用,其水平可与*体外*实验相媲美,从而使得新理论得以快速发展 (Gottweis et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib19); Ghareeb et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib22); Swanson et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib27); Jumper et al., 2021 (https://arxiv.org/html/2606.26460#bib.bib57); M. Bran et al., 2024 (https://arxiv.org/html/2606.26460#bib.bib61); Jin et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib65); Gao et al., 2024 (https://arxiv.org/html/2606.26460#bib.bib66))。基于智能体的工作流已经为开放问题找到了解决方案,并在数学领域提出了新算法 (Novikov et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib60); Romera-Paredes et al., 2024 (https://arxiv.org/html/2606.26460#bib.bib55); Fawzi et al., 2022 (https://arxiv.org/html/2606.26460#bib.bib59)),并且已被成功应用于社会科学和认知科学 (Balla et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib8); Rmus et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib34); Jagadish et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib35); Geng et al., 2025 (https://arxiv.org/html/2606.26460#bib.bib62); Éltető et al., 2026 (https://arxiv.org/html/2606.26460#bib.bib64))。在这些工作中,Rmus et al. (2025 (https://arxiv.org/html/2606.26460#bib.bib34)) 与我们的工作最为接近,因为他们使用AI模型作为管道的一部分来提出和验证概率认知模型。然而,这些工作均未尝试自动化整个计算认知科学的过程,从推测和评估假设到设计和运行涉及真实人类参与者的实验。 我们在此的具体工作集中于主观随机性——人们对给定事件序列随机程度的感知和判断。已有大量文献考虑了人们可能使用的启发式方法 (Bar-Hillel and Wagenaar, 1991 (https://arxiv.org/html/2606.26460#bib.bib24); Ayton and Fischer, 2004 (https://arxiv.org/html/2606.26460#bib.bib23))。流行的解释包括原型的代表性 (Kahneman and Tversky, 1972 (https://arxiv.org/html/2606.26460#bib.bib18))、算法复杂性 (Falk and Konold, 1997 (https://arxiv.org/html/2606.26460#bib.bib69); Li and Vitányi, 2008 (https://arxiv.org/html/2606.26460#bib.bib44))、贝叶斯推理解释 (Griffiths and Tenenbaum, 2003 (https://arxiv.org/html/2606.26460#bib.bib38); Griffiths et al., 2018 (https://arxiv.org/html/2606.26460#bib.bib39)),以及诉诸有限注意窗口的解释 (Hahn and Warren, 2009 (https://arxiv.org/html/2606.26460#bib.bib17))。 ## 3 方法 我们的框架使用基于LLM的智能体在编码工具中实例化两个循环:一个内循环,用于推测、拟合和批判模型;以及一个外循环,用于设计和运行实验。两个循环都使用 OpenCode (https://opencode.ai/) 工具,以 gemini-3.1-pro-preview 作为语言模型。我们首先描述主观随机性领域,然后转向工作流的细节。代码和数据可在 GitHub (https://github.com/mcfrank/auto-psych) 上获取。进一步的方法论细节可在附录 A (https://arxiv.org/html/2606.26460#A1) 中找到。 ### 3.1 主观随机性 主观随机性研究中的主要问题是哪些硬币抛掷序列被认为更随机。为便于我们的研究,我们选择了简单的强迫选择范式,参与者被呈现两个序列并被要求选择其中一个。此设置对于自动生成和测试认知模型具有许多理想属性:可能的刺激空间是离散且易于枚举的,实验范式简单,模型只需为每个序列生成一个概率。为了用文献中的模型来初始化我们的循环,我们添加了四个模型:1)一个"编码可压缩性"模型,使用周期性、长序列等启发式特征作为序列可压缩性的代理 (Falk and Konold, 1997 (https://arxiv.org/html/2606.26460#bib.bib69));2)一个简化版的"贝叶斯诊断性"解释,近似于一个序列由公平硬币生成相对于更规则计算过程生成的对数似然比 (Griffiths and Tenenbaum, 20
相似文章
AutoSci:面向完整科研生命周期的以记忆为中心的智能代理系统
AutoSci是一个以记忆为中心的智能代理系统,旨在自动化完整的科学研究生命周期,从文献理解到回复审稿意见,使用基于LLM的智能体,具有持久记忆和自我进化能力。
@danielwurgaft: 新预印本!AI智能体展现了令人印象深刻的科学自动化能力。我们能否将它们应用于心理学研究…
一篇新预印本介绍了auto-psych,这是一个利用AI智能体提出认知模型并设计/执行人类实验的框架,将AI科学自动化扩展到心理学研究。
@TheTuringPost: AutoScientists – 一个由智能体组成的研究实验室 @哈佛大学的研究人员将智能体连接成一个自组织的科学…
哈佛大学研究人员提出 AutoScientists,一个没有中央协调器、能够形成自组织科学团队的多智能体系统,在 BioML-Bench 和优化任务上取得了强劲成果。
自动化并扩展AI代理的行为科学研究
本文介绍了AEROBAT,这是首个多代理系统,用于自动化AI代理的行为科学研究,包括生成假设、设计和执行受控实验以及撰写报告。作者在12个目标行为上展示了其有效性,为26个假设找到了统计证据。
@bibryam: Autogenesis:自我演化型智能体协议 https://arxiv.org/abs/2604.15034 tl;dr:将每个智能体组件视为版本控制的资源,可自动改进与回滚
介绍了 Autogenesis 协议(AGP),这是一种自我演化型智能体协议,将组件的演化过程解耦,支持对基于 LLM 的多智能体系统中的提示词、智能体、工具、环境和记忆进行生命周期管理、版本追踪和安全回滚。