FirstResearch: 面向LLM科学发现代理的可审计问题形成框架
摘要
FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。
arXiv:2607.05682v1 公告类型: 新
摘要: 用于科学发现的LLM系统越来越多地协助构思、文献综合、实验规划和报告生成,但它们提出的第一个研究问题可能仍然难以审计:它听起来可能是合理的,但未揭示科学家应审查的机制、证伪条件或假设。我们引入了FirstResearch,这是一个面向科学LLM代理的第一性原理研究问题形成框架,其核心产物是结构化的研究问题证书。该证书记录了原始定义、假设、机制模型、张力或矛盾、可证伪假设、最小决定性测试以及失败更新规则,使得所提出的问题在下游执行之前即可被审查。在十个LLM代理研究主题上,FirstResearch在主要的DeepSeek盲审协议下优于受AI co-scientist、Agent Laboratory和AI Scientist-v2启发的受控提示级基线。Gemini-2.5-Flash独立评审员对同一40个基线包进行重新评分,保持了系统级排名:FirstResearch得分为4.86/5,而最强基线为4.38/5,平均分的Pearson一致性为0.865。一次重复消融检查点进一步表明,以证书为核心是最强组件:仅证书评分在DeepSeek下达到4.90/5,在Gemini下达到4.88/5,而移除证书后,两个评审员的评分均降至1/5以下。这些结果是初步的,且使用LLM评审员而非人类领域专家,但它们支持一个狭窄的科学发现主张:显式推导约束是使LLM生成的科学问题更具可审计性的一种有前景的机制。代码、提示、保存的输出和复现脚本可在 https://github.com/louiswang524/FirstResearch 获取。
查看缓存全文
缓存时间: 2026/07/08 04:38
# 用于LLM科学发现代理的可审计问题形成 来源:https://arxiv.org/html/2607.05682 ###### 摘要 用于科学发现的LLM系统日益辅助构思、文献综合、实验规划和报告生成,但其提出的第一个研究问题可能仍难以审计:它听起来似乎合理,却没有暴露出科学家应检查的机制、证伪条件或假设。我们引入FirstResearch,一个面向科学LLM代理的第一性原理研究问题形成框架,其核心产物是结构化的研究问题证书。该证书记录了原始定义、假设、机制模型、张力或矛盾、可证伪假设、最小决定性检验以及失败更新规则,使得提议的问题在下游执行之前就可被检查。在十个LLM代理研究主题上,在主要DeepSeek盲评协议下,FirstResearch优于受AI co-scientist、Agent Laboratory和AI Scientist-v2启发的受控提示级基线。使用Gemini-2.5-Flash独立评审对同一40个基线包进行重新评分,仍保持了系统级排名,FirstResearch得分为4.86/5,而最强基线为4.38/5,平均得分的Pearson一致性为0.865。一次重复的消融检查点进一步表明,以证书为中心的核心是最强组件:仅证书评分在DeepSeek下达到4.90/5,在Gemini下达到4.88/5,而移除证书则在两个评委下均降至1/5以下。这些结果是初步的,并且使用LLM评委而非人类领域专家,但它们支持一个狭窄的科学发现主张:显式推导约束是使LLM生成的科学问题更具可审计性的一种有前景的机制。代码、提示词、保存的输出和再现脚本可在https://github.com/louiswang524/FirstResearch获取。 ## 1 引言 语言模型正成为科学合作者:它们集思广益提出假设、综合文献、规划实验、分析数据和撰写报告。最近的自研研究系统展示了这一议程能走多远。AI Scientist生成想法、执行实验、撰写手稿,并使用自动审稿人进行评估(Lu et al., 2024 (https://arxiv.org/html/2607.05682#bib.bib3));Agent Laboratory将研究协助结构化为文献综述、实验和报告撰写(Schmidgall et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib4));AI co-scientist使用生成、辩论、排名和进化来进行假设生成(Gottweis et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib1));AI Scientist-v2通过代理树搜索和车间级手稿生成扩展了自主发现(Yamada et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib7))。这些系统展示了令人印象深刻的广度,但广度并不能保证第一个研究问题在机制上是清晰的、可证伪的或足够可追溯以供科学审查。 在LLM辅助的科学构思中,核心挑战不仅是找到一个听起来合理的话题,而是形成一个能够暴露机制的问题。一个薄弱的研究问题可以被实施和撰写,但科学上仍然可能失败,因为它测试的是一个未明确定义的空白、一个模糊的改进主张,或一个没有明确证伪观察指标的度量。这个问题对于人类与AI在科学中的协作至关重要:科学家需要知道代理做了哪些假设,哪种观察会否定所提出的假设,以及负面结果应如何更新研究方向。如果没有显式的推导记录,很难判断代理是发现了真正的张力,还是仅仅模仿了研究提案的表面形式。 我们提出FirstResearch,一个将推导视为一等产物的研究问题生成框架。给定一个主题,FirstResearch首先定义原始概念和第一性原理假设,构建机制模型,识别张力,生成候选问题,并为每个候选问题构建一个研究问题证书。该证书要求一个可证伪的假设、一个最小决定性检验、预期的观察结果和一个失败更新规则。一个新颖性感知门在实验设计之前修复薄弱的证书,将问题推向更清晰的边界条件,例如阈值、交互、相变或失效机制。 我们的实证主张是有意限定的。我们并不声称FirstResearch是一个完整的自主科学家,或者它可以取代执行密集型科学代理。相反,我们测试一个基于推导的问题形成层是否能够提高为LLM代理科学主题生成的研究包的评判质量。这个设置是科学构思的初步测试平台,而非在生物学、化学或材料科学领域跨领域发现的声明。在一个十主题基准测试中,FirstResearch在主要DeepSeek评委下的平均评分标准得分和新颖性方面,均高于受AI co-scientist、Agent Laboratory和AI Scientist-v2启发的三个受控提示级基线,并且当相同的保存包由Gemini-2.5-Flash重新评分时,系统级排名保持不变。 本文的贡献包括: 1. 一个基于推导的研究问题框架,核心是研究问题证书,它连接了原始概念、假设、机制、张力、假设、检验和失败更新。 2. 一个新颖性感知证书门,通过要求机制边界信号(如阈值、交互和失效机制)来修复有效但通用的问题。 3. 一个用于LLM生成科研包的基准和自动评估协议,在共享评分标准下比较FirstResearch与受控的自动研究基线近似。 4. 初步证据(经过Gemini-2.5-Flash交叉验证)表明,证书、门修复和机制模型驱动了评判的科学构思质量,而后续的审稿人/元层则需要单独验证。 ## 2 相关工作 #### 自主研究代理。 AI Scientist是最早的端到端自主机器学习研究演示之一,结合了想法生成、代码执行、实验分析、论文撰写和模拟评审(Lu et al., 2024 (https://arxiv.org/html/2607.05682#bib.bib3))。AI Scientist-v2进一步发展了这一路线,采用了代理树搜索、减少对人工编写模板的依赖以及车间级自主手稿生成(Yamada et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib7))。这些系统通过下游产物(如论文、实验和评审分数)来评估研究代理。 Agent Laboratory将研究自动化框架化为一个分阶段助手工作流:文献综述、实验和报告撰写(Schmidgall et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib4))。这种设计突出了结构化研究过程和人类反馈的实际价值,但其主要单位是完整的研究工作流,而非初始研究问题的推导质量。FirstResearch是互补的:它专注于问题形成层,可以馈入工作流系统。 AI co-scientist与我们的构思设定最为接近,因为它专注于使用生成、辩论、排名和进化进行假设生成(Gottweis et al., 2025 (https://arxiv.org/html/2607.05682#bib.bib1))。我们将其作为强基线模式,并测试了一个小型组合试验,在认证之前插入co-scientist风格的辩论。关键区别在于FirstResearch并非主要依赖对假设的搜索;它强制每个候选者暴露原始假设、机制、张力和证伪检验。 #### 自动化科学发现与假设形成。 自动化科学发现早于最近的LLM代理。基于文献的发现表明,有用的假设可以通过连接独立发表的零散知识片段而产生,例如Swanson的鱼油与雷诺氏综合征例子(Swanson, 1986 (https://arxiv.org/html/2607.05682#bib.bib6))。机器人科学家Adam展示了更闭环的自动化形式,系统在酵母功能基因组学中生成假设、设计实验、执行实验并分析结果(King et al., 2009 (https://arxiv.org/html/2607.05682#bib.bib2))。这些系统强调,科学自动化不仅仅是生成文本;它是在假设、证据、实验和修订之间保持结构化关系。FirstResearch继承了这种结构化科学观点,但针对一个更早期的瓶颈:使提议的研究问题的推导在执行之前可检查。 #### 代理痕迹、反思与可审计性。 LLM代理的工作还表明,中间痕迹可以使代理行为更具可解释性和可控性。ReAct交错推理痕迹和动作以获得更可解释的任务解决轨迹(Yao et al., 2023 (https://arxiv.org/html/2607.05682#bib.bib8)),而Reflexion使用口头反馈和记忆来改进未来的尝试,而无需改变模型权重(Shinn et al., 2023 (https://arxiv.org/html/2607.05682#bib.bib5))。FirstResearch要求的痕迹类型不同:研究问题证书不是思维链转录或执行日志,而是候选问题的结构化科学来源记录。这让人或下游代理能够检查问题是否源于原始概念和机制,实验是否能否定假设,以及失败是否会更新特定假设。 表格1:与近期自动研究模式的功能比较。 #### 研究问题质量。 一个强研究问题不应仅仅是听起来新颖。它应该明确可能成立的是哪种机制,哪种观察会否定它,以及为什么实验能隔离相关的张力。FirstResearch通过研究问题证书将这一观点付诸实践。该证书使推导可检查,并创建了自动拒绝、修复和失败分析的钩子。 ## 3 方法 ### 3.1 概述 FirstResearch通过图1 (https://arxiv.org/html/2607.05682#S3.F1)所示的分阶段推导流水线,将科学研究主题映射到可审计的研究包。 主题 → 原始概念+假设 → 机制模型 → 张力查找器 → 候选问题 → 研究问题证书 → 新颖性门+修复 → 最小实验 → 审稿人批评 → 元更新+审计日志 证书仅输出(核心后) 无证书(移除这条路径) 证书为中心的核心 图1:FirstResearch流水线和用于可审计科学构思的消融边界。CertificateOnly是一种内部消融,保留推导和证书核心,但移除下游评审和元更新层;NoCertificate绕过证书/门路径。 设计原则是,文献搜索和实现不应取代问题推导。一个主题首先变成一组原始概念和假设;只有在这之后,系统才生成问题和实验。这使得FirstResearch成为科学LLM工作流的前端构思层,而不是替代下游执行、数据分析或专家评审。 ### 3.2 实现细节 实现组织为一个类型化的代理流水线。每个阶段都会发出Pydantic验证的JSON对象,这使得中间推导记录可检查并可供后续代理重用。 表格2:FirstResearch组件和当前一次重复消融的证据。 当前门有两类标准。硬阻挡规则要求非空的证伪观察、非空的机制摘要、第一性原理推导评分至少3/5,以及可证伪性评分至少3/5。软修复规则在推导、机制清晰度、新颖性、可实验性、主题遵循性或显式机制边界语言薄弱时要求改进。边界语言包括阈值、相变、失效机制、非线性权衡和机制交互。 如果任何硬规则或软规则发出建议,则调用一次CertificateRepairer,并通过确定性门对修复后的证书重新评分。然后证书在打包前根据元组(平均分、新颖性、机制清晰度、可证伪性、可实验性、第一性原理推导)进行排序,因此向评委公开的主要产物是本地评分标准下最强的可用证书。 ### 3.3 研究问题证书 研究问题证书是核心表示。每个证书包含原始定义、第一性原理假设、机制模型、张力或矛盾、研究问题、假设、最小决定性检验、预期观察、失败更新规则和质量评分。这种表示支持可审计性:评审者可以检查问题是否源于原始概念和机制,假设是否有拒绝性观察,以及失败的实验是否会更新特定假设,而不仅仅是产生一个模糊的负面结果。 ### 3.4 基线和组合变体 我们将FirstResearch与三个受控基线进行比较,这些基线旨在在提示工作流级别近似近期的自动研究模式:一个CoScientistBaseline,它生成、辩论、排名和进化假设;一个AgentLabBaseline,它模拟文献综述、实验规划、教授批评和最终综合;一个TreeSearchScientistBaseline,它生成研究分支的前沿,根据新颖性和可行性选择一个分支,并将其扩展为最终包。 这些并非专有系统或大型系统的精确复现。它们不执行原始代码库、工具环境、人在回路协议或AI co-scientist、Agent Laboratory、AI Scientist-v2的完整搜索预算。它们是受控的提示级近似,允许进行相同模型、相同主题、相同模式的比较。 我们还实现了一个组合变体firstresearch_debate_combo,它在认证之前借用了co-scientist的生成/辩论/进化设计选择。它在候选问题生成和证书构建之间插入了一个QuestionDebateRefiner。这测试了搜索式辩证精炼是否与证书核心互补。 ## 4 实验设置 #### 基准测试。 我们在十个LLM代理科学研究主题上进行评估,涵盖技能发现、过程保真度、工具路由、记忆干扰、规划评估、多代理系统、技能库膨胀、自我改进、基准构建以及自动研究代理中的检索。这些主题在研究LLM研究代理本身的意义上是科学的,并构成了研究问题形成的第一个聚焦基准。每个系统接收相同的主题并生成一个结构化的研究包。 #### 评分协议。 每个包由一个LLM评委使用五个0-5分的评分标准维度进行评分:第一性原理推导、可证伪性、机制清晰度、新颖性和可实验性。选择这些维度是为了反映科学问题质量,而不仅仅是写作润色。评委还提供一个1-10分的评审风格分数和一个推荐。在可能的情况下,系统身份在评委输入中被盲化。主要的强基线和消融检查点结果使用DeepSeek。为了测试评委敏感性,我们使用Gemini-2.5重新评分已保存的包。
相似文章
是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。
ForeSci:评估LLM代理的前瞻性AI研究判断
介绍了ForeSci,一个时间控制基准,用于评估LLM代理是否能够基于历史证据做出前瞻性研究判断。它包含跨越四个AI领域的500个任务,结果表明显式的证据组织提高了可追溯性,但揭示了反复出现的证据-决策解耦。
迈向可审计的AI科学家:面向LLM代理的假设演化协议
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
扮演真正的研究者:一套评估前沿大语言模型及代理系统在研究生命周期中的基准测试集
本文介绍了AARR(扮演真正的研究者)基准系列,旨在评估前沿大语言模型和代理系统在细粒度研究场景中的表现。首个基准AARRI-Bench显示,即使表现最佳的代理成功率也仅为68.3%,凸显了其在领域敏感性和细微推理能力方面的不足。
像科学家一样思考?LLM生成研究方法的结构化研究
本研究探讨了当仅提供研究问题时,LLM如何推荐研究方法(数据集、模型、指标),发现LLM表现出强烈的提供者偏差,且相比实际论文所提出的方法范围要窄得多,这可能会缩小研究者的方法论搜索空间。