PrimeScientist:自主研究中的策略性研究投入分配
摘要
介绍PrimeScientist,这是一种在自主研究智能体中使用自适应MCTS策略来策略性分配研究投入的方法,旨在资源约束下提高研究质量和样本效率。
arXiv:2609.17846v1 公告类型:新
摘要:自主研究智能体旨在自动化科学工作流程,从提出想法到进行实验和分析结果。然而,当前的人工智能和研究智能体可以提出的方向多于可用资源所能支持的。此外,每次尝试可能消耗大量资源,要求智能体重新考虑如何在后续研究中投入。因此,策略性地决定如何投入研究能力应该是自主研究智能体的一个关键能力。因此,我们引入PrimeScientist,它共同决定跨连续研究尝试的研究方向和资源投入。具体来说,我们将这一策略性研究投入分配的挑战形式化为一个序列决策问题,其中剩余资源应明确指导研究策略。我们首先引入一个可执行计划树,它在各次尝试中保留竞争计划及其结果。在此表示的基础上,我们提出一个自适应的MCTS分配策略,该策略利用实验反馈和剩余资源平衡探索与利用。全面的评估覆盖人工智能研究、系统和代码优化以及机器学习工程,显示策略性分配同时提高了研究质量和样本效率。在12个人工智能研究任务中,PrimeScientist在相同资源预算下,与AutoResearch相比,平均奖励提高了10.3%,研究尝试次数减少了50.6%。我们相信,将研究投入分配作为明确的优化目标,确立了有效资源利用作为自主智能体的核心研究能力,以推动科学突破的规模化发展。
查看缓存全文
缓存时间: 2026/09/17 08:59
# 自主研究中的研究精力战略分配 来源:https://arxiv.org/html/2609.17846 作者:Xinle Yu、Fan Bai、Kaiser Sun、Hengshuo Miao、Abhay Anand、Zhongyan Luo、Kun Zhou、Zhen Wang 邮箱:[xiy033@ucsd\.edu](mailto:) ###### 摘要 自主研究代理旨在自动化科学工作流程,从提出想法到开展实验和分析结果。然而,当前的 AI 和研究代理可能提出的方向数量超过了可用资源所能支持的范围。此外,每次尝试都可能消耗大量资源,需要代理重新考虑如何投资后续研究。因此,如何战略分配研究精力应当成为自主研究代理的核心能力。为此,我们引入 **PrimeScientist**,它能够联合决定研究方向与跨多次研究尝试的资源投入。具体而言,我们将这一研究精力战略分配问题形式化为一个序列决策问题,其中剩余资源应明确引导研究策略。我们首先引入一个可执行计划树,该树保留了跨多次尝试的竞争性计划及其结果。在此基础上,我们提出了一种基于自适应 MCTS(蒙特卡洛树搜索)的分配策略,该策略利用实验反馈和剩余资源来平衡探索与利用。在 AI 研究、系统与代码优化以及机器学习工程等多个领域的综合评估表明,战略分配能够同时提高研究质量和样本效率。在 12 个 AI 研究任务中,PrimeScientist 在相同资源预算下,相比 AutoResearch 平均奖励提升了 10.3%,同时研究尝试次数减少了 50.6%。我们认为,将研究精力分配作为明确的优化目标,能够建立高效资源利用作为自主代理的核心研究能力,从而推动科学突破的规模化实现。代码和数据可在 https://github.com/Henri-XYu02/PrimeScientist 获取。 图 1:使用 PrimeScientist 进行研究精力战略分配。(a) PrimeScientist 在匹配的 token 预算下,以更少的尝试次数达到与 AutoResearch 相当或更好的分数。条形图显示平均分数;茎线和阴影显示平均尝试次数及减少量。MLE‑Bench 将分数与损失分开显示。(b) 显式计划支持围绕编码代理执行循环进行战略分配。实验反馈和剩余资源指导哪些研究方向应获得进一步投入。 ## 1 引言 自主研究(利用 AI 代理提出假设、修改实验代码、运行实验并决定下一步尝试)已成为机器学习工程和更广泛科学工作的可行范式 [30, 39, 61, 27, 62, 5]。在 Karpathy 的 autoresearch [30] 中,单个代理读取 Markdown 计划、编辑 Python 训练文件、运行固定时间的训练实验,并决定在下一次迭代前保留或丢弃该更改。围绕这一核心循环,一系列不断发展的系统将其扩展至机器学习工程 [27, 62, 5]、研究构思与实验工作流 [39, 61, 2, 45]、生物医学 [53, 14, 15, 59, 9]、化学与材料科学 [3, 25] 以及工业研发 [10]。近期研究探讨了如何通过推理时扩展和更长的自主研究循环来有效利用额外计算资源 [50, 55, 60]。然而,代理可以生成大量看似合理的研究想法和计划,包括替代假设、数据集选择、模型族、消融实验、调试策略以及对弱证据的解释 [2, 45, 61]。每一次端到端的研究尝试都会将大量代理投入(例如 token)用于一个计划,并减少后续研究尝试可用的机会。研究进展将取决于研究精力如何随时间分配,需结合迄今积累的证据和剩余资源 [48, 16, 35]。因此,我们研究了 **研究精力的战略分配** 问题,即自主代理应如何随着证据的积累在不同研究方向上分配精力。目标是让资源的有效使用成为研究策略中有意识、可调整的一部分。我们将此能力视为自主研究代理智能的重要维度。 表 1:代表性自主研究代理的比较。 - *分支探索* 保留备选方案; - *计划级搜索* 在尝试间选择未执行的计划。 - *价值反向传播* 从后代结果更新祖先节点。 - *战略精力规划* 根据剩余预算调整探索与细化。 - *共享 token 预算* 涵盖所有规划和执行 token。 然而,现有的自主研究系统很少将战略精力分配视为需要优化的显式能力。AutoResearch 将每次新尝试分配给当前轨迹,因此已走过的路径在很大程度上决定了后续精力的去向 [30]。基于树和种群的系统暴露了多种备选方案,但通常使用固定搜索规则或未显式表示剩余研究预算的 LLM 判断来进行导航 [27, 61, 8, 54]。R&D‑Agent 在实施前选择想法,并根据剩余墙钟时间调整计划 [62]。更接近我们设定的是,AlphaLab 使用剩余实验次数来指导 LLM 策略师,而 FML‑Bench 的 AdaptiveSearch 在进展停滞时从贪婪细化切换到多分支探索 [22, 69]。剩下的挑战是如何协调研究计划的演变及其精力分配。这需要一个统一的策略,利用实验证据和剩余资源来指导计划和执行(表 1)。 为应对这一挑战,我们引入 **PrimeScientist**,旨在为自主研究代理配备指导其研究精力的策略。我们将战略精力分配形式化为一个序列决策问题,联合建模计划的构建、执行及其资源成本。为实现这一想法,我们引入了一个可执行计划树,使得竞争性计划在执行前可供选择。反思器根据树中积累的证据起草和修改计划,而编码代理执行器则通过编码、调试、实验和结果分析来执行每个选定的计划。基于此表示,我们提出了一种基于自适应 MCTS 的分配策略 [31, 4],该策略利用实验反馈和剩余资源来平衡不同研究方向上的探索与利用。即使在观察到相同结果的情况下,不同的剩余资源也可能需要不同的分配。 我们在 AI 研究、系统与代码优化以及机器学习工程 [58, 60, 5] 上评估了 PrimeScientist。在相同资源预算下,PrimeScientist 比 AutoResearch 以更少的研究尝试获得了更好或相当的研究成果。研究样本效率衡量的是相对于完整研究尝试次数所获得的任务质量。每次尝试需要实现、实验和分析以测试一个研究方向。在质量相当的情况下减少尝试次数可以降低这种实验需求。资源预算包括规划和执行;第 4.1 节规定了单位和限制。我们的消融研究表明,根据剩余预算调整探索策略,相比 *UCT*、*Greedy*、*Random* 以及固定指数等替代方案,能够提高总体奖励。这些发现支持将战略精力分配作为自主研究代理的核心能力。优化这一能力可能使代理能够改进自身的研究策略,并将不断增长的计算资源转化为规模化的科学突破。 ## 2 相关工作 **自主研究代理。** 自主研究代理正日益自动化涵盖构思、实验设计、实现、评估和报告的工作流程。AI Scientist、ResearchAgent 和 Agent Laboratory 等系统通过迭代和多阶段代理工作流生成研究想法或产物 [39, 2, 45, 36]。基于指标的系统使用任务分数来引导进展。例如,Karpathy 的 autoresearch 反复修改实验程序,并保留提高目标指标的更改,而 AIDE 将机器学习工程构建为代码解决方案的树搜索 [30, 27]。更近期的系统使搜索更加显式。AI Scientist‑v2 使用渐进式代理树搜索来开发和评估实验;AIRA 比较了贪婪、MCTS 和进化搜索策略在机器学习研究中的应用;GEAR 通过变异和交叉维护一个研究状态种群;FML‑Bench 研究了搜索拓扑和探索动态如何影响研究代理性能 [61, 54, 26, 69]。总的来说,这些工作确立了迭代反馈、持久化研究状态和结构化搜索是自主研究的核心组成部分。PrimeScientist 将研究精力分配作为明确的设计选择。它研究了经验性证据和剩余资源应如何联合指导研究尝试的分配。 **代理规划与搜索。** 关于语言模型的研究探讨了推理、规划和工具使用 [20, 19, 41, 21, 56, 28, 46, 68]。近期工作还在推理和搜索中显式考虑了成本或剩余资源 [18]。MARS 引入了成本约束的 MCTS 用于自动化 AI 研究,并反向传播结合了验证性能和候选执行时间的奖励 [6]。AlphaLab 使用策略师修订实验队列,并通过手册保留实验经验;策略师使用剩余实验次数来从探索转向细化 [22]。FML‑Bench 提出了 AdaptiveSearch,它从贪婪细化开始,在检测到停滞时一次性切换到多分支探索,其分支结构由剩余步骤预算决定 [69]。这两种方法都在适应试验选择的同时,将分配给规划的资源排除在分配目标之外。在更细的粒度上,BATS 使工具使用代理能够持续感知剩余工具调用次数,而 BAVT 则使用剩余资源比例来锐化基于价值的选择分布,使其在推理树内从更广泛的探索转向利用 [38, 33]。这些搜索机制为我们的解决方案提供了信息,而我们独特的贡献在于将计划构建和执行形式化为共享资源预算下的决策。在可执行计划树中,选择一个未测试的计划会启动一次研究尝试;选择一个已评估的计划会发展替代方案。因此,同一个策略利用实验性证据和剩余资源来同时指导研究规划和实验。 **智能系统中的资源分配。** 资源分配是智能决策研究中的一个长期问题。Simon 的有限理性理论将有效选择与代理可用的信息和计算能力联系起来 [48]。计算和资源理性理论进一步通过决策质量和所需资源来评估推理过程 [16, 35]。理性元推理将选择计算什么本身视为一个决策。近期工作通过学习中间推理何时值得其计算成本,将这一原则应用于语言模型 [11]。在相邻领域,在线创新竞赛的研究表明,解题者会根据反馈和剩余时间策略性地调整投入,而感知截止日期的任务和运动规划已被构建为针对备选选项的元推理精力分配问题 [12, 52]。这些视角将资源使用视为智能决策的一部分。在自主研究中,代理必须构建备选方案并生成评估它们所需的证据。PrimeScientist 在一个序列决策问题中形式化了投入于这两项活动的精力。一次研究尝试可以改进当前结果并为后续选择提供信息,从而将其价值与进一步研究的机会联系起来。 **自我改进与自我进化代理。** 更广泛的一系列工作使语言模型系统能够改进其行为或修订其底层程序 [47…
相似文章
@rohanpaul_ai: PRIMESCIENTIST 表明研究代理应选择实验投入方向,而不是持续推进相同想法……
PRIMESCIENTIST 证明研究代理应动态分配实验于竞争性计划中,在 FIRE-Bench 任务中以更少的尝试实现平均奖励提高10.3%。
PrimeIntellect-ai/prime-agent
Prime Agent 是 Prime Intellect 推出的开源编码与研究代理,结合了持久化 Python 环境、稳定的运行框架、子代理以及自我改进能力,适用于长时间运行的自主任务。
Prime Agent:一个自我改进的RLM智能体
Prime Intellect 推出 Prime Agent,这是一个完全开源、自我改进的编码工具(harness),围绕递归语言模型(RLM)和 Continual Harness 抽象构建,通过基于 REPL 的接口实现持久子智能体和动态工具。
Prime Agent: 一个自我改进的RLM框架
Prime Agent 是一个开源框架,它使用递归子代理和持久化计算来扩展语言模型在编码和推理任务中的长期能力,显著提高了在ARC-AGI-3等基准测试上的性能。
@TheTuringPost: AutoScientists – 一个由智能体组成的研究实验室 @哈佛大学的研究人员将智能体连接成一个自组织的科学…
哈佛大学研究人员提出 AutoScientists,一个没有中央协调器、能够形成自组织科学团队的多智能体系统,在 BioML-Bench 和优化任务上取得了强劲成果。