迈向可审计的AI科学家:面向LLM代理的假设演化协议

arXiv cs.AI 论文

摘要

本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。

arXiv:2607.09195v1 Announce Type: new 摘要:大型语言模型(LLM)代理日益被期望在AI驱动的科学发现中发挥核心作用。它们具备广泛知识、灵活推理和工具使用能力,能够通过反复提出假设、测试假设并根据证据修正信念,自主探索和解决科学问题。然而,在当前的代理中,这些假设、测试和信念更新都隐藏在非结构化的日志中,没有任何机制让代理或人类研究员审计这一过程。本文提出了假设演化协议(HEP),这是一种代理框架,将假设生成、评估和演化作为明确且可审计的操作。在材料科学研究任务上,配备HEP的代理执行了规划型代理所缺乏的假设-测试-证据-信念循环,能够泛化到不同研究问题,并且随着基础LLM能力的增强而更充分地利用该协议。这些结果标志着迈向可审计的AI科学家的一步,其科学推理可以被检查、验证和在此基础上构建。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:53

# 一个面向LLM智能体的假设演化协议
来源:https://arxiv.org/html/2607.09195
## 迈向可审计的AI科学家:面向LLM智能体的假设演化协议

Izumi Takahara东京大学生产技术研究所,东京,日本 153\-8505kougen@iis\.u\-tokyo\.ac\.jp,†\\daggerteru@iis\.u\-tokyo\.ac\.jp

> 大型语言模型(LLM)智能体日益被期望在AI驱动的科学发现中发挥核心作用。凭借广泛的知识、灵活的推理能力和工具使用,它们有潜力通过反复提出假设、进行检验并根据证据修正信念,自主探索和解决科学问题。然而,在当前的智能体中,这些假设、检验和信念更新都深埋在非结构化的日志中,没有任何机制让智能体或人类研究人员能够审计这一过程。本文提出**假设演化协议(HEP)**,这是一个智能体框架,将假设生成、评估和演化作为显式、可审计的操作提供。在材料科学研究任务中,配备HEP的智能体能够运行规划型智能体所缺乏的“假设–检验–证据–信念”循环,跨研究问题泛化,并且随着基础LLM能力的增强而更充分地利用该协议。这些结果标志着向可审计的AI科学家迈出了一步,其科学推理过程可以被检查、验证和在此基础上构建。

## 1. 引言

大型语言模型(LLM)的快速进步,尤其是基于LLM的智能体,作为潜在的科学发现驱动力,在广泛领域引起了浓厚兴趣[Lu2026AIScientist, Gottweis2026CoScientist, Mitchener2025Kosmos, Zhang2026AgenticMaterials]。现代LLM结合了广泛的科学知识与灵活的推理能力,当配备工具[Yao2023ReAct, Anthropic2024MCP, Hou2025MCP]、技能[Wang2023Voyager, Jiang2026AgenticSkills]、记忆[Chhikara2025Mem0, Gao2026SelfEvolvingAgents]以及计划和反思等推理策略[Yao2023ReAct, Sun2023AdaPlanner, Shinn2023Reflexion]时,生成的智能体有潜力灵活自主地驱动科学研究。

迄今为止,LLM智能体已在多个领域被开发用于自主执行研究。突出的例子包括人工智能研究和工程的端到端自动化[Lu2026AIScientist, Jin2026Arbor]、生物医学发现的自动化[Gottweis2026CoScientist, Ghareeb2025Robin, Mitchener2025Kosmos, Ke2025BioDisco],以及将LLM与领域工具和机器人实验室结合的化学智能体[Bran2024ChemCrow, Boiko2023Coscientist, Darvish2025ORGANA]。在材料科学中,LLM智能体已被积极应用于计算材料设计[Jia2024LLMatDesign, Takahara2025MatAgent, Nduma2025Crystalyse, Kim2026Materealize, Zou2025ElAgente, Pham2026ChemGraph, Deng2026AtomisticSkills]以及材料合成与表征的自动化[Fei2026AgenticLLM, YanguasGil2026ALDOptimization, shi2026knowledge, mandal2025evaluating, vriza2026operating],并且作为加速材料研究进展的实际途径正在兴起[Zhang2026AgenticMaterials]。

然而,LLM智能体的“自主研究”一词包含了具有显著不同自主程度的任务[RiosGarcia2026AIScientists]。上述大部分工作自动化了预定义的工作流程,其中智能体可靠地执行一系列规定的计算、合成或测量[Bran2024ChemCrow, Boiko2023Coscientist, Darvish2025ORGANA, Deng2026AtomisticSkills],或朝着外部指定的目标进行优化[YanguasGil2026ALDOptimization, Fei2026AgenticLLM]。一个要求显著更高自主程度的任务是回答“为什么”的问题:即通过反复生成机制性假设、设计能够区分它们的实证检验、并根据结果证据修正信念,来获得解释性理解。朝此方向迈出的步骤包括:生成和排序科学假设的智能体[Ghafarollahi2025SciAgents, Yang2024MOOSE, Yang2025MOOSEChem, Yang2025MOOSEChem2, Ke2025BioDisco, Gottweis2026CoScientist];将证伪置于研究过程核心的框架[Liu2024AIGS, Huang2025POPPER];信念引导的开放式探索[Agarwal2025AutoDiscovery];以及根据数据、实验或模拟迭代优化假设的闭环系统[Mitchener2025Kosmos, Ghareeb2025Robin, Wang2026ScienceClaw, Jin2026Arbor, Wiemann2026DiscoverPhysics]。

然而,在现有的智能体中,无论是智能体本身还是人类研究人员,都无法轻易追溯智能体考虑过哪些假设、执行了哪些检验、以及结果证据如何改变其信念。假设和信念通常隐含在自由文本推理或未公开的内部状态中。当研究记录被外部化时,追踪的是基于论证的排序[Gottweis2026CoScientist]、工件的来源[Wang2026ScienceClaw]或任务性能分数[Jin2026Arbor],而不是经验证据可以提高或降低的显式信念程度。事实上,最近一项对智能体执行轨迹的大规模分析发现,约三分之二的轨迹中证据被忽略,约四分之一的情况中信念在反驳后才被修正[RiosGarcia2026AIScientists]。如果没有显式、可审计的“假设–检验–证据–信念”循环记录,以及没有约束该循环如何运作的结构,智能体结论的科学可靠性就无法被验证[Wang2026WorkflowClosure, Bisht2026AgenticNotBuilt],智能体本身也无法在长期研究视野中系统地构建、修正或淘汰自己的假设。

在这项工作中,我们提出**假设演化协议(HEP)**,这是一个智能体框架,将根据证据提出、检验和修正假设的科学过程转化为显式协议,其中的每一步骤对LLM智能体和人类研究人员都是可追踪的。HEP将每个假设外部化为一个可审计注册表中的持久对象,携带一个只能由附加证据移动的信念概率,通过细化(parent hypotheses)的优化和合并而演化,并经历从提出到解决(支持、反驳或休眠)的生命周期。该协议因此为智能体以纪律严明的方式运行“假设–检验–证据–信念”循环提供了基础。利用材料科学研究任务作为测试平台,我们展示了配备HEP的智能体确实运行了规划型智能体所缺乏的“假设–检验–证据–信念”循环,同一协议能跨研究问题泛化,并且该协议被利用的深度与基础LLM的能力成比例。

参见图注图1:假设演化协议(HEP)概述。(a) 给定一个研究任务,LLM智能体照常运行实验和任何其他工具,同时通过HEP管理其假设、证据和信念。该协议引导智能体反复进行“假设–检验–证据–信念”循环,任务以最终报告结束。HEP由一个可审计的**HEP注册表**和**HEP工具**组成。(b) HEP注册表是管理每个假设状态的存储库。每个假设在唯一假设ID下作为一个持久对象保存,并附带一个仅追加的事件日志。展开的示例显示了假设hyp\_31a58d的事件日志,该假设以先验信念P(H)=0.35提出,并在附加证据将其信念降低至0.16后被反驳。每个事件都保留在仅追加日志中,因此完整记录是可审计的。(c) HEP工具将HEP注册表通过三个组暴露给智能体:**提出与演化**、**检验与判断**和**读取**。(d) 假设通过四种机制生成和演化:**de-novo**、**inspired-by**、**refine**和**merge**。(e) 通过HEP管理的假设具有五种生命周期状态之一:proposed、under\_test、supported、refuted或dormant。状态转换通过transition\_hypothesis工具执行,每个假设预计最终变为supported、refuted或dormant状态。

## 2. 结果

### 假设演化协议

图1(https://arxiv.org/html/2607.09195#S1.F1)展示了所提出的HEP的概览。处理研究任务的LLM智能体照常与其实验环境及任何其他工具交互。在此常规工作流程之上,HEP提供了智能体管理其假设、证据和信念的层(图1(https://arxiv.org/html/2607.09195#S1.F1)a)。该协议由两个组件组成:一个可审计的**HEP注册表**和一组**HEP工具**。HEP注册表将每个假设记录为一个持久对象,具有唯一假设ID、自然语言声明、信念P(H)(定义为智能体当前认为该假设为真的概率)、生命周期状态及其来源。每个信念更新、证据附加和状态转换都会被附加到相应假设的事件日志中,因此每个假设的完整历史对智能体和人类研究人员都是可审计的(图1(https://arxiv.org/html/2607.09195#S1.F1)b)。

HEP工具在三个组中调解智能体与HEP注册表之间的交互:**提出与演化**、**检验与判断**和**读取**,最后一项让智能体查找跟踪的假设及其当前状态和信念(图1(https://arxiv.org/html/2607.09195#S1.F1)c)。假设通过四种生成机制进入注册表:**de-novo**、**inspired-by**、**refine**和**merge**(图1(https://arxiv.org/html/2607.09195#S1.F1)d)。当智能体在运行过程中调用这些工具时,其假设不断演化,其总体形成显式谱系而非简单列表。

每个假设具有五种生命周期状态之一,从proposed和under\_test到最终状态supported、refuted或dormant(图1(https://arxiv.org/html/2607.09195#S1.F1)e)。信念受到两条规则的约束。首先,P(H)只能由通过验证门控的证据来移动。被判断为不充分的附加会被记录,但信念保持不变。其次,判决是由注册表强制执行的阈值转换:只有当P(H) ≥ 0.8时,假设才能转换为supported状态;只有当P(H) ≤ 0.2时,才能转换为refuted状态;而无法进一步检验的假设则以明确原因搁置为dormant状态。设计细节在方法(https://arxiv.org/html/2607.09195#S4)中给出。

### 实验

我们在三个材料科学研究任务上评估HEP,每个任务提出一个相同形式的开放研究问题:“对于一个固定机器学习原子间势(MLIP),对于某个化合物家族中的每个化合物,该势偏好哪种晶体结构?以及什么物理或化学原理解释了这种模式?”任务AO2涉及AO2二氧化物中七种原型之间的多晶型选择;任务A2BB′O6涉及A2BB′O6双钙钛矿中B位阳离子有序化,在岩盐、层状和柱状有序化以及无序参考之间进行选择;任务MX涉及MX过渡金属单硫族化物和单磷族化物中岩盐、NiAs、闪锌矿和纤锌矿之间的原型选择。

这三个家族涵盖从二元(AO2, MX)到四元(A2BB′O6)化合物的组合复杂性,它们提出的问题要求解释而非针对预定义目标进行优化。LLM对这些系统有一些先验知识,但固定势的行为直到实际测试时才知晓。因为目标是要获得新知识而非回忆已知事实,智能体形成的每个假设只能通过检验来判断。单个偏好可以通过弛豫计算,但支配模式的规则无法仅通过枚举来解读。这些问题也具有科学意义,因为理解一个势稳定哪种晶体结构以及为什么,直接关系到材料设计。

在每次运行中,智能体接收一个单一任务提示,并被要求使用提供的工具自主解答研究问题,并以最终报告的形式交付。除非另有说明,基础LLM为GPT-5.5[OpenAI2026GPT55]。智能体设置和运行参数在方法(https://arxiv.org/html/2607.09195#S4)中给出。

参见图注图2:HEP使科学循环显式且可审计。(a) 任务AO2上某次运行的假设树。节点为假设(填充色=最终生命周期状态,数字=最终信念,标签=ID后缀);边显示生成机制(橙色实线=*refine*,紫色虚线=*merge*,青色点线=*inspired-by*,后者提供来源但不提供谱系)。对于*de-novo*和*inspired-by*假设,generation为0;对于*refine*,为parent+1;对于*merge*,为max(parents)+1。(b) 所有16个假设的信念轨迹(浅线)随累积的已验证证据更新次数(0为提出时的先验)的变化。每个最终状态高亮显示一个示例。阴影带表示注册表强制执行的判决阈值(supported ≥ 0.8,refuted ≤ 0.2)。(c) 规划型智能体(基线)与配备HEP的智能体(相同目标,相同基础LLM,各n=3次运行)的科学循环。左:循环步骤各元素的比例(H=假设提出,T=检验,E=证据,B=信念更新,J=判断,U=假设更新;平均值±标准差跨运行)。中、右:行归一化的转移概率P(next|current)在运行上的平均值,经过压缩连续的相同元素。因此自转移未定义,显示为灰色。全白行表示该元素从未出现;规划型智能体的H、J、U行各自仅包含1到3个事件,因此相应概率基于很少的转移。

#### HEP运行假设–检验–证据–信念循环。

我们首先查看智能体在单个研究运行中如何操作HEP,以任务AO2的一次运行为例。图2(https://arxiv.org/html/2607.09195#S2.F2)a显示了生成的假设树,其中每个节点是一个假设,按最终生命周期状态着色,并标有最终信念,边指示生成机制。在该次运行中,智能体枚举了16个候选假设,使用了全部四种生成机制,并且每个假设最终都转换为supported、refuted或dormant状态,结束时没有留下开放假设。在运行后期,候选假设通过合并汇聚。一次四父本合并产生了一个候选支配规则,随后通过进一步基于证据的合并得到巩固,最终形成信念为0.97的最终假设。因此,该树能够追踪每个假设与其父本的关系以及其生成机制。

图2(https://arxiv.org/html/2607.09195#S2.F2)b追踪了相同运行中的信念。纵轴是每个假设的信念P(H),横轴是累计已验证证据更新次数,0对应于提出时的先验。浅线显示了该运行中提出的所有16个假设,每个最终状态各高亮显示一条轨迹作为示例,阴影带标记了注册表强制执行的判决阈值。每个信念变化对应于一次通过验证门控的记录证据附加。

相似文章

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。

层次化实验者智能体

arXiv cs.AI

介绍了层次化实验者智能体(HExA),这是一个基于上下文、以实验为中心的自我改进框架,使LLM智能体能够设计实验、学习可复用技能,并在新领域回答查询,在Interphyre物理模拟基准上取得了显著优于基线的改进。

分层实验者智能体

Hugging Face Daily Papers

介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。