神奇的科学代理及其构建方法:AgentBuild用于Rietveld精修
摘要
本文介绍了AgentBuild,一个基于科学家编写的合约构建LLM科学代理的框架,该合约包括评分标准、课程大纲和知识库。本文将其应用于X射线衍射数据的Rietveld精修,展示了如何构建和调优代理。
arXiv:2606.12834v1 公告类型:新
摘要:随着科学工作流从确定性可执行程序转向基于LLM的代理,现有的开发实践(如微调、强化学习和即时提示)埋没了科学家的判断。我们提议将代理构建视为工作流的一个阶段,并引入AgentBuild,它根据科学家编写的合约构建科学代理。合约包括版本控制的评分标准、难度分级的课程和精选的外部知识库。评分标准驱动的评判器控制着一个元优化编码代理,该代理在声明的边界内编辑代理,因此构建编译的是代理而非科学家的判断。我们通过GSAS-II(基于MCP和A2A)将其实例化用于X射线衍射数据的Rietveld精修,其中空白框架构建运行经过锂镧锆氧化物(LLZO)信噪比阶梯,达到4小时扫描作为前沿案例,并暴露了剩余的工作流范围限制。同一评分标准既奖励可信拟合,也评分轨迹范围,使得前沿案例成为合约失败而非模式拟合失败。随着基础模型的演进,重新运行AgentBuild是重新调优而非重建,而科学家编写的合约仍是持久资产。
查看缓存全文
缓存时间: 2026/06/12 08:53
# 用于Rietveld精修的AgentBuild 本手稿部分由UT-Battelle, LLC根据合同DE-AC05-00OR22725与美国能源部(DOE)共同撰写。出版商接受本文发表即承认:美国政府保留非排他性、已付费、不可撤销的世界性许可,允许出版或复制手稿的已出版形式,或允许他人以此为目的进行复制,用于美国政府目的。DOE将按照DOE公共获取计划(http://energy.gov/downloads/doe-public-access-plan)提供对这些结果的公开访问。 来源:https://arxiv.org/html/2606.12834 ###### 摘要 随着科学工作流从确定性可执行文件转向基于LLM的智能体,现有的开发实践(如微调、强化学习和即用提示)掩盖了科学家的判断。我们提出将智能体构建视为工作流的一个阶段,并引入AgentBuild——它根据科学家编写的合约构建科学智能体。该合约包含三个部分:一个版本控制的评分标准、一个难度分级的课程体系以及一个精心策划的外部知识库。评分标准驱动的评判器控制着元优化编码智能体,该智能体在声明的边界内编辑智能体,从而确保构建过程编译的是智能体本身,而非科学家的判断。我们为X射线衍射数据的Rietveld精修实例化了这一方法,通过MCP和A2A协议后端的GSAS-II实现。在此过程中,一个空白框架的构建运行沿着锂镧锆氧(LLZO)信噪比梯级推进,将4小时扫描作为前沿案例,并揭示了工作流范围的局限性。同样的评分标准既奖励可信的拟合,也评估轨迹范围,从而将前沿问题定义为合约失效而非模式匹配失效。随着基础模型的演进,重新运行AgentBuild是一次再调优而非重建,而科学家编写的合约仍是持久的资产。 ## I 引言 科学工作流管理系统[39 (https://arxiv.org/html/2606.12834#bib.bib7)]二十年来一直将确定性可执行文件跨机构和仪器进行传递,使“将类型化输入通过一组固定程序移动”成为一个已解决的问题。然而,智能体时代打破了这一基本假设。工作流节点上的可执行文件不再是一个固定程序,而是一个大型语言模型(LLM)智能体,其提示、工具和代码会随着每次基础模型发布和科学仪器升级而变化。现成的LLM尚未具备工作流能力[48 (https://arxiv.org/html/2606.12834#bib.bib30)],因此开放性问题不在于是否将智能体置于节点中,而在于如何构建它,以及当下季度基础模型发生变化时如何重新构建它。 现有的开发实践将科学家的判断埋藏在科学家无法触及之处。监督微调将领域专业知识编码为权重,这些权重既不可逆地可区分,也无法在模型交换后保留。带有可验证奖励的强化学习(RL)[34 (https://arxiv.org/html/2606.12834#bib.bib41),15 (https://arxiv.org/html/2606.12834#bib.bib43)]进一步要求一个清晰的标量奖励,但科学家实际进行的视觉、多准则判断无法简化为这种形式。即用提示方式将基础模型直连可以避免这两个问题,但却没有提供一个可接受的评判标准。在所有这三种方法中,你都无法在通常的地方找到智能体,而科学家也缺乏一个可读的工件来表明什么样的分析是合格的。 智能体的领域能力源于科学家提炼的判断,而本文的贡献在于提供一种方法,使这种判断保持可读、可编写,并且位于构建循环之外。我们将判断视为由科学家编写的三部分合约:一个版本控制的评分标准,规定了合格分析必须满足的定性和视觉标准;一个难度分级的课程体系,将代表性样本与参考报告配对;一个精心策划的外部知识库,提炼了该领域依赖的程序。科学家的角色是编写者而非智能体编码者,并且构建过程编译的是智能体,而非科学家的判断。这是不替换的担保:基础模型可以帮助格式化编写的工件,但评分标准和课程体系构成了科学主张,科学家拥有它们。 在本文中,我们的贡献如下: - **一种智能体构建方法论**,将智能体的领域能力定位在科学家编写的合约中,并为科学家分配编写角色而非智能体编码角色。第四部分(https://arxiv.org/html/2606.12834#S4)将其基于信噪比实验进行实证,其中空白框架的构建运行在已编写的评分标准下,沿着锂镧锆氧(LLZO)信噪比梯级推进——即同一LLZO粉末图案在不同计数时间下的测量。具体来说,X射线粉末衍射数据是在Ta掺杂的LLZO基锂离子导电固体电解质上采集的。 - **AgentBuild,一个工作流阶段**,从该合约编译智能体。该阶段公开一个声明的接口、一个评分标准驱动的LLM作为评判的验收测试、一个变异多组件智能体组件(包括逐例的工具层)的元优化器,以及一个可追溯的输出,其接口在模型交换中持久存在。这些属性共同将其与仅提示优化器和单件程序搜索系统区分开来(第五部分(https://arxiv.org/html/2606.12834#S5)),并且持久接口属性在第二部分(https://arxiv.org/html/2606.12834#S2)的工件层面得到实证。 - **一个Rietveld和X射线衍射(XRD)案例研究**,通过模型上下文协议(MCP)服务器[7 (https://arxiv.org/html/2606.12834#bib.bib66)]在A2A[1 (https://arxiv.org/html/2606.12834#bib.bib67)]后端驱动GSAS-II[42 (https://arxiv.org/html/2606.12834#bib.bib68)]。该案例研究为合约的每个条款提供了具体证据(第四部分(https://arxiv.org/html/2606.12834#S4))。 它们共同回答了科学智能体从何而来、如何构建以及构建后是什么。本文的其余部分分三个部分展开:第二部分(https://arxiv.org/html/2606.12834#S2)将AgentBuild作为一个工作流阶段呈现,从科学家编写的工件开始,然后介绍使用它们的构建机制;第三部分(https://arxiv.org/html/2606.12834#S3)在GSAS-II上为Rietveld精修实例化该阶段;第四部分(https://arxiv.org/html/2606.12834#S4)报告了信噪比构建轨迹、评分标准合约以及将可信拟合与严格工作流范围成功区分开的4小时前沿;第五部分(https://arxiv.org/html/2606.12834#S5)将该方法论与智能体构建和自驱动科学谱系进行对比;第六部分(https://arxiv.org/html/2606.12834#S6)总结。 ## II AgentBuild:一个工作流阶段原语 请参见说明图1:AgentBuild循环。科学家和三个编写的工件(版本控制的评分标准、难度分级的课程体系以及精心策划的外部知识库)是循环左侧的起点;评分标准驱动的评判器将每个课程案例评分到记分卡中,该记分卡控制中心位置的元优化器构建步骤;右侧出现的开发中智能体(AUD)是一个版本化、A2A打包的盒子,带有其自身的机器编写的消费知识库。AgentBuild是一个科学工作流阶段,其任务是为同一工作流或联邦工作流的后续阶段构建一个基于LLM的智能体。工作流阶段是可组合的,具有声明的接口、执行的工作体以及可供其他阶段消费的类型化输出。智能体的程序能力存在于科学家编写的合约中。在本部分中,我们概述科学家编写的三个工件,然后介绍使用它们的构建机制。图1(https://arxiv.org/html/2606.12834#S2.F1)显示了端到端的循环。左侧的科学家和三个编写的工件是其起点,中心运行的是评分标准驱动的评判器和元优化器构建步骤,右侧出现的智能体是一个打包的盒子。 ### II-A 三个编写的支柱 科学家编写三个支柱,它们是对智能体领域能力来源的具体回答。第一个是版本控制的**评分标准**,规定了智能体的输出和轨迹必须满足的定性和视觉标准,每个维度都有严格的通过阈值。评分标准是可测试的工件,以可读、可归属于作者的形式捕捉领域专家的判断。第二个是难度分级的**课程体系**,一组配对元组,每个元组包含一个代表性科学样本和一个对该样本合格分析样式的参考报告,从易到难排列。第三个是精心策划的**外部知识库**,提炼了该领域依赖的程序,由科学家编写,作为构建过程中程序能力的来源。第三部分(https://arxiv.org/html/2606.12834#S3)为Rietveld精修具体填充了所有三个支柱,评分标准维度和阈值在表II(https://arxiv.org/html/2606.12834#S3.T2)中列出。 ### II-B 两个知识库 AgentBuild将两个知识库分开,以便最终的知识蒸馏可以针对底层模型能力具体定制。**生产者外部知识库**是科学家精心策划的只读语料库。元优化器在构建时读取它,但它永远不会进入智能体。它仍然是科学家的知识产权,是程序能力的来源。**消费者AUD知识库**是机器编写的,位于智能体的编辑边界内,由开发中智能体(AUD)在运行时读取。它是构建的智能体的属性,而非其起源的属性。 图2(https://arxiv.org/html/2606.12834#S2.F2)展示了边界。生产者知识库(紫色)对元优化器是只读的,并被阻止进入智能体,而消费者AUD知识库(青色)位于智能体内。 请参见说明图2:两个知识库的接缝。生产者外部知识库(紫色)是科学家精心策划的知识产权,由元优化器在构建时读取,并被阻止进入智能体。消费者AUD知识库(青色)是机器编写的,位于智能体内,并在运行时读取。生产者知识库是智能体的起源,永远不会成为智能体的一部分。 ### II-C 阶段合约 AgentBuild合约有六个声明的输入、一个验收测试、一个构建步骤和两个输出,以及一个发布候选的升级门。图3(https://arxiv.org/html/2606.12834#S2.F3)展示了端到端的循环。科学家编写的输入位于左上角起点,构建步骤在后续运行,版本化的输出和溯源轨迹从右侧退出。 **声明的输入**。第一个声明的输入是**课程体系**,第二个是**评分标准**,如上所述。第三个是**生产者外部知识库**,科学家精心策划的只读程序来源。第四个是**基础模型句柄**,指定AUD、评判器和元优化器使用的具体LLM检查点。第五个是**MCP工具清单**[7 (https://arxiv.org/html/2606.12834#bib.bib66)],AUD可以调用的模型上下文协议原语集,由驱动科学引擎的MCP服务器暴露。第六个是**编辑边界**,一个表,声明元优化器可以变异AUD组件的哪些表面(系统提示、工具连接、辅助代码,以及逐例的MCP服务器代码),以及哪些在构建期间是冻结的(底层引擎、课程体系、评分标准、生产者外部知识库和评判器框架)。 **验收测试**。验收测试是一个评分标准驱动的LLM评判器,根据评分标准的输出和轨迹维度对AUD在每个课程案例上的轨迹进行评分;表II(https://arxiv.org/html/2606.12834#S3.T2)给出了本文中使用的Rietveld实例化。逐例评分聚合成每次迭代的裁决。这是LLM作为评判器方法论[49 (https://arxiv.org/html/2606.12834#bib.bib39)],作为阶段类型化的验收测试,而不是独立的评估框架。收敛标准是通过标准**P-strict**。在同一迭代中,评判器的评分在所有评分标准维度上对所有活跃的课程案例达到所有阈值。P-strict和事件驱动的层级升级规则(即当AUD在P-strict下通过先前层级时添加一个层级)是预先注册的验收标准,在此处任何结果之前声明,以便标准固定独立于构建产生的内容。 **构建步骤**。构建步骤是一个元优化器LLM,它根据评判器的最新裁决和课程体系的当前前沿,在编辑边界内变异AUD组件。搜索目标是AUD组件本身,而不是单个程序或单个奖励函数。提示、工具连接、辅助代码,以及当边界允许时,MCP服务器胶水代码被共编辑。构建步骤的不变量是每次变异后的端到端可执行性。每个候选AUD必须能够在课程体系上运行而不崩溃,无论其评分如何。 **可追踪的输出**。升级门是P-strict下的评分标准饱和加上发布标签。当它触发时,AgentBuild输出两个内容。主要输出是一个版本化、A2A打包的AUD[1 (https://arxiv.org/html/2606.12834#bib.bib67)],可在已知URI后部署,无需重新编写编排层。次要输出是一个**溯源轨迹**,涵盖评分标准和课程体系版本、每次元优化器对AUD的差异、每次评判器记录、每个模型句柄以及参与构建的每个工具版本。溯源轨迹使得FAIR-CWFR立场[46 (https://arxiv.org/html/2606.12834#bib.bib20)]对于由工作流构建的智能体成为可能,因为构建本身就是一个工作流,其运行序列化为PROV[37 (https://arxiv.org/html/2606.12834#bib.bib28)],并与其他运行符合FAIR原则[45 (https://arxiv.org/html/2606.12834#bib.bib17)]和研究软件FAIR[10 (https://arxiv.org/html/2606.12834#bib.bib19)]。 请参见说明图3:AgentBuild阶段合约。六个声明的输入(课程体系、评分标准、基础模型句柄、MCP工具清单、生产者外部知识库、编辑边界)位于左上角起点,评分标准驱动的评判器和元优化器构建步骤形成内部循环,升级门在右侧发布版本化的A2A打包AUD和溯源轨迹。科学家编写的输入位于构建步骤的上游,从左到右的顺序是方法论的起源-然后-构建序列。 ### II-D 持久接口 AgentBuild声明的接口是跨模型代际、超越单个实例化而持久存在的。当基础模型句柄改变时,针对相同评分标准和课程体系重新运行AgentBuild是一次再调优而非重建。评分标准和课程体系是项目的知识产权资产,而A2A打包的AUD是任何足够有能力的基础模型都可以根据相同接口重新衍生的衍生品。当句柄从一个检查点翻转到下一个时,评分标准规范、课程体系记录、MCP工具清单、评判器框架——所有这些都与AUD的组件分离,并且接口——AUD必须通过该接口入队和出队——保持不变。持久接口使得具有不同原点(不同基础模型)的AUD可以在相同工作流编排中互换,而编排层无需重新配置。
相似文章
FirstResearch: 面向LLM科学发现代理的可审计问题形成框架
FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。
RF-Agent:用于RFIC设计的语言智能体构建实用框架
RF-Agent引入了一种基于教科书的知识蒸馏流水线,创建了首个射频领域推理数据集和基准测试,证明了领域特定微调和语义检索能显著提升大语言模型在射频电路设计中的推理能力。
SciToolAgent-Evo:面向开放世界科学工具获取的本体感知自进化智能体
介绍了SciToolAgent-Evo,一种面向开放世界科学工具获取的本体感知自进化LLM智能体,以及包含900个真实任务的OpenSciToolBench基准。该智能体利用进化记忆和基于LinUCB的赌博机门控,动态探索并获取新工具。
Prime Agent:一个自我改进的RLM智能体
Prime Intellect 推出 Prime Agent,这是一个完全开源、自我改进的编码工具(harness),围绕递归语言模型(RLM)和 Continual Harness 抽象构建,通过基于 REPL 的接口实现持久子智能体和动态工具。
构建智能体
关于构建AI智能体的指南或资源。