Agent-MD:面向有状态GCMC-MD模拟活动的选择性LLM干预与事件驱动升级
摘要
Agent-MD是一个框架,选择性地将LLM推理应用于长期分子模拟活动,使用确定性规则型代理处理常规任务,并对异常情况采用事件触发的LLM审查。在GCMC–MD水蒸气解吸模拟中的演示表明,可审计、可复现的科学工作流可以避免将每项操作都置于LLM推理循环中。
arXiv:2608.07637v1 公告类型:新
摘要:长期分子模拟活动需要从已保存状态进行重复延续、具有来源感知的推进、自适应评估,以及对无法通过固定规则安全解决的工作流条件进行偶尔解释。在此,我们提出Agent-MD,一个将大语言模型(LLM)推理选择性地置于活动构建和事件触发的审查中的框架,而常规的模拟、分析、延续、归档和状态推进则由一个持久的基于规则的代理使用已批准策略和显式状态记录来处理。Agent-MD在一个包含五个蒙脱石体系和三个连续相对湿度状态(RH = 0.9-0.3-0.1)的巨正则蒙特卡罗-分子动力学(GCMC-MD)水蒸气解吸活动中得到演示。在15个体系-RH状态中,该工作流完成了120个分段模拟循环,具有特定于状态的采样长度和来源感知的重启继承。常规生产无需实时调用推理代理,而一个状态达到了审查边界;随后通过盲法推理代理重放评估了两个保留事件,识别出潜在的工作流问题并推荐了适当的后续行动。模拟还揭示了明显的组成依赖性低RH响应,含Ca蒙脱石比含Na和K的体系保留更多的层间水并维持更大的基面间距,而最高电荷的Na体系在干燥条件下保留了更多残余水。这些结果表明,长期科学工作流不必将每项操作都置于LLM推理循环中:选择性推理可以与确定性执行、结构化证据和经过验证的控制交接相结合,以提供可复现且可审计的代理辅助分子模拟。
查看缓存全文
缓存时间: 2026/08/11 08:02
# Agent-MD:面向有状态 GCMC–MD 活动的选择性 LLM 干预与事件驱动升级机制 来源:https://arxiv.org/html/2608.07637 Yijie WangDepartment of Civil and Environmental Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, ChinaZhen\-Yu Yin通讯作者:zhenyu\.yin@polyu\.edu\.hkDepartment of Civil and Environmental Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, ChinaZhenheng TangDepartment of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, ChinaXiaowen ChuThrust of Artificial Intelligence, The Hong Kong University of Science and Technology \(Guangzhou\), Guangzhou, China ###### 摘要 长期运行的分子模拟活动需要从已保存状态进行重复续算、具备来源感知的推进、自适应评估,并且偶尔需要对固定规则无法安全解决的工作流条件进行解读。在此,我们提出 Agent\-MD,一个将大语言模型(LLM)推理选择性置于活动构建和事件触发审查阶段的框架,而常规模拟、分析、续算、归档和状态推进则由一个持久化的基于规则的campaign agent按照经批准的策略和显式状态记录来处理。Agent\-MD在包含五个蒙脱石体系和三个连续相对湿度状态(RH = 0.9 → 0.3 → 0.1)的巨正则蒙特卡洛–分子动力学(GCMC–MD)水蒸气脱附活动中得到了验证。在全部15个体系–RH状态中,该工作流完成了120个分段模拟循环,具有特定于状态的采样长度和来源感知的重启继承。常规生产阶段无需调用实时推理代理,而一个状态达到了审查边界;随后通过盲法推理代理重放评估了两个已保存事件,识别出潜在的工作流问题并推荐了适当的后续行动。模拟结果还揭示了明显的组分依赖的低RH响应:含Ca蒙脱石比Na和K体系保留更多层间水并维持更大的基底间距,而最高电荷的Na体系在干燥条件下保留了更多残余水。这些结果表明,长期运行的科学工作流不必将每个操作都置于LLM推理循环中:选择性推理可以与确定性执行、结构化证据和经过验证的控制交接相结合,从而提供可复现、可审计的代理辅助分子模拟。 ## 1 引言 分子动力学(MD)模拟已成为解析分子尺度机制以及预测化学、材料和生物体系的结构、热力学和输运性质的核心工具12 (https://arxiv.org/html/2608.07637#bib.bib29)、7 (https://arxiv.org/html/2608.07637#bib.bib31)。然而,一项可靠的MD研究远不止执行一条轨迹。研究人员必须构建并验证分子模型、选择力场和数值设置、准备引擎特定输入、提交并监控计算作业、管理重启文件、分析持续演化的输出,并保留将每个结果与其输入和执行历史联系起来的来源信息1 (https://arxiv.org/html/2608.07637#bib.bib12)、3 (https://arxiv.org/html/2608.07637#bib.bib30)、7 (https://arxiv.org/html/2608.07637#bib.bib31)。在专用模拟软件、脚本和文件系统之间协调这些任务需要大量专业技术知识和反复的人工监督。随着模拟变得越来越长且相互关联,人工协调还会增加参数不一致、重启选择错误、工作流上下文丢失和记录不完整的风险。 这些挑战使分子模拟成为人工智能(AI)代理的自然应用场景。通过解读高层科学目标并调用已建立的领域工具,代理可以在协调一致的工作流中将分子模型准备、输入生成、模拟执行、监控、分析和报告连接起来。这种操作模式有可能降低专用模拟软件的实际使用门槛,减少重复性监督和记录保存工作,并使计算过程更加明确和可复现,前提是工具使用和工作流决策保持可追溯。近期研究已开始展示这一潜力。MDCrow采用大语言模型(LLM)引导的推理–行动循环来选择专家设计的工具,用于分子动力学设置、执行和分析6 (https://arxiv.org/html/2608.07637#bib.bib4)。Ding等人将全局监督、领域特定技能和高性能计算执行相结合,构建了基于OpenClaw的计算化学架构9 (https://arxiv.org/html/2608.07637#bib.bib3)。相关的代理辅助工作流已实现金属有机框架模拟的自动化,并协调了大规模材料筛选任务17 (https://arxiv.org/html/2608.07637#bib.bib5)、19 (https://arxiv.org/html/2608.07637#bib.bib6)。这些研究共同表明,AI代理可以充当跨专用科学软件的工具接口和协调者,而不仅仅是孤立代码或输入文件生成的助手。 尽管取得了这些进展,现有代理辅助研究主要展示了工具选择、有界工作流执行或跨预定义模拟任务的协调6 (https://arxiv.org/html/2608.07637#bib.bib4)、9 (https://arxiv.org/html/2608.07637#bib.bib3)、17 (https://arxiv.org/html/2608.07637#bib.bib5)、19 (https://arxiv.org/html/2608.07637#bib.bib6)。分子模拟还包括长轨迹、自适应采样和多阶段活动,在这些活动中,后续计算使用较早阶段的结果进行选择或初始化23 (https://arxiv.org/html/2608.07637#bib.bib13)、16 (https://arxiv.org/html/2608.07637#bib.bib32)、13 (https://arxiv.org/html/2608.07637#bib.bib33)。在这些活动中,所需采样工作量可能无法预先知道,每个模拟状态可能需要重复的执行和分析循环,而后继状态可能依赖于在较早条件下接受的构型。因此,科学工作流系统一直强调显式任务依赖、持久化元数据和来源感知执行,作为可复现计算研究的基础1 (https://arxiv.org/html/2608.07637#bib.bib12)、15 (https://arxiv.org/html/2608.07637#bib.bib11)、20 (https://arxiv.org/html/2608.07637#bib.bib9)、14 (https://arxiv.org/html/2608.07637#bib.bib10)、3 (https://arxiv.org/html/2608.07637#bib.bib30)。对于此类工作流,提交作业的完成不一定等同于相应科学状态的完成:可能需要评估多个可观测量,必须选择权威的重启或归档文件,并且前驱状态与后继状态之间的关系必须保持一致。许多续算、分析和归档操作可以通过显式规则处理,而意外故障、模糊的稳定化行为或来源冲突可能需要灵活解读。在一个LLM代理应如何在常规决策与不确定决策的混合体中介入——同时已建立的科学工具继续负责可靠的计算和分析——这一问题仍未得到充分探索。 吸附和解吸等温线模拟是这类长期、状态依赖活动的代表性示例。完整的等温线是通过在一系列压力或湿度条件下进行的模拟组装而成,而非单次计算;每个条件都需要足够的采样,并明确评估相应状态是否已准备好进行报告或推进10 (https://arxiv.org/html/2608.07637#bib.bib14)、27 (https://arxiv.org/html/2608.07637#bib.bib16)。在依赖路径的吸附或解吸研究中,一个条件下接受的构型可用于初始化下一个条件,这使得重启选择和前驱状态来源成为科学流程的一部分。结构弛豫、分子摄取和空间再分布可能在不同条件下以不同方式推进,且不同可观测量可能不会同时稳定;吸附滞后和结构转变进一步增加了这种变异性28 (https://arxiv.org/html/2608.07637#bib.bib17)。因此,构建此类等温线涉及重复的模拟、监控、续算、状态评估、归档和推进,以及大量的人工判断和记录保存。代理辅助执行在减少重复监督方面具有巨大潜力,同时保留科学结论所依赖的经过验证的模拟和分析方法。 蒙脱石提供了一个科学上重要且技术上有挑战性的测试案例。其层间水化驱动着水组织和粘土片间距的变化,产生膨胀和收缩,进而影响膨胀土变形、井壁稳定性以及地质环境和核废料应用中粘土屏障的性能2 (https://arxiv.org/html/2608.07637#bib.bib34)、25 (https://arxiv.org/html/2608.07637#bib.bib26)、30 (https://arxiv.org/html/2608.07637#bib.bib24)。这些响应强烈依赖于可交换阳离子种类和层电荷;后者与阳离子交换容量(CEC)和电荷平衡层间离子的数量密切相关31 (https://arxiv.org/html/2608.07637#bib.bib25)、29 (https://arxiv.org/html/2608.07637#bib.bib27)、24 (https://arxiv.org/html/2608.07637#bib.bib28)。在实验中,分离层电荷的影响是困难的,因为电荷、CEC、可交换离子数量和矿物结构往往是耦合的,受控操作需要专门的化学处理18 (https://arxiv.org/html/2608.07637#bib.bib35)。分子动力学和GCMC–MD提供了互补的机制研究工具,因为分子组成和层电荷可以被规定,而层间水、离子组织、吸附和粘土片分离则被直接解析25 (https://arxiv.org/html/2608.07637#bib.bib26)、28 (https://arxiv.org/html/2608.07637#bib.bib17)。因此,蒙脱石水蒸气脱附既提供了一个要求高的有状态工作流,也为评估代理辅助分子模拟提供了一个有实际意义的物理问题。 因此,我们开发了Agent\-MD,作为在长期分子模拟活动中实现选择性LLM干预和事件驱动升级的框架。该框架将活动构建和未解决审查任务分配给基于LLM的推理代理,而持久化的基于规则的campaign agent则通过经批准的策略、经过验证的科学计算和分析工具以及显式状态和来源记录来管理常规生产。推理代理的建议在影响执行之前会经过验证,从而允许灵活解读仅在常规规则无法安全确定下一步行动时重新进入。我们在一个包含五个蒙脱石体系和三个连续RH状态的GCMC–MD水蒸气脱附活动中展示了这一架构,包括自适应续算、已接受状态继承和事件触发审查。该工作流通过其运行记录、一个真实的生产事件、一个来源冲突以及所保存案例的盲法重放进行评估。与此同时,模拟还考察了可交换阳离子种类和层电荷如何影响解吸过程中的残余水化、水分配和粘土片收缩。这一双重展示使Agent\-MD既成为可靠、可审计的长期运行模拟的实用工作流架构,也成为解决实质性分子尺度材料问题的工具。 ## 2 Agent\-MD框架 ### 2.1 总体架构与代理角色 Agent\-MD由人类研究人员、基于LLM的推理代理、持久化的基于规则的campaign agent、科学计算与分析工具以及持久化的campaign状态和来源记录组成。人类研究人员定义科学目标,并负责批准活动以及任何需要科学判断的变更。推理代理用于需要灵活解读的任务,主要是活动构建和未解决生产状态的审查。这两个功能由同一个基于LLM的推理角色在不同的干预点执行。基于规则的campaign agent通过读取批准的campaign规范和当前campaign状态来选择下一个允许的操作、调用适当的科学工具并更新campaign记录,从而管理常规生产。因此,两个代理角色之间的区别主要在于其行动选择方式:推理代理解读有界的科学或工作流问题,而基于规则的campaign agent遵循批准的策略和记录的状态。 如图1 (https://arxiv.org/html/2608.07637#S2.F1)所示,该架构由三个相互连接的阶段组成。活动构建始于研究人员定义的输入,包括科学目标、规定条件或路径、目标可观测量、约束和可用工具。推理代理将这些输入转化为提议的分子体系选择、活动计划以及执行和验收规则。然后,研究人员审查并批准该提议。由此产生的活动规范构成了灵活规划与生产执行之间的显式边界:它可以在被基于规则的campaign agent使用之前进行检查和验证。在常规生产期间,推理代理并非持续活动;只有当未解决状态被路由到事件触发审查时,它才重新进入工作流。 见图注图1:用于有状态模拟活动的Agent\-MD总体架构。活动构建产生经人类批准的活动规范,基于规则的campaign agent管理常规有状态生产,未解决状态可在经过验证的操作返回生产之前被路由到事件触发审查。 生产被组织为有状态的模拟活动。分子体系表示一个独特的模型或组成,而模拟状态表示该体系在某个规定条件下的状态,连同其当前构型、采样进度、分析和验收状态以及来源。启动一个新的分子体系需要模型构建和初始模拟文件的准备。相比之下,从状态kk推进到状态k\+1k\+1使用已接受的前驱状态来准备下一个规定条件的输入。因此,新体系构建和已接受状态继承被视为不同的工作流操作。 在每个模拟状态内,基于规则的campaign agent协调一个分段的运行–分析–决策循环。在每个模拟段之后,自动例程分析输出并应用批准的续算和验收规则。需要额外采样的状态从其当前有效重启继续进行;已接受状态与其支持记录一起被归档;而无法由批准规则安全解决的状态则被路由到事件触发审查。因此,单个模拟段的完成本身并不意味着相应模拟状态的完成。 在事件触发审查期间,推理代理接收结构化审查...
相似文章
如何防止LLM代理相互干扰及干扰您的系统?
探讨防止LLM代理相互干扰及干扰系统操作的技巧,重点关注多代理部署中的协调和安全措施。
模拟、推理、决策:基于LLM的科学推理驱动仿真决策
密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。
多智能体LLMs未能相互探索
本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。
持续LLM智能体中的受控记忆干扰
提出了受控记忆干扰(CMI),一个用于研究LLM智能体在不同记忆关系下记忆演化的诊断框架,揭示了特定关系的干扰会抑制更新可塑性,且干扰感知训练能够改进对有效更新的区分。
你的LLM不应该是你的编码智能体工作流
主张在编码智能体工作流中,LLM应仅用于推理,而由确定性基础设施处理队列、状态、重试和恢复,这样即使达到使用限制,流程也不会中断。