ColPackAgent: 代理技能引导的胶体堆积硬粒子蒙特卡洛工作流
摘要
ColPackAgent 是一个代理框架,使用模型上下文协议(MCP)工具服务器和代理技能,自主运行用于胶体堆积的硬粒子蒙特卡洛模拟,支持通过人类反馈或自主执行的结构化工作流,并在多个大型语言模型(LLM)上进行基准测试。
arXiv:2605.15625v1 Announce Type: new
摘要:我们介绍了 ColPackAgent,一个代理框架,通过模型上下文协议(MCP)工具服务器和代理技能自主运行胶体堆积的蒙特卡洛模拟,无论是作为独立代理还是集成到现有代理系统中。通过利用 MCP 服务器和代理技能,ColPackAgent 执行胶体堆积模拟的结构化工作流,这对于相行为、自组装和材料设计的研究至关重要。在没有专用模拟工具和工作流指令的情况下,通用大型语言模型(LLM)代理倾向于描述这些工作流而非可靠地执行它们。MCP 服务器暴露了一个自定义构建的 colpack Python 包,该包封装了 HOOMD-blue 硬粒子蒙特卡洛模拟,而技能编码了一个四阶段工作流合约。ColPackAgent 可以交互式地通过人类反馈执行工作流,从端到端提示自主执行,或者根据提供的程序文件进行自动研究。我们通过几个胶体堆积模拟示例展示了系统的不同模式,例如三维立方体粒子、二维圆盘和胶囊的二元系统,以及使用自动研究的二维硬圆盘冻结转变。我们还在一组 17 个阶段特定提示上,跨多个 LLM 比较了模型在此工作流上的性能。这个基准测试提供了不同模型在设置、规划和分析工作流中可靠程度的阶段级检查。总之,这些结果表明,将领域 Python 包与 MCP 工具和可移植代理技能配对,是将模拟工具包转变为代理辅助研究工作流的实用途径。
查看缓存全文
缓存时间: 2026/05/18 06:33
# ColPackAgent:基于智能体技能指导的胶体堆积硬粒子蒙特卡洛工作流 来源:https://arxiv.org/html/2605.15625 Lijie Ding ([email protected]) 中子散射部,橡树岭国家实验室,橡树岭,田纳西州 37831,美国 ###### 摘要 我们介绍了 ColPackAgent,一个通过模型上下文协议(MCP)工具服务器和智能体技能(可独立运行或嵌入现有智能体系统)自主执行胶体堆积蒙特卡洛模拟的智能体框架。借助 MCP 服务器和智能体技能,ColPackAgent 能够执行胶体堆积模拟的结构化工作流,这对相行为、自组装和材料设计研究至关重要。缺乏专用模拟工具和工作流指令时,通用大型语言模型(LLM)智能体往往只能描述这些工作流,而无法可靠执行。MCP 服务器暴露了一个自定义的 colpack Python 包,该包封装了 HOOMD-blue 硬粒子蒙特卡洛模拟,而智能体技能则编码了一个四阶段工作流协议。ColPackAgent 可以通过人机交互反馈、端到端提示词自主执行,或根据提供的程序文件进行自动研究。我们以多种模式展示了该系统,包括三维立方体粒子、二维圆盘与胶囊二元系统,以及通过自动研究实现的二维硬圆盘冻结转变等胶体堆积模拟实例。我们还使用 17 个阶段特定提示词,在一组 LLM 上比较了模型在此工作流上的性能。该基准测试提供了阶段级别的检查,以评估不同模型在遵循设置、规划和分析工作流方面的可靠性。综合这些结果,将领域 Python 包与 MCP 工具及可移植智能体技能相结合,为将模拟工具包转变为智能体辅助的研究工作流提供了一条实用途径。 ††preprint:APS/123-QED ## I 引言 胶体广泛存在于软物质中[1, 2],从乳液[3]和凝胶[4]到工程纳米粒子组装体[5];它们的堆积有助于理解相行为、自组装和材料设计[6, 7, 8]。由于这些系统涉及难以通过实验隔离的多体几何约束,计算机模拟已成为实验的重要补充。模拟能够解析粒子尺度的构型,测试理想化形状模型[9, 7],并将微观结构与体积分数、径向分布函数[10]和取向有序度[11, 12]等可观测物理量联系起来。在这些方法中,硬粒子蒙特卡洛(HPMC)是研究熵驱动胶体堆积的核心方法[9]。HPMC 及相关硬粒子蒙特卡洛研究已探讨了硬圆盘的二维熔化[13, 14]、四面体的致密堆积与准晶形成[15]、凸多面体的形状驱动自组装[16, 7]以及各向异性粒子的取向有序化[12]。尽管概念简单,实际的 HPMC 研究仍需要一个多阶段工作流:将科学问题转化为模拟设置,运行一组相关计算,判断平衡状态,并收集结果进行分析。这个过程大多是标准化的,但通常仍由研究人员手动协调。 近期关于 AI 智能体的工作指出了自动化部分协调工作的实用途径。通用 LLM 智能体已经能够读取项目文件、调用命令行工具、编辑脚本并迭代结果,而更广泛的自动研究理念则探讨智能体能否将科学问题贯穿于规划、执行和报告的全过程[17]。与此同时,领域特定智能体已开始将 LLM 与科学工具及闭环工作流连接起来,应用于化学[18, 19]、材料合成[20]、散射分析[21]和聚合物模拟[22]等领域。类似地,HPMC 胶体堆积等专业模拟工作流需要的不仅仅是一个强大的对话界面。如果缺乏经过验证的模拟工具以及设置-规划-执行-分析序列的程序知识,通用智能体可以描述工作流,但无法可靠执行。图 1 直接展示了这一对比:原生 OpenCode 对胶体蒙特卡洛请求仅返回一般性指导,而配备 ColPackAgent 工具服务器和技能的同一智能体则能将请求执行完毕,完成模拟工作流。 > 图 1:要求 OpenCode 运行胶体堆积模拟。(a) 配备 colpackMCP 和 colpack.skill 时,OpenCode 通过专用工具执行任务。(b) 原生 OpenCode 仅提供一般信息。 缺失的部分是结构化的工具接口和可移植的工作流程序编码方式。模型上下文协议(MCP)为智能体通过类型化输入和结构化输出调用外部工具提供了标准方法[23, 24]。对于模拟工作流,这允许将领域操作暴露为明确的工具调用,而非临时的 shell 命令或生成的脚本。智能体技能则提供了互补的程序层[25]。技能可以告诉智能体何时调用每个工具、必须首先收集哪些信息、哪些默认值不安全以及如何处理阶段边界。MCP 工具和智能体技能共同让领域专家能够分离“智能体可以调用什么”与“工作流应如何执行”。 在本工作中,我们提出了 ColPackAgent,一个基于上述 MCP 与技能分离的 HPMC 胶体堆积模拟智能体框架。ColPackAgent 结合了 colpack Python 包(封装 HOOMD-blue HPMC[26, 9])、通过结构化调用暴露模拟操作的 MCP 工具服务器,以及编码阶段顺序和决策规则的可移植智能体技能。该系统可以独立运行,也可以作为工具和技能包嵌入现有智能体前端。我们在交互式、自主和自动研究模式中展示了 ColPackAgent,包括针对二维硬圆盘冻结转变的端到端自动研究运行,并比较了不同 LLM 在阶段特定工作流提示词上的表现。本文剩余部分安排如下:第二节描述 ColPackAgent 架构和 HPMC 后端;第三节演示交互式、自主和跨平台运行;第四节介绍二维硬圆盘自动研究案例;第五节报告阶段感知的 LLM 基准测试;第六节总结发现与未来方向。 ## II 方法与系统设计 ### II.1 ColPackAgent 架构 如图 2(a) 所示,胶体堆积研究分为四个阶段:设置、规划、执行和分析。设置定义整体模拟问题,如维度、系综(NVT 或 NPT)、粒子组成和总粒子数 N。规划将设置扩展为具体的扫描任务,如选择 NVT 的目标体积分数或 NPT 的压力调度,以及采样长度和每个粒子的形状参数。执行初始化低密度构型,将其压缩至目标状态,采样系统并记录轨迹。分析则通过 freud 库[27] 从模拟轨迹计算序参量、径向分布函数[10] 并可视化结果。这种规则化结构允许我们将每个阶段暴露为模式验证的工具调用,而非 LLM 每次需要编写的自由格式代码。 > 图 2:胶体堆积模拟和 ColPackAgent 架构概览。(a) 胶体堆积模拟的典型四阶段工作流。(b) 用于执行胶体堆积模拟的 ColPackAgent。执行模拟所需的工具和知识分别实现为模型上下文协议(MCP)工具服务器和智能体技能。技能与工具之间的依赖关系由箭头表示。 ColPackAgent 将这四阶段映射到一个模型上下文协议(MCP)[23, 24] 工具服务器上,其使用由相应的智能体技能[25] 指导,如图 2(b) 所示。每个阶段通过一个工具暴露:设置工具、规划工具、执行工具和分析工具。第五个工具返回当前支持的维度、形状、系综、可调参数以及不相容混合规则,以便智能体了解工具能力。MCP 服务器实现为围绕 colpack 包的 Python 封装。在模拟过程中,研究状态在一个工作目录下持久化。每个阶段会写入结构化产物,使下一阶段或任何外部工具能够以规范形式读取已发生的内容,而非解析自由形式对话。模拟执行和分析工具异步运行,因此智能体不会在耗时模拟过程中超时。 为了帮助智能体使用 MCP 工具完成模拟工作流,我们为工具服务器配对了智能体技能,如图 2(b) 右侧所示。服务器定义了什么可调用,而技能定义了什么该做:阶段顺序、无静默默认值规则、范围规则(例如“在硬粒子模拟中永远不要询问温度”),以及控制交互式与自主模式的启发式规则。例如,当用户输入“模拟立方体”时,技能告诉智能体在调用设置工具之前先询问系综和粒子数 N,而非猜测合理值。技能是带有 YAML 前置头的 Markdown 文件。智能体技能可以安装在任何兼容的智能体系统上,并且 MCP 服务器在不同客户端间的调用方式相同。程序知识随工具一起传播。 ### II.2 使用 colpack 的硬粒子蒙特卡洛模拟 对于胶体堆积问题的模拟,我们采用硬粒子蒙特卡洛(HPMC)方法[28]。在 HPMC 中,粒子被视作刚体,重叠时具有无限大的排斥作用,否则无相互作用,这使得平衡态是非热的且完全由熵驱动。每个 MC 步提出一个试验移动——即平动、各向异性形状的转动,或 NPT 系综中的模拟盒子体积变化——仅当生成的构型无重叠时才接受该移动。我们使用 HOOMD-blue[26, 9] 中的 HPMC 积分器进行重叠检测和试验移动记账。NVT 固定模拟盒子,在目标体积分数 φ 下运行系统;而 NPT 允许盒子在施加压力 P 下波动,并将 φ 作为输出可观测量处理。 为了使模拟工具对智能体友好,我们开发了 colpack Python 包,底层利用 HOOMD-blue 作为模拟引擎。colpack 提供二维和三维中硬粒子形状的固定目录,如图 3 所示。二维形状包括圆盘、椭圆以及多边形形状(三角形、正方形、矩形和胶囊);三维形状包括球体、椭球体以及多面体形状(立方体、八面体、四面体和胶囊)。每个形状暴露一组几何参数,例如球体直径、椭球体的三个长度参数、立方体的边长等。这些参数通过相应的 MCP 工具暴露给智能体。 > 图 3:colpack 包涵盖的胶体粒子类型及模拟参数。 colpack 包支持广泛的可调参数,以研究不同的胶体堆积系统。例如,可以研究所有粒子的全局体积分数 φ 以及不同粒子之间的相对体积比 R_φ。对于 NPT 系综,压力 P 在规划阶段是可调参数。对于粒子形状,详细的几何参数在规划阶段均可调。最后,不同形状的粒子可以混合,以研究二元或多组分系统的堆积。由于 HPMC 模拟基于 HOOMD-blue 包实现,混合物模拟受限于 HOOMD-blue 的约束:混合物中的每种组分必须共享一个兼容的积分器家族。colpack 内部的一个积分器解析规则通过将组分提升至共同积分器来处理大多数组合。该规则无法解析的一种组合是混合椭圆/椭球与多边形/多面体形状,因为 HOOMD-blue 没有单一积分器同时覆盖两者。能力工具会暴露此限制,智能体技能在设置前检查该限制,设置工具则强制执行同一规则,从而在模拟启动前拒绝不允许的混合物。 ## III 智能体工作流演示 ### III.1 交互式工作流 图 4(a) 展示了一个示例对话,用户要求 ColPackAgent 在 NPT 系综中模拟立方体粒子。智能体每轮推进一个工作流阶段,并在调用每个工具前等待用户明确确认。在设置阶段,智能体引导用户提供维度、系综和粒子数 N,但尚未询问压力值;这些属于规划阶段,仅在设置完成后才收集。同样的阶段隔离模式在规划、执行和分析中重复。 > 图 4:与 ColPackAgent 的交互式对话示例。(a) ColPackAgent 在 NPT 系综中模拟立方体粒子的示例对话。(b) 对 ColPackAgent 在同一请求下的对应响应。
相似文章
长时段LLM智能体服务的并行上下文压缩
介绍了用于长时间范围LLM智能体的并行上下文压缩,实现了对摘要量的细粒度控制,并相比多个骨干模型上的顺序同步压缩,降低了端到端延迟。
CAX-Agent: 一种用于可靠APDL自动化的轻量级Agent工具框架
CAX-Agent是一种轻量级Agent工具框架,利用大语言模型自动化MAPDL有限元仿真,重点在于恢复策略。评估表明,基于模型的恢复实现了最佳的完成率。
AgentCompass: 统一智能体能力评估基础设施
AgentCompass 是一个面向基于大语言模型的智能体的开源、轻量级且可扩展的评估基础设施,将基准测试、测试框架与运行环境解耦,支持灵活配置。它覆盖五个能力维度共20多个基准测试,并提供容错运行时与轨迹分析工具。
Collider-Bench: 以粒子物理分析复现基准测试AI代理
Collider-Bench是一个新基准,评估LLM代理仅使用公开论文和开源软件复现大型强子对撞机粒子物理分析的能力,需要物理推理来填补缺失的实现细节。
COOPA:一种面向运筹学问题的模块化LLM智能体架构
本文介绍了COOPA,一种面向运筹学问题的模块化LLM智能体架构,它结合了基于迭代置信度的建模、元素级溯源和多求解器路由。在八个LLM主干网络和四个基线的评估中,COOPA在六个主干网络上取得了最佳的宏平均准确率,并在最强基线的基础上提升了最多6.7个百分点。