LLM智能体使用模拟模型进行受控实验

arXiv cs.AI 论文

摘要

本文提出了一种多智能体框架,使LLM智能体能够使用模拟模型为药物过程设计进行受控实验,从而产生比纯语言推理更具体和可操作的建议。

arXiv:2608.23622v1 Announce Type: new 摘要:大语言模型(LLMs)在推理、规划和工具使用方面表现出强大的能力,但许多科学和工程任务需要的不仅仅是合理的文本和代码生成。它们需要理解系统对干预的响应,这在实践中依赖于受控实验。在这项工作中,我们提出了一种多智能体框架,使LLM智能体能够使用科学模拟模型为药物过程设计进行受控实验。给定用户查询和基线配置,该系统构建结构化任务表示,设计实验,执行比较模拟,解释结果,并综合基于证据的过程参数优化建议。通过在交互式智能体框架中将语言模型与高保真模拟模型耦合,所提出的系统支持通过干预、比较和观察进行推理。因此,它产生的输出比纯语言推理更具体和可操作。在工业应用环境中,这一优势体现在更高的输出特异性以及改进的用户评价正确性和有用性上。消融研究和可视化案例分析进一步证明了模拟集成实验推理的有效性和实用性。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:09

# 使用仿真模型的 LLM 代理执行对照实验
来源:https://arxiv.org/html/2608.23622
Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla所属机构:斯图加特大学工业自动化与软件工程研究所,斯图加特,德国 \{yuchen\.xia\|\|michael\.weyrich\|\|nasser\.jazdi\|\|johannes\.stuempfle\|\|johannes\.sigel\|\|akshay\.narla\}@ias\.uni\-stuttgart\.deGavin K\. Reynolds1, Anna Jawor\-Baczynska2, Pol Llopart3所属机构:阿斯利康 1可持续创新与转型卓越中心 (xSITE),制药技术与开发,运营部 2化学开发,制药技术与开发,运营部 3数据分析与人工智能 (DA&AI),运营 IT 部 1,2麦克尔斯菲尔德,英国;3巴塞罗那,西班牙 \{Gavin\.Reynolds\|\|Anna\.Jawor\-Baczynska\|\|Pol\.Llopart\}@astrazeneca\.com

###### 摘要

大型语言模型 (LLMs) 在推理、规划和工具使用方面展现出强大能力,但许多科学与工程任务需要的不仅仅是看似合理的文本和代码生成。它们需要理解系统如何响应干预,而在实践中这取决于对照实验。在本研究中,我们提出一个多智能体框架,使 LLM 代理能够利用科学仿真模型进行制药工艺设计的对照实验。给定用户查询和基线配置,该系统构建结构化任务表示、设计实验、执行对比仿真、解释结果,并综合基于证据的工艺参数优化建议。通过将语言模型与高保真仿真模型在交互式智能体框架中耦合,所提出的系统支持通过干预、对比和观察进行推理。因此,它能产生比纯语言推理更具体、可操作的输出。在工业应用场景中,这种优势体现为更高的输出特异性以及用户评价的正确性和实用性提升。消融研究和可视化案例分析进一步证明了集成仿真的实验推理的有效性和实际应用价值。

###### 索引术语:

LLM、多智能体系统、仿真、工具增强推理、科学人工智能、工艺优化

## I 引言

大型语言模型 (LLMs) 在多步骤推理、规划和工具使用方面展现了有前景的能力。然而,许多科学与工程任务需要的不仅仅是看似合理的文本生成。它们需要确定系统如何响应干预,而在实践中这意味着通过对照比较进行推理,而不仅仅是语言生成。

对照实验是科学探究和工程问题解决的核心机制。要理解一个工艺应如何改进,通常需要形成假设,在保持其他条件不变的情况下改变一个选定的因素,观察产生的变化,并将其与参考条件进行比较。这种逻辑对于识别因果效应以及产生具体、可测试且可操作的结论至关重要。

当前基于 LLM 的系统并非天然以这种模式运作。即使配备了外部工具,这些工具通常也被用于检索信息或执行孤立的功能,而不是进行结构化的实验比较。因此,它们的输出可能仍然是暗示性的,而非证据性的,尤其是在可靠结论依赖于在受控干预下比较结果的任务中。

这一问题在科学和工业应用中尤为重要,因为重要的知识常常体现在捕获不同操作条件下系统动态的仿真模型中。例如,在制药工艺设计中,仿真模型可以为评估候选工艺修改及其后果提供实用基础。

受此场景启发,我们研究如何将 LLM 置于基于仿真的实验环境中进行科学推理。我们不是将仿真视为被动的辅助工具,而是将其视为一个可以通过受控干预和比较来检验假设的环境。这一视角为本研究中开发的框架奠定了基础。

参考说明图1:图形摘要。集成仿真的智能体系统提供精确、基于证据的洞见,以支持工程决策。
## II 相关工作

### II-A 相关应用领域和用例

在各个科学和工程领域,LLMs 越来越多地被应用于特定领域的工作流程。在化学领域,先前的工作展示了工具增强的化学推理(如 ChemCrow[3 (https://arxiv.org/html/2608.23622#bib.bib1)])、自主实验设计与执行(如 Coscientist[2 (https://arxiv.org/html/2608.23622#bib.bib2)])以及端到端合成开发(如 LLM-RDF[16 (https://arxiv.org/html/2608.23622#bib.bib3)])。在以仿真为中心的工程环境中,近期系统已支持基于 OpenFOAM 的计算流体动力学设置与优化(如 OpenFOAMGPT[12 (https://arxiv.org/html/2608.23622#bib.bib4)])、自然语言到 CFD 的自动化(如 AutoCFD[4 (https://arxiv.org/html/2608.23622#bib.bib5)])以及更广泛的端到端仿真研究工作流(如 ASA[9 (https://arxiv.org/html/2608.23622#bib.bib6)])。

这些研究表明,LLMs 在特定领域科学与工程任务中的适用性日益增强。然而,大多数现有系统强调检索、工作流自动化、代码生成或仿真设置,而不是将仿真模型用作进行对照实验和比较推理的环境。因此,仿真通常被视为执行任务的工具,而非通过变量干预和结果解释来检验假设的实验基底。

### II-B 推理机制与智能体框架

先前的研究表明,LLMs 可以执行迭代推理并与外部工具交互,例如 ReAct[26 (https://arxiv.org/html/2608.23622#bib.bib7)]、Toolformer[17 (https://arxiv.org/html/2608.23622#bib.bib8)] 和 Gorilla[13 (https://arxiv.org/html/2608.23622#bib.bib9)]。多智能体框架如 AutoGen[22 (https://arxiv.org/html/2608.23622#bib.bib10)]、HuggingGPT[18 (https://arxiv.org/html/2608.23622#bib.bib11)] 和 CAMEL[8 (https://arxiv.org/html/2608.23622#bib.bib12)] 为智能体分配功能性角色以解决通用和特定领域任务。Communicative Agents[14 (https://arxiv.org/html/2608.23622#bib.bib13), 23 (https://arxiv.org/html/2608.23622#bib.bib14)] 进一步展示了多轮协作如何能提升结构化工作流中的性能。

更新的工作强调了显式的角色分解以及规划与执行的分离[25 (https://arxiv.org/html/2608.23622#bib.bib28)],例如 ConAgents[19 (https://arxiv.org/html/2608.23622#bib.bib15)] 和 Plan-And-Act[5 (https://arxiv.org/html/2608.23622#bib.bib16)]。通过更清晰和标准化的工具描述,可靠的工具使用也得到了改进,例如 EASYTOOL[27 (https://arxiv.org/html/2608.23622#bib.bib17)]。这些工作为构建结构化的 LLM 智能体系统提供了重要的设计原则。然而,它们并未直接解决如何围绕科学仿真模型的对照实验推理来组织此类智能体架构的问题。

### II-C 仿真器与工具集成

越来越多的研究探索了将 LLMs 与工具、软件环境以及仿真相关组件集成。现有系统已表明,LLM 代理可以访问工具[28 (https://arxiv.org/html/2608.23622#bib.bib18)] 和 Web API[15 (https://arxiv.org/html/2608.23622#bib.bib19)],并且可以连接到基于仿真的工作流,例如基于 OpenFOAM 的 CFD 环境[12 (https://arxiv.org/html/2608.23622#bib.bib4)] 和更广泛的自动化仿真研究流程[9 (https://arxiv.org/html/2608.23622#bib.bib6)]。多智能体系统也被用于构建、执行和验证基于物理的仿真,例如 MechAgents[11 (https://arxiv.org/html/2608.23622#bib.bib20)] 中的力学问题和 ProtAgents[6 (https://arxiv.org/html/2608.23622#bib.bib21)] 中的蛋白质设计与分析。

与此同时,许多与仿真器相关的 LLM 研究仍局限于简化的、具身化的或沙盒式的环境,包括 3D 仿真器[7 (https://arxiv.org/html/2608.23622#bib.bib22)]、基于规则的游戏设置[1 (https://arxiv.org/html/2608.23622#bib.bib23)] 以及用于行为探索的虚拟环境[21 (https://arxiv.org/html/2608.23622#bib.bib24), 24 (https://arxiv.org/html/2608.23622#bib.bib25)]。在这些环境中,仿真通常作为动作生成或规划行为的测试平台,而不是作为进行对照比较和基于证据推理的高保真科学环境。

参考说明图2:所提出的集成仿真智能体框架中的信息流。
### II-D 超越先前工作的贡献

本工作的主要贡献如下:

科学推理作为结构。所提出的智能体架构按照科学问题解决范式组织推理。系统将任务分解为子目标和需求,设计对照实验以检验假设,观察产生的结果,并将这些观察综合为结论。这种结构支持工程应用中的系统化和可验证推理。

科学仿真。虽然先前的工作已证明了利用仿真软件为 LLMs 提供依据的可行性,通常是在简化的或类似游戏的环境中,但我们的框架旨在与再现动态物理和化学现象的高保真科学仿真进行交互。这使系统能够利用仿真模型和语言模型的互补知识。

应用驱动的设计。该框架是在现实世界应用约束下开发的。通过将推理过程形式化为有向图,系统提供了中间推理工件的清晰可观测性和可视化,以支持实际的工业使用。

## III 方法

图2 (https://arxiv.org/html/2608.23622#S2.F2) 展示了所提出的集成仿真智能体框架。该系统通过一系列专业智能体处理用户查询,并为工程师用户生成建议。

整体设计被组织为一个结构化的信息处理工作流,其中中间推理工件被显式生成、转换并在智能体之间传递。在本研究的背景下,该工作流使基于 LLM 的系统能够执行对照实验推理:它分析任务、识别相关的干预变量、规划基于仿真的比较、执行参数化实验、解释结果,并将结果综合为最终建议。

### III-A 智能体框架设计

所提出的框架由六个不同的智能体组成。其中五个是 LLM 驱动的智能体,每个都由专用的提示引导,而另一个,执行器智能体,则被实现为基于规则的软件组件。每个智能体在整个流程中负责一个特定的功能性角色。

需求分析器智能体接收用户输入,解释其潜在的用户意图,并对其进行推理,以产生任务表述和结构化的需求列表。这些输出共同构成任务描述,作为后续推理的基础。

规划器智能体以任务描述为输入,执行逐步推理,生成一个抽象计划,而不承诺具体的执行细节。规划器获知可用的仿真功能列表,称为仿真规格,其中每个功能都附有简洁的描述。根据任务要求和可用的仿真能力,规划器生成一个抽象计划,概述推理步骤的逻辑顺序并识别仿真功能相关的节点。规划器被明确指示保持在抽象层面,不生成详细的执行逻辑或结果。

交互操作器智能体接收抽象计划并通过详细推理将其具体化。特别是,它将计划中需要基于仿真比较的步骤付诸实施。每当操作器遇到涉及仿真函数的步骤时,它会生成带有完全指定输入参数的 Python 代码,并将执行委托给执行器。收到执行结果后,它恢复后续的推理。通过这种方式,操作器将抽象的推理步骤转化为可执行的对照仿真实验。

交互执行器智能体在受控的 Python 解释器环境中执行模块化的仿真函数。它返回文本和图形输出,并通过提供执行反馈直接与操作器交互。作为一个确定性的软件组件,它负责可靠的工具执行而非语言推理。

解释器智能体使用具有视觉能力的 LLM 对仿真生成的图表进行语义解释。它从视觉化的仿真输出中产生文本洞见,并总结通过仿真模型进行的参数化实验的结果。

报告器智能体观察整个推理和执行过程,聚合前面智能体生成的文本输出,并生成一个面向用户的响应,总结任务解决过程和最终结果。

总而言之,这些智能体将系统组织成一个结构化的推理流程,逐步将用户查询转化为显式的中间工件、基于仿真的证据和最终建议。

### III-B LLM 智能体与仿真模型之间的交互接口

智能体系统与仿真模型之间的接口通过三个智能体的协调交互实现:操作器、执行器和解释器,如图3 (https://arxiv.org/html/2608.23622#S3.F3) 所示。操作器和执行器形成一个用于仿真调用的两智能体对话循环,而解释器则分析仿真产生的视觉输出。

参考说明图3:仿真调用期间的操作器–执行器–解释器交互协议。
从抽象计划开始,操作器将每个相关的计划步骤扩展为具体的推理文本。当需要仿真实验时,它生成相应的函数调用代码并将其发送给执行器。执行器运行代码,从仿真函数获取文本和视觉输出,并将文本执行结果返回给操作器,然后操作器继续其推理。同时,视觉输出(如图表)被传递给解释器,解释器从中提取文本形式的语义洞见。

这种交互协议支持自适应且容错的工具使用过程。如果函数调用失败,确定性的执行器会返回错误信息。然后操作器可以修改函数调用并重试生成,直到执行成功或达到预定义的重试次数限制。该设计使系统能够从格式错误或不完整的工具调用中恢复,同时保持推理过程的连续性。

相似文章

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

TradingAgents:多智能体 LLM 金融交易框架

Papers with Code Trending

本文介绍了 TradingAgents,这是一个多智能体 LLM 框架,通过模拟现实世界中的交易公司来提升股票交易表现。该框架利用执行分析和风险管理的专用智能体,在累计收益和夏普比率方面优于基线模型。

LLM Agents Factory: Retrieval of Domain-Specific LLM Agents

arXiv cs.CL

The paper presents LLM Agents Factory, a retrieval-based framework that constructs domain-specific LLM agents from a base of over 20K predefined agent profiles, offering a cost-efficient and controllable alternative to dynamic agent generation. Experiments show accuracy comparable to AutoGen with a 120B backbone at substantially lower inference cost.