模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI 论文

摘要

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

arXiv:2606.04505v1 公告类型:新论文 摘要:科学模拟器正日益被集成到由LLM驱动的系统中,用于高风险的仿真驱动决策。然而,现有框架主要将LLM用于生成、校准或执行模拟器,将其视为黑盒接口,而非可供推理的结构化机制系统。因此,当前方法缺乏识别、表示和推理模拟器行为背后假设与机制的能力,限制了透明度、可审计性与决策依据的可解释性。我们提出了MechSim——一个面向可执行科学模拟器的、基于机制的神经符号推理框架。与以往主要在静态符号结构上进行推理的神经符号方法不同,MechSim使LLM智能体能够对科学模拟器的机制、假设和执行行为进行推理。我们的框架通过一套共享的结构化模式表示模拟器,涵盖假设、变量、机制依赖关系和执行轨迹。在此表示之上,LLM智能体作为受约束的推理引擎运行,生成将模拟器输出与其底层机制相关联的结构化、有据可查的解释。我们在多个高风险领域对该方法进行了评估,结果表明其在机制层面的解释质量、模拟器分析以及下游决策可靠性方面均有显著提升。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:07

# 模拟、推理、决策:基于LLM的科学推理驱动仿真决策

来源:https://arxiv.org/html/2606.04505

Yuhan Yang Ruipu Li Alexander Rodríguez

密歇根大学计算机科学与工程学院

\{yuhanyyh, liruipu, alrodri\}@umich\.edu

###### 摘要

科学模拟器正日益被集成到LLM驱动的系统中,用于高风险的仿真驱动决策。然而,现有框架主要使用LLM来生成、校准或执行模拟器,将其视为黑盒接口,而非可加以推理的结构化机制系统。因此,当前方法缺乏识别、表示和推理模拟器行为底层假设与机制的能力,限制了透明度、可审计性和决策依据。

我们提出MechSim——一个面向可执行科学模拟器的机制驱动神经符号推理框架。与主要在静态符号结构上进行推理的既有神经符号方法不同,MechSim使LLM智能体能够推理科学模拟器的机制、假设和执行行为。我们的框架通过一个共享的结构化模式来表示模拟器,该模式涵盖假设、变量、机制依赖关系和执行轨迹。在此表示之上,LLM智能体作为受约束的推理引擎运行,生成结构化、有据可查的解释,将模拟器输出与其底层机制相关联。我们在多个高风险领域对该方法进行了评估,结果表明其在机制层面的解释质量、模拟器分析以及下游决策可靠性方面均有显著提升。

## 1 引言

LLM智能体为自动化决策工作流提供了自然的接口,能够摄取来自多样化来源的多模态信息并生成建议 Ma et al.\(2025 (https://arxiv.org/html/2606.04505#bib.bib75)\); Xiao et al.\(2024 (https://arxiv.org/html/2606.04505#bib.bib74)\)。近年来,LLM驱动的系统已开始将科学模拟器纳入其中,以支持医疗、金融、物流和公共政策等高风险领域的仿真驱动决策 Kim et al.\(2024 (https://arxiv.org/html/2606.04505#bib.bib78)\); Datta et al.\(2026 (https://arxiv.org/html/2606.04505#bib.bib50)\); Choukhman et al.\(2026 (https://arxiv.org/html/2606.04505#bib.bib77)\)。科学模拟器在这些场景中尤为宝贵,因为它们能够在真实世界实验成本高昂、风险较大或存在伦理障碍时,对干预措施和反事实场景进行评估 Marathe and Vullikanti \(2013 (https://arxiv.org/html/2606.04505#bib.bib67)\); Banks et al.\(2010 (https://arxiv.org/html/2606.04505#bib.bib14)\); Carson \(2005 (https://arxiv.org/html/2606.04505#bib.bib15)\)。

尽管LLM集成仿真系统受到越来越多的关注,现有方法主要使用LLM来生成、校准或执行仿真模型 \(Holt et al.,2025 (https://arxiv.org/html/2606.04505#bib.bib20); Datta et al.,2026 (https://arxiv.org/html/2606.04505#bib.bib50); Wahl et al.,2026 (https://arxiv.org/html/2606.04505#bib.bib102)\),但对模拟器本身的推理支持十分有限。具体而言,现有框架缺乏结构化表示,无法让LLM智能体以有据可查、可验证的方式分析模拟器假设、机制层面的依赖关系及执行行为。因此,这些系统仍局限于对模拟器输出进行描述性摘要和表层解读,生成的解释往往看似合理,却并未根植于模拟器结构、执行轨迹或科学证据。

这一局限尤为关键,因为科学模拟器明确编码了从根本上塑造其输出的假设、变量和机制层面的依赖关系。然而,这些假设往往嵌入于专业的科学形式体系中,使人难以判断特定结果的成因,以及模拟器行为是否与部署场景或所评估的政策相一致。例如,在公共卫生危机期间,流行病模拟器可能预测关闭学校能降低感染高峰,但这一效果究竟主要源于儿童之间传播减少、出行变化,还是接触网络结构中内嵌的假设,往往并不清晰。更重要的是,这些结论的有效性可能取决于模拟器假设是否与真实世界背景相符——例如当地的社会接触模式、行为响应或干预依从性。若没有能够将结果追溯到模拟器假设和机制的框架,基于仿真的建议将难以解释、审计和验证,而这些对于高风险决策至关重要 Rudin \(2019 (https://arxiv.org/html/2606.04505#bib.bib17)\); Saltelli et al.\(2020 (https://arxiv.org/html/2606.04505#bib.bib26)\); Holmdahl and Buckee \(2020 (https://arxiv.org/html/2606.04505#bib.bib18)\)。

为应对上述挑战,我们提出MechSim——一个用于仿真驱动决策中科学模拟器推理的神经符号框架。MechSim将结构化模拟器表示与基于LLM的推理相结合,实现对模拟器行为和结果的有据可查的分析。我们的主要贡献有以下三点:

1. **我们提出了一个机制驱动推理框架**,使LLM智能体能够分析模拟器结果的产生方式和原因,而不仅仅停留在表层输出上。该框架通过一个共享的结构化模式表示模拟器,涵盖假设、变量、机制层面的依赖关系和执行轨迹,使LLM智能体能够以有据可查、受约束的方式对模拟器结构进行推理。

2. **我们提出了一个可验证的解释框架**,要求生成的论断必须根植于模拟器结构、执行轨迹或检索到的科学证据。这将解释生成从事后总结转变为构建和验证关于模拟器行为的机制驱动假设的过程。

3. **我们在三个高风险领域开展了大量实验**,证明MechSim在多个场景中提升了解释质量、模拟器分析能力以及下游决策可靠性。

## 2 问题建模

我们研究如何使LLM智能体指导仿真驱动决策。在该场景中,LLM智能体需分析模拟器行为、假设和输出,生成建议,并为真实世界决策任务提供有据可查的依据。

我们考虑如下设定:决策任务 $\mathcal{T}$、一组(集成)结构异构的科学模拟器 $\mathcal{S}=\{s_{1},s_{2},\dots,s_{n}\}$、描述部署环境的上下文信息 $\Omega$,以及包含科学文献、技术报告或政策指南的科学语料库 $\mathcal{D}$。上下文信息 $\Omega$ 描述了决策所处真实世界环境的属性,包括人口特征、机构约束、地理条件、时间跨度、行为模式以及影响模拟器假设对目标场景有效性的文化因素 \(Uhrmacher et al.,2024 (https://arxiv.org/html/2606.04505#bib.bib54)\)。

值得注意的是,$\mathcal{S}$ 中的模拟器在假设、内部机制和计算抽象方面可能存在显著差异,在相同的部署背景下可能产生截然不同的输出 Holmdahl and Buckee \(2020 (https://arxiv.org/html/2606.04505#bib.bib18)\)。因此,仅凭模拟器输出往往不足以支撑可靠的决策,因为建议可能在很大程度上依赖于模拟器的潜在假设及其与部署环境的契合程度。

任务规范 $\mathcal{T}$ 定义了模拟器输出用于决策的预期方式。本工作聚焦于两种主要场景:

(1)**政策选择**:智能体根据模拟器输出评估候选干预措施,例如流行病学中的公共卫生干预或供应链系统中的库存管理策略。在该场景中,$\mathcal{T}$ 包括待评估的候选干预措施集合。

(2)**面向预测的模拟器选择**:在对未来事件(如住院预测或需求预测)进行预测之前,智能体从可用模型集合中选择最可靠的模拟器。

每个模拟器 $s_i \in \mathcal{S}$ 将初始条件 $x$ 映射到输出 $y_i$,表示为 $y_i = s_i(x, \theta_i, f_i)$,其中 $\theta_i$ 表示模拟器参数,$f_i$ 表示模拟器的计算逻辑。在许多科学模拟器中,$x$ 和 $\theta_i$ 本身具有不确定性,因此被建模为概率分布而非固定值,本工作采用这一假设。初始条件 $x$ 和参数 $\theta_i$ 由上下文信息 $\Omega$ 和任务规范 $\mathcal{T}$ 实例化。

因此,我们的目标是使LLM智能体能够生成根植于模拟器机制、执行行为和上下文有效性的建议与解释。

## 3 MechSim:面向科学模拟器的机制感知推理

MechSim是一个面向可执行模拟器的机制驱动约束推理神经符号框架。我们问题设定的核心挑战在于,模拟器输出本身无法揭示哪些假设、机制或上下文因素驱动了最终预测。MechSim通过显式表示模拟器结构,并利用模拟器机制、科学证据和执行行为(即仿真过程中模拟器状态与机制激活的演化)约束LLM推理来应对这一挑战。

我们的框架将模拟器推理分解为四个紧密耦合的组件:(1)上下文锚定、(2)机制层面锚定、(3)受约束的机制层面推理、(4)验证检查。MechSim的符号层由结构化模拟器表示组成,包括机制图、假设、执行轨迹和敏感性分析产物;神经层由基于LLM的上下文解释、科学证据综合、解释生成和决策推理组成。机制图作为神经推理运行的符号基底,使推理能够扎根于可执行模拟器,而非仅依赖无约束的文本摘要推理。

MechSim的每个组件通过专门的模块实例化,这些模块以协作LLM智能体的形式实现,如图1所示。这些智能体负责上下文理解、模拟器校准与执行、机制建模、约束推理、敏感性分析和验证。虽然该框架在概念上围绕有据可查的神经符号推理组织,但智能体分解使各阶段能够模块化执行并迭代优化。

形式上,给定上下文信息 $\Omega$、任务规范 $\mathcal{T}$、模拟器集成 $\mathcal{S}$ 和科学语料库 $\mathcal{D}$,MechSim构建结构化模拟器表示,并在结构一致性、证据锚定和实证支持约束下,生成经过验证的解释 $E$ 和建议 $R$。值得注意的是,与主要在静态符号结构上运行的既有神经符号推理方法不同,MechSim对可执行模拟器进行约束推理,其行为在仿真和干预过程中动态涌现。

### 3.1 上下文锚定

上下文锚定组件通过上下文理解智能体实现,将异构上下文信息转化为适合下游推理的结构化表示。给定上下文信息 $\Omega$、任务规范 $\mathcal{T}$ 和科学语料库 $\mathcal{D}$,MechSim提取模拟器执行和推理所需的决策相关实体、约束、干预措施和初始条件。

与此同时,框架检索科学证据 $\mathcal{Z}$ 以锚定下游解释生成与验证。具体而言,给定从 $\Omega$ 和 $\mathcal{T}$ 派生的查询 $q$,检索函数 $\mathcal{K}(q, \mathcal{D}) \rightarrow \mathcal{Z}$ 通过受 OpenScholar 启发的密集检索与重排序流水线检索相关科学证据 \(Asai et al.,2026 (https://arxiv.org/html/2606.04505#bib.bib57)\)。所得证据集 $\mathcal{Z}$ 为下游推理提供科学依据,并减少无据可查或幻觉性解释的产生 \(Ji et al.,2023 (https://arxiv.org/html/2606.04505#bib.bib31); Huang et al.,2025 (https://arxiv.org/html/2606.04505#bib.bib68)\)。

图1:MechSim概览。MechSim是一个面向仿真驱动决策中科学模拟器机制驱动推理的神经符号框架。MechSim协调专门的LLM智能体进行上下文锚定、模拟器执行、机制建模、敏感性分析、约束推理和验证,从模拟器输出、机制图和科学证据中生成实证锚定的解释和决策建议。

### 3.2 机制层面锚定

机制层面锚定构建模拟器行为与执行动态的结构化表示。其核心目标是揭示产生模拟器结果的机制、假设和执行模式,从而使推理能够扎根于模拟器行为,而非仅依赖输出结果。

##### 机制图构建

对于每个模拟器 $s_i \in \mathcal{S}$,MechSim构建机制图 $\mathcal{G}_i = (\mathcal{V}_i, \mathcal{E}_i, \mathcal{M}_i)$,其中 $\mathcal{V}_i$ 表示模拟器变量,$\mathcal{E}_i$ 表示变量之间的机制层面转换,$\mathcal{M}_i$ 表示与模拟器关联的图元数据。元数据 $\mathcal{M}_i$ 包括模拟器假设 $\mathcal{A}_i$、执行轨迹 $\tau_i$ 以及从模拟器执行中导出的汇总统计量。机制图作为约束下游推理的符号表示。节点对应模拟器实体或状态变量,边表示模拟器编码的机制性转换、交互或传播路径。假设 $\mathcal{A}_i$ 决定了在给定部署背景和干预设定下哪些机制处于激活状态。

为构建 $\mathcal{G}_i$,机制建模智能体从模拟器定义、执行轨迹和领域文档中提取结构化模拟器表示。感染高峰、死亡率或系统过载等仿真输出作为图级元数据附加,从而实现对模拟器结构和观测结果的联合推理。

##### 模拟器校准与执行

给定上下文信息 $\Omega$ 和任务规范 $\mathcal{T}$,MechSim对集成 $\mathcal{S}$ 中的每个模拟器进行实例化和执行。初始条件与干预设定由……

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

学习如何让大语言模型进行推理

OpenAI Blog

OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。