科学机器学习中的物理审计代理发现
摘要
介绍了物理审计代理科学机器学习(PA-SciML),这是一种以验证为先的工作流程,其中LLM代理发现替代模型,并针对边界条件和因果性等物理要求而非仅误差指标进行验证。数值示例表明,与仅基于误差的基线相比,可信度有所提高。
arXiv:2607.07379v1 公告类型:新
摘要:在代理科学机器学习(SciML)中,大语言模型(LLM)代理可以发现替代模型并通过自动化评分(通常为误差指标)进行选择。然而,低误差并不能确保预测场满足力学中重要的物理要求,如边界条件、叠加、刚度缩放或因果性。我们引入了物理审计代理科学机器学习(PA-SciML),这是一种用于代理SciML发现的以验证为先的工作流程。该工作流程在搜索前固定评分评估器,推导出可审查、可机器检查的物理要求,检查每个训练候选的输出,并单独搜索指定的输入范围或测量的载荷历史跨度,以寻找高违反情况,且无需参考解场。仅当通过所述检查时,才将替代模型报告为已验证。启用后,该工作流程还会在训练前添加咨询性数值探针,并一次只测试一个建模变化,以记录在重用前哪些孤立编辑与得分提高相关。在报告的计算固体力学数值示例中,静态弹性运行选择了验证误差低于仅误差基线的替代模型,而两个选定模型均通过常见的线弹性检查。在瞬态弹性动力学运行中,一个具有相似平均误差的仅误差基线未能通过更严格的因果性检查,因为它对载荷历史中未来的部分做出了响应,而所选替代模型则通过了所述检查。主要区别在于对每个候选的预测场提供物理证据,而非更丰富的聚合评分。
查看缓存全文
缓存时间: 2026/07/09 07:56
# 物理审计的智能体科学机器学习发现 来源:https://arxiv.org/html/2607.07379 Diab W. Abueidda¹,², Bilal Ahmed¹, Panos Pantidis¹, Mostafa E. Mobasher¹ ¹ 阿布扎比纽约大学土木与城市工程系,阿拉伯联合酋长国 ² 伊利诺伊大学厄巴纳-香槟分校国家超级计算应用中心,美国 ###### 摘要 在智能体科学机器学习(Agentic SciML)中,大型语言模型(LLM)智能体可以发现替代模型,并通过自动评分(通常是一个误差指标)来选择其中一个。然而,低误差并不能保证预测场满足力学中重要的物理规律,例如边界条件、叠加原理、刚度缩放或因果性。我们引入了物理审计的智能体科学机器学习(PA-SciML),这是一种面向智能体科学机器学习发现的"验证优先"工作流。该工作流在搜索之前固定评分评估器,推导可审查的机器可检查物理要求,检查每个训练候选模型在其输出上的表现,并在没有参考解场的情况下,对指定的输入范围或实测载荷历史区间进行单独搜索,以发现高违规案例。只有在通过所述检查后,替代模型才被报告为已验证。当启用时,该工作流在训练前还会添加咨询性数值探针,并一次只测试一个模型改动,以记录哪些孤立的编辑与分数提升相关,以备后续重用。在报告的计算固体力学数值示例中,静态弹性运行选择了一个验证误差低于纯误差基线的替代模型,同时两个选定模型都通过了常见的线弹性检查。在瞬态弹性动力学运行中,一个平均误差相近的纯误差基线未能通过更严格的因果性检查——它对载荷历史的未来部分做出了响应——而选定的替代模型通过了所述检查。主要区别在于每个候选模型在预测场上提供的物理证据,而非更丰富的聚合分数。 *关键词*:智能体发现 · 科学机器学习 · 大型语言模型智能体 · 基于物理的验证 · 神经算子 · 可信替代模型 ## 1 引言 计算固体力学通常需要反复求解由偏微分方程(PDE)支配的边值问题和初边值问题。设计参数扫描、不确定性量化、反问题识别以及数字孪生工作流可能需要大量评估完整的位移、应力或历史相关的场响应。高保真有限元模拟仍然是参考工具,但当几何形状、材料本构、载荷或边界数据需要多次变化时,反复求解可能过于昂贵。科学机器学习(SciML)和神经算子替代模型提供了一条补充途径:学习从问题输入到解场的映射,这样无需重新进行有限元求解即可评估新案例[¹ (https://arxiv.org/html/2607.07379#bib.bib1),² (https://arxiv.org/html/2607.07379#bib.bib2),³ (https://arxiv.org/html/2607.07379#bib.bib3),⁴ (https://arxiv.org/html/2607.07379#bib.bib4)]。实际困难在于,构建有用的替代模型仍然依赖于针对特定问题的架构选择、训练策略、物理信息结构以及评估指标。 大型语言模型(LLM)智能体正在开始自动化这部分工作流。一个分支编写并运行适用于有限元力学和计算流体力学的模拟代码[⁵ (https://arxiv.org/html/2607.07379#bib.bib5),⁶ (https://arxiv.org/html/2607.07379#bib.bib6),⁷ (https://arxiv.org/html/2607.07379#bib.bib7),⁸ (https://arxiv.org/html/2607.07379#bib.bib8)]。另一个分支自动化工程设计及设计审查[⁹ (https://arxiv.org/html/2607.07379#bib.bib9)]。第三个分支与本论文最接近,它自动化了 SciML 模型发现:智能体可以提出替代模型设计、实现训练代码、评审候选模型,并在有限的人为干预下选择模型[¹⁰ (https://arxiv.org/html/2607.07379#bib.bib10),¹¹ (https://arxiv.org/html/2607.07379#bib.bib11),¹² (https://arxiv.org/html/2607.07379#bib.bib12)],这建立在早期物理信息网络设计自动化的基础之上[¹³ (https://arxiv.org/html/2607.07379#bib.bib13),¹⁴ (https://arxiv.org/html/2607.07379#bib.bib14)]。 这些系统使替代模型设计不那么手动化,但它们也将一个力学问题带到了工作流的中心:在一个自动化系统选定一个替代模型之后,有什么证据表明其预测场满足该模型旨在模拟的物理规律?基于分数或奖励的选择不足以回答这个问题。验证误差、训练损失或复合科学奖励可以对候选模型进行排序,但它不一定检查每个训练替代模型的输出是否符合机器可检查的物理要求。现有的智能体 SciML 系统包含了重要的验证和诊断步骤,但这些检查通常针对生成的代码、执行过程、计划一致性或聚合奖励,而不是针对每个评分的替代模型进行独立的输出级物理检查[¹¹ (https://arxiv.org/html/2607.07379#bib.bib11),¹² (https://arxiv.org/html/2607.07379#bib.bib12)]。这正是本文要解决的差距。 一个被选定的替代模型可能因为分数高而看似合理,但仍然缺乏直接证据表明其预测场满足规定的边界条件、对称性、缩放比例或时间顺序要求。智能体 SciML 文献也认识到了这种风险:LLM 中介的辩论可能并不反映物理上严谨的推理,除非它与数值验证相结合[¹⁰ (https://arxiv.org/html/2607.07379#bib.bib10)]。在下面报告的数值示例中,这一差距在两个力学问题中以不同的方式产生了重要影响。在静态线弹性示例中,一次常规的后期审计显示,启用审计的选定替代模型和纯误差基线都满足规定的线弹性检查;在那里,审计提供了支持性证据,表明误差较低的选定替代模型并未以牺牲叠加原理、刚度缩放或辊轴边界条件的准确性来换取精度。在瞬态弹性动力学示例中,这种区别是决定性的:根据更严格的因果性要求重新检查一个纯误差基线,发现它对载荷历史的未来部分做出了响应。这是预测场在输出级上的失效,而不仅仅是实现上的不便。这些例子共同说明了为什么低误差不应被视为选定替代模型通过规定物理检查的充分证据。 我们引入了物理审计的智能体科学机器学习(PA-SciML),这是一种用于智能体 SciML 发现的"验证优先"框架,它为模型选择增加了每个候选模型的物理证据。该框架是为更广泛的智能体 SciML 设计的;本文将其应用于计算固体力学的神经算子替代模型。PA-SciML 在候选搜索之前固定可审查的物理要求,使用一个固定的评估器对每个成功候选模型进行评分,对预测输出应用采样的、机器可检查的物理检查,并在没有参考解场的情况下,对指定的输入范围或实测载荷历史区间进行单独搜索,以发现高违规案例。一个被选定的替代模型只有在通过所述检查后才被报告为已验证。当启用时,该工作流还会为提议的模型更改添加咨询性的训练前数值探针,并一次测试一个孤立的编辑,以记录与分数提升相关的更改,以备后续重用。 本工作的贡献在于将特定的物理检查证据作为自动化替代模型发现选择证据的一部分。PA-SciML 并不将低验证误差视为充分条件,而是要求选定替代模型的预测场在规定的验证设置下通过预设的机器可检查物理检查。数值示例展示了这种证据的两个互补作用。在静态弹性示例中,它记录了选定的低误差替代模型仍然符合规定的线弹性检查。在瞬态示例中,它揭示了误差指标未能捕捉到的因果性失效。同一框架还记录了围绕选择决策的支持性证据,包括在可接受输入范围内无参考解场的搜索、全面训练前的咨询性数值探针,以及发现后的孤立编辑测试。这种分离避免了将执行失败、预测误差、物理检查结果和后期分析混为一谈。 本文的其余部分结构如下:第̃2 (https://arxiv.org/html/2607.07379#S2)节将 PA-SciML 置于 SciML、神经算子、智能体发现和可信性文献的背景下;第̃3 (https://arxiv.org/html/2607.07379#S3)节详述了框架和验证层;第̃4 (https://arxiv.org/html/2607.07379#S4)节介绍了实验设计和数值示例;第̃4.4 (https://arxiv.org/html/2607.07379#S4.SS4)节和第̃5 (https://arxiv.org/html/2607.07379#S5)节讨论了局限性和展望。 ## 2 相关工作 科学机器学习提供了一条从重复 PDE 求解到可重用替代模型的途径。物理信息神经网络将控制方程残差嵌入训练目标[¹ (https://arxiv.org/html/2607.07379#bib.bib1)],而更广泛的物理信息机器学习文献展示了如何将控制方程、边界条件和初始条件、守恒约束以及数据结合到面向正问题和反问题 PDE 的神经模型中[² (https://arxiv.org/html/2607.07379#bib.bib2)]。这些工作为基于物理信息的神经 PDE 求解器和替代模型奠定了基础,但实际应用仍然存在依赖于问题的选择:架构、残差权重、训练策略以及物理信息进入模型的形式。 神经算子和相关的全场替代模型通过学习从问题输入到解场的映射来解决多查询场景。这类模型的理论基础包括非线性算子的通用逼近结果[¹⁵ (https://arxiv.org/html/2607.07379#bib.bib15)]以及现代神经算子框架,其中学习到的映射作用于函数空间[¹⁶ (https://arxiv.org/html/2607.07379#bib.bib16)]。两个架构为该领域提供了主要支撑:DeepONet,它结合了分支和主干子网络[³ (https://arxiv.org/html/2607.07379#bib.bib3)],以及 Fourier 神经算子,它在傅里叶空间中对积分核进行参数化[⁴ (https://arxiv.org/html/2607.07379#bib.bib4)]。DeepONet 存在逼近误差估计[¹⁷ (https://arxiv.org/html/2607.07379#bib.bib17)]。这两个家族都朝着对 PDE 代理重要的方向扩展:物理信息算子学习增加了基于残差的约束到学习到的映射[¹⁸ (https://arxiv.org/html/2607.07379#bib.bib18),¹⁹ (https://arxiv.org/html/2607.07379#bib.bib19)];DeepONet 变体包括多输入算子[²⁰ (https://arxiv.org/html/2607.07379#bib.bib20)]以及与 Fourier 神经算子基准的比较扩展[²¹ (https://arxiv.org/html/2607.07379#bib.bib21)];Fourier 算子变体处理一般几何形状和多相流预测[²² (https://arxiv.org/html/2607.07379#bib.bib22),²³ (https://arxiv.org/html/2607.07379#bib.bib23)]。对于本文,相关的设计空间包括函数到函数的算子以及由算子学习架构构建的参数或载荷到场映射替代模型。在这个空间中,架构、物理信息损失项、几何编码和数据表示仍然是针对每个问题做出的选择。 在计算固体力学中,学习的替代模型已经针对多个物理任务开发,而不是针对单一模型家族。本构和场响应替代模型涵盖了路径相关的塑性、热-粘塑性瞬态材料行为以及全场应力预测[²⁴ (https://arxiv.org/html/2607.07379#bib.bib24),²⁵ (https://arxiv.org/html/2607.07379#bib.bib25),²⁶ (https://arxiv.org/html/2607.07379#bib.bib26)]。基于能量的神经公式已被引入用于有限变形超弹性[²⁷ (https://arxiv.org/html/2607.07379#bib.bib27)]。算子学习和参数化 PDE 的工作涵盖了断裂和损伤、输入-输出映射的降阶模型、非局部核网络、时间相关的输入历史以及依赖于几何的全场预测[²⁸ (https://arxiv.org/html/2607.07379#bib.bib28),²⁹ (https://arxiv.org/html/2607.07379#bib.bib29),³⁰ (https://arxiv.org/html/2607.07379#bib.bib30),³¹ (https://arxiv.org/html/2607.07379#bib.bib31),³² (https://arxiv.org/html/2607.07379#bib.bib32)]。一条互补的有限元耦合路线是将神经网络嵌入有限元求解器中,用于非局部连续体损伤和耦合多物理场[³³ (https://arxiv.org/html/2607.07379#bib.bib33),³⁴ (https://arxiv.org/html/2607.07379#bib.bib34)],这在更广泛的连续体力学的机器学习和数据挖掘文献中[³⁵ (https://arxiv.org/html/2607.07379#bib.bib35)]。这些文献表明,替代模型可以表示丰富的力学响应,但也说明了为什么替代模型构建仍然是专家和任务特定的:每项研究必须为其问题选择合适的架构、训练公式、几何表示、有限元耦合和物理结构。因此,自动化这些建模选择是自然的下一步。 Auto-PINN 使用训练损失作为搜索目标,在选定的 PINN 架构和超参数空间中进行搜索[³⁶ (https://arxiv.org/html/2607.07379#bib.bib36)]。PINNsAgent 使用带有记忆树推理策略的物理引导知识重放来优化 PINN 架构和超参数[¹³ (https://arxiv.org/html/2607.07379#bib.bib13)],而 Lang-PINN 协调 PDE、PINN、代码和反馈智能体,将自然语言任务描述转化为可执行的 PINN 代码,并带有验证或反馈步骤[¹⁴ (https://arxiv.org/html/2607.07379#bib.bib14)]。更近期的智能体 SciML 系统将搜索从调参扩展到模型和方法发现。AgenticSciML 结合了角色专业化智能体、结构化辩论、先前方法检索和进化搜索,以生成和选择 SciML 解决方案[¹⁰ (https://arxiv.org/html/2607.07379#bib.bib10)]。ATHENA 将数值方法发现组织为一个迭代的提出-实现-评估过程,由专家派生的蓝图和复合科学奖励引导[¹¹ (https://arxiv.org/html/2607.07379#bib.bib11)]。GRAFT-ATHENA 通过结构化的问题和方法的表示、度量邻域以及奖励校准的先验,将这一方向朝着跨问题迁移扩展[¹² (https://arxiv.org/html/2607.07379#bib.bib12)]。这些系统表明智能体搜索可以减少人工方法设计。与此同时,它们的选择机制由训练损失、验证误差、科学奖励、诊断或试验历史驱动,而不是由对每个选定的学习型替代模型进行的独立机器可检查输出测试驱动。AgenticSciML 也直接指出了潜在风险:LLM 中介的辩论和论证可能不反映物理上严谨的推理,除非与数值验证信号结合[¹⁰ (https://arxiv.org/html/2607.07379#bib.bib10)]。 这些文献中报告的误差水平是特定于场景的:经典的物理信息 PDE 基准、数据驱动的 Burgers 算子学习以及固体力学替代学习在问题复杂度、物
相似文章
LLM-AutoSciLab:通过主动实验实现闭环科学发现
LLM-AutoSciLab是一个闭环框架,利用LLM迭代生成假设、选择信息量大的实验并优化机制,在物理和生物学基准测试上相比之前的静态方法实现了更高的准确性和样本效率。
科学领域的代理型AI实验
本文介绍了两个代理型AI框架:DeepTS/DeepCollector和DeepScribe,它们利用混合本地-云端架构和大语言模型,自动化科学工作流程,包括时间序列数据整理以及将物理讲座转化为结构化报告。
@ProfBuehlerMIT: 对于科学而言,AI主权和基于物理的推理是不可妥协的。但如何教像Ge…这样的小型LLM呢?
mistral.rs 现已原生支持 Agent Skills,使本地运行的小型LLM能够执行复杂的科学任务代理工作流,并完全控制模型、数据和执行。
测试前沿大语言模型在平行物理世界中的物理素养
本文介绍了一种四阶段诊断法,用于测试大语言模型能否在不熟悉的物理框架中进行推理。研究发现,前沿模型的通过率较低,并表现出定性分析与定量分析之间的不对称性。
模拟、推理、决策:基于LLM的科学推理驱动仿真决策
密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。