PhysicsBench:工程设计和仿真中生成式与预测模型的统一排行榜
摘要
PhysicsBench引入了一个统一的基准测试和排行榜,以标准化工程设计和仿真中生成式与预测AI模型的评估,涵盖多种任务和数据规模。
arXiv:2608.24056v1 宣布类型:新
摘要:生成式和预测性人工智能模型越来越多地用于工程设计和仿真中的几何生成以及物理场和标量量的预测。然而,这些模型通常被孤立地评估,使用学术数据集在无约束的规模上,采用不一致的指标和流程。我们提出了PhysicsBench,这是一个统一的基准测试和排行榜,在单一标准化流程下评估生成式和预测模型。PhysicsBench涵盖了七个生成和预测任务,跨一维、二维和三维领域,并在九个数据集上对66个模型进行排名,这些数据集包括工业规模的CAD/CFD/FEA仿真和公开参考,并扩展为28种配置。一个流程和排名适用于两个家族,每个在其各自的任务中排名。评估涵盖了从S到XL的真实、有限数据规模,而不是学术基准中常见的无限制训练集。通用指标套件通过分布距离捕捉几何保真度、物理场和标量准确性,以及工程特定的场和形状有效性。BenchRank通过页面排名算法对相互支配图进行去偏相关指标排名,因此每个报告的质量指标都被排名,计算成本在单独的效率视图中。跨任务,一个架构的大规模学术地位对小数据排名的预测性较弱。在七个任务中,有六个任务的顶级模型随数据规模变化,没有一个模型在多个任务中领先。PhysicsBench将“最先进”从一个自我宣称的声明转变为一个公开发布的模型选择基础。
查看缓存全文
缓存时间: 2026/08/26 09:32
# PhysicsBench:工程设计与仿真中生成模型和预测模型的统一排行榜 来源:https://arxiv.org/html/2608.24056 ###### 摘要 生成与预测性人工智能模型正日益被用于在工程设计和仿真中生成几何体、预测物理场和标量量。然而,这些模型通常在孤立环境中,基于无约束尺度的学术数据集,采用不一致的指标和流程进行评估。我们提出 PhysicsBench,一个统一的基准测试和排行榜,在标准化流程下评估生成模型和预测模型。PhysicsBench 涵盖 1D、2D 和 3D 领域的七个生成与预测任务,在九个数据集上对 66 个模型进行排名,数据集包含工业规模的 CAD/CFD/FEA 仿真和公开参考,并扩展为 28 种配置。同一套流程和排名适用于两个模型家族,每个家族在其自身的任务内排名。评估涵盖从 S 到 XL 的现实、有限数据规模,而非学术基准测试中常见的无限训练集。一套通用指标通过分布距离衡量几何保真度,评估物理场和标量精度,以及针对工程特有字段和形状有效性的验证。BenchRank 通过基于 PageRank 的头对头优势图来消除相关指标的偏差并进行排名,因此每个报告的质量指标都参与排名,而计算成本则在单独的效率视图中呈现。跨任务来看,架构的大规模学术排名对其小数据排名的预测能力较弱。在七个任务中,有六个任务的顶尖模型随数据规模变化而变化,且没有模型在超过一个任务中领先。PhysicsBench 将“最先进的”从一个自我宣称的说法转变为模型选择的公开发布基础。 ††脚注:†这些作者对本工作贡献均等。 ## 1 引言 数值仿真长期以来一直是现代工程设计的基石,能够预测从结构力学到流体动力学等跨学科的物理行为。高保真方法,如计算流体动力学(CFD)和有限元分析(FEA),提供了精确的性能估计。然而,它们对精细空间和时间离散化的依赖,使得计算成本高昂,因此单个设计评估通常需要专业软件、领域专业知识和大量的高性能计算资源[1 (https://arxiv.org/html/2608.24056#bib.bib1)]。在迭代设计和优化循环中,需要评估数千个候选几何体,这种成本变得令人望而却步。为了减轻这一负担,最近基于深度学习的数据驱动替代模型成为了一种引人注目的替代方案,它们直接从仿真数据学习设计几何体到物理响应的映射,从而提供近乎瞬时的预测[2 (https://arxiv.org/html/2608.24056#bib.bib2), 3 (https://arxiv.org/html/2608.24056#bib.bib3)]。特别是几何深度学习、神经算子和基于 Transformer 的神经求解器方面的进展,将空气动力学和结构分析的速度提高了几个数量级,同时保持了工程级的精度[4 (https://arxiv.org/html/2608.24056#bib.bib4), 5 (https://arxiv.org/html/2608.24056#bib.bib5), 6 (https://arxiv.org/html/2608.24056#bib.bib6)]。除了这种正向预测外,生成模型开辟了一种互补的逆向设计方法,能够合成满足规定性能目标的新颖且可制造的几何体。生成对抗网络(GANs)、变分自编码器(VAEs)、归一化流和扩散模型将人工智能(AI)从设计评估扩展到了设计创建[7 (https://arxiv.org/html/2608.24056#bib.bib7), 8 (https://arxiv.org/html/2608.24056#bib.bib8), 9 (https://arxiv.org/html/2608.24056#bib.bib9), 10 (https://arxiv.org/html/2608.24056#bib.bib10)]。这些生成和预测能力的结合正在重塑工程设计过程,扩展可探索的设计空间,并实现复杂三维系统的实时交互式评估[11 (https://arxiv.org/html/2608.24056#bib.bib11), 12 (https://arxiv.org/html/2608.24056#bib.bib12)]。 人工智能的快速进步与大规模、公开排名的基准测试的可用性密不可分。在计算机视觉和自然语言处理领域,标准化的数据集和排行榜,如 ImageNet[13 (https://arxiv.org/html/2608.24056#bib.bib13), 14 (https://arxiv.org/html/2608.24056#bib.bib14)]、GLUE[15 (https://arxiv.org/html/2608.24056#bib.bib15)]、SuperGLUE[16 (https://arxiv.org/html/2608.24056#bib.bib16)] 和 MMLU[17 (https://arxiv.org/html/2608.24056#bib.bib17)] 建立了通用的评估协议,实现了公平比较、确保了可重复性,并催化了跨竞争模型家族的连续突破[18 (https://arxiv.org/html/2608.24056#bib.bib18)]。受这一先例的激励,科学机器学习社区已经开始为基于物理的仿真构建类似的基准测试。PDEBench[19 (https://arxiv.org/html/2608.24056#bib.bib19)] 提供了涵盖广泛时间依赖偏微分方程(PDEs)的标准化数据集和基线,而 The Well[20 (https://arxiv.org/html/2608.24056#bib.bib20)] 在单一评估界面下汇集了一个包含从流体动力学到声学和天体物理学等多种物理仿真的 15TB 数据集。特别是在工程设计领域,大规模 CFD 数据集,如用于翼型空气动力学的 AirfRANS[21 (https://arxiv.org/html/2608.24056#bib.bib21)] 和用于三维汽车空气动力学的 DrivAerNet++[22 (https://arxiv.org/html/2608.24056#bib.bib22)],已经引入了用于代理模型评估的公开排行榜。CarBench[23 (https://arxiv.org/html/2608.24056#bib.bib23)] 最近建立了第一个全面且可重复的基准测试,对十一个最先进的高保真汽车空气动力学架构进行排名。这些排名的排行榜统一了整个社区的评估实践,量化了真正的算法进步,并降低了新方法的准入门槛,从而加速了数据驱动工程的成熟。 尽管取得了这些进展,但仍有一些研究空白尚未解决。大多数现有基准测试范围狭窄,针对单一物理机制或标准参考几何体,并且许多仍然依赖简化的二维案例或理想化的三维形状,忽略了生产部件的几何复杂性[19 (https://arxiv.org/html/2608.24056#bib.bib19), 21 (https://arxiv.org/html/2608.24056#bib.bib21)]。它们的覆盖范围还受到高保真实验验证数据稀缺以及非标准化的训练、验证和测试划分的限制,这掩盖了公平比较并阻碍了评估模型对未见设计的真正泛化能力[24 (https://arxiv.org/html/2608.24056#bib.bib24)]。此外,主流的基准测试通常校准为主流机器学习的大数据条件,隐含地假设可以访问数千个标记的仿真数据。相比之下,工业实践中的高保真 CFD 和 FEA 活动在每个设计研究中仅产生有限数量的样本,使得工程部署中主导的低数据领域基本未被考察。因此,当前的排行榜捕获了理想化条件下的算法能力,但对于决定实际效用的约束下的模型行为却知之甚少。 针对这些局限性,本工作引入了 PhysicsBench,它采用了公开排行榜模式,但纠正了上述缺点。PhysicsBench 将这种方法引入了尚无类似排行榜的工程设计领域,评估候选几何体的生成及其物理性能的预测——这两个阶段传统上由设计创作和数值求解器服务——是在工程实践条件而非学术便利条件下进行的。它是一个统一的基准测试和排行榜,部署为工程人工智能排行榜(Engineering AI Leaderboard),网址为 https://leaderboard.narnia.ai/,在单一标准化流程下,在工业工程数据集上评估生成模型和预测模型的训练、推理、指标计算和排名。通过统一应用此流程,PhysicsBench 将真正的算法差异与评估设置差异分离,得出的排名反映了一个共同、独立应用的标准,而非自选的报告条件。 PhysicsBench 基于两个原则。第一个是在所有生成和预测任务中统一应用单一标准化流程和排名。第二个是在现实且有限的数据规模下进行评估,报告为小(S)、中(M)、大(L)和超大(XL)区间,而非学术基准测试中常见的无限训练集。该基准测试涵盖 1D、2D 和 3D 领域的七个任务,由一套通用的指标套件支持,涵盖几何保真度(包括分布距离)、物理场和标量精度、工程特定的字段和形状有效性以及计算成本。排名由 BenchRank 产生,这是一种去偏的基于图的流程,其中每个质量指标直接贡献于排名,而计算成本则在效率视图中单独报告。 PhysicsBench 的目标不是识别单一的最佳模型,而是提供决策支持,针对每个任务和数据规模,在给定数据集上识别表现最佳的模型。PhysicsBench 做出了五项贡献: - • 一个统一的跨家族排行榜。先前的工程设计框架,如 Felten 等人提出的 EngiBench[25 (https://arxiv.org/html/2608.24056#bib.bib25)],提供了通用的 API、精选的数据集以及对生成、代理和优化方法的模块化支持,为工程设计问题上的可重复比较建立了宝贵的基础。PhysicsBench 将此方向扩展到与工业相关的规模下的模型输出评估,在单一的去偏排行榜下对生成模型和预测模型进行排名,并覆盖受控的数据规模范围。它涵盖 1D、2D 和 3D 工程领域的七个生成和预测任务,使用的 CAD/CFD/FEA 数据范围从工业规模仿真到已建立的公开参考。每个家族在其自身的任务和指标套件内排名,PhysicsBench 不直接比较生成器与预测模型。 - • 现实规模评估。每个模型在从 S 到 XL 的受控数据规模下进行扫描。这种扫描揭示了数据效率曲线、小数据崩溃和最佳模型交叉,而固定规模的学术评估则隐藏了这些现象,并表明模型的大规模学术地位对其在小数据领域的排名预测能力较弱。 - • BenchRank。PhysicsBench 引入了一种去偏的、基于图的排名方法,专为多指标工程评估量身定制。BenchRank 对相关指标进行降权,基于头对头优势图的 PageRank 进行排名,对不可行模型进行门控,并通过几何平均值跨数据集聚合。该过程是确定性且可重复的。 - • 排名的工程有效性指标。除了像素和点平均误差外,PhysicsBench 还对预测进行*字段有效性*排名,对生成进行*形状有效性*排名。字段有效性涵盖通过模态保证准则测量的方向和模态对齐,以及通过符号和极值匹配测量的图案保真度。形状有效性涵盖通过流形-Δ\Delta 和均匀性-Δ\Delta 分数测量的结构流形质量。因此,一个在度量上接近但物理上无效的模型不会得到奖励。 - • 一个可重复、持续更新的平台。每个发布的排名都可以从提交的每次运行数据确定性地重新生成,贡献者可以添加新模型而不会发生冲突,排行榜公开了底层的每次运行分数。 本文其余部分组织如下:第 2 节 (https://arxiv.org/html/2608.24056#S2) 回顾了生成模型、预测模型和工程基准测试。第 3 节 (https://arxiv.org/html/2608.24056#S3) 描述了 PhysicsBench 的数据集、任务、流程、指标和 BenchRank。第 4 节 (https://arxiv.org/html/2608.24056#S4) 呈现并讨论了排行榜结果,第 5 节 (https://arxiv.org/html/2608.24056#S5) 以局限性和未来工作作为总结。 ## 2 相关工作 ### 2.1 工程设计的生成模型 深度生成模型直接从数据中合成候选工程设计。在二维中,生成对抗网络(GANs)、变分自编码器(VAEs)和去噪扩散模型[10 (https://arxiv.org/html/2608.24056#bib.bib10)] 在规则网格上生成工程图像和物理场离散化表示。在三维中,隐式坐标网络(DeepSDF[26 (https://arxiv.org/html/2608.24056#bib.bib26)])、连续归一化流(PointFlow[9 (https://arxiv.org/html/2608.24056#bib.bib9)])和点云扩散模型将形状生成为连续的隐式表面或离散的点云。Regenwetter 等人[11 (https://arxiv.org/html/2608.24056#bib.bib11)] 对这些用于工程设计的方法进行了综述。已经发布了一些特定领域的生成设计数据集,包括用于自行车的 BIKED[27 (https://arxiv.org/html/2608.24056#bib.bib27)]、用于 CAD 构建序列的 DeepCAD[28 (https://arxiv.org/html/2608.24056#bib.bib28)] 和用于船体的 Ship-D[29 (https://arxiv.org/html/2608.24056#bib.bib29)]。这些数据集针对单一领域内的形状或 CAD 合成,不包括代理预测任务。生成模型在学术形状集合(如 ShapeNet[30 (https://arxiv.org/html/2608.24056#bib.bib30)])上进行基准测试,使用分布指标,如 Fréchet 起始距离(FID)、Chamfer 距离以及 Achlioptas 等人[31 (https://arxiv.org/html/2608.24056#bib.bib31)] 的覆盖(COV)和最小匹配距离(MMD)套件。这些指标衡量样本的保真度和多样性。它们并不测试生成的几何体是否位于一个有效的、均匀采样的形状流形上。PhysicsBench 将这个结构测试提升为一对排名的形状有效性指标:流形-Δ\Delta 和均匀性-Δ\Delta。仍存在两个差距:生成模型很少在工业 CAD 几何体上、在真实的数据稀缺性和可制造性约束下进行评估,并且它们在工程规模数据下的行为尚未被表征。 ### 2.2 神经代理与算子学习模型 神经代理模型用学习的模型替代昂贵的求解器,以预测物理场或标量量。神经算子学习函数空间之间的映射并在离散化之间泛化,包括 Fourier 神经算子(FNO)[3 (https://arxiv.org/html/2608.24056#bib.bib3)]、DeepONet[2 (https://arxiv.org/html/2608.24056#bib.bib2)] 以及更广泛的算子学习框架[5 (https://arxiv.org/html/2608.24056#bib.bib5)]。几何感知算子和 Transformer 将此扩展到不规则的工程几何体,包括几何感知神经算子(GINO)[32 (https://arxiv.org/html/2608.24056#bib.bib32)]、Transolver[6 (https://arxiv.org/html/2608.24056#bib.bib6)]、GNOT[33 (https://arxiv.org/html/2608.24056#bib.bib33)] 和通用物理 Transformer(Universal Physics Transformer)[34 (https://arxiv.org/html/2608.24056#bib.bib34)] 以及它们的锚定分支变体。
相似文章
PACE-Bench:动态环境中通过代码演化进行物理适应的基准测试
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
PHITSBench:基于执行得分的基准测试,用于评估AI通过自然语言生成PHITS辐射输运输入文件
PHITSBench是一个基于执行得分的基准测试,用于评估AI模型从自然语言生成PHITS辐射输运输入文件的能力,涵盖编辑、修复和完整生成任务。使用GPT-5.4进行的实验表明,虽然领域知识能提升性能,但在正确配置物理可观测量方面仍存在显著挑战。
介绍 BenchBench(5分钟阅读)
介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。
Physics-IQ Verified
本文对Physics-IQ基准进行了系统性审计,该基准用于评估视频生成模型对物理世界的理解,并提出了改进提示和评分的方法以增强可靠性。
Collider-Bench: 以粒子物理分析复现基准测试AI代理
Collider-Bench是一个新基准,评估LLM代理仅使用公开论文和开源软件复现大型强子对撞机粒子物理分析的能力,需要物理推理来填补缺失的实现细节。