大型语言模型及其对力学与空间几何的感知

arXiv cs.AI 论文

摘要

本文介绍了MecEng,这是一个用于评估大型语言模型在机械工程中力学与空间几何任务的基准,揭示了其能力不断提升但仍易出错的现状。

arXiv:2608.14615v1 Announce Type: new 摘要:大型语言模型(LLMs)在现有的代码生成和数学推理基准上表现良好,但其在力学与空间几何方面的能力,这里称为机械工程感知,尚未被系统量化。我们提出MecEng,这是一个全自动基准,用于评估LLMs从参数化文本描述创建多体仿真模型的能力。该基准包含84个通用任务,分为三个难度级别,从带有接头和接触的刚体系统到需要精确3D几何生成、四面体有限元网格划分和Hurty-Craig-Bampton模型阶次缩减的柔性多体系统,涉及机械部件。一个专用的管道使用LLMs和Netgen从文本生成仿真就绪的几何,并为代码Exudyn构建多体系统模型,然后在多个层面上与专家真值进行验证:系统图同构,包括图节点注释、数值解,以及特定部件的度量,如质量、几何和特征频率。总共评估了32个开源权重和两个专有LLMs。在刚体任务上,最佳开源模型获得了86.0%的总体成功率,而最强专有模型为91.4%,而柔性多体系统任务仍然相当困难。额外研究量化了采样温度、推理、提示设计、模型大小和LLMs发布时间的影响。结果表明,当前LLMs的机械工程感知能力在快速提升,但仍易出错。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:53

# 大型语言模型及其对力学与空间几何的认知能力
来源:https://arxiv.org/html/2608.14615  
S·韦勒 T·默尔特纳 P·曼茨尔 M·皮伯

###### 摘要
大型语言模型(LLM)在现有代码生成和数学推理基准测试中表现优异,但其在力学与空间几何领域的能力——此处称为"机械工程认知能力"——尚未被系统量化。本文提出MecEng基准测试,这是一个全自动评估框架,用于测试大型语言模型根据参数化文本描述创建多体仿真模型的能力。该基准包含三个难度层级的84项通用任务:从带关节和接触的刚体系统,到需要精确三维几何生成、四面体有限元网格划分及零件Hurty-Craig-Bampton模型阶数缩减的柔性多体系统。专用流水线使用Netgen工具,通过大型语言模型从文本生成可仿真几何体,并为Exudyn代码构建多体系统模型,随后通过多个维度与专家基准真值进行验证:包括含节点注释的系统图同构验证、数值解验证,以及针对部件的质量、几何特性和固有频率等特定指标验证。共计评估了32个开源权重模型和两个闭源模型。在刚体任务中,最佳开源模型整体成功率为86.0%,而最强闭源模型达到91.4%,柔性多体任务仍具有显著难度。补充研究量化了采样温度、推理方式、提示设计、模型规模及发布日期等因素的影响。结果表明当前大型语言模型的机械工程认知能力正在快速提升,但仍存在易错性。

###### 关键词:柔性多体动力学、模型对比、模型验证、大型语言模型、基于LLM的有限元建模  
††期刊:待定\\
机构
\[因斯布鲁克大学机电一体化系\]  
地址:Technikerstraße 13,城市:因斯布鲁克,邮编:6020,国家:奥地利
\\
机构
\[奥格斯堡大学材料资源管理研究所\]  
地址:Am Technologiezentrum 8,城市:奥格斯堡,邮编:86159,国家:德国

## 1引言
在统计语言建模的早期成功之后,Transformer架构的引入结合训练数据与策略的改进,使得现代大型语言模型不仅在自然语言处理方面表现出色,在代码生成和句法推理领域也取得卓越成就。尽管现代大型语言模型在包括视觉数学推理在内的多项基准测试中表现优异,但即使是前沿模型,在没有推理辅助的空间几何问题上仍面临挑战。在机械工程领域,系统综合不仅需要逻辑句法,更要求我们定义的"机械工程认知能力":即理解多体系统(MBS)内部空间关系、精确几何结构、物理参数和约束条件的能力。多体系统是一类机械系统,也是本文的核心研究对象。广义而言,MBS由相互连接的刚体或柔性体(即可变形体)组成,这一广泛定义涵盖从摆锤和简单机构等学术示例,到机器人、起重机和车辆等复杂机械的广泛设备,甚至可代表土木工程结构。这种广泛适用性使得MBS成为检验大型语言模型机械工程认知能力的理想测试平台。

从文本生成此类机械系统需要精确的、可直接用于仿真的几何模型——这是当前生成式方法尚未满足的要求。现有文本到三维几何生成流水线已从基于体素的近似方法发展到神经辐射场(NeRF)和三维高斯溅射技术,但这些方法主要针对视觉美学而非确定性工程约束进行优化。本文提出一种新型结构化评估流水线,能够通过几何基元从文本生成精确的三维实体几何和有限元网格,实现参数化建模并规避无效网格与体素幻觉问题。通过将生成的机械系统图与专家基准真值模型对比,可验证结构正确性并区分参数误差。研究从简单刚体到复杂柔性多体系统三个复杂度层级,系统考察机械推理错误的本质特征。

本研究推出的机械工程基准测试"MecEng"涵盖广泛的机械问题,提供自动化评估所需的基准实现方案。MecEng基准在超过30个本地开源权重大型语言模型,以及通过各自应用程序编程接口(API)访问的Anthropic Claude Opus 4.8和OpenAI GPT-5.2模型上进行评估。文中涉及的模型均采用Ollama库中的标准命名,闭源模型以其名称和版本号标识:"Claude-Opus-4.8"与"GPT-5.2"。

### 1.1技术现状
为艺术与图形应用生成三维几何的方法,如DreamFusion、DreamGaussian、Magic3D和Point-E,利用预训练的二维视觉语言模型和文本到图像扩散模型的知识。这些方法采用CLIP引导或分数蒸馏等技术,要么优化神经场景表示(如NeRF),要么直接从自然语言提示生成点云。MeshGPT和LLaMA-Mesh等新型工作展示了AI驱动的三角网格合成技术,但其目标仍是视觉美学而非有限元法(FEM)仿真所需的工程级确定性水密几何模型。Thengane等人详细综述了基础模型对结合二维图像的三维点云的理解能力。虽然这展示了大型语言模型在视觉高质量模型方面的能力,但在使用LLaMA-Mesh和MeshGPT等工具的测试中,对于机械工程中常见的简单几何(如圆柱或阶梯轴)生成效果已不适用于工程仿真。与计算机图形学的可视化表示不同,柔性多体系统建模需要精确的(封闭)几何形式,包括节点、网格和顶点,其精确几何不仅影响惯性特性,更定义了构件的柔顺性。为此,近期研究倾向于让大型语言模型通过CAD工具而非直接处理顶点和网格连接。Text2CAD使用多模态AI模型创建新的DeepCAD数据集,并使用定制数据集微调预训练的BERT编码器;而更近期的CAD-coder则微调Llava1.5模型,基于Open CASCADE Technology(OCCT)从图像生成CAD代码。大型语言模型与工程仿真交叉领域的最新研究,促使我们重点关注零样本、本地化、基于仿真的模型创建及严格自动化验证。

Ni和Buehler证明多智能体大型语言系统能够构建并解决力学任务,添加专用审查智能体可提升模型设置和后处理阶段的错误检测能力。他们记录了应力分量提取失败、几何遗漏等典型失效模式。Molinari等人提出的EngiAI是一个面向工程工作流的多智能体框架,其评估报告指出自动生成的几何体始终存在非水密问题,这与我们发现的AI生成几何常不适用于直接仿真的结论一致。针对更低层级的有限元任务代码生成(如核心单元实现),Mohammadzadeh等人引入FEM-Bench基准;Guo等人则利用大型语言模型进行无数据模型阶数缩减以加速大规模问题仿真。本研究旨在更高层级生成仿真模型,使用经过验证的仿真代码而非要求模型创建局部刚度矩阵等底层代码。

与本模型生成框架更接近的是Jadhav和Farimani的研究,他们展示了具备工具调用能力的大型语言智能体可作为迭代机械设计师,但侧重于结构模型的迭代优化而非类CAD几何建模。我们近期提出的参数化虚拟实验室方案,通过上下文学习支持多体仿真模型的创建、评估与自验证,为本研究的大型语言模型评估和基于仿真输出的自动化基准对比奠定了基础。EngiBench提出的工程相关性过滤、学科分类和能力导向评估标准设计,与我们的评估目标互补——我们需要为系统组装、可执行性和柔性部件正确性制定结构化评分标准。Naser等人提出的工程推理与指令基准采用分类法驱动设计,但未详细说明任务类型。Elhambakhsh等人针对机械装配功能分类任务微调大型语言模型,使用俄勒冈州立设计仓库数据集并报告了显著准确率提升。Guo等人对商业大型语言模型在多个工程领域的基准测试覆盖更广泛学科,但其任务具体性较低且依赖人工评估。Sharma综述的LLM空间推理研究指出大型语言模型存在根本性空间推理缺陷,并建议通过指令微调改进,这直接启发我们重点关注空间几何与三维多体组装任务。Yamada等人对LLM空间理解的研究强调了参与者/任务考量因素,这与我们在验证正确仿真几何和边界条件前所需的多步空间结构推理需求相关。Tang和Kejriwal提出的GRASP基准量化了LLM在基于文本的布局理解上的成败,其空间抽象程度低于本研究中的关节与连接件,但需要类似的空间推理能力。Zeng等人通过乐高拼图评估多步空间推理能力,采用多项选择格式实现自动化评估,但主要基于多模态大型语言模型。Tian等人考察了LLM在机械工程教育中的概念理解,这促使我们不仅关注代码可执行性,更注重材料、工程静力学与动力学、边界条件和后处理的概念正确性。

Abdullaeva等人提出的NoReGeo几何基准评估LLM在无多步推理脚手架下的内在几何理解能力。虽然与本研究空间推理类似,但NoReGeo侧重于图像内线线相交等几何任务,而本研究测试涉及构建完整机械仿真。当前工程领域大型语言模型评估遵循三种路径:与人类参与者或专家对比;LLM评委评分;以及通过代码执行、仿真衍生真值或规则匹配进行全自动评估。本研究属于最后一类,通过系统图同构和数值时间序列验证,将LLM生成的多体仿真模型与参数化基准实现进行对比。目前尚无研究能将空间推理评估、精确几何生成和自动化工程验证统一集成到机械系统的综合基准中。

### 1.2研究目标与创新点
本研究首要目标是构建面向机械与多体仿真模型的全自动工程级基准测试MecEng。次要目标之一源于在多维度对比LLM生成模型与基准真值的需求,包括数值结果、系统图表示、几何模型与有限元网格,这需要精确的模型定义以确保表示与解的唯一性。另一目标是在本地工作站运行的开源权重模型性能评估,特别是测量温度参数和链式推理(亦称思考机制)的依赖关系。性能与模型规模、发布日期的依赖关系分析显示机械工程能力持续提升,预示着该领域及其他工程学科的未来发展潜力。

创新点包括:量化机械工程认知能力、实现机械模型全自动对比、提供从文本到有限元模型和多体系统的生成流水线(包含工业标准降阶模型)。

相似文章

大语言模型几何表示鲁棒性评测

arXiv cs.CL

# 大语言模型几何表示鲁棒性评测 来源:[https://arxiv.org/html/2604.16421](https://arxiv.org/html/2604.16421) Vedant Jawandhia 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Yash Sinha 计算机科学与信息系统系,BITS Pilani \{f20220627, dhruv\.kumar, yash\.sinha\}@pilani\.bits\-pilani\.ac\.in Ankan Pal 数学系,BITS Pilani

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。