具身CAD:基于求解器的LLM智能体用于参数化B-Rep装配建模

arXiv cs.AI 论文

摘要

介绍具身CAD(Embodied CAD),一个闭环框架,将LLM智能体置于CAD执行环境中,用于参数化B-Rep装配建模,利用求解器反馈进行规划和优化。

arXiv:2606.31252v1 公告类型:新 摘要:大型语言模型能够编写可用的CAD脚本,但可靠的工业CAD建模需要的不只是语法正确的代码:每个特征、放置和装配关系必须被精确的几何内核接受,同时保持为可编辑的参数化边界表示几何。我们提出具身CAD(Embodied CAD),一种基于求解器的LLM智能体,用于参数化B-Rep装配建模。该智能体并非一次性生成完整脚本,而是从分层L0-L4 CAD技能库中迭代选择动作,将其解析为类型化几何操作,在CAD后端执行,并利用求解器反馈进行规划、修复和学习。该框架结合了动作语法约束、确定性参数解析以及基于求解器的奖励,用于监督预热和GRPO风格的精炼。我们使用求解器对齐的指标——可执行率、技能准确率、操作族准确率、精确策略准确率和任务完成成功率——在多种机械、工业设备和模具导向的装配任务上评估了具身CAD。结果表明,基于求解器的规划执行了当前基准中的所有强规划器工作流,而学习到的控制器达到了较高的可执行率,并揭示了有效工具调用与精确长时域策略预测之间的剩余差距。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:37

# Embodied CAD: Solver-Grounded LLM Agents for Parametric B-Rep Assembly Modeling
来源:https://arxiv.org/html/2606.31252
刘富民 周昊宇 郝飞 杨林 南京大学 602025710018@smail\.nju\.edu\.cn; haoyu\.max@gmail\.com 6020250201012@smail\.nju\.edu\.cn; linyang@nju\.edu\.cn

###### 摘要

大型语言模型可以编写看似合理的CAD脚本,但可靠的工业级CAD建模需要的不仅仅是语法正确的代码:每一个特征、放置和装配关系都必须被精确的几何内核所接受,同时保持作为可编辑的参数化边界表示几何。我们提出了Embodied CAD,一个闭环框架,它将LLM智能体锚定在CAD执行环境中。该智能体并非一次性生成完整脚本,而是从分层的L0–L4 CAD技能库中迭代选择动作,将其解析为类型化的几何操作,在CAD后端执行,并利用求解器反馈进行规划、修复和学习。该框架结合了操作族预测、确定性参数解析以及用于监督预热和GRPO风格优化的求解器派生奖励。我们在多步骤机械、工业设备和模具导向的装配任务上,使用求解器对齐的指标进行评估:可执行率、技能准确率、操作族准确率、精确策略准确率、任务完成度和FreeCAD执行成功率。结果表明,基于求解器的规划能够执行当前基准测试中的所有强规划器工作流,而学习型控制器达到了较高的可执行率,并揭示了有效工具调用与精确长程策略预测之间尚存的差距。

## 1 引言

大型语言模型在程序合成、工具使用和交互式软件自动化方面取得了快速进展(Ouyang等人,2022 (https://arxiv.org/html/2606.31252#bib.bib1);Yao等人,2023 (https://arxiv.org/html/2606.31252#bib.bib2);Schick等人,2023 (https://arxiv.org/html/2606.31252#bib.bib3);Madaan等人,2023 (https://arxiv.org/html/2606.31252#bib.bib4);Shinn等人,2023 (https://arxiv.org/html/2606.31252#bib.bib5))。然而,计算机辅助设计(CAD)仍然是一个难以实现自主生成的目标。一个有用的工程CAD制品不仅仅是一个视觉上合理的网格。它必须表示为可编辑的参数化B-Rep几何体,尊重尺寸和拓扑约束,保持特征依赖关系,并通过精确的装配关系组合多个零件。

这种差距在长装配工作流中尤为明显。LLM可能会生成语法有效的CadQuery或FreeCAD代码,但却将刀具放置在错误的坐标系中,选择了旧的局部面,以错误的偏移重复放置孔,或者将组件堆叠在原点。这些错误在词元级别通常不可见,但在CAD内核级别却是致命的。现有的序列、草图、文本到CAD系统在零件级建模和命令生成方面展示出了强劲的进展(Wu等人,2021 (https://arxiv.org/html/2606.31252#bib.bib6);Xu等人,2022 (https://arxiv.org/html/2606.31252#bib.bib7);Khan等人,2024 (https://arxiv.org/html/2606.31252#bib.bib8);Dorris等人,2025 (https://arxiv.org/html/2606.31252#bib.bib9);Guan等人,2025 (https://arxiv.org/html/2606.31252#bib.bib10)),然而工业装配需要一种不同的锚定方式:模型必须在精确的几何环境中反复行动、检查并恢复。

Embodied CAD通过将CAD生成视为闭环的具身化工具使用来解决这个问题。智能体接收自然语言规范和结构化参数集,选择下一个CAD技能,通过确定性后端执行它,观察求解器反馈,并继续直到装配完成。该框架遵循以下循环:

意图→\\rightarrow技能规划→\\rightarrowCAD执行→\\rightarrow求解器反馈→\\rightarrow反思/策略更新。

关键的设计选择是将模型约束在语义上有意义的CAD技能上,同时将脆弱的几何簿记工作交给确定性解析器和CAD求解器。

本文做出了四项贡献。首先,我们将自主参数化装配建模形式化为一个基于求解器的技能轨迹问题,而不是开环脚本生成。其次,我们设计了一个L0–L4 CAD技能层次结构,涵盖工作空间操作、图元构建、特征加工、空间装配和领域级宏。第三,我们引入了操作族解析和基于求解器的反馈,作为连接LLM规划与精确B-Rep执行的桥梁。第四,我们在多类别的工业装配任务上,使用与求解器对齐的指标评估了该框架,并报告了定量的控制器性能和定性的构建轨迹。

参见图注图1:Embodied CAD概览。LLM规划器预测技能级动作或操作族。确定性解析器实例化类型化参数,技能执行器调用CAD后端,求解器返回执行诊断信息。相同的反馈支持在线修复和训练奖励。参见图注图2:三种代表性强规划器工作流的逐步PhyClaw构建快照:冲压机、模芯镶件和冷却塔工作流,其早期检查点强调了在最终175步装配之前的较低模块。每一行使用相同数量的求解器检查阶段来显示基础几何、重复特征构建和最终的可编辑状态。参见图注图3:FreeCAD归一化的同提示定性比较。PhyClaw输出是可执行的技能工作流;ArtiCAD风格和TOOLCAD风格列是基于论文的代理基线,通过相同的FreeCAD查看器渲染以保持视觉风格一致。代理列比较了视觉特征覆盖范围,并非官方的可执行复现。参见图注图4:当前强规划器POC路径的模芯镶件构建快照。相同的参数化工作流支持在用户编辑轴半径、肋条数量和分段布局后快速重新生成。
## 2 相关工作

**参数化CAD生成。** 大型CAD数据集和序列模型使参数化CAD生成成为一个实际的学习问题。ABC提供了一个面向B-Rep的大规模几何学习语料库(Koch等人,2019 (https://arxiv.org/html/2606.31252#bib.bib11));Fusion 360 Gallery数据集公开了用于程序化CAD构建的人类设计历史(Willis等人,2021 (https://arxiv.org/html/2606.31252#bib.bib12))。DeepCAD将CAD命令建模为序列生成问题(Wu等人,2021 (https://arxiv.org/html/2606.31252#bib.bib6)),SkexGen通过解耦码本改进了序列生成(Xu等人,2022 (https://arxiv.org/html/2606.31252#bib.bib7)),Text2CAD将自然语言映射到CAD命令序列(Khan等人,2024 (https://arxiv.org/html/2606.31252#bib.bib8))。最近的CAD代码系统进一步探索了视觉和文本条件下的代码生成(Dorris等人,2025 (https://arxiv.org/html/2606.31252#bib.bib9);Guan等人,2025 (https://arxiv.org/html/2606.31252#bib.bib10))。相比之下,Embodied CAD不要求模型一次性生成完整的CAD程序。它限制生成的是经过求解器检查的技能轨迹,这些轨迹的中间状态可以被检查和修复。

**B-Rep学习与可执行结构。** 工程CAD模型包含拓扑、解析曲面、曲线、特征历史和约束,这些无法仅通过视觉表面相似性来捕捉。BRepNet对实体模型进行拓扑消息传递(Lambourne等人,2021 (https://arxiv.org/html/2606.31252#bib.bib13));UV-Net从参数曲线和曲面域学习(Jayaraman等人,2021 (https://arxiv.org/html/2606.31252#bib.bib14));SolidGen和BRepGen直接针对边界表示合成(Jayaraman等人,2022 (https://arxiv.org/html/2606.31252#bib.bib15);Xu等人,2024 (https://arxiv.org/html/2606.31252#bib.bib16))。程序化方法如CSGNet和ShapeAssembly展示了显式可执行结构的价值(Sharma等人,2018 (https://arxiv.org/html/2606.31252#bib.bib17);Jones等人,2020 (https://arxiv.org/html/2606.31252#bib.bib18))。Embodied CAD赞同这种对可执行结构的偏好,但专注于长的、可编辑的装配工作流,其中每个中间CAD状态都由求解器验证。

**装配生成与工具使用智能体。** 装配建模增加了重复零件、关节关系和空间约束,超越了单零件生成。JoinABLe研究了参数化CAD关节的自底向上装配(Willis等人,2022 (https://arxiv.org/html/2606.31252#bib.bib19))。工具增强的CAD系统,包括CAD-Assistant、ArtiCAD和TOOLCAD,将基础模型连接到CAD工具或工具使用训练流程(Mallis等人,2025 (https://arxiv.org/html/2606.31252#bib.bib20);Shui等人,2026 (https://arxiv.org/html/2606.31252#bib.bib21);Gong等人,2026 (https://arxiv.org/html/2606.31252#bib.bib22))。我们的工作与这些工具增强的系统最为接近,但重点强调了类型化技能调用、操作族解析和与求解器对齐的评估,而非仅依赖视觉判断。

## 3 问题形式化

给定一个工业建模请求xx和一个参数集pp,目标是生成一个可执行的轨迹

τ=\(a1,...,aT\), at=\(lt,ft,θt\),\\tau=\(a\_\{1\},...,a\_\{T\}\),\\qquad a\_\{t\}=\(\\ell\_\{t\},f\_\{t\},\\theta\_\{t\}\),\(1\)其中lt\\ell\_\{t\}是技能层级,ftf\_\{t\}是技能或操作族,θt\\theta\_\{t\}包含类型化参数。CAD内核KK确定性地更新状态:

st=K\(st−1,at\)。s\_\{t\}=K\(s\_\{t-1\},a\_\{t\}\)。\(2\)如果每个动作都无内核错误地执行,并且最终状态满足特定于任务的检查(如有效实体、预期组件、包围盒、特征计数和装配完成情况),则该轨迹是求解器可行(solver-feasible)的。核心挑战在于θt\\theta\_\{t\}通常依赖于当前的几何状态:孔中心、倒角目标、镜像实例或重复紧固件索引必须与之前的操作一致地选择。

Embodied CAD将这个问题分解为规划、解析和执行。LLM预测高层技能或操作族;确定性模块推导依赖几何的参数;CAD后端执行每个技能;反馈被返回给规划器和学习目标。这种分离减少了幻觉坐标,并使失败模式变得可观测。

## 4 方法

### 4.1 闭环架构

图1 (https://arxiv.org/html/2606.31252#S1.F1)总结了该架构。规划器观察用户意图、参数、构建历史和求解器反馈。它选择下一个技能或操作族。解析器将可重用的操作族(例如build\_pin\_body或cut\_hole\_grid)映射到具体的实例标识符和类型化参数。执行器将解析后的调用分派给CAD后端。求解器返回结构化反馈,包括成功或失败、对象名称、有效性检查、体积、包围盒以及(如果可用)拓扑摘要。

**算法1** 闭环CAD技能执行
1: 根据意图xx和参数pp初始化CAD状态s0s\_\{0\}。
2: 对于t=1,...,Tt=1,...,T 执行
3: 规划器提出技能或操作族ftf\_\{t\}。
4: 解析器从st−1s\_\{t-1\}推导出类型化参数θt\\theta\_\{t\}。
5: 使用CAD内核KK执行at=\(lt,ft,θt\)a\_\{t\}=\(\\ell\_\{t\},f\_\{t\},\\theta\_\{t\}\)。
6: 从结果状态sts\_\{t\}收集求解器反馈oto\_\{t\}。
7: 如果执行失败 则
8: 使用oto\_\{t\}修改ftf\_\{t\}或θt\\theta\_\{t\}并在预算内重试。
9: 结束如果
10: 结束循环
11: 返回最终的参数化B-Rep装配和轨迹日志。

### 4.2 技能分层

原始的CAD脚本空间对于可靠的长期LLM规划来说过于庞大。因此,我们将动作组织为五个层级(表1 (https://arxiv.org/html/2606.31252#S4.T1))。该层次结构使模型的选择接近工程操作,同时保留了足够的表达能力来构建多零件装配。

表1:Embodied CAD使用的L0–L4技能层次结构。该层次结构在保持操作可解释和可编辑的同时,约束了动作空间。
### 4.3 操作族与确定性解析

工业装配中包含重复的结构:轴承中的滚珠、歧管中的销钉、模板中的螺钉、冲压机中的导柱、轴上的肋条。直接预测实例特定的操作键会将语义意图与脆弱的索引纠缠在一起。我们转而要求模型预测操作族。控制器使用构建状态、计数器、对称规则和派生几何将操作族解析为下一个有效实例。这种设计保留了LLM的智能体规划角色,同时将坐标敏感的计算转移到确定性模块中。

例如,在规划器预测了place\_guide\_post这样的操作族后,解析器确定下一个是哪个导柱,检索对应的板角,计算局部轴和间隙,并生成类型化的技能调用。然后,求解器检查导柱是否与预期的板堆叠相交,以及生成的实体是否保持有效。失败会作为结构化反馈返回,而不是隐藏在最终失败的脚本中。

### 4.4 从求解器反馈中学习

我们以两种方式使用求解器反馈。首先,监督微调在验证过的轨迹上预热规划器。其次,GRPO风格的优化对同一状态采样多个候选动作,并使用结构化奖励对其进行评分:

R=wfRformat\+wpRpolicy\+weRexec。R=w\_\{f\}R\_\{\\mathrm\{format\}\}+w\_\{p\}R\_\{\\mathrm\{policy\}\}+w\_\{e\}R\_\{\\mathrm\{exec\}\}。\(3\)这里RformatR\_\{\\mathrm\{format\}\}检查模型是否输出了可解析的动作块,RpolicyR\_\{\\mathrm\{policy\}\}检查所选技能或操作族是否匹配预期的转移,RexecR\_\{\\mathrm\{exec\}\}衡量解析后的动作是否在CAD后端成功执行。每个组内的相对奖励用于更新策略。我们报告了跳过更新率和回退SFT率,因为高解析率本身并不能保证有信息量的奖励方差。

## 5 基准测试与指标

该基准测试围绕可执行的CAD技能轨迹组织。每个任务提供一个自然语言的工业规范和结构化的参数集。系统必须生成一系列技能调用,这些调用可以被FreeCAD后端解析和执行。当前的任务族包括:

**标准机械装配:** 轴承任务,涉及同轴环、极向球阵列、重复隔圈、可编辑环尺寸和倒角机械细节。

**工业设备装配:** 冲压机、冷却塔和线性歧管任务,涉及分层结构、重复连接件、弹簧、导柱、风扇、孔和管道类特征。

**模具装配:** 注塑机和模芯镶件任务,涉及板堆叠、导柱、孔网格、沉头孔、凹槽、花键肋条和可编辑芯轴布局。

我们评估两个证据层级。**求解器执行层级**衡量解析后的轨迹是否在CAD后端中执行。**学习策略层级**衡量SFT或GRPO控制器是否预测出正确的下一个技能或操作族。这种区别很重要:确定性强规划器轨迹测试技能库和解析器的能力,而学习策略指标衡量有多少规划决策可以分配给基于求解器的锚定。

相似文章

Procedura: 代理式三维建模与程序化控制

Hugging Face Daily Papers

Procedura 引入了一个新颖的三维建模代理,它使用 LLMs 从文本提示创建可编辑的、部件结构化的组件,在质量和可编辑性方面优于现有方法。

面向CAD生成的记忆增强强化学习智能体

arXiv cs.AI

本文提出了一种用于CAD生成智能体的记忆增强强化学习框架,该框架集成了几何内核工具链、双轨记忆和动态效用检索,以处理具有长操作序列和几何约束的复杂CAD模型,从而提升了成功率和几何一致性。

基于有限元分析反馈的自我改进CAD生成代理

Hugging Face Daily Papers

本文提出了一种新的CAD生成任务形式,将有限元分析作为反馈,并结合了改进的监督信号,如纯文本蓝图方案和多视角图像渲染器,从而在基准测试中实现了更好的几何重建。

工具增强代理:闭环优化、仿真与建模编排

arXiv cs.AI

本文介绍了COSMO-Agent,一个工具增强的强化学习框架,用于训练LLM执行闭环CAD-CAE优化,迭代生成参数化几何体并运行仿真直到满足约束条件,并包含一个多约束奖励和新的行业对齐数据集。