PR-CAD:利用大语言模型渐进式优化,实现统一、可控且高保真的文本到 CAD 生成
摘要
PR-CAD 提出基于大语言模型的统一框架,通过强化学习与高质量数据集,实现文本到 CAD 的迭代生成与编辑,在可控性与保真度上达到 SOTA。
arXiv:2604.19773v1 公告类型:新
摘要:传统 CAD 模型构建依赖繁琐手工操作与专业经验。近期大语言模型(LLM)进展催生了文本到 CAD 生成研究,但现有方法通常将生成与编辑视为独立任务,实用性受限。我们提出 PR-CAD,一种渐进式优化框架,将生成与编辑统一,实现可控且高保真的文本到 CAD 建模。为此,我们策划了一个覆盖 CAD 全生命周期的高保真交互数据集,涵盖多种 CAD 表示及定性与定量描述,系统定义编辑操作类型并生成高度拟人化交互数据。基于面向 LLM 的 CAD 表示,我们设计强化学习增强的推理框架,将意图理解、参数估计与精准编辑定位整合为单一智能体,实现设计与精修“一站式”方案。大量实验表明,生成与编辑任务在定性与定量模态上相互强化。在公开基准测试中,PR-CAD 在生成与精修场景均实现 SOTA 可控性与保真度,同时易用性佳,显著提升 CAD 建模效率。
查看缓存全文
缓存时间: 2026/04/23 10:02
# PR-CAD:面向统一可控且忠实文本生成 CAD 的渐进式精修框架
来源:https://arxiv.org/html/2604.19773
Jiyuan An¹²、Jiachen Zhao¹²、Fan Chen³、Liner Yang¹²、Zhenghao Liu⁴、Hongyan Wang⁵、Weihua An¹、Meishan Zhang⁶、Erhong Yang¹²
¹ 国家语委平面媒体语言资源监测与研究分中心,北京语言大学,中国
² 北京语言大学 信息科学学院,中国
³ 北京交通大学 计算机与信息技术学院,中国
⁴ 东北大学 计算机科学与工程学院,中国
⁵ 清华大学 计算机系,中国
⁶ 哈尔滨工业大学(深圳) 计算机科学与技术学院,中国
{lineryang}@gmail\.com
###### 摘要
CAD 模型构建长期依赖人工操作与专业经验。大语言模型(LLM)的最新进展催生了“文本→CAD”研究,但现有方法普遍将生成与编辑视为割裂任务,实用性受限。本文提出 PR-CAD,一个渐进精修框架,将生成与编辑统一于可控、忠实的文本驱动 CAD 建模流程。为此,我们构建了覆盖 CAD 全生命周期的高保真交互数据,涵盖多种 CAD 表示及定性与定量描述;系统定义编辑操作类型,生成高度拟人化的交互数据。基于面向 LLM 的 CAD 表示,我们提出强化学习增强的推理框架,将意图理解、参数估计与精准编辑定位整合为单一智能体,实现“设计-修改一体化”。大量实验表明,生成与编辑任务相互增强,定性、定量模态协同提升。在公开基准上,PR-CAD 在生成与精修场景均取得 SOTA 可控性与忠实度,同时显著提升 CAD 建模效率,用户体验友好。
---
图 1:PR-CAD 通过渐进精修实现用户友好、可控的 CAD 生成。每幅子图下方为文本指令,上方为对应 CAD 输出。支持从零开始生成并渐进增删改,用户可灵活选用定性或定量描述,直至获得理想设计。
## 1 引言
计算机辅助设计(CAD)是现代制造与工业设计的基石,但传统建模高度依赖专家经验与繁琐操作。大语言模型(LLM)为“文本→CAD”带来新机遇,然而主流方法把生成与编辑割裂,违背设计天然“迭代”本质:设计师极少一次成稿,而是持续增删改。现有系统缺乏统一精修框架,用户只能接受次优初稿或退回手工编辑,极大限制实用性。此外,多数方法依赖冗长技术提示,非专家难以撰写;少量编辑工作亦仅基于随机合成数据,无法捕捉真实意图驱动的细粒度修改。
为此,我们提出 PR-CAD,一个渐进精修框架,统一文本驱动的 CAD 生成与编辑,核心贡献如下:
- 提出 PR-CAD 框架,将生成与编辑纳入单一可控智能体,实现“创建-修改”无缝流程。
- 构建覆盖 CAD 全生命周期的高保真交互数据集,支持多元编辑类型与描述模态。
- 设计强化学习增强推理:监督微调(SFT)+ 结构化思维链(SCoT)+ 强化学习(RL),在几何精度、可执行性与用户意图对齐上全面优化,并经 ChatCAD 实验验证。
## 2 相关工作
**CAD 模型生成**
传统参数化 CAD 需要逐序描述草图-拉伸等操作。DeepCAD 等大型数据集推动基于 Transformer 的文本生成 CAD 研究,如 Text2CAD、GeoCAD、Seek-CAD 等,但平均需约 100 词描述一步操作,提示负担沉重。
**CAD 模型编辑**
FLEXCAD 探索随机参数编辑,CAD-Editor 支持定向修改,然而训练数据多为随机增删,定量编辑稀缺,真实可用性不足。
**CAD 序列表示**
DeepCAD 提出 DSL,Text-to-CAD 采用 GPL(Python+cadquery),FLEXCAD 使用结构化文本(ST)。各表示差异大,难以互通。
**LLM 推理**
SFT、RL、SCoT 已在数学、代码等任务验证有效。应用于 CAD,可缓解对技术提示的依赖,实现更直观、精准的生成与编辑,为 PR-CAD 奠定方法论基础。
## 3 方法
PR-CAD 统一文本驱动生成与编辑,核心包括:
1. 高保真拟人交互数据标注(§3.1)
2. 面向渐进精修的后训练策略(§3.2)
### 3.1 高保真拟人交互数据标注
覆盖 CAD 全生命周期,含定性/定量文本描述与增删改操作标签。
**生成任务**
- 定性:对 CAD 渲染 9 视角图 + JSON,输入大视觉模型生成高阶设计描述。
- 定量:JSON 直接输入 LLM,生成精确操作序列与参数。
- 表示兼容:使用 LogoUp 3D、ST、DSL、GPL(Python)等多种序列格式,由代码翻译工具与 LLM 互相转换,选取最适配大模型推理的形式。相似文章
RA-CAD:为状态感知的文本到CAD生成学习执行后批判
RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。
面向大型语言模型的 Compatibility-Aware Dynamic Fine-Tuning
介绍 Compatibility-Aware Dynamic Fine-Tuning (CADFT),这是 Dynamic Fine-Tuning 的扩展,在 LLM 监督微调中控制样本级优化方差,从而提高稳定性和泛化能力。
面向CAD生成的记忆增强强化学习智能体
本文提出了一种用于CAD生成智能体的记忆增强强化学习框架,该框架集成了几何内核工具链、双轨记忆和动态效用检索,以处理具有长操作序列和几何约束的复杂CAD模型,从而提升了成功率和几何一致性。
基于有限元分析反馈的自我改进CAD生成代理
本文提出了一种新的CAD生成任务形式,将有限元分析作为反馈,并结合了改进的监督信号,如纯文本蓝图方案和多视角图像渲染器,从而在基准测试中实现了更好的几何重建。
具身CAD:基于求解器的LLM智能体用于参数化B-Rep装配建模
介绍具身CAD(Embodied CAD),一个闭环框架,将LLM智能体置于CAD执行环境中,用于参数化B-Rep装配建模,利用求解器反馈进行规划和优化。