RA-CAD:为状态感知的文本到CAD生成学习执行后批判
摘要
RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。
arXiv:2608.05714v1 公告类型:新
摘要:文本到CAD生成将自然语言设计意图转化为可编辑且可执行的参数化计算机辅助设计(CAD)代码,减少了手动建模所需的专业知识和精力。现有方法采用固定的、外部提供的、提示诱导的或单独优化的批判机制来优化生成过程,但它们不一定优化反馈在整个生成过程中如何被解释并转化为有效的纠正措施。为了弥合这一反馈利用差距,我们提出了RA-CAD(用于CAD的ReAct智能体),一种通过生成--执行--批判--重写循环与CAD环境交互的状态感知智能体。在每次迭代中,RA-CAD执行当前代码并观察其结果。基于设计指令、当前代码和执行反馈,智能体随后生成显式的执行后批判作为中间策略动作。该批判要么验证当前结果以终止,要么提供面向修订的指导,以约束下一步重写。CAD代码引导(CCB)首先通过监督微调建立基本的参数化CAD编码能力。随后,反馈驱动的智能体优化(FAO)将轨迹级组相对策略优化应用于策略生成的代码和批判序列,为完整交互轨迹分配终端F1和Chamfer距离奖励。这种表述使批判成为一种与结果对齐的、可学习的策略决策,而非未优化的辅助输出。在CADFusion和Text2CAD上的实验表明,与现有方法和强大的专有语言模型相比,RA-CAD实现了最先进的执行有效性和几何质量,证明了所提出的状态感知文本到CAD智能体的有效性。
查看缓存全文
缓存时间: 2026/08/07 07:47
# 学习文本到CAD生成中的执行后评审 来源:https://arxiv.org/html/2608.05714 ###### 摘要 文本到CAD生成将自然语言设计意图转换为可编辑且可执行的参数化计算机辅助设计(CAD)代码,从而减少手动建模所需的专业知识和精力。现有方法采用固定的、外部提供的、提示诱导的或单独优化的评审机制来优化生成过程,但它们不一定优化在整个生成过程中如何解释反馈并将其转化为有效的纠正动作。为了弥合这一反馈利用差距,我们提出了RA-CAD(用于CAD的ReAct智能体),一个状态感知的智能体,通过生成-执行-评审-重写循环与CAD环境交互。在每次迭代中,RA-CAD执行当前代码并观察其结果。以设计指令、当前代码和执行反馈为条件,该智能体随后生成一个显式的执行后评审作为中间策略动作。该评审要么验证当前结果以终止,要么提供面向修订的指导,为下一次重写提供条件。CAD代码引导(CCB)首先通过监督微调建立基本的参数化CAD编码能力。反馈驱动的智能体优化(FAO)随后将轨迹级的分组相对策略优化应用于策略生成的代码和评审序列,为完整交互轨迹分配终端F1和倒角距离奖励。这一公式使评审成为一种与结果对齐、可学习的策略决策,而非未优化的辅助输出。在CADFusion和Text2CAD上的实验表明,与现有方法和强大的专有语言模型相比,RA-CAD实现了最先进的执行有效性和几何质量,证明了所提出的状态感知文本到CAD智能体的有效性。 ## 引言 计算机辅助设计(CAD)通过精确、可编辑的几何操作来表示工程对象,是产品设计和制造的核心(Wu等.2021 (https://arxiv.org/html/2608.05714#bib.bib1); Xu等.2022 (https://arxiv.org/html/2608.05714#bib.bib2))。然而,手动创建这些模型需要大量的领域专业知识和精力(Denget al.2023 (https://arxiv.org/html/2608.05714#bib.bib40))。近年来,已经提出了各种自动CAD生成技术,将用户规格或设计意图转换为可执行、可编辑的CAD表示,如图1 (https://arxiv.org/html/2608.05714#Sx1.F1)\(a\)所示。 请参阅图注 图1:现有方法与我们的方法之间的CAD生成方法比较。现有方法将反馈视为来自外部视觉审阅者的启发式指导。我们的工作将其建模为一个显式的决策过程,带有智能体侧组件。
早期神经方法学习了CAD构建序列上的无条件分布(Wu等.2021 (https://arxiv.org/html/2608.05714#bib.bib1); Xu等.2023 (https://arxiv.org/html/2608.05714#bib.bib27))。随后出现了条件方法,用自然语言描述来指导生成,通常将该任务表述为一次性监督预测(Khan等.2024b (https://arxiv.org/html/2608.05714#bib.bib6); He等.2025 (https://arxiv.org/html/2608.05714#bib.bib9); Xie和Ju2025 (https://arxiv.org/html/2608.05714#bib.bib8); Yuan等.2026 (https://arxiv.org/html/2608.05714#bib.bib11))。偏好学习和几何奖励优化进一步提高了最终输出的保真度(Wang等.2025 (https://arxiv.org/html/2608.05714#bib.bib35); Guan等.2025 (https://arxiv.org/html/2608.05714#bib.bib10); Li等.2026a (https://arxiv.org/html/2608.05714#bib.bib36))。然而,完整的CAD程序是脆弱的:单个无效参数或不一致的操作可能阻止执行,而语法有效的代码仍可能实例化错误的几何体。一次性解码器无法利用这些结果来修复其预测。 请参阅图注 图2:我们的训练框架概览,包括两个阶段:CAD代码引导(CCB)和反馈驱动的智能体优化(FAO)。在CCB阶段,智能体通过使用配对的文本-CAD数据进行监督微调来初始化,以学习参数化CAD代码的语法和几何约束。在FAO阶段,采用GRPO算法对智能体的完整执行轨迹进行微调,使生成和评审策略在反馈驱动的执行下共同进化。
近期系统通过执行反馈、外部视觉审阅者、工具交互或迭代细化来解决这一局限性(Li等.2026b (https://arxiv.org/html/2608.05714#bib.bib37); Gong等.2026 (https://arxiv.org/html/2608.05714#bib.bib19); Hu等.2026 (https://arxiv.org/html/2608.05714#bib.bib17); Fan等.2026 (https://arxiv.org/html/2608.05714#bib.bib18))。然而,反馈的可用性本身并不决定如何表示或学习反馈利用:它可能仅用作训练奖励,由固定的审阅者或编译器生成,或仍嵌入在更广泛的推理轨迹中。无论形式如何,它们都将反馈视为启发式指导,如图1 (https://arxiv.org/html/2608.05714#Sx1.F1)\(b\)所示,其实际价值取决于一个关键的执行后决策:判断实例化代码是否满足指令,识别可操作的缺陷,并决定是否以及如何修订它。在CAD中,不准确的决策可能导致过早接受、不必要的编辑或累积的语法和几何错误。因此,可靠的生成需要可执行代码合成以及与重写共同优化的执行后评审决策。 RA-CAD通过一个ReAct智能体(Yao等.2022 (https://arxiv.org/html/2608.05714#bib.bib46))解决这一问题,该智能体作为一个状态感知的生成-执行-评审-重写循环运行。如图2 (https://arxiv.org/html/2608.05714#Sx1.F2)所示,RA-CAD将CAD生成组织为在环境交互下的评审引导修订过程。我们不是将评审视为固定的后置提示或辅助文本分析步骤,而是将其建模为智能体侧决策组件,为后续重写和终止产生诊断信号。具体来说,CAD代码引导(CCB)通过监督微调(SFT)初始化代码生成,而反馈驱动的智能体优化(FAO)使用终端代码和几何奖励,通过分组相对策略优化(GRPO)优化所有策略生成的代码和评审令牌。RA-CAD随后将执行后评审显式分解为可学习的策略组件,并在完整的环境交互轨迹上联合优化评审和代码提议/重写,如图1 (https://arxiv.org/html/2608.05714#Sx1.F1)\(c\)所示,而不是像图1 (https://arxiv.org/html/2608.05714#Sx1.F1)\(b\)所示的外部审阅者。通过这种方式,RA-CAD不仅学习提出CAD代码,还学习评审中间结果并利用这些评审输出来指导后续修订。通过优化完整的交互轨迹,该框架提高了复杂CAD代码生成的可执行性、几何准确性和鲁棒性。主要贡献总结如下:
- •我们将状态感知的文本到CAD生成形式化为一个回合级闭环,带有显式分解、可学习的执行后评审策略。评审被显式建模为智能体侧决策组件,而不是被视为固定提示模板或纯粹的后置分析步骤。
- •我们提出了带有CCB的轨迹级FAO,它为完整交互轨迹分配终端CAD质量奖励,并联合优化代码生成、执行后评审和重写。
- •在CADFusion和Text2CAD上的实验结果表明,闭环、评审引导的修订显著提高了现有文本到CAD方法和强大专有语言模型的执行有效性和几何质量。
## 相关工作
### CAD生成
序列模型如DeepCAD(Wu等.2021 (https://arxiv.org/html/2608.05714#bib.bib1))、SkexGen(Xu等.2022 (https://arxiv.org/html/2608.05714#bib.bib2))、HNC-CAD(Xu等.2023 (https://arxiv.org/html/2608.05714#bib.bib27))、SketchGen(Para等.2021 (https://arxiv.org/html/2608.05714#bib.bib28))和CAD-as-Language(Ganin等.2021 (https://arxiv.org/html/2608.05714#bib.bib5))学习结构化草图或草图-拉伸表示,而BRepGen(Xu等.2024 (https://arxiv.org/html/2608.05714#bib.bib3))和SolidGen(Jayaraman等.2023 (https://arxiv.org/html/2608.05714#bib.bib4))直接建模边界表示。基于图像/草图条件的方法(Li等.2022 (https://arxiv.org/html/2608.05714#bib.bib21); You等.2025 (https://arxiv.org/html/2608.05714#bib.bib20); Chen等.2025 (https://arxiv.org/html/2608.05714#bib.bib22); Doris等.2026 (https://arxiv.org/html/2608.05714#bib.bib23))或点云(Khan等.2024a (https://arxiv.org/html/2608.05714#bib.bib24); Liu等.2024 (https://arxiv.org/html/2608.05714#bib.bib25); Rukhovichi等.2025 (https://arxiv.org/html/2608.05714#bib.bib26))从几何观测重建CAD代码;FlexCAD和GeoCAD额外支持可控编辑(Zhang等.2025 (https://arxiv.org/html/2608.05714#bib.bib29),2026 (https://arxiv.org/html/2608.05714#bib.bib30))。尽管这些输入提供了强大的几何约束,但自然语言为表达高层设计意图提供了更直接的界面。文本到CAD方法则从描述中预测参数序列或CAD代码(Yavartanoo等.2024 (https://arxiv.org/html/2608.05714#bib.bib7); Xie和Ju2025 (https://arxiv.org/html/2608.05714#bib.bib8); Li等.2025 (https://arxiv.org/html/2608.05714#bib.bib14); Govindarajan等.2025 (https://arxiv.org/html/2608.05714#bib.bib15))。它们大多强调监督映射、规划或可控生成。它们的输出可以被执行以进行评估,但执行不一定会被表示为细化轨迹中的学习型执行后评审动作。
### 反馈引导的CAD细化
反馈引导的方法在反馈的来源和表示上有所不同。CADFusion(Wang等.2025 (https://arxiv.org/html/2608.05714#bib.bib35))开创性地引入了DPO(Rafailov等.2023 (https://arxiv.org/html/2608.05714#bib.bib33)),使用渲染的3D视觉反馈作为偏好信号,以提高几何一致性和视觉保真度。为了进一步提高几何精度,CAD-Coder(Guan等.2025 (https://arxiv.org/html/2608.05714#bib.bib10))引入了GRPO(Shao等.2024 (https://arxiv.org/html/2608.05714#bib.bib34)),利用链式思维(CoT)(Wei等.2022 (https://arxiv.org/html/2608.05714#bib.bib43))推理和几何指标作为优化信号,进一步提高了几何精度。ReCAD(Li等.2026a (https://arxiv.org/html/2608.05714#bib.bib36))、PR-CAD(An等.2026 (https://arxiv.org/html/2608.05714#bib.bib39))、CME-CAD(Niu等.2026 (https://arxiv.org/html/2608.05714#bib.bib38))、ToolCAD(Gong等.2026 (https://arxiv.org/html/2608.05714#bib.bib19))和IterCAD(Hu等.2026 (https://arxiv.org/html/2608.05714#bib.bib17))进一步证明了强化学习、结构化推理、多轮细化和环境交互在CAD生成中的价值。尽管这些方法表明反馈可以改善CAD生成,但它们主要优化结构化输入、生成策略或工具使用过程。相比之下,我们将文本到CAD生成表述为由显式可学习的执行后评审驱动的闭环细化过程,并在轨迹级别联合优化生成、重写和评审策略。
## 方法
### 问题表述
设\(\mathcal{D}=\{(d^{(i)},c^{\star(i)})\}_{i=1}^N\)为一个文本到CAD数据集,其中\(d\)是自然语言设计描述,\(c^{\star}=(c^{\star}_{1},\ldots,c^{\star}_{L})\)是其对应的真实参数化CAD代码。CAD执行器\(\mathcal{E}\)将候选代码\(c\)映射到执行结果\(e=\mathcal{E}(c)\),该结果记录代码是否有效以及任何可用的诊断消息。如果执行成功,CAD环境将实例化几何体\(\mathcal{G}(c)\)。因此,文本到CAD生成寻求一个条件策略
\[
\hat{c}\sim\pi_{\theta}(\,\cdot\mid d),\qquad\hat{e}=\mathcal{E}(\hat{c}),
\qquad(1)
\]
其中\(\hat{c}\)是可执行的,与\(d\)中的设计意图一致,并实例化与\(\mathcal{G}(c^{\star})\)一致的几何体。一次性策略在产生\(\hat{c}\)后结束,不能使用\(\hat{e}\)来修复代码。RA-CAD则将生成表述为策略与\(\mathcal{E}\)之间的有限交互序列。从由\(d\)初始化的状态开始,第\(t\)轮遵循以下高层转移
\[
\tilde{c}_{t}\displaystyle\sim\pi_{\theta}^{\mathrm{g\&r}}(\,\cdot\mid s_{t-1}),\qquad e_{t}=\mathcal{E}(\tilde{c}_{t}),\qquad(2)
\]
\[
\tilde{f}_{t}\displaystyle\sim\pi_{\theta}^{\mathrm{crit}}(\,\cdot\mid\bar{s}_{t}),
\]
其中\(\tilde{c}_{t}\)是\(t=1\)时的初始代码或\(t>1\)时的重写,\(\bar{s}_{t}\)是执行完成后的状态,\(\tilde{f}_{t}\)是显式的执行后评审。该评审要么接受当前代码,要么提供指导,为下一次重写提供条件。过程在接受或达到交互限制时终止,并返回最终代码\(c_{T}\)。如图3 (https://arxiv.org/html/2608.05714#Sx3.F3)所示,其完整轨迹为
\[
\tau=(s_{0},a_{1},s_{1},\ldots,a_{T},s_{T}),
\qquad(3)
\]
其中\(\tau\)表示轨迹,\(s_{0}\)表示仅由\(d\)构成的初始状态,\(a_{>0}\)表示每个复合动作,\(s_{>0}\)表示每个完整状态,\(T\)表示最终轮次。如图2 (https://arxiv.org/html/2608.05714#Sx1.F2)所示,RA-CAD分两个阶段训练该策略。CAD代码引导(CCB)首先通过监督微调从\((d,c^{\star})\)对中学习描述到代码的映射。反馈驱动的智能体优化(FAO)随后采样完整的生成-执行-评审-重写轨迹,并将终端CAD质量奖励应用于所有策略生成的代码和评审序列。以下小节详细说明这两个阶段和轨迹级目标。
### CAD代码引导
严格的CAD语法和几何约束使得强化学习从头开始学习有效的CAD生成并不可靠。因此,CCB首先在基础语言模型上执行监督微调,以初始化其参数化CAD代码生成能力。在训练过程中,我们采用教师强制策略,通过自回归(下一个令牌预测)逐步预测目标CAD代码中的每个令牌。在第\(l\)个生成步骤中,模型基于前\(l-1\)个真实令牌作为条件预测当前令牌\(c^{\star}_{l}\),并使用交叉熵相似文章
PR-CAD:利用大语言模型渐进式优化,实现统一、可控且高保真的文本到 CAD 生成
PR-CAD 提出基于大语言模型的统一框架,通过强化学习与高质量数据集,实现文本到 CAD 的迭代生成与编辑,在可控性与保真度上达到 SOTA。
基于有限元分析反馈的自我改进CAD生成代理
本文提出了一种新的CAD生成任务形式,将有限元分析作为反馈,并结合了改进的监督信号,如纯文本蓝图方案和多视角图像渲染器,从而在基准测试中实现了更好的几何重建。
面向CAD生成的记忆增强强化学习智能体
本文提出了一种用于CAD生成智能体的记忆增强强化学习框架,该框架集成了几何内核工具链、双轨记忆和动态效用检索,以处理具有长操作序列和几何约束的复杂CAD模型,从而提升了成功率和几何一致性。
ArtisanCAD: 一种基于专家知识蒸馏的工业级CAD智能体
ArtisanCAD是一种技能引导的工业级CAD智能体,利用专家驱动的知识蒸馏将模糊提示转化为可执行的CAD程序,在Text2CAD基准上提升了性能,并能生成复杂汽车部件的可编辑B-Rep模型。
TraceCAD:面向智能体CAD生成的可追踪引导修复
TraceCAD是面向基于LLM的CAD智能体的持久化恢复层,用于诊断错误操作并执行局部化、可复用的修复,以提升最终几何质量与修复可靠性。