FllumaOne:一个代码原生的多模态CAD数据集,包含可执行程序与内核验证的特征历史
摘要
介绍了FllumaOne,一个由Flluma CAD系统中可执行Python程序生成的10万个样本的多模态CAD数据集,提供特征树、STEP几何、点云和语言描述,以支持可编辑CAD研究。
arXiv:2606.17696v1 公告类型:新
摘要:参数化计算机辅助设计不仅记录最终几何形状,还记录有序的构造历史,该历史决定了零件如何被编辑。因此,面向可编辑CAD研究的数据集应同时暴露建模操作、参数和特征依赖关系以及经过验证的几何形状。我们引入了FllumaOne,一个代码原生的多模态CAD数据集,其模型由Flluma(一个基于Qt/C++和OpenCASCADE的CAD系统)中的可执行Python程序生成。每个样本将其程序与结构化特征树、面向训练的中间表示、STEP几何、表面点云、自然语言描述、元数据以及八个规范可视边渲染图对齐。
主要版本FllumaOne-100K包含10万个通过验收的样本,跨越四个模板级别的复杂度区间。程序仅在通过内核几何、实体有效性和导出检查后才会执行并保留;发布报告还记录了模态完整性和分割级别重复测试。基于80,000个样本训练的Qwen2.5-Coder-1.5B LoRA基线模型,在保留的10,000个样本测试集上实现了99.98%的Python语法有效性、99.97%的Flluma构建成功率和99.14%的STEP导出有效性。在转换为表面点云的9,909个预测结果中,平均归一化倒角距离为0.002124。该数据集支持条件化CAD重建、可执行程序合成、特征树预测、边界表示分析、检索、设计补全和可编辑逆向工程。
查看缓存全文
缓存时间: 2026/06/17 05:38
# FllumaOne:一种代码原生的多模态CAD数据集,包含可执行程序和经过内核验证的特征历史记录 来源:https://arxiv.org/html/2606.17696 \(2026年6月\) ###### 摘要 参数化计算机辅助设计不仅记录最终几何形状,还记录有序的构造历史,该历史决定了部件如何被编辑。因此,可编辑CAD研究的数据集应同时暴露建模操作、参数和特征依赖关系以及经过验证的几何形状。我们介绍了FllumaOne,一种代码原生的多模态CAD数据集,其模型由基于Qt/C++和OpenCASCADE的CAD系统Flluma中的可执行Python程序生成。每个样本将其程序与结构化特征树、面向训练的中级表示、STEP几何形状、表面点云、自然语言描述、元数据以及八个规范可见边缘渲染图对齐。 主要发布版本FllumaOne-100K包含100,000个通过验证的样本,跨越四个模板级别的复杂度范畴。程序仅在通过内核几何形状、实体有效性和导出检查后执行并保留;发布报告还记录了模态完整性和分割级别的重复性测试。一个基于Qwen2.5-Coder-1.5B LoRA的基线模型,在80,000个样本上训练,在保留的10,000个样本测试集上实现了99.98%的Python语法有效性、99.97%的Flluma构建成功率和99.14%的STEP导出有效性。对于转换为表面点云的9,909个预测结果,平均归一化倒角距离为0.002124。该数据集支持条件化CAD重建、可执行程序合成、特征树预测、B-Rep分析、检索、设计补全和可编辑逆向工程。 关键词:计算机辅助设计,CAD数据集,可执行CAD程序,构造历史,特征树,多模态CAD,B-Rep几何 ## 1 引言 一个可编辑的CAD模型并不仅仅由其最终形状定义。它的工程价值还在于构造历史:决定部件如何被修改的草图、特征、参数和依赖关系。网格或最终的B-Rep可以精确地再现边界,但会省略这些信息。这种省略限制了设计重用、变体创建、制造特征分析和逆向工程,在这些场景中,所需的输出是一个可以编辑而不仅仅是查看的模型[1 (https://arxiv.org/html/2606.17696#bib.bib1)]。 大型几何数据库已支持在形状学习和B-Rep处理方面取得了实质性进展[2 (https://arxiv.org/html/2606.17696#bib.bib2),3 (https://arxiv.org/html/2606.17696#bib.bib3)]。后来,关注构造信息的数据集引入了命令序列、草图图和人工编写的建模历史[4 (https://arxiv.org/html/2606.17696#bib.bib4),5 (https://arxiv.org/html/2606.17696#bib.bib5),6 (https://arxiv.org/html/2606.17696#bib.bib6)]。更近期的数据集将这些表示与语言、图像、点样本、原生CAD文件或可执行脚本联系起来[7 (https://arxiv.org/html/2606.17696#bib.bib7),8 (https://arxiv.org/html/2606.17696#bib.bib8),9 (https://arxiv.org/html/2606.17696#bib.bib9)]。实践中剩余的挑战是将可检查的构造记录、可重放代码、经过内核验证的几何形状以及对齐的学习输入结合起来,而无需商业CAD许可证。 我们介绍了FllumaOne,一个用于学习可编辑构造结构的代码原生多模态CAD数据集。每个样本都有一个规范的特征树和一个配对的Python程序,该程序由基于Qt/C++和OpenCASCADE构建的CAD系统Flluma执行。发布版本还提供了紧凑的训练IR以及衍生的几何、视觉和文本观测。将构造记录和可重放程序放在一起,允许在代码、特征历史、内核和导出级别检查失败。 10万个样本是从一个受控的参数化构造过程库中生成的,并且仅在通过几何验证和导出检查后才被接受。一个单独的本地LLM阶段从内核派生记录生成标题、全面描述和提示变体,而不选择参数或更改几何形状,从而使几何生成保持确定性。 主要贡献是: - •配对构造表示。一个规范的特征树、可执行的Python程序和紧凑的训练IR在互补的抽象级别上描述了相同的可编辑建模历史。 - •以内核为基础的多模态发布。构造记录与STEP几何形状、表面点云、规范视图、文本和验证元数据对齐,共10万个已接受样本。 - •可审计的生成和完整性检查。发布报告报告了几何形状和导出验证、分割成员身份、模态完整性以及针对程序、构造记录、IR和实体签名的精确重复检查。 - •可执行的基线和评估工具。一个可重现的文本到程序基线从Python语法开始,经过Flluma执行、实体验证、STEP导出和归一化表面倒角距离进行评估。 ## 2 相关工作 ### 2.1 从形状集合到CAD边界表示 ModelNet、ShapeNet和Thingi10K建立了从体素、网格和物体集合进行大规模学习的基准[10 (https://arxiv.org/html/2606.17696#bib.bib10),2 (https://arxiv.org/html/2606.17696#bib.bib2),11 (https://arxiv.org/html/2606.17696#bib.bib11)]。它们的优势在于几何和语义覆盖面,而非可编辑建模结构。面向资产的数据集如Objaverse++和3DCOMPAT++扩展了视觉、材质和多模态标注,但仍以最终对象作为主要表示[12 (https://arxiv.org/html/2606.17696#bib.bib12),13 (https://arxiv.org/html/2606.17696#bib.bib13)]。 CAD研究需要更精确的几何形状。ABC以百万模型规模提供了分析型B-Rep曲线和曲面,支持面片、拓扑和微分几何学习[3 (https://arxiv.org/html/2606.17696#bib.bib3)]。UV-Net展示了直接在B-Rep面和边上操作的价值,而SolidGen、BrepGen和BrepDiff将边界实体视为生成目标[14 (https://arxiv.org/html/2606.17696#bib.bib14),15 (https://arxiv.org/html/2606.17696#bib.bib15),16 (https://arxiv.org/html/2606.17696#bib.bib16),17 (https://arxiv.org/html/2606.17696#bib.bib17)]。操作注释增加了部分构造语义:CC3D-Ops将操作和步骤标签分配给B-Rep面,eCAD-Net从最终B-Rep恢复可编辑的草图-拉伸序列[18 (https://arxiv.org/html/2606.17696#bib.bib18),19 (https://arxiv.org/html/2606.17696#bib.bib19)]。这些资源为最终几何和拓扑提供了强大的监督;构造历史仍然是一个独立的表示问题。 ### 2.2 构造历史和约束 Fusion 360 Gallery引入了人工编写的构造序列和一个用于序列化重建的执行环境[5 (https://arxiv.org/html/2606.17696#bib.bib5)]。DeepCAD表明,即使是在紧凑的草图-拉伸语言中,较大的命令序列集合也能支持生成式建模[6 (https://arxiv.org/html/2606.17696#bib.bib6)]。SketchGraphs则从草图角度处理设计意图,将几何约束表示为跨越数百万个2D草图的图[4 (https://arxiv.org/html/2606.17696#bib.bib4)]。这些数据集建立了可编辑CAD数据的三个互补要素:真实的历史、可扩展的序列表示和显式的几何关系。 此后,条件化CAD生成已扩展了所研究的输入和操作。Text2CAD将自然语言提示与构造序列对齐,Drawing2CAD从矢量绘图中预测序列,RLCAD研究用于命令生成的强化学习[20 (https://arxiv.org/html/2606.17696#bib.bib20),21 (https://arxiv.org/html/2606.17696#bib.bib21),22 (https://arxiv.org/html/2606.17696#bib.bib22)]。HistCAD将可执行历史与显式草图约束和原生CAD兼容性结合起来,将参数可编辑性和约束保持置于评估的中心[8 (https://arxiv.org/html/2606.17696#bib.bib8)]。这一系列工作表明,单次通过的几何有效性和可编辑性是相关但不同的属性。 ### 2.3 可执行CAD程序 可执行脚本提供了一种表示,代码模型可以生成,工程师可以检查。CAD-Recode将点云映射到CadQuery程序,并使用大规模程序化生成的训练数据[23 (https://arxiv.org/html/2606.17696#bib.bib23)]。Zero-to-CAD将代码生成嵌入到执行和修复循环中,并扩展了超出草图和拉伸的操作词汇[24 (https://arxiv.org/html/2606.17696#bib.bib24)]。CAD-Coder和FutureCAD进一步将语言模型生成与几何反馈或B-Rep基础结合起来[25 (https://arxiv.org/html/2606.17696#bib.bib25),26 (https://arxiv.org/html/2606.17696#bib.bib26)]。主要的权衡是,规模和可执行性是通过选择脚本API和生成过程获得的,其约定成为学习分布的一部分。 其他工作以图像、文本或跨模态检索为条件进行构造。GenCAD和DiffCAD研究以图像为条件的生成或对齐,而CAD-GPT和CADFusion集成了语言、空间推理和视觉反馈[27 (https://arxiv.org/html/2606.17696#bib.bib27),28 (https://arxiv.org/html/2606.17696#bib.bib28),29 (https://arxiv.org/html/2606.17696#bib.bib29),30 (https://arxiv.org/html/2606.17696#bib.bib30)]。因此,可执行程序数据不仅作为代码语料库进行评估,而且越来越多地作为观察结果与可编辑几何之间的桥梁。 ### 2.4 多模态CAD数据集 近期的数据集将构造数据与几种观察模态打包在一起。CADInstruct为CAD程序添加了语言监督,Omni-CAD将命令序列与文本、图像和点数据对齐[7 (https://arxiv.org/html/2606.17696#bib.bib7),31 (https://arxiv.org/html/2606.17696#bib.bib31)]。HistCAD将受约束的历史与STEP、视图、原生文件和文本相结合;SldprtNet从SolidWorks部件中推导出对齐的表示;CADFS以多模态注释重构可执行的FeatureScript程序[8 (https://arxiv.org/html/2606.17696#bib.bib8),32 (https://arxiv.org/html/2606.17696#bib.bib32),9 (https://arxiv.org/html/2606.17696#bib.bib9)]。 FllumaOne在这个设计空间中占据了一个不同的位置。其规范记录是一个结构化的特征树,配有一个在基于OpenCASCADE的运行时中的可执行Python视图。标准的几何和学习观察结果是从已接受的构造中派生的,并通过发布清单和哈希值链接起来。该方法倾向于可访问的可执行接口和跨表示的可审计性,同时继承了受控程序化生成器的分布限制。 ## 3 数据集概述 ### 3.1 设计目标 发布版本的设计平衡了三个工程要求。首先,规范表示必须保留操作顺序、参数和依赖关系,同时可转换为可以检查和重放的代码。其次,每个已接受的记录必须解析为经过内核验证的几何形状和标准交换文件;一个看似合理但没有稳定实体的序列是不够的。第三,该表示必须足够规则以用于机器学习。因此,Flluma API使用显式的操作名称、类型化参数、稳定的参数顺序以及中间对象的直接绑定。 这些选择以无限制的建模自由换取了规模和对齐。特征树、Python视图和训练IR在不同的细节层次上描述相同的构造,而派生观察结果仅在接受后生成。其结果比任意用户脚本更容易审计和分词,但它必然反映了生成器的操作词汇和过程惯例。 ### 3.2 样本结构 每个已接受的样本包含一组连贯的源文件、派生文件、监督文件和溯源文件,如表1 (https://arxiv.org/html/2606.17696#S3.T1)所示。规范的`feature_tree.json`记录有序的建模操作、语义角色、参数、依赖关系和拓扑引用,提供与Fusion 360 Gallery、DeepCAD、HistCAD和SldprtNet中使用的构造历史监督相关的监督[5 (https://arxiv.org/html/2606.17696#bib.bib5),6 (https://arxiv.org/html/2606.17696#bib.bib6),8 (https://arxiv.org/html/2606.17696#bib.bib8),32 (https://arxiv.org/html/2606.17696#bib.bib32)]。配对的Python程序是该记录的可重放代码视图,并在Flluma中构建CAD模型。特征树同样可以在Flluma运行时中重放,并转换回可执行的Python代码用于模型重建。 训练IR将相同的构造历史序列化为紧凑的序列学习目标。几何形状导出为STEP,而点云和规范视图提供几何和视觉监督。视觉数据包括八张特征感知的可见边缘渲染图,位于`images/canonical/`下。这些视图从固定的正交和等轴测视点生成,旨在保留与构造相关的可见边缘,而非逼真外观。文本文件提供确定性描述和LLM增强的提示,而元数据和发布报告记录哈希值、质量检查、模式版本和生成溯源。在发布级别,FllumaOne以原始样本文件夹的形式分发,附带JSON发布清单、分割文件、模式描述、词汇文件和Parquet训练表格,因此用户可以检查单个CAD记录或直接加载训练/验证/测试分割。 表1:FllumaOne中主要的每个样本和发布级别文件。 ### 3.3 视觉模态 主要的视觉模态是规范的八视图集:六个轴对齐的正交视图和两个等轴测视图。渲染器并非模仿产品照片,而是保留可见的特征边界,以便孔、凹槽、凸台、阵列和局部构造细节从固定视点仍然可观察。纯轮廓投影会隐藏许多内部或背面的构造线索。 图1 (https://arxiv.org/html/2606.17696#S3.F1)展示了这些视图如何与一个已发布样本的其他表示一起存储。各个面板并非独立收集的注释:程序、构造表示、几何形状、点样本、图像和文本都指向同一个已接受的CAD记录。这种对应关系允许在一个表示中的模型预测可以对照可执行源代码和其他表示中的内核生成几何形状进行检查。 参阅图注图1:已发布样本`flluma_0008012`的对齐表示。可执行Python程序、规范特征树和面向模型的特征树、训练IR、STEP B-Rep、带有存储法线的2048点表面点云、确定性描述、LLM增强描述以及八个规范视图均源自同一经过内核验证的构造记录。文本面板显示缩短的摘录;视觉集包含六个正交视图和两个等轴测视图。 ### 3.4 规模和复杂度分配 主要发布版本包含100,000个有效的CAD样本。其调度器为四个复杂度级别分配固定目标(表2 (https://arxiv.org/html/2606.17696#S3.T2)),使得基本图元仍然有代表性,但不会让它们主导语料库——这是命令序列数据集中的一个已知风险[6 (https://arxiv.org/html/2606.17696#b
相似文章
用于自动CAD生成的基础模型
本文全面实证研究了使用基础模型(大语言模型和视觉语言模型)从自然语言自动生成CAD的方法,提出了LLMForge框架,包含两种批评机制(IterTracer和IterVision),并在包含97个工程设计问题的基准上评估了七个模型。
@tom_doerr: 从原始数据生成LLM就绪的数据集 https://github.com/OpenDCAI/DataFlow…
DataFlow是一个开源工具,提供可视化、低代码的管道,用于从原始数据生成、清洗和准备高质量的LLM训练数据集。它包含一篇arXiv上的技术报告。
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
基于有限元分析反馈的自我改进CAD生成代理
本文提出了一种新的CAD生成任务形式,将有限元分析作为反馈,并结合了改进的监督信号,如纯文本蓝图方案和多视角图像渲染器,从而在基准测试中实现了更好的几何重建。
GenCAD
GenCAD 引入了一种图像条件模型,该模型利用 transformers 和扩散先验生成完整的参数化 CAD 命令历史,从而实现从图像中进行精确且可修改的 3D 建模。