一种将2D设计高效转化为3D模型以实现快速原型制作的更好方法

MIT News — Artificial Intelligence 论文

摘要

MIT等机构的研究人员开发了GIFT系统,该系统教导视觉-语言模型自动将2D设计转换为精确的CAD程序,用于快速原型制作,通过使用模型生成的数据来纠正错误,并以更少的计算量提升性能。

<p>工程师通常使用视觉-语言模型来生成新设计,例如飞机或汽车零部件。为了模拟这些零部件在真实场景中的表现,他们会使用经过验证的计算机辅助设计(CAD)软件生成这些设计的3D模型,并对其进行虚拟碰撞或耐久性测试。&nbsp;</p><p>MIT等机构的研究人员现已开发出一个系统,能够教导视觉-语言模型自动将2D设计转换为CAD程序,这些程序比其他方法更精确、功能更强大,且仅需少量计算。</p><p>通过提升AI驱动CAD生成的性能和效率,该技术可简化快速原型制作流程并降低成本。它还能帮助工程师发现那些可能被忽视的有益设计选择。&nbsp;</p><p>该系统根据模型尝试将2D图像转换为CAD程序的能力生成新数据。该框架纠正模型的失败,并将其与成功解决方案一起纳入数据集。&nbsp;</p><p>它利用这些数据教导模型如何修复特定错误并处理那些单独难以解决的棘手问题。&nbsp;</p><p>“我们希望工程师能够将我们的框架指向一个性能不佳的CAD模型,设定计算预算,然后让系统接管——将模型自身的错误转化为更好的训练数据,”主要作者Giorgio Giannone表示,他是MIT设计与计算数字工程(DeCoDE)实验室的研究员,也是Red Hat AI创新团队的首席研究科学家。</p><p>论文合著者包括MIT机械工程研究生Anna Claire Doris、MIT博士后Amin Heyrani Nobari、RedHat的Kai Xu,以及共同资深作者:IBM核心AI总监兼MIT-IBM计算研究实验室首席研究员Akash Srivastava;MIT机械工程副教授、DeCoDE实验室负责人兼MIT-IBM计算研究实验室首席研究员Faez Ahmed。该研究近日在国际机器学习会议上发表。</p><p>“我们周围几乎所有的实体产品,从飞机到家电,都始于CAD模型。行业团队渴望AI能帮助加速这些设计的创建,但当今的模型通常生成过于简单的形状,不足以用于实践。这项工作的令人兴奋之处在于,它为许多图像转CAD代码模型提供了一种自我改进的方式,通过从自身错误中学习,而不是等待更多人为数据——这使可信的AI设计工具更接近日常工程,”Ahmed表示。</p><p><strong>模型感知数据</strong></p><p>研究人员正致力于构建用于CAD生成的视觉-语言模型(VLM)。这些VLM接收2D图像和描述性文本,输出可在CAD软件中执行的Python代码,以生成物理对象的3D模型。</p><p>他们研究了部署现有VLM完成此任务的挑战,并确定限制其能力的主要瓶颈是缺乏多样化、高质量的CAD数据集进行训练。&nbsp;</p><p>为了解决这个问题,他们试图创造新数据来教导模型如何进行CAD生成,使用一种称为数据增强的过程。</p><p>在数据增强中,科学家通常通过随机调整现有数据来生成更多样本,例如调整图像中物体的颜色、大小和形状。&nbsp;</p><p>相反,MIT研究人员构建了一个名为GIFT(几何推理反馈调优)的数据增强系统,该系统生成的数据旨在提升特定任务中单个VLM的性能。</p><p>GIFT通过测试模型来了解其优势与弱点,然后利用这些知识生成数据,以提升模型在难以解决的CAD生成问题上的表现。</p><p>“我们希望获得由模型自身驱动的数据增强,”Giannone说。&nbsp;</p><p><strong>从错误中学习</strong></p><p>为此,GIFT要求模型多次并行生成解决CAD生成问题的代码,并检查这些猜测的正确性,以了解模型解决该问题的能力。</p><p>“对于模型来说,生成近乎<em>&nbsp;</em>正确的CAD查询代码并不难,但生成完美正确并可执行的代码对于标准VLM来说更具挑战性,”Giannone说。</p><p>对于接近正确的猜测,GIFT会进行调整使之成为成功解决方案。它将“接近成功”的案例和成功解决方案保存到新数据集中,以教导模型如何克服那些通常会导致失败的问题。</p><p>“如果我们对模型采样10次,它生成10个正确答案,那么就没有太多可学习的。我们关注的是中间情况,即模型可能只有50%的几率解决问题,”他说。</p><p>利用这些中间情况,GIFT能够生成既感知模型又感知任务的数据增强。此外,通过纳入同一问题的多个正确解,新数据扩展了模型在CAD代码生成方面的通用知识。</p><p>此自动系统无需人工干预来纠正模型错误。</p><p>GIFT使用称为推理时缩放的过程从预训练的VLM创建数据增强。该过程允许已经训练好的静态模型生成更好的输出,而无需重新训练整个模型的高计算成本。&nbsp;</p><p>通过推理时缩放,用户可以决定为GIFT分配多少计算量,从而根据时间和预算限制进行调整。&nbsp;</p><p>GIFT优于几种竞争技术,生成的CAD程序更精确,且仅使用约20%的计算量。使用GIFT的VLM生成的CAD模型与真实模型的形状对齐更好。</p><p>“利用GIFT,我们从几何入手,因为对于工程问题,如果3D形状的几何不正确,其他一切都不会正确,但还有许多其他方面需要考虑,”Giannone说。</p><p>未来,研究人员希望扩展GIFT,使该框架能够教导模型生成提升3D模型性能和可制造性的CAD程序。他们还希望将系统应用于更大的模型和更多样化的CAD生成任务。</p><p>该研究部分由MIT-IBM计算研究实验室资助。&nbsp;</p>
查看原文
查看缓存全文

缓存时间: 2026/07/16 10:55

# 将2D设计转化为3D模型的更优方式,助力快速原型制作 来源:https://news.mit.edu/2026/turning-2d-designs-into-3d-models-for-rapid-prototyping-0716 工程师通常使用视觉语言模型来生成新设计,例如飞机或汽车零部件。为了模拟这些组件在现实场景中的性能,他们会采用经过验证的计算机辅助设计(CAD)软件来生成这些设计的3D模型,以便进行虚拟碰撞或耐久性测试。 来自麻省理工学院(MIT)及其他机构的研究人员现已开发出一种系统,能够训练视觉语言模型自动将2D设计转换为CAD程序。与其他方法相比,该系统生成的CAD程序更加精确且功能更强,同时仅需极少的计算资源。 通过提升AI驱动的CAD生成的性能和效率,这项技术可以简化快速原型制作流程并降低成本。它还能帮助工程师发现那些可能被忽略的有益设计方案。 该系统基于模型自身的能力生成新数据,同时尝试将2D图像转换为CAD程序。该框架会修正模型的失败案例,并将其与成功解决方案一同纳入数据集。 它利用这些数据教导模型如何修复特定错误,并解决那些单靠自身难以处理的棘手问题。 “我们希望工程师能够将我们的框架指向一个性能不佳的CAD模型,设定一个计算预算,然后让系统接管——将模型自身的错误转化为更好的训练数据。”论文第一作者、MIT设计计算与数字工程(DeCoDE)实验室的研究员、Red Hat AI创新团队的首席研究科学家Giorgio Giannone表示。 该论文的其他作者包括:MIT机械工程研究生Anna Claire Doris、MIT博士后Amin Heyrani Nobari、Red Hat的Kai Xu;以及共同资深作者——IBM核心AI总监、MIT-IBM计算研究实验室首席研究员Akash Srivastava;还有MIT机械工程副教授、DeCoDE实验室负责人、MIT-IBM计算研究实验室首席研究员Faez Ahmed。这项研究近期在国际机器学习大会上发表。 “我们身边几乎每一件物理产品,从飞机到家电,最初都是以CAD模型的形式诞生的。工业界迫切希望AI能帮助加速这些设计的创建,但如今的模型往往只能生成简单的形状,不足以满足实际应用。让我兴奋的是,这项工作赋予了许多图像转CAD代码模型自我改进的能力——它们从自身错误中学习,而不是等待更多人工标注数据——这使可信赖的AI设计工具离日常工程应用更近了一步。”Ahmed说。 **模型感知数据** 研究人员正致力于构建用于CAD生成的视觉语言模型(VLM)。这些VLM接收2D图像和描述性文本,输出可在CAD软件中执行的Python代码,从而生成物理对象的3D模型。 他们研究了将现有VLM应用于此任务时面临的挑战,并确定限制其能力的主要瓶颈是缺乏多样、高质量的CAD数据集来对它们进行训练。 为了解决这一问题,他们尝试通过一种称为数据增强的方法,创建新数据来教导模型如何执行CAD生成。 在数据增强中,科学家通常通过随机调整现有数据(例如改变图像中物体的颜色、大小和形状)来生成更多样本。 而MIT研究人员构建了一个名为GIFT(几何推理反馈调优)的数据增强系统,该系统生成的数据旨在针对特定任务提升一个VLM的性能。 GIFT通过测试模型来了解其强项和弱项。然后,它利用这些知识生成数据,从而提升模型在它难以解决的CAD生成问题上的表现。 “我们希望获得由模型自身驱动的数据增强。”Giannone说。 **从错误中学习** 为此,GIFT要求模型多次并行生成解决同一CAD生成问题的代码。它通过检查这些猜测的正确性来了解模型解决该问题的能力。 “对于一个模型来说,生成接近正确的CAD查询代码并不难,但要生成完美正确且可执行的代码,对标准VLM来说则困难得多。”Giannone说。 对于接近正确的猜测,GIFT会将其调整为成功解决方案。它将这些“接近失败”的案例和成功解决方案保存到一个新数据集中,该数据集可以教导模型如何克服通常会难倒它的问题。 “如果我们对模型采样10次,它对同一个问题生成了10个正确解答,那么它就没什么可学的了。我们关心的是那些中间情况,即模型可能只有50%的概率解决问题。”他说。 利用这些中间情况,GIFT能够生成既感知模型又感知任务的数据增强。此外,通过将同一问题的多个正确解决方案纳入其中,新数据扩展了模型对CAD代码生成的整体知识。 这个自动化系统无需人工干预来修正模型的错误。 GIFT通过一种称为推理时扩展的过程,从预训练的VLM创建数据增强。该过程允许一个已经训练好的静态模型生成更好的输出,而无需重新训练整个模型带来的高计算成本。 使用推理时扩展,用户可以决定为GIFT分配多少计算资源,从而根据自身的时间和预算限制进行定制。 GIFT在性能上优于多种竞争技术,生成的CAD程序更精确,同时仅使用约20%的计算量。使用GIFT训练的VLM生成的CAD模型,与真实几何模型的形状对齐程度更高。 “通过GIFT,我们从几何入手,因为对于工程问题而言,如果3D形状的几何不正确,其他一切都不会正确,但还有许多其他方面需要考虑。”Giannone说。 未来,研究人员希望扩展GIFT,使其能够教导模型生成能够提升3D模型性能和可制造性的CAD程序。他们还希望将该系统应用于更大规模的模型和更多样化的CAD生成任务。 这项研究部分得到了MIT-IBM计算研究实验室的资助。

相似文章

预览工具帮助制作者可视化3D打印物件

MIT News — Artificial Intelligence

MIT研究人员开发了VisiPrint,一款由AI驱动的预览工具,帮助3D打印用户可视化打印物件的美学效果(颜色、纹理、光泽),从而减少浪费并提升设计准确性。

GenCAD

Hacker News Top

GenCAD 引入了一种图像条件模型,该模型利用 transformers 和扩散先验生成完整的参数化 CAD 命令历史,从而实现从图像中进行精确且可修改的 3D 建模。