MegaParts: 通过令牌高效的自回归建模扩展部件感知3D物体生成至300个部件

Hugging Face Daily Papers 论文

摘要

MegaParts 引入了一个可扩展的框架,用于部件感知3D物体生成,该框架使用令牌高效的向量量化令牌和自回归建模,使得能够生成具有多达300个部件的物体。

部件感知3D物体生成对于图形应用至关重要,例如可控建模、编辑和关节运动,其中物体被表示为语义部件的连贯组合。然而,现有的部件感知生成方法无法很好地扩展到高度复杂的物体。随着部件数量的增加,生成详细几何形状在令牌长度和内存方面变得极其昂贵。我们引入MegaParts,一个可扩展的自回归3D生成框架,通过结合结构化序列建模与令牌高效的向量化形状分词器来解决这一挑战。我们的分词器通过最小化令牌使用量并确保高保真重建来学习部件级别几何的离散潜在表示,实现基于几何复杂度的自适应长度分词。在这一紧凑表示之上,我们训练一个大型语言模型在统一的结构化序列中生成物体边界框、部件边界框和部件形状令牌。结合高效的长上下文训练策略,我们的令牌高效公式可扩展到具有多达300个部件和长达256k令牌序列长度的物体。这大幅扩展了部件感知3D生成的规模,同时保留了组合结构并实现了细粒度的部件级别控制。我们的方法比基线自回归和扩散模型实现了更高的网格质量,表明压缩的离散部件令牌不仅提高了可扩展性,还提高了生成几何的可达到保真度。这些结果表明,LLM原生令牌高效自回归建模是大规模部件感知3D生成中扩散模型的一个有吸引力的替代方案。项目页面可在 https://expmaster.github.io/megaparts_webpage 访问。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:53

论文页面 - MegaParts:通过令牌高效的自回归建模将部件感知3D对象生成扩展到300个部件

来源:https://huggingface.co/papers/2608.14783 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

MegaParts 通过令牌高效的向量量化部件令牌和结合长上下文训练的结构化自回归序列建模,扩展了部件感知的3D生成能力。

部件感知的3D对象生成对于可控建模、编辑和关节动画等图形应用至关重要,在这些应用中,对象被表示为语义部件的连贯组合。然而,现有的部件感知生成(https://huggingface.co/papers?q=part-aware%20generation)方法在扩展到高度复杂的对象时效果不佳。随着部件数量的增加,生成详细的几何结构在令牌长度和内存方面变得极其昂贵。我们引入了MegaParts,一个可扩展的自回归3D生成(https://huggingface.co/papers?q=autoregressive%203D%20generation)框架,通过将结构化序列建模(https://huggingface.co/papers?q=structured%20sequence%20modeling)与令牌高效的向量量化形状分词器(https://huggingface.co/papers?q=vector-quantized%20shape%20tokenizer)相结合来解决这一挑战。我们的分词器通过在保证高保真重建的前提下最小化令牌使用,学习部件级几何结构的离散潜在表示(https://huggingface.co/papers?q=discrete%20latent%20representations),从而实现基于几何复杂度的自适应长度分词(https://huggingface.co/papers?q=adaptive-length%20tokenization)。在此紧凑表示的基础上,我们训练一个大型语言模型(https://huggingface.co/papers?q=large%20language%20model)在统一的结构化序列内生成对象边界框、部件边界框和部件形状令牌。结合高效的长上下文训练(https://huggingface.co/papers?q=long-context%20training)策略,我们令牌高效的公式化方法可以扩展到最多300个部件、序列长度高达256k令牌的对象。这极大地扩展了部件感知3D生成的规模,同时保留了组合结构(https://huggingface.co/papers?q=compositional%20structure)并支持精细的部件级控制(https://huggingface.co/papers?q=part-level%20control)。我们的方法在网格质量上优于基线自回归和扩散模型,表明压缩的离散部件令牌不仅提高了可扩展性,还提升了生成几何结构的保真度。这些结果表明,LLM原生的令牌高效的自回归建模是大规模部件感知3D生成中扩散模型的一个有力替代方案。项目主页:https://expmaster.github.io/megaparts_webpage\。

查看arXiv页面 (https://arxiv.org/abs/2608.14783) 查看PDF (https://arxiv.org/pdf/2608.14783) 项目主页 (https://expmaster.github.io/megaparts_webpage/) GitHub504 (https://github.com/InternRobotics/MeshCoder) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14783)

引用本文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。

引用本文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。

引用本文的Space0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。

包含本文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其从本页面链接。

相似文章

我构建了一个工具,可以生成由独立逻辑部件组装的3D对象(例如,视频中生成的微波炉具有完整的内部组件和一扇可开关的门)

Reddit r/artificial

一款名为Nova3D的新型开源工具利用大语言模型(LLM)生成具有独立逻辑部件的3D对象(例如,带有内部组件和可开关门的微波炉),不同于传统的整体式AI生成器。它通过编写Blender Python代码,创建干净、模块化的GLB导出文件,适用于动画和编辑。