MegaParts: 通过令牌高效的自回归建模扩展部件感知3D物体生成至300个部件
摘要
MegaParts 引入了一个可扩展的框架,用于部件感知3D物体生成,该框架使用令牌高效的向量量化令牌和自回归建模,使得能够生成具有多达300个部件的物体。
查看缓存全文
缓存时间: 2026/08/18 03:53
论文页面 - MegaParts:通过令牌高效的自回归建模将部件感知3D对象生成扩展到300个部件
来源:https://huggingface.co/papers/2608.14783 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
MegaParts 通过令牌高效的向量量化部件令牌和结合长上下文训练的结构化自回归序列建模,扩展了部件感知的3D生成能力。
部件感知的3D对象生成对于可控建模、编辑和关节动画等图形应用至关重要,在这些应用中,对象被表示为语义部件的连贯组合。然而,现有的部件感知生成(https://huggingface.co/papers?q=part-aware%20generation)方法在扩展到高度复杂的对象时效果不佳。随着部件数量的增加,生成详细的几何结构在令牌长度和内存方面变得极其昂贵。我们引入了MegaParts,一个可扩展的自回归3D生成(https://huggingface.co/papers?q=autoregressive%203D%20generation)框架,通过将结构化序列建模(https://huggingface.co/papers?q=structured%20sequence%20modeling)与令牌高效的向量量化形状分词器(https://huggingface.co/papers?q=vector-quantized%20shape%20tokenizer)相结合来解决这一挑战。我们的分词器通过在保证高保真重建的前提下最小化令牌使用,学习部件级几何结构的离散潜在表示(https://huggingface.co/papers?q=discrete%20latent%20representations),从而实现基于几何复杂度的自适应长度分词(https://huggingface.co/papers?q=adaptive-length%20tokenization)。在此紧凑表示的基础上,我们训练一个大型语言模型(https://huggingface.co/papers?q=large%20language%20model)在统一的结构化序列内生成对象边界框、部件边界框和部件形状令牌。结合高效的长上下文训练(https://huggingface.co/papers?q=long-context%20training)策略,我们令牌高效的公式化方法可以扩展到最多300个部件、序列长度高达256k令牌的对象。这极大地扩展了部件感知3D生成的规模,同时保留了组合结构(https://huggingface.co/papers?q=compositional%20structure)并支持精细的部件级控制(https://huggingface.co/papers?q=part-level%20control)。我们的方法在网格质量上优于基线自回归和扩散模型,表明压缩的离散部件令牌不仅提高了可扩展性,还提升了生成几何结构的保真度。这些结果表明,LLM原生的令牌高效的自回归建模是大规模部件感知3D生成中扩散模型的一个有力替代方案。项目主页:https://expmaster.github.io/megaparts_webpage\。
查看arXiv页面 (https://arxiv.org/abs/2608.14783) 查看PDF (https://arxiv.org/pdf/2608.14783) 项目主页 (https://expmaster.github.io/megaparts_webpage/) GitHub504 (https://github.com/InternRobotics/MeshCoder) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14783)
引用本文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。
引用本文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。
引用本文的Space0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.14783,以将其从本页面链接。
包含本文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以将其从本页面链接。
相似文章
我构建了一种新型AI工具;它能生成由各个组成部分构成的3D物体(而不是所有3D AI生成器所生成的单一实心块)。
一种新型AI工具通过生成代码来创建3D物体,从而得到具有独立功能部件的物体,而非单一实心块。该工具免费开源,托管于GitHub。
BrickAnything:基于几何条件的可构建砖块生成与结构感知标记化
BrickAnything是一种自回归框架,通过点云和结构感知树标记化,从多种3D表示中生成物理可构建的砖块结构,确保几何保真度和结构稳定性。
在几秒内生成参数化、可制造的3D模型
一种新工具能够在几秒内快速生成参数化、可制造的3D模型,简化设计和生产流程。
MeshWeaver: 稀疏体素引导的表面编织用于自回归网格生成
MeshWeaver 提出了一种自回归网格生成框架,它使用多级稀疏体素编码器直接预测顶点,为高多边形网格实现了最先进的压缩率和几何保真度。
我构建了一个工具,可以生成由独立逻辑部件组装的3D对象(例如,视频中生成的微波炉具有完整的内部组件和一扇可开关的门)
一款名为Nova3D的新型开源工具利用大语言模型(LLM)生成具有独立逻辑部件的3D对象(例如,带有内部组件和可开关门的微波炉),不同于传统的整体式AI生成器。它通过编写Blender Python代码,创建干净、模块化的GLB导出文件,适用于动画和编辑。