面向3D生成的原生紧凑结构潜变量
摘要
本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。
查看缓存全文
缓存时间: 2026/07/25 05:03
论文页 - 用于3D生成的天然紧凑结构化潜在表示
来源:https://huggingface.co/papers/2512.14692 发布于 2025年12月16日
作者:
,
,
,
,
,
,
,
,
,
摘要
一种名为 O-Voxel 的新型稀疏体素表示,能够实现高质量的3D生成建模,同时具备高效推理和稳健的拓扑处理能力。
近年来3D生成建模在生成逼真度上取得了显著进步,但该领域仍受现有表示方法的制约——这些方法难以捕捉具有复杂拓扑和细致外观的资产。本文提出了一种从原生3D数据中学习结构化潜在表示的方法来应对这一挑战。其核心是一种名为 O-Voxel 的新型稀疏体素结构,这是一种全能体素表示,同时编码了几何和外观信息。O-Voxel 能够稳健地建模任意拓扑,包括开放、非流形和全封闭表面,同时捕获超越纹理颜色的全面表面属性,例如基于物理的渲染参数。基于 O-Voxel,我们设计了一种稀疏压缩 VAE,可实现高空间压缩率和紧凑的潜在空间。我们利用多样化的公共3D资产数据集,训练了包含40亿参数的大规模流匹配模型用于3D生成。尽管模型规模庞大,推理过程仍保持高效。同时,我们生成资产的几何和材质质量远超现有模型。我们相信,这一方法为3D生成建模带来了重要进展。
查看 arXiv 页面 (https://arxiv.org/abs/2512.14692) 查看 PDF (https://arxiv.org/pdf/2512.14692) 项目页面 (https://microsoft.github.io/TRELLIS.2/) GitHub 8.92k (https://github.com/microsoft/TRELLIS.2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.14692)
在您的智能体中获取本论文:
hf papers read 2512.14692
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 37 个
microsoft/TRELLIS.2-4B 图像转3D • 更新于 2025年12月27日 • 156万 • 1.01k (https://huggingface.co/microsoft/TRELLIS.2-4B)
mancub/TRELLIS.2-4B 图像转3D • 更新于 2025年12月18日 • 17 • 1 (https://huggingface.co/mancub/TRELLIS.2-4B)
Jinstudio/TRELLIS.2-4B 图像转3D • 更新于 29天前 • 34 • 1 (https://huggingface.co/Jinstudio/TRELLIS.2-4B)
camenduru/TRELLIS.2-4B 图像转3D • 更新于 2025年12月17日 • 3.54万 (https://huggingface.co/camenduru/TRELLIS.2-4B)
浏览 37 个引用本文的模型 (https://huggingface.co/models?other=arxiv:2512.14692) ## 引用本文的数据集 1 个
serpentine-b/t2 更新于 2025年12月20日 • 17 (https://huggingface.co/datasets/serpentine-b/t2)
引用本文的 Spaces 164 个
浏览 164 个引用本文的 Spaces (https://huggingface.co/spaces?arxivIds=2512.14692) ## 包含本文的收藏 2 个
相似文章
LATO.2: 顶点与拓扑流分解的三维网格生成
LATO.2是一个用于三维网格生成的分解式流匹配框架,它将生成过程分解为顶点流和基于顶点的连接流,实现了最先进的几何保真度和连接质量。
将3D生成模型用于自回归布局生成
LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。
FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成
FLUX3D引入了一个框架,通过利用扩散对齐的结构化潜变量和稀疏结构感知的扩散变压器来增强表示学习和跨模态对齐,实现高保真图像到3D高斯泼溅生成,取得了最先进的结果。
MeshWeaver: 稀疏体素引导的表面编织用于自回归网格生成
MeshWeaver 提出了一种自回归网格生成框架,它使用多级稀疏体素编码器直接预测顶点,为高多边形网格实现了最先进的压缩率和几何保真度。
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。