面向3D生成的原生紧凑结构潜变量

Papers with Code Trending 论文

摘要

本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。

近期3D生成建模的进展显著提升了生成的真实感,但现有表示方法在捕捉具有复杂拓扑和细致外观的资产时仍存在不足。本文提出了一种从原生3D数据中学习结构化潜表示的方法,以应对这一挑战。其核心是一种名为O-Voxel的新型稀疏体素结构,这是一种全能体素表示,同时编码几何与外观。O-Voxel能够稳健地建模任意拓扑,包括开放表面、非流形表面和完全封闭表面,同时捕获超越纹理颜色的全面表面属性,例如基于物理的渲染参数。基于O-Voxel,我们设计了一种稀疏压缩变分自编码器,该编码器具有高空间压缩率和紧凑的潜空间。我们利用多种公开3D资产数据集,训练了包含4B参数的大规模流匹配模型用于3D生成。尽管模型规模庞大,推理过程依然高效。同时,我们生成的资产在几何和材质质量上远超现有模型。我们相信,本方法为3D生成建模带来了重要突破。
查看原文
查看缓存全文

缓存时间: 2026/07/25 05:03

论文页 - 用于3D生成的天然紧凑结构化潜在表示

来源:https://huggingface.co/papers/2512.14692 发布于 2025年12月16日

作者:

,

,

,

,

,

,

,

,

,

摘要

一种名为 O-Voxel 的新型稀疏体素表示,能够实现高质量的3D生成建模,同时具备高效推理和稳健的拓扑处理能力。

近年来3D生成建模在生成逼真度上取得了显著进步,但该领域仍受现有表示方法的制约——这些方法难以捕捉具有复杂拓扑和细致外观的资产。本文提出了一种从原生3D数据中学习结构化潜在表示的方法来应对这一挑战。其核心是一种名为 O-Voxel 的新型稀疏体素结构,这是一种全能体素表示,同时编码了几何和外观信息。O-Voxel 能够稳健地建模任意拓扑,包括开放、非流形和全封闭表面,同时捕获超越纹理颜色的全面表面属性,例如基于物理的渲染参数。基于 O-Voxel,我们设计了一种稀疏压缩 VAE,可实现高空间压缩率和紧凑的潜在空间。我们利用多样化的公共3D资产数据集,训练了包含40亿参数的大规模流匹配模型用于3D生成。尽管模型规模庞大,推理过程仍保持高效。同时,我们生成资产的几何和材质质量远超现有模型。我们相信,这一方法为3D生成建模带来了重要进展。

查看 arXiv 页面 (https://arxiv.org/abs/2512.14692) 查看 PDF (https://arxiv.org/pdf/2512.14692) 项目页面 (https://microsoft.github.io/TRELLIS.2/) GitHub 8.92k (https://github.com/microsoft/TRELLIS.2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2512.14692)

在您的智能体中获取本论文:

hf papers read 2512.14692

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 37 个

microsoft/TRELLIS.2-4B 图像转3D • 更新于 2025年12月27日 • 156万 • 1.01k (https://huggingface.co/microsoft/TRELLIS.2-4B)

mancub/TRELLIS.2-4B 图像转3D • 更新于 2025年12月18日 • 17 • 1 (https://huggingface.co/mancub/TRELLIS.2-4B)

Jinstudio/TRELLIS.2-4B 图像转3D • 更新于 29天前 • 34 • 1 (https://huggingface.co/Jinstudio/TRELLIS.2-4B)

camenduru/TRELLIS.2-4B 图像转3D • 更新于 2025年12月17日 • 3.54万 (https://huggingface.co/camenduru/TRELLIS.2-4B)

浏览 37 个引用本文的模型 (https://huggingface.co/models?other=arxiv:2512.14692) ## 引用本文的数据集 1 个

serpentine-b/t2 更新于 2025年12月20日 • 17 (https://huggingface.co/datasets/serpentine-b/t2)

引用本文的 Spaces 164 个

浏览 164 个引用本文的 Spaces (https://huggingface.co/spaces?arxivIds=2512.14692) ## 包含本文的收藏 2 个

相似文章

LATO.2: 顶点与拓扑流分解的三维网格生成

Hugging Face Daily Papers

LATO.2是一个用于三维网格生成的分解式流匹配框架,它将生成过程分解为顶点流和基于顶点的连接流,实现了最先进的几何保真度和连接质量。

将3D生成模型用于自回归布局生成

Hugging Face Daily Papers

LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。

FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成

Hugging Face Daily Papers

FLUX3D引入了一个框架,通过利用扩散对齐的结构化潜变量和稀疏结构感知的扩散变压器来增强表示学习和跨模态对齐,实现高保真图像到3D高斯泼溅生成,取得了最先进的结果。

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。