GS-Voxel:无需拟合的大规模3DGS生成结构化潜变量

Hugging Face Daily Papers 论文

摘要

GS-Voxel引入了一个无需拟合的框架,将3D Gaussian Splatting重建转换为结构化潜变量,通过流模型和分块推理实现大规模空中3D场景的可扩展生成。

许多可扩展的潜变量3D生成器操作于结构化张量上,而预优化的3D Gaussian Splatting (3DGS) 重建是无序的、空间不规则的,且基元数量差异很大。我们提出了GS-Voxel,一个无需拟合的结构化潜变量框架,并评估其在大规模空中3D Gaussian场景生成中的应用。GS-Voxel无需额外的每场景优化,将兼容的预优化3DGS重建确定性转换为稀疏活跃体素,保留所选基元的子体素位置和渲染属性。然后,一个GS特定的分解式变分自编码器分别将体素几何和局部Gaussian属性编码为稀疏3D潜变量,其大小随占用体素的数量增长,而不是受限于固定的全场景基元数量。我们在GS-Voxel潜变量空间中训练图像条件流模型来生成空中3DGS场景。GS-Voxel的一个关键应用是大面积场景生成:感知重叠的分块推理扩展了基于卫星视图图像的合成,超越了单个训练裁剪区域。我们的结果表明,GS-Voxel为预优化的空中3DGS重建提供了结构化潜变量,其潜变量容量随占用体素的数量增长。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:57

论文页面 - GS-Voxel:适用于大规模3DGS生成的免拟合结构化潜变量

来源:https://huggingface.co/papers/2608.17988

摘要

GS-Voxel 将非结构化的3D高斯重建转换为稀疏结构化潜变量,从而支持通过流模型实现可扩展的航拍场景生成。

许多可扩展的潜变量3D生成器基于结构化张量运行,而经过预优化的3D高斯溅射 (3DGS) 重建则是无序、空间不规则且基元数量差异很大的。我们提出了GS-Voxel,一个免拟合的结构化潜变量框架,并评估其在大规模航拍3D高斯场景生成中的应用。GS-Voxel 能确定性地将兼容的预优化3DGS重建转换为稀疏活跃体素,无需额外的场景级优化,同时保留所选基元的亚体素位置和渲染属性。一个针对高斯特化分解的变分自编码器(VAE)随后将体素几何结构和局部高斯属性分别编码为稀疏3D潜变量,其大小随占用体素数量增长,而非受限于固定的全局场景基元数量。我们在GS-Voxel 潜变量空间中训练了图像条件流模型,以生成航拍3DGS场景。GS-Voxel 支持的一个关键应用是大面积场景生成:重叠感知的分块推理可以将合成范围扩展到基于卫星视角图像的单个训练区域之外。我们的结果表明,GS-Voxel 为预优化的航拍3DGS重建提供了结构化潜变量,其容量随占用体素数量增长。

查看arXiv页面 (https://arxiv.org/abs/2608.17988)查看PDF (https://arxiv.org/pdf/2608.17988)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.17988)

在您的代理中获取此论文:

hf papers read 2608\.17988

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.17988以从本页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.17988以从本页面链接它。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.17988以从本页面链接它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接它。

相似文章

面向3D生成的原生紧凑结构潜变量

Papers with Code Trending

本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。

GlobalSplat: 通过全局场景标记实现高效的前馈式三维高斯散射

Hugging Face Daily Papers

GlobalSplat 引入了一种高效的前馈框架,用于三维高斯散射,通过全局场景标记实现紧凑且一致的场景重建,将计算开销和推理时间降低至78毫秒以下。该方法采用从粗到细的训练策略,防止表示膨胀,同时以显著更少的高斯原语(16K)达到有竞争力的新视角合成性能,与密集基线相比更为高效。