GAE:学习用于3D一致世界生成的几何原生潜空间

Hugging Face Daily Papers 论文

摘要

本文介绍了GAE,一种几何原生的自动编码器,它创建了一个紧凑的潜空间,用于生成3D一致的场景,相比现有方法,提升了视觉质量和一致性。

我们提出一个紧凑的几何原生潜空间,作为感知和生成的共享基础。视觉生成器可以生成逼真的帧,而无需保持一致的3D场景。我们认为这不仅是一个建模问题,也是一个表示问题:生成器通常演化出以外观为中心的潜变量,而感知模型在一个编码跨视图结构的语义丰富空间中恢复几何。我们不是将几何作为另一个输出添加,而是将几何基础模型的特征重新参数化为一个紧凑的潜空间用于生成。我们通过几何原生自动编码器(GAE)实现了这一转变,其潜变量可以联合解码为外观、深度、相机和点云图。有了这种状态,标准条件流支持多样化的生成任务。在固定生成器和训练协议的受控比较中,用GAE替换潜变量提高了视觉质量和独立测量的3D一致性:在RealEstate10K和DL3DV上,FVD分别下降了12.7%和23.1%,并且在RealEstate10K上,相机轨迹误差减半。总的来说,这些结果表明,潜空间对于几何一致生成至关重要,并且可以作为感知和生成之间的共享接口。
查看原文
查看缓存全文

缓存时间: 2026/09/23 03:30

论文页面 - GAE:面向3D一致性世界生成的几何原生潜空间学习

来源:https://huggingface.co/papers/2609.24981

摘要

我们提出一种紧凑的几何原生潜空间,作为感知与生成的共享基础。现有视觉生成模型可以生成逼真图像帧,但无法保持一致的3D场景。我们认为这不仅是建模问题,也是表征问题:生成模型通常演化以外观为中心的潜变量,而感知模型则在富含语义、编码跨视图结构的空间中恢复几何信息。我们并未将几何作为另一个输出端,而是将几何基础模型的特征重新参数化,转化为一个用于生成的紧凑潜空间。我们通过几何原生自编码器(GAE)实现了这一转变,其潜变量可联合解码为外观、深度、相机参数和点图。基于这种状态,标准的条件流模型可支持多样化的生成任务。在控制生成器与训练协议不变的对比实验中,将潜空间替换为GAE后,视觉质量与独立测量的3D一致性均得到提升:在RealEstate10K和DL3DV数据集上,FVD指标分别下降12.7%和23.1%,相机轨迹误差在RealEstate10K上减半。这些结果共同表明,潜空间对于几何一致性生成至关重要,并可作为感知与生成之间的共享接口。

查看arXiv页面 (https://arxiv.org/abs/2609.24981)
查看PDF (https://arxiv.org/pdf/2609.24981)
项目主页 (https://jiah-cloud.github.io/GAE.github.io/)
GitHub仓库 (https://github.com/TencentARC/GAE-GeometricAutoEncoder)
添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24981)

获取本文至您的代理:

hf papers read 2609.24981

尚未安装最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无关联模型

在模型README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。

引用本文的数据集0

暂无关联数据集

在数据集README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。

引用本文的Spaces0

暂无关联Space

在Space README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。

包含本文的收藏夹1

相似文章

@zhiwen_fan_: DUSt3R 团队的论文

X AI KOLs Timeline

DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。

AeroJEPA:学习用于可扩展3D气动场建模的语义潜在表示

arXiv cs.LG

本文介绍了AeroJEPA,一种用于可扩展3D气动场建模的联合嵌入预测架构。它通过预测流场的语义潜在表示,解决了当前代理模型在可扩展性和设计实用性方面的局限性,从而实现了高效的高保真分析和设计优化。