GAE:学习用于3D一致世界生成的几何原生潜空间
摘要
本文介绍了GAE,一种几何原生的自动编码器,它创建了一个紧凑的潜空间,用于生成3D一致的场景,相比现有方法,提升了视觉质量和一致性。
查看缓存全文
缓存时间: 2026/09/23 03:30
论文页面 - GAE:面向3D一致性世界生成的几何原生潜空间学习
来源:https://huggingface.co/papers/2609.24981
摘要
我们提出一种紧凑的几何原生潜空间,作为感知与生成的共享基础。现有视觉生成模型可以生成逼真图像帧,但无法保持一致的3D场景。我们认为这不仅是建模问题,也是表征问题:生成模型通常演化以外观为中心的潜变量,而感知模型则在富含语义、编码跨视图结构的空间中恢复几何信息。我们并未将几何作为另一个输出端,而是将几何基础模型的特征重新参数化,转化为一个用于生成的紧凑潜空间。我们通过几何原生自编码器(GAE)实现了这一转变,其潜变量可联合解码为外观、深度、相机参数和点图。基于这种状态,标准的条件流模型可支持多样化的生成任务。在控制生成器与训练协议不变的对比实验中,将潜空间替换为GAE后,视觉质量与独立测量的3D一致性均得到提升:在RealEstate10K和DL3DV数据集上,FVD指标分别下降12.7%和23.1%,相机轨迹误差在RealEstate10K上减半。这些结果共同表明,潜空间对于几何一致性生成至关重要,并可作为感知与生成之间的共享接口。
查看arXiv页面 (https://arxiv.org/abs/2609.24981)
查看PDF (https://arxiv.org/pdf/2609.24981)
项目主页 (https://jiah-cloud.github.io/GAE.github.io/)
GitHub仓库 (https://github.com/TencentARC/GAE-GeometricAutoEncoder)
添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24981)
获取本文至您的代理:
hf papers read 2609.24981
尚未安装最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无关联模型
在模型README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。
引用本文的数据集0
暂无关联数据集
在数据集README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。
引用本文的Spaces0
暂无关联Space
在Space README.md中引用arxiv.org/abs/2609.24981,即可从本页链接。
包含本文的收藏夹1
相似文章
CGGS: 一致性增强的几何高斯泼溅用于第一人称3D场景生成
CGGS是一个文本到3D的框架,通过使用一致性增强损失、布局装饰和基于熵的深度损失的几何细化等多阶段方法,提高了第一人称3D场景生成中的几何一致性和质量。
复杂域中偏微分方程的几何感知潜变量自回归生成模型
本文提出了GeoLAMP,一种几何感知的潜变量自回归生成模型,用于在复杂几何结构中求解多物理场偏微分方程,采用双编码器架构和因果自注意力变换器结合流匹配,以实现稳定且可扩展的预测。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
@zhiwen_fan_: DUSt3R 团队的论文
DUSt3R 团队的一篇论文提出了用于多视图图像 3D 场景生成的稀疏自回归建模方法,使用了体素对齐的 3D 潜空间与占用感知的掩码自回归 Transformer。
AeroJEPA:学习用于可扩展3D气动场建模的语义潜在表示
本文介绍了AeroJEPA,一种用于可扩展3D气动场建模的联合嵌入预测架构。它通过预测流场的语义潜在表示,解决了当前代理模型在可扩展性和设计实用性方面的局限性,从而实现了高效的高保真分析和设计优化。