Sat3DGen:基于单张卫星图像的全面街景级3D场景生成
摘要
Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。
查看缓存全文
缓存时间: 2026/05/15 16:26
论文页面 - Sat3DGen:从单张卫星图像生成全面的街道级3D场景
来源:https://huggingface.co/papers/2605.14984
摘要
Sat3DGen 解决了从卫星图像生成街道级3D场景的挑战,采用几何优先的方法,通过新颖的约束和训练策略,提高了几何精度和照片真实感。
从单个卫星图像生成街道级3D场景是一项至关重要但极具挑战性的任务。当前方法存在明显的权衡:几何着色模型实现了高几何保真度,但通常专注于建筑,缺乏语义多样性。相比之下,基于代理的模型使用前馈式图像到3D框架(https://huggingface.co/papers?q=feed-forward%20image-to-3D%20frameworks)通过联合学习几何和纹理来生成整体场景,这一过程产出了丰富的内容,但几何形状粗糙且不稳定。我们将这些几何失败归因于卫星到街道数据中固有的极端视角差异和稀疏、不一致的监督。我们引入 Sat3DGen 来应对这些根本性挑战,它体现了几何优先的方法论(https://huggingface.co/papers?q=geometry-first%20methodology)。该方法通过整合新颖的几何约束(https://huggingface.co/papers?q=geometric%20constraints)和透视视角训练策略(https://huggingface.co/papers?q=perspective-view%20training%20strategy),显式地对抗几何误差的主要来源,从而增强了前馈式范例。这种以几何为中心的策略在3D精度和照片真实感方面带来了显著提升。为了验证,我们首先通过将 VIGOR-OOD(https://huggingface.co/papers?q=VIGOR-OOD)测试集与高分辨率 DSM(https://huggingface.co/papers?q=high-resolution%20DSM)数据配对,构建了一个新的基准。在此基准上,我们的方法将几何RMSE从6.76米降至5.20米。至关重要的是,这一几何跃升也提升了照片真实感,将 Fréchet Inception Distance(https://huggingface.co/papers?q=Fr%C3%A9chet%20Inception%20Distance)(FID)从40降至19(相对于领先方法 Sat2Density++),尽管没有使用额外的定制图像质量模块。我们通过多种下游应用展示高质量3D资产的通用性,包括语义图到3D合成、多相机视频生成、大规模网格化以及无监督单图像数字表面模型(https://huggingface.co/papers?q=Digital%20Surface%20Model)(DSM(https://huggingface.co/papers?q=DSM))估计。代码已在 https://github.com/qianmingduowan/Sat3DGen 发布。
查看 arXiv 页面(https://arxiv.org/abs/2605.14984)查看 PDF(https://arxiv.org/pdf/2605.14984)项目页面(https://qianmingduowan.github.io/Sat3DGen_project_page/)GitHub28(https://github.com/qianmingduowan/Sat3DGen)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.14984)
在你的 agent 中获取本论文:
hf papers read 2605.14984
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型1
qian43/Sat3DGen 图像到3D• 更新于约1小时前 • 44 • 2 (https://huggingface.co/qian43/Sat3DGen)
引用本论文的数据集1
qian43/VIGOR_SAT3DGEN_add_skymask_DSM_satdepth 查看器• 更新于约1小时前 • 89.9k • 51 • 2 (https://huggingface.co/datasets/qian43/VIGOR_SAT3DGEN_add_skymask_DSM_satdepth)
引用本论文的 Spaces1
包含本论文的收藏0
没有包含本论文的收藏
将本论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
@vincieye: 从几张照片生成完整的3D场景通常意味着凭空想象盲点或内存爆炸。SPAR3S s…
SPAR3S是一种稀疏自回归生成模型,能高效地从稀疏多视角图像生成完整的3D场景,无需3D真值数据,使用体素对齐的潜在空间和可微分的3D Gaussian Splatting。
SceneFrom3D:基于几何条件的户外3D场景生成——视图调度与对象级控制
SceneFrom3D 是一个框架,能够从输入几何数据中自动调度视图,生成高质量的户外3D场景,并实现对外观和几何一致性的对象级控制。
@svpino: 这个世界生成模型太不可思议了。我上传了一张图片(左边的那张),它就创建了一个完整的3…
一位用户展示了Hyper3D WorldGen,这是一个AI模型,能从单张图片生成完整、可编辑的3D场景,突出其令人印象深刻的功能。
ABot-Earth 0.5:生成式3D地球模型
ABot-Earth 0.5 是一个生成式3D框架,它利用3D高斯泼溅(3D Gaussian Splatting)从卫星图像合成逼真的3D城市环境,实现实时可视化和低成本的闭环无人机导航。
CGGS: 一致性增强的几何高斯泼溅用于第一人称3D场景生成
CGGS是一个文本到3D的框架,通过使用一致性增强损失、布局装饰和基于熵的深度损失的几何细化等多阶段方法,提高了第一人称3D场景生成中的几何一致性和质量。