TerraDiT-Ω: 任意地理空间基元的卫星图像合成统一空间控制框架

Hugging Face Daily Papers 论文

摘要

TerraDiT-Ω 是一个用于卫星图像合成的统一空间控制框架,接受任意原生地理空间基元,并使用几何感知局部注意力,在多个下游任务中优于先前的密集和稀疏控制方法。

生成模型取得了显著进展,但将其应用于卫星图像仍面临挑战。与自然图像不同,卫星场景由空间复杂且语义不同的几何结构构成。先前的工作通过采用密集栅格或稀疏提示来适配自然图像框架,在注释成本与保真度之间做出权衡,同时破坏了与常用于表示地理信息的矢量基元的兼容性。我们提出了 TerraDiT-Ω,这是一个统一的空间控制框架,可直接从任意原生地理空间基元生成卫星图像。通过联合利用精确注释(多边形、折线)和粗略注释(边界框、点),该模型支持在不同注释预算下的可控布局,从而拓宽了其在城市规划等设计任务中的适用性,同时自然兼容端到端的 GeoAI 工作流。为了在生成过程中有效利用这些基元,我们提出了几何感知局部注意力,这是一种将显式几何线索注入注意力空间的调节机制。在所有调节格式下,我们的方法均持续优于密集控制和稀疏控制基线。此外,这种灵活性使得使用单一生成模型进行可控的合成数据增强成为可能,从而提升了在下游任务上的性能,包括土地覆盖分割、目标检测、道路图提取和场景分类。代码、数据和权重可在 https://github.com/mvrl/TerraDiT 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/01 07:41

论文页面 - TerraDiT-Ω:基于任意地理空间基元的卫星图像合成统一空间控制

来源:https://huggingface.co/papers/2606.31029

摘要

TerraDiT-Ω 利用几何感知局部注意力机制,从原生地理空间基元生成卫星图像,实现了灵活的条件控制,并改进了下游地理空间任务。

生成模型(https://huggingface.co/papers?q=Generative%20models)已取得显著进展,但其在卫星图像(https://huggingface.co/papers?q=satellite%20imagery)上的应用仍具挑战性。与自然图像不同,卫星场景由空间复杂且语义各异的几何结构组成。此前的工作通过采用密集栅格或稀疏提示来适配自然图像框架,以应对这种复杂性,但这种方式在权衡标注成本与保真度的同时,打破了与地理信息表示中常用的向量基元的兼容性。我们提出了 TerraDiT-Ω,这是一个统一的空间控制框架,可直接从任意原生地理空间基元生成卫星图像(https://huggingface.co/papers?q=satellite%20imagery)。通过联合利用精确标注(多边形、折线)和粗略标注(边界框、点),该模型在不同标注预算下支持可控布局(https://huggingface.co/papers?q=controllable%20layouts),从而拓展了在城市规划等设计任务中的适用性,同时天然兼容端到端的GeoAI工作流。为在生成过程中有效利用这些基元,我们提出了几何感知局部注意力(https://huggingface.co/papers?q=Geometry-Aware%20Local%20Attention)机制,这是一种将显式几何线索注入注意力空间的条件控制机制。在所有条件格式下,我们的方法均持续优于密集控制和稀疏控制基线。此外,这种灵活性使得仅用单一生成模型即可实现可控的合成数据增强,从而提升下游任务性能,包括土地覆盖分割(https://huggingface.co/papers?q=land-cover%20segmentation)、目标检测(https://huggingface.co/papers?q=object%20detection)、道路图提取(https://huggingface.co/papers?q=road%20graph%20extraction)和场景分类(https://huggingface.co/papers?q=scene%20classification)。代码、数据和权重可在 https://github.com/mvrl/TerraDiT 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2606.31029)查看 PDF (https://arxiv.org/pdf/2606.31029)项目页面 (https://brian-j-wei.github.io/terradit-omega)GitHub1 (https://github.com/mvrl/TerraDiT)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2606.31029)

在您的智能体中获取本文:

hf papers read 2606.31029

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无关联本文的模型

在模型的README.md中引用arxiv.org/abs/2606.31029,即可从本页链接到该模型。

引用本文的数据集0

暂无关联本文的数据集

在数据集的README.md中引用arxiv.org/abs/2606.31029,即可从本页链接到该数据集。

引用本文的Space0

暂无关联本文的Space

在Space的README.md中引用arxiv.org/abs/2606.31029,即可从本页链接到该Space。

包含本文的收藏集0

暂无包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection),即可从本页链接到该收藏集。

相似文章

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。

Sat3DGen:基于单张卫星图像的全面街景级3D场景生成

Hugging Face Daily Papers

Sat3DGen采用几何优先的方法,从单张卫星图像生成街景级3D场景,通过新颖的约束条件和训练策略,提高了几何精度和照片级真实感。该方法在VIGOR-OOD基准测试上相比先前工作有显著改进。

UniT:基于分组自回归Transformer的统一几何学习

Hugging Face Daily Papers

UniT是一种统一的几何感知前馈模型,采用分组自回归Transformer,集成了多种范式(在线/离线、多模态、长时域),同时通过自适应尺度损失和队列式KV缓存保持度量尺度精度。它在涵盖七个任务的十个基准上取得了最先进性能。