标签
SPARGen引入了一个统一的多模态框架,将3D重建、稠密对应和空间推理视为指令条件生成任务,从而实现共享空间表示。
本文提出了一种名为掩码边界建模(masked boundary modeling)的自监督视觉预训练范式,该范式通过学习亚像素边界表示来提升密集空间感知能力。由此得到的模型LingBot-Vision在深度估计及其他下游任务中展现出显著改进,证明边界建模是一种可扩展的预训练原则,可用于学习空间结构化的视觉表示。