标签
LingBot-Vision 是一系列用于密集空间感知的自监督视觉Transformer骨干网络,通过掩码边界建模来捕获语义和几何结构,适用于深度估计和分割等任务。
LingBot Vision 是蚂蚁集团推出的一种自监督视觉骨干网络家族,它采用掩码边界建模方法,在密集空间感知任务上取得了领先性能,在 NYU-Depth v2 基准上超越了更大的 DINOv3 模型。