@tom_doerr: 使用掩码边界建模预训练自监督视觉Transformer骨干网络,用于密集空间感知。htt…

X AI KOLs Timeline 模型

摘要

LingBot-Vision 是一系列用于密集空间感知的自监督视觉Transformer骨干网络,通过掩码边界建模来捕获语义和几何结构,适用于深度估计和分割等任务。

使用掩码边界建模预训练自监督视觉Transformer骨干网络,用于密集空间感知。 https://t.co/MjJJbzqZz8 https://t.co/ADsMqpObAo
查看原文
查看缓存全文

缓存时间: 2026/08/24 01:44

LingBot-Vision:面向密集空间感知的视觉预训练

相似文章

面向密集空间感知的视觉预训练

Hugging Face Daily Papers

本文提出了一种名为掩码边界建模(masked boundary modeling)的自监督视觉预训练范式,该范式通过学习亚像素边界表示来提升密集空间感知能力。由此得到的模型LingBot-Vision在深度估计及其他下游任务中展现出显著改进,证明边界建模是一种可扩展的预训练原则,可用于学习空间结构化的视觉表示。