@tom_doerr: 使用掩码边界建模预训练自监督视觉Transformer骨干网络,用于密集空间感知。htt…
摘要
LingBot-Vision 是一系列用于密集空间感知的自监督视觉Transformer骨干网络,通过掩码边界建模来捕获语义和几何结构,适用于深度估计和分割等任务。
使用掩码边界建模预训练自监督视觉Transformer骨干网络,用于密集空间感知。
https://t.co/MjJJbzqZz8 https://t.co/ADsMqpObAo
查看缓存全文
缓存时间: 2026/08/24 01:44
LingBot-Vision:面向密集空间感知的视觉预训练
相似文章
面向密集空间感知的视觉预训练
本文提出了一种名为掩码边界建模(masked boundary modeling)的自监督视觉预训练范式,该范式通过学习亚像素边界表示来提升密集空间感知能力。由此得到的模型LingBot-Vision在深度估计及其他下游任务中展现出显著改进,证明边界建模是一种可扩展的预训练原则,可用于学习空间结构化的视觉表示。
@AdinaYakup: LingBot Vision 来自蚂蚁集团的一种用于密集空间感知的自监督视觉骨干网络家族 @robbyant_brain - A…
LingBot Vision 是蚂蚁集团推出的一种自监督视觉骨干网络家族,它采用掩码边界建模方法,在密集空间感知任务上取得了领先性能,在 NYU-Depth v2 基准上超越了更大的 DINOv3 模型。
LingBot-Vision: 基于掩码边界建模的自监督预训练 (在1.1B参数下NYUv2线性探测RMSE为0.296,对比DINOv3-7B的0.309,在ImageNet上稍逊一筹);提供四种尺寸的权重[R]
LingBot-Vision引入了掩码边界建模用于自监督预训练,在1.1B参数下NYUv2线性探测上达到0.296 RMSE,而DINOv3-7B为0.309,虽然在ImageNet上表现稍逊;已发布四种尺寸的权重。
@rohanpaul_ai:一个仅1B参数的视觉模型在深度估计上击败了7B模型,且是冻结状态、单线性层、零微调。@robbyant_brain…
Robbyant发布了LingBot-Vision,一个基于边界训练的1B参数视觉模型,在深度估计上优于DINOv3-7B,且权重开放。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。