VLM3: 视觉语言模型是原生的3D学习者
摘要
本文提出VLM3,一种通过简单的架构修改和基于文本的训练将视觉语言模型适配到3D理解任务的方法,无需复杂设计即可实现有竞争力的性能。该方法在深度估计精度上取得了显著提升,并支持多种3D任务,如像素对应、相机姿态估计和物体级理解。
查看缓存全文
缓存时间: 2026/06/01 03:18
论文页面 - VLM3: 视觉语言模型是天生的3D学习者
来源:https://huggingface.co/papers/2605.30561
摘要
通过简单的架构修改和基于文本的训练,视觉语言模型可以适配用于3D理解任务,其性能可与专用视觉模型媲美,而无需复杂的设计或大量的数据增强。
视觉语言模型(Vision Language Models,VLMs)(https://huggingface.co/papers?q=Vision%20Language%20Models)能够通过提示(prompting)实现统一的模型来解决各种视觉任务。它们在语义理解方面已展现出有前景的性能。然而,3D理解(https://huggingface.co/papers?q=3D%20understanding)仍然在很大程度上依赖于具有复杂任务特定设计的专家视觉模型。本文的核心论点是:VLMs是天生的3D学习者。我们深入的大规模研究表明:1)焦距统一(https://huggingface.co/papers?q=focal%20length%20unification),2)基于文本的像素参考(https://huggingface.co/papers?q=text-based%20pixel%20reference),以及3)数据混合(https://huggingface.co/papers?q=data%20mixture)与缩放(https://huggingface.co/papers?q=scaling),就是实现高效3D学习的全部所需。模型架构变更、大型模型、重度数据增强以及包括回归公式在内的复杂损失函数——这些构成了专家视觉模型基础的许多要素——实际上并非必要条件。因此,我们提出了VLM3,一种采用最简单设计的可扩展方法,使标准VLMs能够掌握多样化的3D任务。VLM3不仅将VLM深度估计(https://huggingface.co/papers?q=depth%20estimation)的准确性大幅提升(0.84 -> 0.9),还实现了多样的3D任务,如像素对应(https://huggingface.co/papers?q=pixel%20correspondence)、相机姿态估计(https://huggingface.co/papers?q=camera%20pose%20estimation)以及物体级3D理解(https://huggingface.co/papers?q=object-level%203D%20understanding),在保持标准架构和基于文本训练的同时,达到了专家视觉模型的准确度。我们相信VLM3为简单且可扩展的3D学习开辟了新的范式。
查看arXiv页面(https://arxiv.org/abs/2605.30561)查看PDF(https://arxiv.org/pdf/2605.30561)GitHub1(https://github.com/facebookresearch/VLM3)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30561)
在你的agent中获取这篇论文:
hf papers read 2605.30561
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.30561以链接到此页面。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.30561以链接到此页面。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.30561以链接到此页面。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中以链接到此页面。
相似文章
@tom_doerr: 使用掩码边界建模预训练自监督视觉Transformer骨干网络,用于密集空间感知。htt…
LingBot-Vision 是一系列用于密集空间感知的自监督视觉Transformer骨干网络,通过掩码边界建模来捕获语义和几何结构,适用于深度估计和分割等任务。
@percyliang: Marin 535B-A23B本周开始训练!一如既往,整个过程是开放的。航行计划:预训练(80%)+中训练…
Marin 535B-A23B AI模型的训练已开始,过程开放,涉及在GB200 NVL72硬件上使用18.75万亿tokens进行预训练和中训练,历时约3个月。
物理视觉-语言推理中的答案级信任选择
本文提出答案级信任选择(ATS),一种后处理的、与模型无关的框架,用于评估视觉-语言模型在定量物理推理任务中单个预测的可靠性。
DARS:基于结构化推理的指令图像编辑双层信用分配强化学习
DARS是一个用于指令图像编辑双层信用分配的强化学习框架,通过结构化推理和自适应课程在规划器与渲染器模块间动态路由更新,从而提升性能。
SafeBranch:基于分支对的具身智能体安全对齐
SafeBranch 是一个框架,通过使用来自不安全轨迹的分支对,使具身智能体对齐以安全行动,显著提高了交互任务中的安全性,而不牺牲任务成功率。