超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
摘要
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
查看缓存全文
缓存时间: 2026/05/29 02:59
论文页面 - 超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
来源:https://huggingface.co/papers/2605.30231
摘要
用几何先验训练视觉语言模型,通过带对比损失和深度一致性的深度监督,能提升3D空间推理能力,其表现优于标准微调方法。
视觉语言模型 (https://huggingface.co/papers?q=Vision-Language%20Models) (VLMs) 通常难以进行稳健的3D空间推理 (https://huggingface.co/papers?q=3D%20spatial%20reasoning)。现有的方法要么依赖3D视觉问答 (https://huggingface.co/papers?q=3D%20visual%20question-answering) (VQA) 数据集进行微调 (https://huggingface.co/papers?q=fine-tuning),可能过拟合数据集特有的偏差;要么集成专门的3D视觉编码器,但往往不够灵活且笨重。本文认为,真正的空间理解应源于学习基本几何先验 (https://huggingface.co/papers?q=geometric%20priors),而非仅仅来自高层VQA监督。我们提出GASP (几何感知空间先验),一个将这些先验直接注入大语言模型Transformer层 (https://huggingface.co/papers?q=transformer%20layers) 的框架。GASP采用一个小型对应头 (https://huggingface.co/papers?q=correspondence%20head),作为深度监督 (https://huggingface.co/papers?q=deep%20supervision) 信号施加在所有层上,并使用双目标进行训练,该目标利用大规模视频场景的真实几何信息:对真实点对应关系施加对比损失 (https://huggingface.co/papers?q=contrastive%20loss) 以强制2D视角不变性,同时通过深度一致性 (https://huggingface.co/papers?q=depth%20consistency) 监督解决3D几何歧义。我们的分析首先通过诊断表明,标准VLM的内部对应匹配准确率非常低(通常低于5%)。然后我们证明,我们的训练显著改善了这一问题,将逐层对应峰值提升至70%以上,并保持了超过85%的时间鲁棒性,而基线方法仍低于5%。这些内部改进转化为下游空间基准上的显著提升,包括All-Angles Bench (https://huggingface.co/papers?q=All-Angles%20Bench) 上提升+18.2%,VSI-Bench (https://huggingface.co/papers?q=VSI-Bench) 上提升+29.0%,而且这一切都未使用任何3D VQA数据进行训练。我们的发现表明,从基本几何先验 (https://huggingface.co/papers?q=geometric%20priors) 中学习是通往更可靠3D空间推理 (https://huggingface.co/papers?q=3D%20spatial%20reasoning) 的VLM的一个有前景且可推广的途径。
查看arXiv页面 (https://arxiv.org/abs/2605.30231)查看PDF (https://arxiv.org/pdf/2605.30231)项目页面 (https://danielchyeh.github.io/GASP/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30231)
在您的Agent中获取此论文:
hf papers read 2605\.30231
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型
介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。