超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理

Hugging Face Daily Papers 论文

摘要

本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。

视觉语言模型(VLM)通常难以进行稳健的3D空间推理。现有方法依赖使用3D视觉问答(VQA)数据集进行微调,这可能导致过拟合数据集特定的偏差,而集成专门的3D视觉编码器往往不够灵活且繁琐。在本文中,我们认为真正的空间理解应源于学习基本的几何先验,而不仅仅是高层VQA监督。我们提出了GASP(几何感知空间先验),一个将这些先验直接注入LLM变压器层的框架。GASP采用一个小型对应头,作为跨所有层的深度监督信号,并使用双重目标进行训练,该目标利用来自大规模视频场景的真实几何数据:基于真实点对应的对比损失强制实现2D视图不变性,而深度一致性监督则解决3D几何歧义。我们的分析首先提供了一个诊断,表明标准VLM的内部对应匹配准确性非常低(通常低于5%)。然后我们证明,我们的训练显著改善了这种行为,将逐层对应峰值提高到超过70%,并保持超过85%的时间鲁棒性,而基线仍低于5%。这些内部改进转化为下游空间基准上的显著提升,包括在All-Angles Bench上提升18.2%,在VSI-Bench上提升29.0%,且所有这些提升均未使用任何3D VQA数据进行训练。我们的发现表明,学习基本几何先验是通往具有更可靠3D空间推理的VLM的一条有前景且可泛化的路径。
查看原文
查看缓存全文

缓存时间: 2026/05/29 02:59

论文页面 - 超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理

来源:https://huggingface.co/papers/2605.30231

摘要

用几何先验训练视觉语言模型,通过带对比损失和深度一致性的深度监督,能提升3D空间推理能力,其表现优于标准微调方法。

视觉语言模型 (https://huggingface.co/papers?q=Vision-Language%20Models) (VLMs) 通常难以进行稳健的3D空间推理 (https://huggingface.co/papers?q=3D%20spatial%20reasoning)。现有的方法要么依赖3D视觉问答 (https://huggingface.co/papers?q=3D%20visual%20question-answering) (VQA) 数据集进行微调 (https://huggingface.co/papers?q=fine-tuning),可能过拟合数据集特有的偏差;要么集成专门的3D视觉编码器,但往往不够灵活且笨重。本文认为,真正的空间理解应源于学习基本几何先验 (https://huggingface.co/papers?q=geometric%20priors),而非仅仅来自高层VQA监督。我们提出GASP (几何感知空间先验),一个将这些先验直接注入大语言模型Transformer层 (https://huggingface.co/papers?q=transformer%20layers) 的框架。GASP采用一个小型对应头 (https://huggingface.co/papers?q=correspondence%20head),作为深度监督 (https://huggingface.co/papers?q=deep%20supervision) 信号施加在所有层上,并使用双目标进行训练,该目标利用大规模视频场景的真实几何信息:对真实点对应关系施加对比损失 (https://huggingface.co/papers?q=contrastive%20loss) 以强制2D视角不变性,同时通过深度一致性 (https://huggingface.co/papers?q=depth%20consistency) 监督解决3D几何歧义。我们的分析首先通过诊断表明,标准VLM的内部对应匹配准确率非常低(通常低于5%)。然后我们证明,我们的训练显著改善了这一问题,将逐层对应峰值提升至70%以上,并保持了超过85%的时间鲁棒性,而基线方法仍低于5%。这些内部改进转化为下游空间基准上的显著提升,包括All-Angles Bench (https://huggingface.co/papers?q=All-Angles%20Bench) 上提升+18.2%,VSI-Bench (https://huggingface.co/papers?q=VSI-Bench) 上提升+29.0%,而且这一切都未使用任何3D VQA数据进行训练。我们的发现表明,从基本几何先验 (https://huggingface.co/papers?q=geometric%20priors) 中学习是通往更可靠3D空间推理 (https://huggingface.co/papers?q=3D%20spatial%20reasoning) 的VLM的一个有前景且可推广的途径。

查看arXiv页面 (https://arxiv.org/abs/2605.30231)查看PDF (https://arxiv.org/pdf/2605.30231)项目页面 (https://danielchyeh.github.io/GASP/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30231)

在您的Agent中获取此论文:

hf papers read 2605\.30231

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2605.30231即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。