为什么远处看起来在上方:探究视觉-语言模型中的空间表征
摘要
探究视觉-语言模型中的空间表征,揭示了一个普遍存在的偏差:模型将图像中的垂直位置与距离混为一谈,并引入了 SpatialTunnel 合成基准来暴露这一捷径;研究发现,更好的解耦空间表征能提升模型的鲁棒性。
查看缓存全文
缓存时间: 2026/05/29 23:04
论文页面 - 为什么远处看起来在上方:探究视觉-语言模型中的空间表征
来源:https://huggingface.co/papers/2605.30161
摘要
视觉-语言模型展现出纠缠的空间表征,将图像的垂直位置与距离相关联,这影响了推理的鲁棒性和跨基准的性能。
视觉-语言模型 (https://huggingface.co/papers?q=Vision-language%20models)(VLMs)在空间推理 (https://huggingface.co/papers?q=spatial%20reasoning) 基准上表现出色,然而这究竟是反映了结构化的三维理解,还是依赖自然图像中的统计捷径,目前尚不清楚。我们引入了一个表征级分析 (https://huggingface.co/papers?q=representation-level%20analysis) 框架,该框架构建最小对比对 (https://huggingface.co/papers?q=contrastive%20pairs),以测量VLM嵌入中空间轴的组织和解缠程度。我们在多个模型家族上的分析揭示了一致的垂直-距离纠缠:模型将图像的垂直位置与距离混为一谈,反映了自然照片中的透视偏差 (https://huggingface.co/papers?q=perspective%20bias)。这种偏差导致了一致透视例子和反启发式例子之间的显著准确率差距,并且随着数据规模的扩大而加剧,即使整体基准准确率在提高。我们进一步表明,具有相似基准得分的模型可能表现出不同的内部表征 (https://huggingface.co/papers?q=internal%20representations),并且这些差异可以预测跨多种空间推理 (https://huggingface.co/papers?q=spatial%20reasoning) 基准的准确率和鲁棒性 (https://huggingface.co/papers?q=robustness)。为了将这种偏差与评估集偏斜分离,我们引入了SpatialTunnel,这是一个合成基准 (https://huggingface.co/papers?q=synthetic%20benchmark),旨在通过移除自然图像中常见的相关性来暴露空间捷径偏差 (https://huggingface.co/papers?q=spatial%20shortcut%20biases)。实验证实,这种纠缠是模型固有的,并且具有良好分离的空间轴的模型表现出更强的鲁棒性 (https://huggingface.co/papers?q=robustness),这表明结构良好的空间表征能够带来更可靠的空间推理 (https://huggingface.co/papers?q=spatial%20reasoning),跨多个基准。代码和基准可在项目页面获取:https://cheolhong0916.github.io/whyfarlooksup.github.io/。
查看arXiv页面 (https://arxiv.org/abs/2605.30161)查看PDF (https://arxiv.org/pdf/2605.30161)项目页面 (https://cheolhong0916.github.io/whyfarlooksup.github.io/)GitHub (https://github.com/cheolhong0916/contrastive-probing)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.30161)
在你的代理中获取此论文:
hf papers read 2605.30161
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2605.30161,即可从此页面链接。
引用此论文的数据集1
cubec/spatialtunnel 查看器• 更新于约16小时前 • 5.37k • 23 • 1 (https://huggingface.co/datasets/cubec/spatialtunnel)
引用此论文的Space0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2605.30161,即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection)中,即可从此页面链接。
相似文章
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
多语言视觉-语言模型中使用空间指示表达的能力评估
本文开发了一个基准,用于评估视觉-语言模型在多语言环境中使用空间指示表达(如'this'、'that')的能力,涵盖四种语言。实验揭示,模型在基于距离选择适当指示词方面与人类存在差异。
看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础
本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。