为什么远处看起来在上方:探究视觉-语言模型中的空间表征

Hugging Face Daily Papers 论文

摘要

探究视觉-语言模型中的空间表征,揭示了一个普遍存在的偏差:模型将图像中的垂直位置与距离混为一谈,并引入了 SpatialTunnel 合成基准来暴露这一捷径;研究发现,更好的解耦空间表征能提升模型的鲁棒性。

视觉-语言模型(VLMs)在空间推理基准测试上表现出色,但尚不清楚这是反映了结构化的三维理解,还是依赖于自然图像中的统计捷径。我们引入了一种表征级分析框架,通过构建最小对比对来测量VLM嵌入中空间轴的组织和解耦程度。我们对多个模型族的分析揭示了一个一致的垂直-距离纠缠:模型将图像中的垂直位置与距离混为一谈,反映了自然照片的透视偏差。这种偏差在透视一致和反启发式的示例之间产生了显著的准确率差距,并且随着数据规模的扩大而加剧,即使整体基准准确率有所提升。我们进一步表明,具有相似基准分数的模型可能表现出不同的内部表征,并且这些差异能够预测在不同空间推理基准上的准确率和鲁棒性。为了将这种偏差与评估集的偏斜分离开,我们引入了 SpatialTunnel,这是一个合成基准,旨在通过去除自然图像中的常见相关性来暴露空间捷径偏差。实验证实,这种纠缠是模型固有的,并且空间轴分离良好的模型表现出更强的鲁棒性,这表明结构良好的空间表征能带来在不同基准上更可靠的空间推理。代码和基准可在项目页面获取:https://cheolhong0916.github.io/whyfarlooksup.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/05/29 23:04

论文页面 - 为什么远处看起来在上方:探究视觉-语言模型中的空间表征

来源:https://huggingface.co/papers/2605.30161

摘要

视觉-语言模型展现出纠缠的空间表征,将图像的垂直位置与距离相关联,这影响了推理的鲁棒性和跨基准的性能。

视觉-语言模型 (https://huggingface.co/papers?q=Vision-language%20models)(VLMs)在空间推理 (https://huggingface.co/papers?q=spatial%20reasoning) 基准上表现出色,然而这究竟是反映了结构化的三维理解,还是依赖自然图像中的统计捷径,目前尚不清楚。我们引入了一个表征级分析 (https://huggingface.co/papers?q=representation-level%20analysis) 框架,该框架构建最小对比对 (https://huggingface.co/papers?q=contrastive%20pairs),以测量VLM嵌入中空间轴的组织和解缠程度。我们在多个模型家族上的分析揭示了一致的垂直-距离纠缠:模型将图像的垂直位置与距离混为一谈,反映了自然照片中的透视偏差 (https://huggingface.co/papers?q=perspective%20bias)。这种偏差导致了一致透视例子和反启发式例子之间的显著准确率差距,并且随着数据规模的扩大而加剧,即使整体基准准确率在提高。我们进一步表明,具有相似基准得分的模型可能表现出不同的内部表征 (https://huggingface.co/papers?q=internal%20representations),并且这些差异可以预测跨多种空间推理 (https://huggingface.co/papers?q=spatial%20reasoning) 基准的准确率和鲁棒性 (https://huggingface.co/papers?q=robustness)。为了将这种偏差与评估集偏斜分离,我们引入了SpatialTunnel,这是一个合成基准 (https://huggingface.co/papers?q=synthetic%20benchmark),旨在通过移除自然图像中常见的相关性来暴露空间捷径偏差 (https://huggingface.co/papers?q=spatial%20shortcut%20biases)。实验证实,这种纠缠是模型固有的,并且具有良好分离的空间轴的模型表现出更强的鲁棒性 (https://huggingface.co/papers?q=robustness),这表明结构良好的空间表征能够带来更可靠的空间推理 (https://huggingface.co/papers?q=spatial%20reasoning),跨多个基准。代码和基准可在项目页面获取:https://cheolhong0916.github.io/whyfarlooksup.github.io/。

查看arXiv页面 (https://arxiv.org/abs/2605.30161)查看PDF (https://arxiv.org/pdf/2605.30161)项目页面 (https://cheolhong0916.github.io/whyfarlooksup.github.io/)GitHub (https://github.com/cheolhong0916/contrastive-probing)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.30161)

在你的代理中获取此论文:

hf papers read 2605.30161

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2605.30161,即可从此页面链接。

引用此论文的数据集1

cubec/spatialtunnel 查看器• 更新于约16小时前 • 5.37k • 23 • 1 (https://huggingface.co/datasets/cubec/spatialtunnel)

引用此论文的Space0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2605.30161,即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到一个收藏 (https://huggingface.co/new-collection)中,即可从此页面链接。

相似文章

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。