看见不等于知道:VLMs 知道何时不应回答空间问题吗(以及原因)?

Hugging Face Daily Papers 论文

摘要

本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。

空间推理是部署在真实世界环境中的视觉语言模型(VLM)的一项基本能力。然而,视觉观测本质上是对三维世界的有限表示:遮挡可能使物体不可见,而视角可能使几何属性产生误导。尽管如此,现有的空间推理基准通常假设观测是充分且可靠的,它们关注模型是否产生正确答案,而非模型是否意识到问题无法回答以及需要哪些额外观测。在这项工作中,我们通过构建一个受控评估框架 SpatialUncertain 来挑战这一假设,并引入两类观测挑战:(1)遮挡,即隐藏目标信息;(2)视角模糊,即产生误导性的视觉线索。针对每种配置,我们设计了在清晰观测下可回答、但在引入挑战下需要避免回答的空间问题。我们进一步评估了模型能否识别出哪些额外视角能够解决视角模糊。我们在多种前沿开源和闭源 VLM 上的结果揭示了一致的两种失败模式。首先,模型容易过度自信,即使视觉证据不完整或具有误导性,也会尝试求解空间推理任务,在遮挡下平均准确率约为 30%,在视角模糊下低于 10%。其次,即使有额外视角可用,一些模型在识别哪些视角能提供可靠证据方面的表现接近随机。总之,我们的研究结果呼吁超越答案正确性,转向评估模型是否知道何时应避免回答以及如何寻求可靠证据。
查看原文
查看缓存全文

缓存时间: 2026/06/01 07:18

论文页面 - 看见不等于知道:视觉语言模型是否知道何时不该回答空间问题(以及为什么)?

来源:https://huggingface.co/papers/2605.30557

摘要

视觉语言模型在空间推理任务中表现出过度自信,且难以识别何时需要更多观察来消除不确定性。

空间推理(https://huggingface.co/papers?q=Spatial%20reasoning)是部署在真实世界环境中的视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLMs)的基础能力。然而,视觉观察本质上是对3D世界的有局限表征:遮挡(https://huggingface.co/papers?q=occlusion)可能使物体不可见,而透视可能让几何属性产生误导。尽管如此,现有的空间推理(https://huggingface.co/papers?q=spatial%20reasoning)基准通常假设观察是充分且可靠的,侧重于模型能否给出正确答案,而非模型是否认识到问题无法回答,以及需要哪些额外观察。在这项工作中,我们通过构建一个受控评估框架 SpatialUncertain,并引入两类观察挑战来挑战这一假设:(1)遮挡(https://huggingface.co/papers?q=occlusion),即隐藏目标信息;(2)透视歧义(https://huggingface.co/papers?q=perspective%20ambiguity),即产生误导性的视觉线索。针对每种配置,我们设计了在清晰观察下可回答、但在引入挑战时需要弃权(https://huggingface.co/papers?q=abstention)的空间问题。我们进一步评估模型能否识别哪些额外视点(https://huggingface.co/papers?q=additional%20viewpoints)可以解决透视歧义(https://huggingface.co/papers?q=perspective%20ambiguity)。我们在多种前沿开源和闭源VLM上的结果显示两种一致的失败模式。首先,模型倾向于过度自信地回答,即使视觉证据(https://huggingface.co/papers?q=visual%20evidence)不完整或具有误导性,也试图解决空间推理(https://huggingface.co/papers?q=spatial%20reasoning)任务,在遮挡(https://huggingface.co/papers?q=occlusion)下平均准确率约30%,在透视歧义(https://huggingface.co/papers?q=perspective%20ambiguity)下低于10%。其次,即使有额外视图可用,一些模型在识别哪个视图能提供可靠证据方面的表现也接近随机。总之,我们的发现呼吁超越答案正确性,转而评估模型是否知道何时应该弃权,以及如何寻求可靠证据。

查看 arXiv 页面(https://arxiv.org/abs/2605.30557)查看 PDF(https://arxiv.org/pdf/2605.30557)项目页面(https://zhangyuejoslin.github.io/spatialuncertain/)GitHub3(https://github.com/zhangyuejoslin/SpatialUncertain_code)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30557)

在代理中获取此论文:

hf papers read 2605.30557

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有与此论文关联的模型

在模型 README.md 中引用 arxiv.org/abs/2605.30557 即可从此页面链接。

引用此论文的数据集 0

没有与此论文关联的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.30557 即可从此页面链接。

引用此论文的 Space 0

没有与此论文关联的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.30557 即可从此页面链接。

包含此论文的收藏集 0

没有包含此论文的收藏集

将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

当记忆说谎:VLM智能体空间记忆过时性的实证研究

Hugging Face Daily Papers

本文实证研究了视觉语言模型智能体中的空间记忆过时性问题,发现模型常常忽略矛盾的视觉证据,并且信任过时记忆会增加安全风险。作者提出了审计机制,但表明在记忆-观察冲突下的视觉接地仍是一个重大开放挑战。

SPACENUM: 重新审视VLMs中的空间数值理解

arXiv cs.AI

本文提出SpaceNum,一个统一的框架,用于评估视觉语言模型(VLMs)在空间上下文中理解数值的能力,发现当前模型在很大程度上未能将数字与空间对应起来,且常常表现出接近随机猜测的性能。