AnswerMap:基于答案后验的VLM忠实空间可解释性
摘要
AnswerMap引入了一种黑箱、免训练的方法,用于VLM的空间可解释性,通过从答案后验构建查询条件地图,展示了在不同任务中的忠实性和实用性。
查看缓存全文
缓存时间: 2026/09/29 16:11
论文页面 - AnswerMap:基于答案后验的视觉语言模型忠实空间可解释性
来源:https://huggingface.co/papers/2609.35247
摘要
当视觉语言模型回答视觉查询时,当前的可解释性工具要么依赖文本理由(使用不匹配的模态),要么依赖内部读出(产生得太早,无法反映最终输出,且需要白盒访问模型)。我们提出AnswerMap,一种无需训练、任务无关、黑盒的视觉理由,由输出头构建。图像被切割成K行和K列的条带,每条条带单独呈现给冻结的模型,同时附带查询,格式为一个是/否相关性问题。行和列的“是”后验的外积给出了查询条件的空间映射。关键的是,通过在AnswerMap上定义固定的读出R(例如期望、最大值),我们可以原生地推导出连续输出,如位置。这绕过了对离散文本标记在连续输出任务上的依赖,并通过构造保证了依赖于图像的答案。然而,一个理由可能是虚构的,因此我们使用两个测试在四个模型和三个查询分布上验证了AnswerMap:(a)与模型自身生成的点的一致性,(b)删除映射区域。该映射落在模型所指的位置(AUC 0.85 对比注意力的0.38),并删除其区域会翻转53%的正确答案(对比注意力的19%)。除了建立忠实性外,我们还通过三种不同的读出展示了该映射的任务无关效用:其最大值无需生成即可标记幻觉对象;当模型自身的指向失败时,其期望能正确定位;其顶部质量区域作为裁剪反馈,修正了一半模型的错误答案。因此,AnswerMap为VLM可解释性提供了一个新的视角,并通过其读出,为超越文本标记的视觉任务提供了新的输出接口。
查看 arXiv 页面 (https://arxiv.org/abs/2609.35247)查看 PDF (https://arxiv.org/pdf/2609.35247)项目页面 (https://github.com/sanataff/AnswerMap/)GitHub1 (https://github.com/sanataff/AnswerMap)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.35247)
在代理中获取此论文:
hf papers read 2609.35247
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.35247 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.35247 以从此页面链接它。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.35247 以从此页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
看见不等于知道:VLMs 知道何时不应回答空间问题吗(以及原因)?
本文介绍了 SpatialUncertain,这是一个用于评估视觉语言模型能否识别因遮挡或视角模糊而无法回答空间问题的基准,揭示了模型过度自信和回避行为不佳的问题。
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
VLA 真的了解基础知识吗?视觉-语言-动作模型中常识与世界知识保留的衡量
本文提出 Act2Answer 协议,通过让智能体执行物理动作来回答问题,从而评估视觉-语言-动作模型中知识的保留情况。研究发现,VLA 模型保留了基础知识,但在更丰富的语义类别上存在差距,而 VQA 联合训练有助于改善。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。