视觉语言模型推理中的视觉访问边界

arXiv cs.AI 论文

摘要

本文介绍了Visual Access Sweep,一种因果干预方法,用于衡量视觉语言模型推理所需的最小图像标记访问量,并发现思维链(Chain-of-Thought)提示并非主要通过延长直接图像访问来提升性能,而是通过在视觉信息上扩展语言侧计算来实现。

arXiv:2607.12815v1 Announce Type: new Abstract: 思维链(Chain-of-Thought, CoT)提示被广泛用作视觉语言模型(Vision-Language Models, VLMs)的测试时扩展策略,但尚不清楚当VLM生成更长的推理轨迹时,到底扩展了什么。我们提出一个问题:CoT是否需要持续访问图像标记,还是主要依赖于在正向传播早期已经可用的视觉信息?我们引入了视觉访问扫描(Visual Access Sweep),一种因果干预方法,它沿着层深度和生成时间遮蔽从生成标记查询到图像标记键的注意力,并将视觉访问边界(Visual Access Boundary, VAB)定义为保持任务准确性的最小访问区域。在来自Qwen2.5-VL和InternVL3的六种模型配置中,无CoT直接回答和CoT提示都表现出有限的VAB。在Qwen2.5-VL-32B以及参数规模为14B和38B的InternVL3中,当CoT与无CoT完全访问目标进行比较时,其VAB层与无CoT边界的差异最多为两层,尽管生成长度显著增加。这表明CoT并非主要通过延长整个推理轨迹中直接图像标记访问来提升性能,而是通过在图像派生的隐藏状态信息上扩展语言侧计算来实现。我们进一步证明,CoT的收益受到感知读取的限制。当查询的视觉属性能够被模型可靠地读取时,CoT有帮助,但当读取不可靠时则无帮助。一个符号属性预言机(symbolic-attribute oracle)表明,一旦以文本形式提供真实属性,CoT可以改善计数,而一个单物体探测-解码检查(single-object probe-vs-decode check)表明,困难属性可以从隐藏状态中线性恢复,但模型本身难以输出。综合这些分析,瓶颈在于读取而非计数。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:20

# 视觉语言模型推理中的视觉访问边界

来源:https://arxiv.org/html/2607.12815

Hiroto Osaka  
东京大学  
hiroto\.osaka@weblab\.t\.u\-tokyo\.ac\.jp

&Shohei Taniguchi  
东京大学  
taniguchi@weblab\.t\.u\-tokyo\.ac\.jp

Gouki Minegishi  
东京大学  
minegishi@weblab\.t\.u\-tokyo\.ac\.jp

&Kai Yamashita  
东京大学  
kai\.yamashita@weblab\.t\.u\-tokyo\.ac\.jp

Masahiro Suzuki  
东京大学  
masa@weblab\.t\.u\-tokyo\.ac\.jp

&Yutaka Matsuo  
东京大学  
matsuo@weblab\.t\.u\-tokyo\.ac\.jp

###### 摘要

Chain\-of\-Thought (CoT) 提示被广泛用作视觉语言模型 (VLM) 的测试时扩展策略,但尚不清楚当 VLM 生成更长的推理轨迹时,到底扩展了什么。我们探究 CoT 是否需要持续访问图像令牌,还是主要依赖于前向传播早期已经可用的视觉信息。我们引入了**视觉访问扫描**,这是一种因果干预方法,它沿层深度和生成时间屏蔽从生成令牌查询到图像令牌键的注意力,并将**视觉访问边界** (VAB) 定义为能够保持任务精度的最小访问区域。在 Qwen2.5-VL 和 InternVL3 的六种模型配置中,无 CoT 直接回答和 CoT 提示都表现出有限的 VAB。在 Qwen2.5-VL-32B 以及 14B 和 38B 规模的 InternVL3 上,当将 CoT 与无 CoT 完全访问目标进行比较时,其 VAB 层与无 CoT 边界的差异最多为两层,尽管生成的文本长度显著增加。这表明 CoT 提升性能的主要方式并非通过在整个推理轨迹中延长对图像令牌的直接访问,而是通过扩展语言侧对源自图像隐藏状态信息的计算。我们进一步证明 CoT 的收益受到感知读取能力的制约。当模型能够可靠地读取所查询的视觉属性时,CoT 有所帮助;但当读取不可靠时,则无益。一个符号属性预言机表明,一旦将 ground-truth 属性作为文本提供,CoT 可以改善计数;而一个单对象探测与解码检查表明,困难属性可以从隐藏状态中线性恢复,但模型自身难以输出。综合这些分析,瓶颈在于读取而非计数。

## 1 引言

CoT 提示是 LLM 中标准的测试时扩展工具 (Kojima et al., 2022 (https://arxiv.org/html/2607.12815#bib.bib10); Wei et al., 2022 (https://arxiv.org/html/2607.12815#bib.bib3); Wang et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib4)),并已被广泛应用于 VLM (Zhang et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib22); Xu et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib32); Lin et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib18))。然而,其在视觉任务上的收益并不一致:一些研究报告了显式中间推理带来的增益,而另一些则发现在感知密集型视觉问答场景中收益有限甚至出现退化 (Lu et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib28); Liu et al., 2024b (https://arxiv.org/html/2607.12815#bib.bib11))。CoT 对 VLM 性能贡献的机制是什么?CoT 是通过在生成过程中延长对图像令牌的直接访问来提升性能,还是通过利用早已可用的视觉信息进行额外的语言侧计算来实现?

参考图注

图 1:视觉访问扫描与视觉访问边界概览。
(a) **视觉访问扫描**。在每个扫描点 $(t_{\text{cutoff}}, \ell_{\text{cutoff}})$,我们只允许满足 $t \leq t_{\text{cutoff}}$ 且层满足 $\ell \leq \ell_{\text{cutoff}}$ 的生成令牌查询直接访问图像令牌。在此允许矩形之外,从生成令牌查询到图像令牌键的注意力被屏蔽。**视觉访问边界** (VAB) 是在容差 $\epsilon$ 范围内保持精度的最小访问对 $(\ell^*, \tau^*)$。
(b) **关键结果**。在直接提示下,消除较后层的影响几乎不影响精度,识别出一个深度 $\ell^*$,超过该深度后,持续的直接图像令牌访问在功能上是冗余的。在 CoT 提示下,尽管生成令牌数量大大增加,VAB 区域依然保持,这表明扩展的语言侧推理并不需要扩展的直接图像令牌访问。

关于此问题的现有证据大多是观察性的:研究记录了 VLM 对图像令牌的注意力在生成过程中会衰减 (Tong et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib24); Rahmanzadehgervi et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib15); Kang et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib7); Yuan et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib19); Yang et al., 2025a (https://arxiv.org/html/2607.12815#bib.bib25)),但注意力的大小并不能建立必要性。低注意力可能意味着持续访问不再被使用,或者访问正在失败;仅凭注意力值无法区分这两种情况。因此,我们通过干预而非读取注意力来测试必要性。为了回答这个问题,我们引入了**视觉访问边界** (VAB)。我们通过沿层深度和生成时间屏蔽从生成令牌查询到图像令牌键的直接注意力进行干预(图 1 (https://arxiv.org/html/2607.12815#S1.F1)(a))。我们将这种双轴干预称为**视觉访问扫描**。这种干预将一个原本是观察性的问题转化为因果性问题。如果在移除后续生成令牌对图像令牌的访问后性能得以保持,那么这些直接的视觉访问对于目标行为并非必要。相反,当 CoT 有帮助时,它似乎是在利用已经携带在隐藏状态中的图像派生信息进行操作。为了将视觉基础与下游推理分离开,我们设计了受控的属性计数任务,其中对象属性和空间布局是完全参数化的,遵循受控视觉推理基准的精神。这避免了模型可能基于参数知识或数据集偏差而非图像本身回答问题的情况,同时保持推理操作固定为计数,仅改变所查询的视觉属性。我们比较了无 CoT 直接回答(我们称之为 Direct)与 CoT 提示。我们还通过一个基于 GQA 的真实图像是/否任务(Hudson and Manning, 2019 (https://arxiv.org/html/2607.12815#bib.bib2))测试了超越合成图像的相同结构是否出现。应用于 Qwen2.5-VL 和 InternVL3 的六种模型配置,视觉访问扫描产生了两个主要发现。首先,如图 1 (https://arxiv.org/html/2607.12815#S1.F1)(b) 所示,在 Direct 和 CoT 提示下都明显存在一个视觉访问边界。在我们测试的每个主要模型-任务设置中,当屏蔽了较大范围的较上层区域时,精度得以保持,一旦干预到达较早期层,精度则急剧下降。综合起来,这些结果对上述两种机制进行了判定。在 Direct 回答中,存在一个深度,超过该深度后,生成的令牌不再需要对图像令牌的直接注意力。在 CoT 下,生成变得非常长,但必要的视觉访问区域并未沿生成时间轴成比例扩展。因此,在我们测试的机制中,CoT 提升性能的主要方式并非继续在整个推理轨迹中重新读取图像。相反,当 CoT 有帮助时,它似乎是利用已经携带在隐藏状态中的图像派生信息进行操作。相同的定性 VAB 结构也出现在基于 GQA 的真实图像任务中。其次,在三个规模的 Qwen2.5-VL 上,每个属性的 CoT 增益在 3B 和 7B 时可由多对象感知读取精度预测,并在 32B 时饱和。一个以符号方式提供属性的预言机绕过机制能均匀地恢复所有属性的 CoT 增益,而困难属性上的探测与解码差距分别提供了单对象证据,表明瓶颈在于感知读取而非计数操作本身(第 6 节 (https://arxiv.org/html/2607.12815#S6))。

我们的贡献如下:
(i) 我们引入了视觉访问扫描和视觉访问边界,这是一种因果干预方法和操作度量,共同描绘了沿层深度和生成时间直接图像令牌访问的功能必要性。
(ii) 我们证明了在 Qwen2.5-VL 和 InternVL3 的主要设置中,Direct 和 CoT 提示下均出现有限的 VAB。在较大模型中,当与无 CoT 完全访问目标进行比较时,CoT VAB 层与无 CoT 边界的差异不超过两层,尽管生成长度大大增加。相同的定性 VAB 结构也出现在基于 GQA 的真实图像是/否任务中。
(iii) 在 Qwen2.5-VL 上,三个规模下的每个属性 CoT 增益均与多对象感知读取精度相关,并且通过在同一检查点无图像输入的预言机绕过机制被均匀恢复。困难属性上的单独单对象探测与解码诊断提供了支持性证据,表明瓶颈在于感知读取而非计数操作本身。

## 2 相关工作

#### VLM 中的视觉注意力衰减。
越来越多的工作表明,VLM 对图像令牌的注意力在生成过程中往往会减弱、变得嘈杂或错误分配,并且一些方法通过加强、重新分配或在推理期间重新注入视觉信号来提高性能 (Tong et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib24); Rahmanzadehgervi et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib15); Kang et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib7); Yuan et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib19); Yang et al., 2025a (https://arxiv.org/html/2607.12815#bib.bib25))。这些研究确立了修改视觉注意力可能有益。我们的问题是互补的。在未修改的基于前缀的仅解码器 VLM 中,持续的图像令牌直接访问在生成期间何时是功能上必要的?视觉访问扫描并非增强视觉注意力,而是沿层深度和生成时间移除生成令牌对图像令牌的访问,从而测试注意力的必要性而非效用。

#### VLM 中的 CoT 和测试时扩展。
CoT 和测试时扩展在 LLM 中已有充分研究 (Wei et al., 2022 (https://arxiv.org/html/2607.12815#bib.bib3); Kojima et al., 2022 (https://arxiv.org/html/2607.12815#bib.bib10); Wang et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib4); Liu et al., 2025a (https://arxiv.org/html/2607.12815#bib.bib26)),并已扩展到 VLM,一些研究报告了多模态推理的改进 (Zhang et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib22); Xu et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib32); Lin et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib18); Wu et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib23)),而另一些则显示在感知密集型场景中收益有限或退化 (Lu et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib28); Liu et al., 2024b (https://arxiv.org/html/2607.12815#bib.bib11))。我们并非寻找最佳提示策略,而是询问当 CoT 确实有帮助时,它扩展了什么。由于生成的推理过程不一定能忠实反映产生答案的计算 (Turpin et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib40); Lanham et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib41)),我们不从 CoT 文本本身推断视觉使用情况;相反,我们通过干预来测试图像令牌访问的功能必要性。

#### 主动感知与视觉重新访问。
近期的几种方法通过允许模型在推理过程中获取额外的视觉证据来修改 VLM 推理,例如通过视觉记忆、区域重聚焦或显式感知动作 (Zou et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib35); Yang et al., 2025b (https://arxiv.org/html/2607.12815#bib.bib36); Yu et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib37))。这些方法研究如何通过添加感知-推理反馈循环来改进模型。我们的工作则提出一个互补的诊断性问题。我们测试普通的 CoT 是否已经使从生成的令牌到初始图像令牌前缀的持续直接访问在基于前缀的仅解码器 VLM 中变得功能上必要。

#### VLM 中的机制可解释性与探测。
对注意力或激活进行因果干预的方法 (Vig et al., 2020 (https://arxiv.org/html/2607.12815#bib.bib21); Geiger et al., 2021 (https://arxiv.org/html/2607.12815#bib.bib27); Meng et al., 2022 (https://arxiv.org/html/2607.12815#bib.bib5); Schwettmann et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib17); Gandelsman et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib16)) 以及表明 VLM 隐藏状态编码了模型无法用语言表达的视觉信息的探测研究 (Alain and Bengio, 2016 (https://arxiv.org/html/2607.12815#bib.bib9); Belrose et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib8); Geva et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib29); Fu et al., 2025 (https://arxiv.org/html/2607.12815#bib.bib33); Liu et al., 2025b (https://arxiv.org/html/2607.12815#bib.bib34)) 都为我们的方法提供了信息。与调整透镜风格的观察性解码不同,VAB 通过因果屏蔽测量直接图像令牌访问在何处不再*必要*,并且我们通过将探测与解码差距与通过预言机绕过的 CoT 增益联系起来,超越了泛化的读取瓶颈观察。

## 3 实验设计

### 3.1 VLM 公式化

我们专注于仅解码器 VLM,其中冻结的视觉编码器后接投影层,产生图像令牌,这些令牌作为前缀与文本令牌连接,输出是自回归生成的 (Vaswani et al., 2017 (https://arxiv.org/html/2607.12815#bib.bib30); Liu et al., 2023 (https://arxiv.org/html/2607.12815#bib.bib1), 2024a (https://arxiv.org/html/2607.12815#bib.bib20); Bai et al., 2024 (https://arxiv.org/html/2607.12815#bib.bib31), 2025 (https://arxiv.org/html/2607.12815#bib.bib6))。在本文中,当我们提及从生成令牌查询到图像令牌键的注意力时,我们指的是这种基于前缀的仅解码器设置中标准自注意力矩阵的对应条目,而非单独的交叉注意力模块。令 $\mathbf{t}_{\mathrm{img}} = (t_{\mathrm{img},1}, \ldots, t_{\mathrm{img},K})$ 表示 $K$ 个图像令牌,$\mathbf{t}_{\mathrm{text}}$ 表示输入文本令牌,$\mathbf{t}_{\mathrm{gen},1:t-1}$ 表示先前生成的令牌;在步骤 $t$,模型条件化为 $\mathbf{T}_t = [\mathbf{t}_{\mathrm{img}}, \mathbf{t}_{\mathrm{text}}, \mathbf{t}_{\mathrm{gen},1:t-1}]$ 并预测 $t_{\mathrm{gen},t}$。我们的干预所操纵的“视觉访问”的操作定义在第 4.1 节 (https://arxiv.org/html/2607.12815#S4.SS1) 中给出。

### 3.2 任务与数据集

我们使用两个任务族:一个受控的合成属性计数任务族,允许精确的因素隔离;以及一个源自 GQA 的真实图像场景图 QA 任务,用于检验超越合成刺激的外部有效性。

#### 受控的属性计数任务。

参考图注

图 2:**受控属性计数任务**。推理操作(计数)是固定的,而所查询的属性在 {颜色, 形状, 位置, 角度, 大小} 之间变化,从而将感知难度对单一固定推理程序的影响隔离开来。

受控任务...

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

更多推理,更低准确性?论视觉语言模型中推理的双重性

Papers with Code Trending

本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。