问两次,看两次:提示回响解决视觉语言模型中的问题优先悖论

arXiv cs.AI 论文

摘要

本文识别了视觉语言模型中的“问题优先悖论”,即在图像之前提问虽然改善了视觉注意,但会阻碍答案准确性。本文提出了一种无需训练的技术——“问题回响”——在图像前后重复提问,该技术无需架构更改即可在多个基准测试中提升性能。

arXiv:2607.15565v1 公告类型:交叉 摘要:在视觉语言模型(VLM)的提示中,问题应该放在图像之前还是之后?直觉认为放在前面:知道问题应该告诉模型往哪里看。然而,在各种视觉问答基准测试中,问题优先提示的表现始终不如前沿VLM推荐的图像优先顺序,我们将这种现象称为问题优先悖论。我们将这一悖论追溯到VLM计算两个阶段之间的冲突。Logit透镜和注意力探测表明,直觉只对了一半:放在图像之前的问题确实引导了感知,将图像块表示推向与问题相关的概念。失败在于下游环节。由于被数百个图像令牌隔开,答案令牌几乎不关注问题,而是倾向于图像驱动的(通常是错误的)答案;因果注意力消除实验证实,只有当问题跟随图像时,答案才会读取问题。这一诊断提供了一种无需训练的修正方法:问题回响,即在图像两侧重复问题,使得一个副本引导感知,另一个副本在回答时被读出。同样的分工出现在五十年前关于人类“附加问题”的研究中,在段落前后重复问题比单独置于任一位置更有助于理解。同时回响图像带来进一步的提升,恢复了因果解码器否则会丢失的整图视角。这一悖论在五个开源VLM中成立,造成高达17.5个组准确率点的损失。回响提示解决了这个问题,并在NaturalBench、POPE、Winoground和开放式VQAv2上超越了最佳单次顺序,Winoground组准确率提升多达19个点,且无需训练、微调或架构更改。该悖论揭示了引导感知与保持问题可达性之间的权衡;仅通过提示设计,回响就能解决这一权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:27

# 先问再看,再问再看:提示回响解决视觉语言模型中的问题优先悖论 来源:https://arxiv.org/html/2607.15565 11institutetext:卡内基梅隆大学,美国###### 摘要 在视觉语言模型(VLM)的提示中,问题应该放在哪里:图像之前还是之后?直觉上认为应该放在前面:知道要问什么,能告诉模型该看哪里。然而,在视觉问答基准测试中,问题优先的提示方式始终不如前沿VLM推荐的图像优先排序,我们将这种现象称为*问题优先悖论*。我们将该悖论追溯到VLM计算的两个阶段之间的冲突。对数透镜和注意力探针显示,直觉只有一半是正确的:放在图像前面的问题确实能引导感知,将图像块表示移向与问题相关的概念。失败在于下游。问题被搁置在数百个图像令牌之后,答案令牌几乎不关注它,而是倾向于给出基于图像的(通常是错误的)答案;因果注意力消融实验证实,只有当问题放在图像之后时,答案才会读取问题。更好的感知被更差的访问所抵消。诊断结果给出了一种无需训练的修复方法:*问题回响*,即在图像两侧重复问题,使一个副本引导感知,另一个副本在回答时被读取。相同的分工也出现在五十年前关于人类“辅助问题”的研究发现中,在段落前后重复同一个问题比单独放在任一位置更能帮助理解。*同时回响图像*带来了进一步的提升,恢复了因果解码器否则会丢失的整图视图。该悖论在五个开源VLM上成立,造成高达17.5个组准确率点的损失。回响提示解决了这一问题,并在NaturalBench、POPE、Winoground和开放式VQAv2上超越了最佳单次排序,在Winoground上提升了多达19个组准确率点,无需任何训练、微调或架构更改。该悖论揭示了多模态提示中引导模型*看到*什么与保留模型*被问到*什么之间的张力;回响仅通过提示设计就解决了这一问题。 ## 1 引言 STI问题优先Sys?A引导✓读取✗SIT问题在后Sys?A引导✗读取✓STIT我们的Sys??A引导✓读取✓回响Q SITIT最佳Sys??A引导✓读取✓+整图回响I + Q 图1:决定答案的是问题的位置,而非问题的存在。VLM将系统(Sys)、图像(I)和问题(?)令牌作为单个流读取,并从最终答案位置(A)生成。每一行都标记了提示必须服务的两种机制:问题是否*引导*图像的编码,以及问题是否在答案处被*读取*。问题优先(STI)能引导但未被读取:它将问题搁置在长图像片段之前,导致答案几乎不关注它,并提前锁定基于图像且常常错误的响应。问题在后(SIT)能被读取但不引导,很大程度上挽回了损失。无需训练的*问题回响*(STIT)在图像两侧重复问题,在保留引导的同时恢复了问题与答案的相邻性;同时用图像重复(SITIT)还为因果解码器提供了整图视图,并取得了最佳准确率。

每个VLM提示都做出了一个隐含的决定:问题在图像之前还是之后。现代视觉语言模型消费系统、图像和任务令牌的交错序列,因此排序是一个自由的设计选择,今天它由经验法则决定。大多数模型卡推荐图像优先[AprilGemini, ImageLearn],而其他提示实践则各不相同。一个自然的假设,借鉴自人类如何观察场景[Buswell1935HowArt],认为经验法则搞反了:问题应该放在前面,因为知道要问什么的模型可以决定看哪里以及编码什么。这个假设失败了,而且失败的方式具有启发性。考虑两种保持内容固定仅移动问题的排序:

STI(系统、任务、图像)将问题放在图像之前,SIT(系统、图像、任务)放在之后。在NaturalBench上用Qwen3-VL-8B,问题优先的组准确率比问题在后低8.1个点(0.270 vs. 0.351)。同样的差距出现在POPE和Winoground以及另外三个VLM系列(Qwen2.5-VL、InternVL3、LLaVA)上,达到17.5个点;仅在Gemma-3-27B上被抑制。我们称之为*问题优先悖论*:本应指导感知的排序却是有害的(图 ̃1 (https://arxiv.org/html/2607.15565#S1.F1))。本文打开模型解释这一悖论,然后将解释转化为修复方案。解决方案是提示设计混淆的两个计算阶段之间的分离。使用对数透镜[2020InterpretingLessWrong]和逐层探针,我们展示了问题优先提示*确实*引导感知:图像块解码出更多与问题相关的概念,并且答案位置更强烈地关注图像。这种引导是真实的,但被浪费了。问题被搁置在数百个图像令牌之前,解码器很少读取它,答案位置在问题表示到达之前就早早地锁定了一个基于图像且常常错误的令牌。更好的感知被更差的访问所抵消。

一旦这样表述,修复方案就自然而然地出现了。*问题回响*(STIT)在图像前后各重复一次问题:第一个副本引导,第二个副本恢复问题与答案的相邻性。*图像回响*(SITIT)与重复的问题一起重新呈现图像;在因果掩码下,第二个副本的每个补丁都会关注整个第一个副本,恢复了视觉编码器计算但因果解码器丢弃的双向整图读取。两者都是纯粹的提示编辑:无需微调、无需解码更改、无需架构更改。引人注目的是,这个修复方法在人类学习者中有五十年的先例。在教育心理学的*辅助问题*文献中,在散文段落前后重复同一个问题比单独放在任一位置更有助于理解:预问题引导注意力,后问题在测试时巩固[Boyd1974RepeatedLearning, Hamaker1986TheLearning]。这正是我们的探针在模型内部揭示的分工,表明回响的双机制结构是顺序理解的普遍属性,而非某一架构的产物。 问:*“人们是站在一大片水里吗?”*(真实答案:是) 输入框 = 放大 参照图注SIT(问题在后)→\to“是”✓ 参照图注STI(问题优先)→\to“否”✗ 参照图注STIT(我们的)→\to“是”✓ 参照图注参照图注 图2:引导确实发生了,但未被读取。图像块上的对数透镜:每个单元格显示该块最后一层隐藏状态解码出的词汇令牌,根据该令牌的概率着色(右侧viridis标尺,深蓝0到黄色1),叠加在图像上。输入上的crimson框标记了放大区域。对于问题*“人们是站在一大片水里吗?”*(真实答案是),问题在后(SIT)使块保持通用(*背景*、*衣服*、*短裤*)并正确回答,而问题优先(STI)将*相同*块引导向问题的水场景(*滴落*、*玩耍*、*群体*)却回答错误:引导发生了,但无济于事。第三栏预览了我们的修复(回响,STIT;Sec. ̃5 (https://arxiv.org/html/2607.15565#S5)):相同的问题优先引导,现在正确回答。

**贡献。** 我们做出四项贡献。首先,我们确立*问题优先悖论*:在内容固定的情况下,将问题放在图像之前会降低三个基准和五个开源VLM的准确率,这与直觉相悖(Sec. ̃3 (https://arxiv.org/html/2607.15565#S3))。其次,我们诊断了它,展示了问题优先提示确实引导了感知却未被读取,并通过因果注意力消融实验证实,只有当问题跟在图像后面时,答案才会从问题中计算出来;感知引导和解码器访问是可分离的,悖论完全存在于访问中(Sec. ̃4 (https://arxiv.org/html/2607.15565#S4))。第三,我们将诊断转化为一种无需训练的修复方法:*问题回响*,它在图像之后重复问题以恢复读取,同时保留引导,并附带一个*图像回响*变体,可在因果掩码下恢复整图读取(Secs. ̃5 (https://arxiv.org/html/2607.15565#S5) 和 5.2 (https://arxiv.org/html/2607.15565#S5.SS2))。最后,我们进行了消融实验,排除了“更多图像令牌”和“回答前更多计算”的可能性,并将问题相邻性和分布内图像优先配对确定为活性成分(Sec. ̃7 (https://arxiv.org/html/2607.15565#S7))。实际信息:一个重复的问题行缩小了问题优先差距,而重复(图像,问题)对则超过了最佳单次排序。科学信息:视觉引导和答案读取是具有不同位置偏好的不同机制,提示设计必须服务于两者。提示顺序可以是一门经过测量、基于机理的科学,而不是经验法则;本文是将它变成这样的一个案例研究。我们的代码和项目网站包含在补充材料中。 ## 2 相关工作 #### VLM中的提示排序。 指令调优的VLM,如LLaVA[Liu2023VisualTuningb]、Qwen2.5-VL[Bai2025Qwen2.5-VLReportb]和Gemma 3[Team2025GemmaReport],将图像和文本展平为单个令牌流,由因果解码器消费,因此视觉令牌和问题的相对位置是一个不可避免的设计选择。它很少被视为一个独立变量:顺序敏感性研究侧重于上下文示例[Tan2024OrderModels]或将图像优先与文本优先的准确率报告为未解释的消融[Ismithdeen2025Promptception:Prompts],而模型卡推荐图像优先却不说明原因;先前的工作没有建立*为什么*问题优先有害。我们将提示顺序视为一等公民,从机理上描述失败,并从诊断中推导出修复方法。 #### 问题重复与重读。 在纯文本LLM中,重新呈现查询的效果褒贬不一:重读提示改善推理[Xu2023Re-ReadingModels],重复的问题令牌吸引更多注意力[HanREADREADING],当查询远离答案位置时提示重复帮助最大[Leviathan2025PromptLLMs],然而受控研究也发现增益不显著[Shaier2024AskingQuestionsb]。这些工作既不涉及视觉,也不解释重复何时应该有帮助。在VLM中,长的图像跨度使查询-答案距离成为结构性而非偶然性的;我们将解码器对远距离问题的读取不足确定为机制,并展示了回响在纯文本文献存在分歧的地方产生了大而一致的增益。图像回响没有纯文本的类比。我们记录的失败与“中间丢失”有关[Liu2023LostContexts],即仅解码器模型未充分利用远离查询的上下文,但有一个纯文本设置中没有的转折:远处的问题仍然成功地引导了感知,失败只出现在答案生成时。 #### 解释VLM表示。 对数透镜[2020InterpretingLessWrong]将中间隐藏状态通过输出嵌入投影,以读取每一层表示的内容;应用于VLM,它显示视觉令牌逐渐与可解释词汇对齐[Neo2024TowardsModels]。我们基于这一工具,但提出不同的问题:不是视觉令牌编码了什么,而是提示顺序如何改变它们编码的内容以及解码器是否将其读取出来。 ## 3 问题优先悖论 ### 3.1 符号与设置 一个提示包含三个部分:系统消息(S)、图像(I,展开为许多视觉令牌)和任务或问题(T)。我们将排序写为按令牌顺序排列的部分字母序列;生成从最后一个字母之后开始。系统消息是默认预置的固定前缀(附录 ̃0.H (https://arxiv.org/html/2607.15565#Pt0.A8) 证明了这一选择的合理性)。两种单问题排序保持内容固定,仅移动问题: STI = 系统,任务,图像(问题优先),SIT = 系统,图像,任务(问题在后)。它们彼此是字母重排。STI将问题与答案位置分开,中间隔着整个图像跨度;SIT将其直接放在答案之前。所有排序都由一个顺序感知的输入构建器生成,该构建器在所有模型间共享,因此变体仅在相同内容的排列上不同。我们在NaturalBench[Li2024NaturalBench:Samples]、POPE[Li2023EvaluatingModels]和Winoground[Thrush2022Winoground:Compositionality](Sec. ̃2 (https://arxiv.org/html/2607.15565#S2))上进行评估,采用贪婪解码、16令牌答案预算和固定的系统提示(附录 ̃0.A (https://arxiv.org/html/2607.15565#Pt0.A1))。Qwen3-VL-8B(主要,带所有消融)和Gemma-3-27B承载完整分析;另外三个系列(Qwen2.5-VL、InternVL3、LLaVA-1.5)测试通用性。我们突出最苛刻的指标:NaturalBench和Winoground上的组准确率,单个错误对使其归零,语言先验无助于此。对于相邻排序,我们报告每组成正确性的配对显著性(双侧精确McNemar;配对bootstrap 95% CI,5000次重采样)。 ### 3.2 现象 表 ̃1 (https://arxiv.org/html/2607.15565#S3.T1) 孤立了悖论:保持内容固定,仅移动问题,问题优先就会损失。在我们的主要模型上,NaturalBench的差距为8.1个组准确率点,在组合性Winoground上更大,所有都是高度显著的,并且是免费的,因为令牌数量相同(每比较测试见附录 ̃0.B (https://arxiv.org/html/2607.15565#Pt0.A2))。该效应并非某一模型的特例。它在五个VLM中的四个以及所有三个基准上重现,并且在较弱的模型上影响最大,问题优先可能使模型崩溃为一个常数答案(Tab. ̃1 (https://arxiv.org/html/2607.15565#S3.T1))。唯一的例外是Gemma-3-27B,两种排序在统计上无法区分;即使如此,Sec. ̃6 (https://arxiv.org/html/2607.15565#S6) 的补救措施仍然有帮助,因此泛化的是缺陷的修复方法而非缺陷本身。 表1:跨架构的问题优先悖论。相同的内容;仅移动问题。NaturalBench组准确率:问题优先(STI)与问题在后(SIT),以及每个基准上的悖论差距Δ=SIT−STI(正值Δ表示问题优先更差);**粗体** 标记每个模型的最大差距。每个差距的配对显著性见Tab. ̃6 (https://arxiv.org/html/2607.15565#Pt0.A2.T6)。悖论在四个模型上大且一致,仅在Gemma上被抑制。所有三个基准在添加的模型上都显示出相同的悖论。在LLaVA-1.5上最为戏剧性,问题优先在每个基准上都崩溃为常数“是”(NaturalBench组0.000,POPE准确率0.500,Winoground组0.000),而问题在后修复了它(POPE 0.871),这是所有模型的最大POPE差距(+0.371)。Qwen2.5-VL和InternVL3的差距(POPE高达+0.057,Winogro

相似文章

自我演进的视觉提问器

Hugging Face Daily Papers

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

更多推理,更低准确性?论视觉语言模型中推理的双重性

Papers with Code Trending

本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。

视觉默认、先验覆盖:视觉-语言模型中感知-知识冲突的因果机制

arXiv cs.CL

本文研究视觉-语言模型如何解决视觉证据与世界知识之间的冲突,揭示了视觉基础是默认的,而先验知识依赖于一小部分位于后层的注意力头。作者在三个VLM系列上进行因果分析,展示了一种不对称结构:消融这些头部会使得预测从基于知识的答案转向基于视觉的答案。