ReVA: 用于视觉定位问答的区域感知视觉助手

arXiv cs.CL 论文

摘要

ReVA 引入了一个区域感知的视觉助手,通过整合全图和区域级表示,增强了视觉定位问答,并减少了多模态大语言模型中的幻觉问题。

arXiv:2608.28707v1 公告类型:新 摘要:多模态大语言模型 (MLLMs) 在视觉问答 (VQA) 方面取得了显著进展,但它们在需要精确空间推理和细粒度视觉理解的问题上仍然存在困难。这些限制通常表现为对象、属性和空间幻觉,模型由于区域级和细粒度视觉定位不足,生成自信但视觉上无支持的回答。为了解决这一挑战,我们提出了 ReVA,一个区域感知的 VQA 模型,它使用冻结的 CLIP ViT-L/14 视觉变换器 (ViT) 和 Qwen2.5-7B-Instruct 大语言模型 (LLM),通过双桥接连接,将全图和区域级表示与 LLM 的嵌入空间对齐。图像桥接将最终变换器块特征映射为图像令牌。区域桥接将来自 ViT 块中丰富中间特征的裁剪特征映射为每个边界框的 K 个区域令牌,使得早期纹理和后期对象线索更加明显。ReVA 使用一个检测器堆栈,提供自动零样本边界框,这些边界框既与问题无关又与问题相关,使用 RAM++ (Recognize Anything Model)、spaCy 和 Grounding DINO。图像令牌和区域令牌被连接为 LLM 提示前缀,在回答问题时共同编码场景级上下文和细粒度区域证据。在 VQAv2、MMBench、POPE 和 SEED-Bench 上进行评估,ReVA 在 POPE 上实现了 82.85% 的平均 F1 值,而没有区域令牌的图像令牌基线为 81.14%。这些结果表明,明确的区域感知视觉表示减少了对象幻觉,并提高了 MLLMs 的事实定位。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:03

# 面向视觉定位问答的区域感知视觉助手
来源:https://arxiv.org/html/2608.28707

## ReVA:面向视觉定位问答的区域感知视觉助手
致谢:1 ReVA的源代码和预训练权重可在以下地址公开获取:https://github.com/anoop675/reva。

Anoop Senthil1  
机构:英国伦敦玛丽女王大学电子工程与计算机科学学院  
联系:[email protected]

#### 摘要
多模态大型语言模型(MLLMs)在视觉问答(VQA)方面取得了显著进展,但在处理需要精确空间推理和细粒度视觉理解的问题时仍面临挑战。这些限制常表现为对象、属性和空间幻觉,模型因缺乏充分的区域级和细粒度视觉定位,生成看似自信但缺乏视觉依据的回答。为应对这一挑战,我们提出ReVA,一个区域感知的VQA模型。该模型采用冻结的CLIP ViT-L/14视觉Transformer(ViT)和Qwen2.5-7B-Instruct大型语言模型(LLM),通过双桥接结构将全局图像与区域级表征分别与LLM的嵌入空间对齐。图像桥将最终Transformer块特征映射为图像令牌。区域桥则从ViT各块中丰富的中间特征裁剪出区域特征(使早期纹理和后期对象线索更显著),并将每个边界框映射为K个区域令牌。ReVA使用检测器栈,结合RAM++(通用识别模型)、spaCy和Grounding DINO,提供既与问题无关又与问题相关的自动零样本边界框。图像令牌与区域令牌作为LLM提示前缀拼接,共同编码场景上下文与细粒度区域证据以回答问题。在VQAv2、MMBench、POPE和SEED-Bench上的评估显示,ReVA在POPE上的平均F1达到82.85%,而无区域令牌的图像令牌基线为81.14%。这些结果表明,显式的区域感知视觉表征能减少对象幻觉并提升MLLM的事实定位能力。

#### 关键词:视觉问答,多模态大型语言模型,区域定位,多模态上下文工程,视觉-语言对齐,LoRA微调

## I 引言
本工作提出**ReVA**(区域感知视觉助手),一个旨在将语言定位在宏观场景与其中细粒度视觉证据上的区域感知VQA模型(图1)。其核心是将冻结的CLIP ViT-L/14视觉Transformer(ViT)(分辨率336 px)与通过LoRA适配的Qwen2.5-7B-Instruct骨干模型相连,并通过图像桥和区域桥实现联结。图像桥将最终Transformer块特征映射为576个图像令牌。对于局部证据,RAM++(通用识别模型)标注图像中的对象,spaCy添加问题中的名词以避免遗漏命名对象,Grounding DINO将每个标注定位到边界框。这使得区域检测器的提议既与问题无关又与问题相关。区域桥随后使用这些框裁剪ViT中间块特征,并将每个裁剪区域映射为区域令牌。因此LLM能感知每个框内的内容,而边界框本身不会以文本形式出现在提示中。训练分为三个阶段,确保每个桥在LLM整合前完成对齐:第一阶段仅训练图像桥,使用全图描述进行训练(CLIP和Qwen冻结);第二阶段使用框关联描述训练区域桥(骨干模型冻结);第三阶段通过LoRA适配Qwen,使其能基于拼接的图像与区域令牌回答问题。在后续对比中,*图像令牌*基线使用第一阶段图像桥加单独训练的第三阶段LoRA,不含区域令牌;*ReVA*是完成三阶段的完整模型,推理时使用提议框生成的区域令牌。

近期MLLMs——如LLaVA、InstructBLIP、Qwen-VL——通过编码图像、将图像块投影至LLM并生成回答。这种全图路径适用于场景级理解,但即使在336 px分辨率下密集的576个令牌网格,在缺乏显式局部证据时也可能使空间关系及属性-实例绑定变得模糊。GPT4RoI提供学习得到的RoI令牌;Shikra提供框文本表示。ReVA采用RoI令牌方法,将每个框扩展为K个区域令牌(而非单个池化向量),并将用户问题保持为普通自然语言。局部证据仅作为区域令牌进入LLM提示前缀。

## II 相关工作
### 将视觉编码器与语言模型连接
现代MLLMs的主流方法始于预训练视觉编码器和预训练LLM,在其之间学习桥接,并通常在保持视觉编码器冻结的同时适配LLM。BLIP-2引入了轻量级查询Transformer(Q-Former),从冻结的图像编码器中提取一组小型查询嵌入供LLM读取;InstructBLIP使该桥接支持指令感知,通过同时将任务指令输入Q-Former,使其提取的视觉特征依赖于所提问题。LLaVA表明,更简单的桥接——线性投影(在LLaVA-1.5中升级为两层MLP)——在视觉指令数据上训练后效果显著;而Qwen-VL通过位置感知交叉注意力适配器将图像块特征压缩为固定长度序列。ReVA的图像桥遵循此脉络:冻结的CLIP编码器馈入两层MLP(图像特征投影器)进入Qwen2.5-7B-Instruct。单独使用该图像桥时,图像作为一个整体令牌集呈现——适用于场景级理解,但缺乏对单个对象的显式处理。

### 使MLLMs区域感知
恢复缺失局部性有两种主要策略。第一种在文本流中编码位置:Shikra将边界框作为自然语言中的纯数字书写,无需额外词汇或检测器;Kosmos-2以Markdown超链接格式将离散位置令牌附加到短语(基于其大规模GRIT语料训练);Qwen-VL用特殊令牌包裹归一化框字符串。这些方案优雅,但要求LLM将空间位置作为文本或位置令牌处理,而非裁剪的视觉证据。第二种策略则向LLM馈入来自区域本身的视觉特征。GPT4RoI构建多级CLIP特征金字塔,引入特征坐标以获得绝对位置,并使用RoI Align,使每个框在指令中替换占位符为交错的区域特征。Ferret采取混合路径:离散坐标加连续特征(来自空间感知视觉采样器,覆盖点、框和自由形状)。GLaMM将定位下沉到像素级分割掩码;Groma将区域视为一等视觉令牌——将提议区域编码为区域令牌与全局令牌并列,使LLM可通过引用这些令牌而非回归坐标来定位。ReVA为VQA采用区域特征即令牌的理念。其与GPT4RoI的不同之处在于框如何转化为令牌:ReVA通过多头自注意力混合金字塔层级,并通过多令牌注意力池将每个框扩展为K个令牌,为Qwen提供在576个图像令牌之外更丰富的局部描述符。同时保持用户问题为纯自然语言,不在查询文本中交错框、位置令牌或占位符。

### 区域来源
推理时,GPT4RoI接受用户或现成检测器提供的框;Ferret的引用路径接受用户指定区域(点、框或自由形状),其定位路径在响应中输出框;Groma训练自己的区域提议器。ReVA则自动从现成开放词汇检测器构建区域集:RAM++(通用识别模型)提议开放集标注以识别存在内容,Grounding DINO根据文本提示将这些标注定位为框。无需重训检测器,且框仅决定特征裁剪位置,不作为文本进入提示。此设计旨在检验在标准VQA输入下(使用普通自然语言问题,无额外空间上下文交错)区域感知增益是否可用。

## III 系统架构
图1展示了ReVA的双桥流水线,为Qwen提供图像令牌和区域令牌。图像由CLIP ViT-L/14(图中的视觉Transformer)编码一次。图像桥通过图像特征投影器将最终Transformer块特征作为576个图像令牌传递。区域桥通过CoordConv、层级投影和多头自注意力丰富中间Transformer块特征,然后使用提议框坐标裁剪;它们成为每个框的K个区域令牌。这些视觉令牌与简短文本尾部(回答格式、问题、“答案:”)拼接;Qwen随后生成回复。第一至二阶段在CLIP和Qwen冻结下训练图像桥和区域桥;第三阶段在Qwen中添加LoRA。

### 图1:ReVA概览。视觉Transformer为CLIP ViT-L/14。图像桥:最终Transformer块特征经图像特征投影器映射为图像令牌。区域桥:中间Transformer块特征经丰富处理(CoordConv、层级投影、多头自注意力),使用RAM++标签经Grounding DINO定位后通过RoI Align裁剪,再经区域特征投影器池化并映射为区域令牌。

### III-A 图像对齐(图像桥)
图像桥是类LLaVA的两层MLP——图像特征投影器——将每个CLIP块映射到Qwen的嵌入空间。图像被调整为336×336并由CLIP ViT-L/14编码为24×24网格的1024维块令牌(丢弃CLS)。设$f^{\mathrm{patch}}\in\mathbb{R}^{1024}$表示一个CLIP块令牌。图像特征投影器将每个块映射到Qwen的3584维空间,生成图像令牌$z^{\mathrm{image}}\in\mathbb{R}^{3584}$:

$$
z^{\mathrm{image}}=W_{2}\,\mathrm{GELU}(W_{1}\,f^{\mathrm{patch}}+b_{1})+b_{2},\quad (1)
$$

在第一阶段,576个图像令牌置于描述令牌之前形成LLM输入。训练目标仅为对描述的下一个令牌预测:图像令牌位置被掩码,因此不贡献损失,训练投影器使图像令牌有助于生成后续描述。

### III-B 区域对齐(区域桥)
区域桥将边界框映射为描述其内容的区域令牌,遵循GPT4RoI并作如下修改。它包括CoordConv、层级投影、多头自注意力、RoI Align、多令牌注意力池和最终的区域特征投影器。从用于图像桥的相同CLIP ViT出发,取中间Transformer块特征(代表早期纹理至高级对象线索)。遵循CoordConv,将归一化空间通道连接到每个24×24特征图上,使每个块嵌入位置携带绝对空间信息。每个深度随后通过线性层和LayerNorm,混合内容和坐标,使四层共享公共特征空间用于多头自注意力。多头自注意力随后混合它们,使浅层纹理和深层语义在相同块嵌入位置交换信息。RoI Align从这些丰富的层级特征的每个框区域提取固定大小的每级裁剪特征窗口。多令牌注意力池随后将每个窗口转换为K个令牌(而非单个池化向量),区域特征投影器将这些令牌映射到Qwen的嵌入空间。第二阶段在CLIP和Qwen冻结下单独训练区域桥。下文详述每个步骤。

#### 中间Transformer块特征
GPT4RoI也从CLIP ViT-L/14的多层提取区域特征,选择$\mathcal{L}=\{14,17,20,23\}$(即倒数第十一、八、五、二块)。该选择与先前证据一致:早期ViT层保留纹理和空间布局,而最后一层大幅丢失定位能力;倒数第二CLIP层通常在MLLMs中优于最后一层;CLIP最深层更利于图像-文本对齐而非视觉区分度。对于每个$\ell\in\mathcal{L}$,块令牌(丢弃CLS)形成特征图$\mathbf{F}^{(\ell)}$。图像桥已仅使用最终Transformer块,这是图像-文本对齐最强但定位保留最弱的表征。

相似文章

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。

自我演进的视觉提问器

Hugging Face Daily Papers

本文介绍了一种面向视觉语言模型的自我演进框架,使其在没有外部监督的情况下提升提问能力,不仅提高了问题质量,还增强了回答者的表现。

Brain-IT-VQA:从大脑信号到答案

Hugging Face Daily Papers

Brain-IT-VQA 框架利用 Transformer 架构从 fMRI 信号中解码视觉内容,性能优于此前的方法。作者还引入了 NSD-VQA,这是一个新数据集,具有更丰富的标注,用于评估基于 fMRI 的视觉问答。

基于证据的视频问答

Hugging Face Daily Papers

本文介绍了基于证据的视频问答(E-VQA),这是一个新任务,要求模型同时输出语义答案和精确的时空证据,如跟踪对象分割掩码序列。作者创建了一个人工验证的基准数据集和一个可扩展的训练数据集,在基线方法上显示出显著改进。