精细粒度MLLM感知的区域级策略优化

Hugging Face Daily Papers 论文

摘要

Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。

在多模态大型语言模型中,提高分辨率通常能改善精细视觉感知,但增加的视觉令牌会加剧视觉编码和语言模型预填充的成本。我们发现,精细感知的两个基础操作——定位感兴趣区域(RoI)和识别其内容——具有不同的分辨率需求。在一个受控诊断实验中,定位能容忍比识别大约3到4倍的强令牌压缩,这启示我们从粗略视图中定位,并将分辨率集中在选定的证据上。使用MLLM解码坐标可以通过答案端到端训练,但每次查询都需要整个模型传递,并依赖于定位能力。一个从模型注意力中提炼的轻量级提议网络速度快,但继承了其注意力目标的噪声。提议网络的RoI通过离散区域选择来获取答案,因此其与答案的一致性无法监督网络。因此,我们使用区域级强化学习优化提议网络,称之为Vision-RL²。它将连贯区域视为动作,并通过冻结的MLLM阅读器根据移除每个区域如何改变答案的可能性来评分。互补的减法和加法目标抑制干扰提案并恢复缺失证据,仅更新预测器,无需区域注释、响应采样或推理轨迹。精炼的提议进一步实现稀疏编码,放大证据并排除背景令牌。在六个精细粒度基准测试和四个MLLM骨干网络中,Vision-RL²在每个令牌预算下都提高了基础模型的准确性,并以大约4倍更少的视觉令牌超过了其最大预算的准确性。代码可在 https://github.com/YuHengsss/VisionRL2 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/18 03:01

论文页面 - 面向细粒度多模态大语言模型感知的区域级策略优化

来源:https://huggingface.co/papers/2609.19745

Vision-RL2:面向细粒度多模态大语言模型感知的区域级策略优化

多模态大语言模型中的细粒度感知通常意味着提升分辨率,但这会增加视觉标记数量与预填充成本。我们证明,相比于识别内容,定位兴趣区域可以承受约3-4倍的标记压缩率,因此两者不应共享同一分辨率。

Vision-RL2通过区域级强化学习,在冻结的多模态大语言模型之上训练轻量级区域提议网络:连贯的区域作为行动单元,冻结的阅读器通过评估移除每个区域后答案似然的变化程度进行评分。无需区域标注、无需响应采样、无需推理链。优化后的提议网络还支持稀疏视觉编码,仅保留前景标记。

在六个细粒度基准测试(V*、ZoomBench、HR-Bench 4K/8K、MME-RealWorld中英文版)和四个主干网络(Qwen3.5-4B/9B、Qwen2.5-VL-7B以及无编码器的Gemma-4-12B)上,Vision-RL2在所有视觉标记预算下均优于基础模型,且在训练参数量减少一个数量级的情况下,性能超越需要全量微调的先前方法。

  • 代码:https://github.com/YuHengsss/VisionRL2
  • 四种主干网络的检查点及训练数据:https://huggingface.co/collections/YuhengSSS/visionrl2
  • 项目页面(包含真实样本的单步训练交互演示):https://yuhengsss.github.io/VisionRL2/

相似文章

面向多模态推理的结构化角色感知策略优化

arXiv cs.AI

本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。

增强多模态推理以对抗视觉退化

Hugging Face Daily Papers

本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。