精细粒度MLLM感知的区域级策略优化
摘要
Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。
查看缓存全文
缓存时间: 2026/09/18 03:01
论文页面 - 面向细粒度多模态大语言模型感知的区域级策略优化
来源:https://huggingface.co/papers/2609.19745
Vision-RL2:面向细粒度多模态大语言模型感知的区域级策略优化
多模态大语言模型中的细粒度感知通常意味着提升分辨率,但这会增加视觉标记数量与预填充成本。我们证明,相比于识别内容,定位兴趣区域可以承受约3-4倍的标记压缩率,因此两者不应共享同一分辨率。
Vision-RL2通过区域级强化学习,在冻结的多模态大语言模型之上训练轻量级区域提议网络:连贯的区域作为行动单元,冻结的阅读器通过评估移除每个区域后答案似然的变化程度进行评分。无需区域标注、无需响应采样、无需推理链。优化后的提议网络还支持稀疏视觉编码,仅保留前景标记。
在六个细粒度基准测试(V*、ZoomBench、HR-Bench 4K/8K、MME-RealWorld中英文版)和四个主干网络(Qwen3.5-4B/9B、Qwen2.5-VL-7B以及无编码器的Gemma-4-12B)上,Vision-RL2在所有视觉标记预算下均优于基础模型,且在训练参数量减少一个数量级的情况下,性能超越需要全量微调的先前方法。
- 代码:https://github.com/YuHengsss/VisionRL2
- 四种主干网络的检查点及训练数据:https://huggingface.co/collections/YuhengSSS/visionrl2
- 项目页面(包含真实样本的单步训练交互演示):https://yuhengsss.github.io/VisionRL2/
相似文章
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型
介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。
增强多模态推理以对抗视觉退化
本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。
VFA: 通过无视觉适应增强多模态大语言模型的多语言能力
本文提出无视觉适应(VFA),一种通过融合多语言和视觉对齐的任务向量来增强多模态大语言模型多语言能力的框架,无需视觉数据,并展示了性能提升和数据效率。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。