iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型

Hugging Face Daily Papers 论文

摘要

介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。

虽然视觉基础思维链 (CoT) 已成为增强多模态大语言模型 (MLLMs) 细粒度感知的一种有前景的范式,但其在推理阶段的效率仍未被充分探索。在这项工作中,我们通过实验发现,在推理过程中强制要求视觉基础 CoT 中的显式目标框通常会降低性能,而标准的文本 CoT(无显式视觉基础的推理)则表现更好。我们假设视觉定位能力可以内化到文本 CoT 中,而强制性的显式基础会对模型回答预测的主要目标引入不必要的干扰。为了解决这个问题,我们提出了一种新颖的强化学习框架——内化视觉基础推理 (iVGR),它将定位能力转移到文本推理过程中。我们采用双流训练策略,通过提出的一致性奖励将文本流与高质量的视觉基础流对齐,使模型在推理过程中无需显式基础即可准确定位。大量实验表明,我们的方法在细粒度基准测试上显著优于现有基线,同时保持了支持工具辅助推理工作流的灵活性。
查看原文
查看缓存全文

缓存时间: 2026/06/01 11:20

论文页面 - iVGR:通过强化学习将视觉定位推理内化到多模态大语言模型中

来源:https://huggingface.co/papers/2605.31096

摘要

引入了一种名为 iVGR 的强化学习框架,旨在将视觉定位能力迁移至文本推理中,从而在推理阶段无需显式视觉定位的情况下,提升多模态语言模型的细粒度感知能力。

虽然带有视觉定位的思维链(Chain-of-Thought,CoT)已成为增强多模态大语言模型(MLLMs)细粒度感知的一种有前途的范式,但其在推理阶段的有效性仍未被充分探索。在本工作中,我们通过实验发现,在推理阶段强制使用显式物体框的视觉定位 CoT 往往比使用标准文本 CoT(即不依赖显式视觉定位的推理)表现更差。我们假设视觉定位能力可以被内化到文本 CoT 中,而强制性的显式定位会引入不必要的干扰,影响模型的主要目标——答案预测。为解决这一问题,我们提出了一种名为内化视觉定位推理(iVGR)的新颖强化学习框架,该框架将定位能力迁移至文本推理过程。我们采用双流训练策略,通过设计的一致性奖励将文本流与高质量的视觉定位流对齐,使模型在推理时无需显式定位即可准确进行定位。大量实验表明,我们的方法在细粒度基准测试中显著优于现有基线,同时保留了对工具辅助推理流程的灵活性支持。

查看 arXiv 页面(https://arxiv.org/abs/2605.31096)查看 PDF(https://arxiv.org/pdf/2605.31096)项目页面(https://visual-ai.github.io/ivgr/)GitHub4(在您的代理中获取这篇论文:https://github.com/Visual-AI/iVGR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31096)

hf papers read 2605\.31096

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。

引用该论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。

引用该论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。

包含该论文的收藏1

相似文章

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

精细粒度MLLM感知的区域级策略优化

Hugging Face Daily Papers

Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。