iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型
摘要
介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。
查看缓存全文
缓存时间: 2026/06/01 11:20
论文页面 - iVGR:通过强化学习将视觉定位推理内化到多模态大语言模型中
来源:https://huggingface.co/papers/2605.31096
摘要
引入了一种名为 iVGR 的强化学习框架,旨在将视觉定位能力迁移至文本推理中,从而在推理阶段无需显式视觉定位的情况下,提升多模态语言模型的细粒度感知能力。
虽然带有视觉定位的思维链(Chain-of-Thought,CoT)已成为增强多模态大语言模型(MLLMs)细粒度感知的一种有前途的范式,但其在推理阶段的有效性仍未被充分探索。在本工作中,我们通过实验发现,在推理阶段强制使用显式物体框的视觉定位 CoT 往往比使用标准文本 CoT(即不依赖显式视觉定位的推理)表现更差。我们假设视觉定位能力可以被内化到文本 CoT 中,而强制性的显式定位会引入不必要的干扰,影响模型的主要目标——答案预测。为解决这一问题,我们提出了一种名为内化视觉定位推理(iVGR)的新颖强化学习框架,该框架将定位能力迁移至文本推理过程。我们采用双流训练策略,通过设计的一致性奖励将文本流与高质量的视觉定位流对齐,使模型在推理时无需显式定位即可准确进行定位。大量实验表明,我们的方法在细粒度基准测试中显著优于现有基线,同时保留了对工具辅助推理流程的灵活性支持。
查看 arXiv 页面(https://arxiv.org/abs/2605.31096)查看 PDF(https://arxiv.org/pdf/2605.31096)项目页面(https://visual-ai.github.io/ivgr/)GitHub4(在您的代理中获取这篇论文:https://github.com/Visual-AI/iVGR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31096)
hf papers read 2605\.31096
没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。
引用该论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。
引用该论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.31096,即可在此页面中链接该论文。
包含该论文的收藏1
相似文章
锚定关键要素:面向视觉基础多模态推理的双层学习框架
本文提出PIVOT,一个双层学习框架,通过自校准经验回放和视觉引导优势分配优化强化学习,以增强大型视觉语言模型中的视觉基础推理。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
精细粒度MLLM感知的区域级策略优化
Vision-RL²是一种方法,通过区域级强化学习压缩视觉令牌,在不进行全模型微调的情况下,提升多模态大型语言模型在多个基准测试中的精细粒度感知性能。
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。