更多推理,更低准确性?论视觉语言模型中推理的双重性

Papers with Code Trending 论文

摘要

本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。

推理已成为大型语言模型(LLM)的关键能力。通过强化学习(RL),通常采用组相对策略优化(GRPO),这些模型能够解决数学和代码生成等复杂任务。基于这些进展,近期研究尝试将推理扩展到视觉语言模型(VLM),并在多种视觉任务上取得了令人瞩目的成果。然而,我们的研究揭示了多模态推理的双重性:虽然它能显著增强逻辑推理并促进对挑战性问题的求解,但可能逐渐损害感知基础,导致对基本视觉问题的识别失败。通过进一步分析,我们将这一现象归因于视觉遗忘——长时间推理使模型日益忽视视觉输入。为解决此问题,我们提出视觉锚定策略优化(VAPO),一种简单而有效的方法,明确将推理过程引导至视觉基础轨迹。我们的模型VAPO-Thinker-7B显著增强了模型对视觉信息的依赖,并在多个标准基准上取得了新的最先进成果。项目页面:https://xytian1008.github.io/VAPO/
查看原文
查看缓存全文

缓存时间: 2026/05/26 06:35

论文页面 - 思忖越多,准确度越低?论视觉语言模型中推理的双重属性

来源:https://huggingface.co/papers/2509.25848 发布于 2025 年 9 月 30 日

摘要

VAPO-Thinker-7B 通过将推理过程锚定到视觉信息来增强多模态推理,从而在保持逻辑推断能力的同时提升视觉任务表现。

推理已成为大语言模型(LLMs)的一项关键能力。通过强化学习(Reinforcement Learning,https://huggingface.co/papers?q=Reinforcement%20Learning),通常是组相对策略优化(GRPO),这些模型能够解决数学和代码生成等复杂任务。基于这些进展,近期研究致力于将推理能力扩展到视觉语言模型(Vision-Language Models,https://huggingface.co/papers?q=Vision-Language%20Models)(VLMs),并在各类视觉任务中取得了令人鼓舞的结果。然而,我们的研究揭示了多模态推理(multimodal reasoning,https://huggingface.co/papers?q=multimodal%20reasoning)的双重属性:尽管它显著增强了逻辑推理(logical inference,https://huggingface.co/papers?q=logical%20inference)并有助于解决难题,但也可能逐渐损害感知接地(perceptual grounding,https://huggingface.co/papers?q=perceptual%20grounding),导致在原本简单的视觉问题上出现识别失败。通过进一步分析,我们将这一现象归因于视觉遗忘(visual forgetting,https://huggingface.co/papers?q=visual%20forgetting),即长时间的推理使得模型逐渐忽视视觉输入。为解决这一问题,我们提出了视觉锚定策略优化(Vision-Anchored Policy Optimization,https://huggingface.co/papers?q=Vision-Anchored%20Policy%20Optimization)(VAPO),一种简单而有效的方法,显式地将推理过程导向视觉接地轨迹。我们的结果模型 VAPO-Thinker-7B 显著增强了模型对视觉信息的依赖,并在广泛的主流基准测试中取得了新的最优结果。项目页面:https://xytian1008.github.io/VAPO/

查看 arXiv 页面 (https://arxiv.org/abs/2509.25848)查看 PDF (https://arxiv.org/pdf/2509.25848)项目页面 (https://xytian1008.github.io/VAPO/)GitHub344 (https://github.com/xytian1008/VAPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2509.25848)

在你的代理中获取该论文:

hf papers read 2509.25848

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接到该论文

在模型 README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。

引用该论文的数据集0

没有数据集链接到该论文

在数据集 README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。

引用该论文的 Spaces0

没有 Space 链接到该论文

在 Space README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。

包含该论文的收藏集7

浏览包含该论文的 7 个收藏集 (https://huggingface.co/collections?paper=2509.25848)

相似文章

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。