更多推理,更低准确性?论视觉语言模型中推理的双重性
摘要
本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。
查看缓存全文
缓存时间: 2026/05/26 06:35
论文页面 - 思忖越多,准确度越低?论视觉语言模型中推理的双重属性
来源:https://huggingface.co/papers/2509.25848 发布于 2025 年 9 月 30 日
摘要
VAPO-Thinker-7B 通过将推理过程锚定到视觉信息来增强多模态推理,从而在保持逻辑推断能力的同时提升视觉任务表现。
推理已成为大语言模型(LLMs)的一项关键能力。通过强化学习(Reinforcement Learning,https://huggingface.co/papers?q=Reinforcement%20Learning),通常是组相对策略优化(GRPO),这些模型能够解决数学和代码生成等复杂任务。基于这些进展,近期研究致力于将推理能力扩展到视觉语言模型(Vision-Language Models,https://huggingface.co/papers?q=Vision-Language%20Models)(VLMs),并在各类视觉任务中取得了令人鼓舞的结果。然而,我们的研究揭示了多模态推理(multimodal reasoning,https://huggingface.co/papers?q=multimodal%20reasoning)的双重属性:尽管它显著增强了逻辑推理(logical inference,https://huggingface.co/papers?q=logical%20inference)并有助于解决难题,但也可能逐渐损害感知接地(perceptual grounding,https://huggingface.co/papers?q=perceptual%20grounding),导致在原本简单的视觉问题上出现识别失败。通过进一步分析,我们将这一现象归因于视觉遗忘(visual forgetting,https://huggingface.co/papers?q=visual%20forgetting),即长时间的推理使得模型逐渐忽视视觉输入。为解决这一问题,我们提出了视觉锚定策略优化(Vision-Anchored Policy Optimization,https://huggingface.co/papers?q=Vision-Anchored%20Policy%20Optimization)(VAPO),一种简单而有效的方法,显式地将推理过程导向视觉接地轨迹。我们的结果模型 VAPO-Thinker-7B 显著增强了模型对视觉信息的依赖,并在广泛的主流基准测试中取得了新的最优结果。项目页面:https://xytian1008.github.io/VAPO/
查看 arXiv 页面 (https://arxiv.org/abs/2509.25848)查看 PDF (https://arxiv.org/pdf/2509.25848)项目页面 (https://xytian1008.github.io/VAPO/)GitHub344 (https://github.com/xytian1008/VAPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2509.25848)
在你的代理中获取该论文:
hf papers read 2509.25848
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接到该论文
在模型 README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。
引用该论文的数据集0
没有数据集链接到该论文
在数据集 README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。
引用该论文的 Spaces0
没有 Space 链接到该论文
在 Space README.md 中引用 arxiv.org/abs/2509.25848 以从该页面链接。
包含该论文的收藏集7
浏览包含该论文的 7 个收藏集 (https://huggingface.co/collections?paper=2509.25848)
相似文章
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
从看到思考:解耦感知与推理改进视觉语言模型的后训练
本文提出一种分阶段训练方法,将视觉感知、视觉推理和文本推理分离为不同阶段。该方法提高了视觉推理准确性,同时缩短了推理链条长度,表明更强的感知能力可减少对过度推理的需求。
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。