See2Think:多模态模型真的会使用中间视觉状态吗?
摘要
本文介绍了See2Think,一个统一的评估框架,用于测试多模态模型在推理过程中是否真正依赖中间视觉状态。研究发现,视觉推理高度依赖模型和环境,而忠实的渲染是主要瓶颈。
查看缓存全文
缓存时间: 2026/07/31 09:53
论文页面 - See2Think:多模态模型真的会使用中间视觉状态吗?
来源:https://huggingface.co/papers/2607.26769
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态大语言模型在推理过程中越来越多地使用草图、标注、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准的局限性既在于任务集合覆盖范围狭窄或包含部分可通过文本解决的样本,也在于评估只关注最终答案,而不诊断中间视觉状态是如何生成、渲染和使用的。我们提出 See2Think,一个统一的评估框架,包含 See2ThinkBench 和 Visual Action-of-Thought(VAoT)。See2ThinkBench 包含 1,200 个开放式、依赖视觉的问题,涵盖 12 个任务类别,涉及 2D 结构化、3D 场景和真实世界推理。VAoT 在四种受控推理设置下记录文本思考、视觉动作、渲染状态及后续推理。通过评估具有代表性的专有和开源多模态模型,我们发现视觉推理强烈依赖于模型和环境,没有任何单一设置能在所有任务中始终占优。过程分析进一步表明,模型通常会选择相关的视觉操作,而忠实渲染仍然是最明显的瓶颈,且较高的反馈采纳率并不一定转化为准确率的提升。在任务相关的损坏反馈下,模型表现出对视觉状态的行为依赖性,在受控干预中准确率下降超过 10 个百分点。
查看 arXiv 页面 (https://arxiv.org/abs/2607.26769) 查看 PDF (https://arxiv.org/pdf/2607.26769) 项目页面 (https://sgysy.github.io/seetothink/) GitHub3 (https://github.com/CSU-JPG/See2Think) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.26769)
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该数据集。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该 Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接到它。
相似文章
视觉的代价:在单一范式中实现可信的多模态推理
本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
轻看,重思:多模态思维链推理能做什么与不能做什么
本文系统评估了12个任务上的多模态思维链推理,发现它对推理任务有选择性效果,但对感知任务有害,并识别出了一种“轻看,重思”模式,即在推理过程中视觉内省能力下降。
更多推理,更低准确性?论视觉语言模型中推理的双重性
本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。
看见还是知道?多模态大语言模型中的视觉上下文敏感性
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。