See2Think:多模态模型真的会使用中间视觉状态吗?

Hugging Face Daily Papers 论文

摘要

本文介绍了See2Think,一个统一的评估框架,用于测试多模态模型在推理过程中是否真正依赖中间视觉状态。研究发现,视觉推理高度依赖模型和环境,而忠实的渲染是主要瓶颈。

多模态大语言模型在推理过程中越来越多地使用草图、标注、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准测试受到两方面的限制:一是任务集合覆盖范围窄或部分样本可通过文本解决,二是评估侧重于最终答案,而没有诊断中间视觉状态是如何生成、渲染和使用的。我们引入了See2Think,一个统一的评估框架,包含See2ThinkBench和视觉思维链(Visual Action-of-Thought, VAoT)。See2ThinkBench包含1,200个开放式、依赖视觉的问题,涵盖12个任务类别,涉及二维结构化、三维场景和现实世界推理。VAoT在四种受控推理设置下记录文本思考、视觉动作、渲染状态及后续推理。通过评估代表性的专有和开源多模态模型,我们发现视觉推理强烈依赖于模型和环境,没有任何一种设置能在所有任务中持续占优。过程分析进一步表明,模型通常会选择相关的视觉操作,而忠实的渲染仍然是最明显的瓶颈,且高反馈采纳率并不一定转化为准确率的提升。在与任务相关的损坏反馈下,模型表现出对视觉状态的行为依赖性,在受控干预中准确率下降超过10个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/31 09:53

论文页面 - See2Think:多模态模型真的会使用中间视觉状态吗?

来源:https://huggingface.co/papers/2607.26769

作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

多模态大语言模型在推理过程中越来越多地使用草图、标注、工具和中间图像,但目前尚不清楚它们是否真正依赖这些视觉状态。现有基准的局限性既在于任务集合覆盖范围狭窄或包含部分可通过文本解决的样本,也在于评估只关注最终答案,而不诊断中间视觉状态是如何生成、渲染和使用的。我们提出 See2Think,一个统一的评估框架,包含 See2ThinkBench 和 Visual Action-of-Thought(VAoT)。See2ThinkBench 包含 1,200 个开放式、依赖视觉的问题,涵盖 12 个任务类别,涉及 2D 结构化、3D 场景和真实世界推理。VAoT 在四种受控推理设置下记录文本思考、视觉动作、渲染状态及后续推理。通过评估具有代表性的专有和开源多模态模型,我们发现视觉推理强烈依赖于模型和环境,没有任何单一设置能在所有任务中始终占优。过程分析进一步表明,模型通常会选择相关的视觉操作,而忠实渲染仍然是最明显的瓶颈,且较高的反馈采纳率并不一定转化为准确率的提升。在任务相关的损坏反馈下,模型表现出对视觉状态的行为依赖性,在受控干预中准确率下降超过 10 个百分点。

查看 arXiv 页面 (https://arxiv.org/abs/2607.26769) 查看 PDF (https://arxiv.org/pdf/2607.26769) 项目页面 (https://sgysy.github.io/seetothink/) GitHub3 (https://github.com/CSU-JPG/See2Think) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.26769)

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该数据集。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.26769,即可从本页链接到该 Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接到它。

相似文章

视觉的代价:在单一范式中实现可信的多模态推理

Hugging Face Daily Papers

本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

更多推理,更低准确性?论视觉语言模型中推理的双重性

Papers with Code Trending

本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。