轻看,重思:多模态思维链推理能做什么与不能做什么
摘要
本文系统评估了12个任务上的多模态思维链推理,发现它对推理任务有选择性效果,但对感知任务有害,并识别出了一种“轻看,重思”模式,即在推理过程中视觉内省能力下降。
查看缓存全文
缓存时间: 2026/06/25 05:17
论文页面 - 轻看,重思:多模态思维链推理能做什么与不能做什么
来源:https://huggingface.co/papers/2606.22565
摘要
多模态思维链推理在不同任务中表现出选择性的有效性,但在推理过程中维持视觉内省方面存在局限。
思维链(Chain-of-Thought, CoT)通过引发逐步思考,已成为提升大型语言模型(LLM)推理能力的标准方法,但其在多模态任务中的效果仍不明确。本文旨在系统性地探究关键问题:多模态思维链推理能做什么,在哪些方面、因何原因存在不足?为此,我们使用 14 个非推理模型和 8 个推理模型,对跨感知与推理类别的 12 个多模态任务进行了评估。我们的分析揭示了几个重要发现:(1) CoT 并非免费午餐,应根据每个任务的具体需求有选择地使用。对于感知任务,CoT 可能带来不良副作用,例如在视觉基础定位和物体计数任务中性能下降;相反,它在涉及数学、科学和多图像推理等推理任务中效果显著。(2) 与原始模型相比,现有的开源多模态推理模型通常仅带来微小的整体改进,这可能是由于过度强调数学推理而牺牲了更广泛的能力。(3) 视觉推理仍是当前多模态 CoT 的关键瓶颈,模型表现出“轻看,重思”的模式——语言层面的反思在推理过程中起伏,而视觉层面的反思则持续减弱。这些发现表明,尽管多模态 CoT 能较好地处理语言反思,但它缺乏在整个推理过程中维持深度视觉内省的能力。
查看 arXiv 页面 (https://arxiv.org/abs/2606.22565)查看 PDF (https://arxiv.org/pdf/2606.22565)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.22565)
在你的 Agent 中获取此论文:
hf papers read 2606.22565
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
思维链削弱多模态大模型的视觉空间推理能力
研究表明,由于捷径学习和仅凭文本臆造视觉细节,思维链提示会损害多模态大模型在视觉空间推理方面的表现。
See2Think:多模态模型真的会使用中间视觉状态吗?
本文介绍了See2Think,一个统一的评估框架,用于测试多模态模型在推理过程中是否真正依赖中间视觉状态。研究发现,视觉推理高度依赖模型和环境,而忠实的渲染是主要瓶颈。
LLM推理研究中的奇怪现象:我们正在尝试去除思维链痕迹
本文讨论了LLM推理研究的一个转变:从通过思维链使推理显式化,转向探索无需语言痕迹的潜在推理,质疑可见性对于有效推理是否必要。
ThoughtFold: 通过内省偏好学习折叠推理链
ThoughtFold 提出了一种利用内省偏好学习的框架,旨在减少大型推理模型在思维链推理中的冗余探索,在 DeepSeek-R1-Distill-Qwen-7B 上实现了约 56% 的令牌减少,且准确率无损。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。