轻看,重思:多模态思维链推理能做什么与不能做什么

Hugging Face Daily Papers 论文

摘要

本文系统评估了12个任务上的多模态思维链推理,发现它对推理任务有选择性效果,但对感知任务有害,并识别出了一种“轻看,重思”模式,即在推理过程中视觉内省能力下降。

思维链(CoT)已成为一种标准方法,通过激发逐步思考来提升大型语言模型(LLMs)的推理能力,但其在多模态任务中的有效性仍不明确。在本文中,我们旨在系统性地探究这一关键问题:多模态思维链推理能做什么,它在哪些方面以及为何表现不足?为此,我们使用14个非推理模型和8个推理模型,评估了感知和推理类别的12个多模态任务。我们的分析揭示了几项重要发现:(1)CoT并非免费午餐,应根据每个任务的具体要求有选择地使用。对于感知任务,CoT可能导致不良副作用,例如在视觉定位和物体计数中性能下降。相反,它在涉及数学、科学和多图像推理的推理任务中效果显著;(2)与原始模型相比,现有的开源多模态推理模型通常仅有微小的整体改进,这可能是由于过度强调数学推理而牺牲了更广泛的能力;(3)视觉推理仍然是当前多模态CoT的关键瓶颈,因为模型表现出“轻看,重思”的模式,即言语反思在推理过程中起伏不定,而视觉反思则持续减弱。这些发现表明,虽然多模态CoT处理言语反思相对较好,但它缺乏在整个推理过程中保持深度视觉内省的能力。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - 轻看,重思:多模态思维链推理能做什么与不能做什么

来源:https://huggingface.co/papers/2606.22565

摘要

多模态思维链推理在不同任务中表现出选择性的有效性,但在推理过程中维持视觉内省方面存在局限。

思维链(Chain-of-Thought, CoT)通过引发逐步思考,已成为提升大型语言模型(LLM)推理能力的标准方法,但其在多模态任务中的效果仍不明确。本文旨在系统性地探究关键问题:多模态思维链推理能做什么,在哪些方面、因何原因存在不足?为此,我们使用 14 个非推理模型和 8 个推理模型,对跨感知与推理类别的 12 个多模态任务进行了评估。我们的分析揭示了几个重要发现:(1) CoT 并非免费午餐,应根据每个任务的具体需求有选择地使用。对于感知任务,CoT 可能带来不良副作用,例如在视觉基础定位和物体计数任务中性能下降;相反,它在涉及数学、科学和多图像推理等推理任务中效果显著。(2) 与原始模型相比,现有的开源多模态推理模型通常仅带来微小的整体改进,这可能是由于过度强调数学推理而牺牲了更广泛的能力。(3) 视觉推理仍是当前多模态 CoT 的关键瓶颈,模型表现出“轻看,重思”的模式——语言层面的反思在推理过程中起伏,而视觉层面的反思则持续减弱。这些发现表明,尽管多模态 CoT 能较好地处理语言反思,但它缺乏在整个推理过程中维持深度视觉内省的能力。

查看 arXiv 页面 (https://arxiv.org/abs/2606.22565)查看 PDF (https://arxiv.org/pdf/2606.22565)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.22565)

在你的 Agent 中获取此论文:

hf papers read 2606.22565

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.22565 以从本页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

ThoughtFold: 通过内省偏好学习折叠推理链

arXiv cs.AI

ThoughtFold 提出了一种利用内省偏好学习的框架,旨在减少大型推理模型在思维链推理中的冗余探索,在 DeepSeek-R1-Distill-Qwen-7B 上实现了约 56% 的令牌减少,且准确率无损。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。