视觉工具使用的幻觉:对图像思考的因果审计
摘要
本文通过因果干预审计多模态大语言模型中的视觉工具使用,揭示尽管总体准确率有所提升,返回的观察结果往往缺乏因果效应。它识别出诸如“不看就调用”和“不做规划就看”等失败模式,并引入了“视觉工具使用的幻觉”这一概念。
查看缓存全文
缓存时间: 2026/08/13 15:33
论文页面 - 视觉工具使用的幻觉:对图像思维进行因果审计
摘要
视觉工具使用(visual tool-use)在多模态LLM中往往缺乏因果有效性,尽管总体准确率有所提升,但返回的观察结果经常无法影响答案,或者被不一致地使用。
“图像思维”(thinking-with-images)范式为多模态LLM(https://huggingface.co/papers?q=multimodal%20LLMs)配备了裁剪和缩放等主动视觉操作。然而,使用这些操作的模型相比直接推理往往只获得很小甚至负面的增益,却消耗了显著更高的token成本。它们还可能反复裁剪不相关的区域,并且无法回答直接推理就能正确回答的问题。我们想知道返回的视觉证据是否对答案产生因果影响。为了回答这个问题,我们将视觉工具使用(https://huggingface.co/papers?q=visual%20tool-use)形式化为因果图(https://huggingface.co/papers?q=causal%20graph),它把由观察介导的路径(https://huggingface.co/papers?q=observation-mediated%20paths)与动作诱导的捷径(https://huggingface.co/papers?q=action-induced%20shortcuts)区分开来。然后我们在三个层面通过干预来审计它:策略层面(比较工具使用与直接推理)、轨迹层面(在rollout过程中破坏所有观察)、步骤层面(在固定前缀下反事实地替换单个观察)。我们步骤层面的估计量——视觉证据增益(Visual Evidence Gain)——分离出每一条返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,我们发现了策略失准(policy miscalibration)的两种失败模式。在“不查看就调用”(https://huggingface.co/papers?q=Calling%20Without%20Looking)模式中,返回的观察对答案没有因果影响。在“只查看不规划”(https://huggingface.co/papers?q=Looking%20Without%20Planning)模式中,观察具有信息量,但调用计划不一致。轨迹级诊断分解了策略级准确率增益,并表明该增益集中在已校准的少数中。我们将这种差异称为视觉工具使用的幻觉(https://huggingface.co/papers?q=illusion%20of%20visual%20tool-use):尽管总体准确率有所提升,但视觉工具使用在广泛的rollout中并不具有因果有效性。代码可在 https://github.com/OpenCausaLab/CauAudit 获取。
查看arXiv页面(https://arxiv.org/abs/2608.06270)查看PDF(https://arxiv.org/pdf/2608.06270)GitHub1(https://github.com/OpenCausaLab/CauAudit)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.06270)
在您的智能体中获取此论文:
hf papers read 2608.06270
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。
引用此论文的Space0
没有Space关联此论文
在Space README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接它。
相似文章
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。
Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents
This paper investigates when hybrid computer-use agents actually choose to use MCP tools versus screenshots, finding that tool availability alone does not guarantee adoption: a reasoning model improves while a non-reasoning model degrades. It also explores training and context compression strategies to close the adoption gap and reduce token costs.
思维链削弱多模态大模型的视觉空间推理能力
研究表明,由于捷径学习和仅凭文本臆造视觉细节,思维链提示会损害多模态大模型在视觉空间推理方面的表现。
通过工具监督强化学习实现视觉推理
提出 ToolsRL,一个两阶段强化学习框架,教多模态大模型使用简单视觉工具完成复杂视觉推理任务。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。