视觉工具使用的幻觉:对图像思考的因果审计

Hugging Face Daily Papers 论文

摘要

本文通过因果干预审计多模态大语言模型中的视觉工具使用,揭示尽管总体准确率有所提升,返回的观察结果往往缺乏因果效应。它识别出诸如“不看就调用”和“不做规划就看”等失败模式,并引入了“视觉工具使用的幻觉”这一概念。

“用图像思考”范式为多模态大语言模型配备了主动视觉操作,如裁剪和缩放。然而,使用这些操作的模型相对于直接推理往往仅获得边际甚至负面的收益,却消耗了显著更高的token成本。它们还可能反复裁剪无关区域,并在直接推理能正确回答的问题上失败。我们探究返回的视觉证据是否对答案产生因果影响。为回答此问题,我们将视觉工具使用形式化为一个因果图,将观察介导的路径与行动引发的捷径分开。然后我们通过三个层面的干预对其进行审计:策略层面(比较工具使用与直接推理)、轨迹层面(在rollout期间破坏所有观察)和步骤层面(在固定前缀下反事实地替换单个观察)。我们的步骤层面估计量——视觉证据增益——隔离了每个返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,我们发现策略校准失误并存在两种失败模式。在“不看就调用”中,返回的观察对答案没有因果影响。在“不做规划就看”中,观察具有信息量但调用调度不连贯。轨迹层面的诊断分解了策略层面的准确率增益,并显示该增益集中于少数“校准”样本中。我们将这种差异称为视觉工具使用的幻觉:尽管总体准确率有所提升,视觉工具使用在广泛的rollout中并不具有因果有效性。代码可在 https://github.com/OpenCausaLab/CauAudit 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:33

论文页面 - 视觉工具使用的幻觉:对图像思维进行因果审计

摘要

视觉工具使用(visual tool-use)在多模态LLM中往往缺乏因果有效性,尽管总体准确率有所提升,但返回的观察结果经常无法影响答案,或者被不一致地使用。

“图像思维”(thinking-with-images)范式为多模态LLM(https://huggingface.co/papers?q=multimodal%20LLMs)配备了裁剪和缩放等主动视觉操作。然而,使用这些操作的模型相比直接推理往往只获得很小甚至负面的增益,却消耗了显著更高的token成本。它们还可能反复裁剪不相关的区域,并且无法回答直接推理就能正确回答的问题。我们想知道返回的视觉证据是否对答案产生因果影响。为了回答这个问题,我们将视觉工具使用(https://huggingface.co/papers?q=visual%20tool-use)形式化为因果图(https://huggingface.co/papers?q=causal%20graph),它把由观察介导的路径(https://huggingface.co/papers?q=observation-mediated%20paths)与动作诱导的捷径(https://huggingface.co/papers?q=action-induced%20shortcuts)区分开来。然后我们在三个层面通过干预来审计它:策略层面(比较工具使用与直接推理)、轨迹层面(在rollout过程中破坏所有观察)、步骤层面(在固定前缀下反事实地替换单个观察)。我们步骤层面的估计量——视觉证据增益(Visual Evidence Gain)——分离出每一条返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,我们发现了策略失准(policy miscalibration)的两种失败模式。在“不查看就调用”(https://huggingface.co/papers?q=Calling%20Without%20Looking)模式中,返回的观察对答案没有因果影响。在“只查看不规划”(https://huggingface.co/papers?q=Looking%20Without%20Planning)模式中,观察具有信息量,但调用计划不一致。轨迹级诊断分解了策略级准确率增益,并表明该增益集中在已校准的少数中。我们将这种差异称为视觉工具使用的幻觉(https://huggingface.co/papers?q=illusion%20of%20visual%20tool-use):尽管总体准确率有所提升,但视觉工具使用在广泛的rollout中并不具有因果有效性。代码可在 https://github.com/OpenCausaLab/CauAudit 获取。

查看arXiv页面(https://arxiv.org/abs/2608.06270)查看PDF(https://arxiv.org/pdf/2608.06270)GitHub1(https://github.com/OpenCausaLab/CauAudit)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.06270)

在您的智能体中获取此论文:

hf papers read 2608.06270

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。

引用此论文的Space0

没有Space关联此论文

在Space README.md中引用 arxiv.org/abs/2608.06270 以从该页面链接它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从该页面链接它。

相似文章