[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。

Reddit r/MachineLearning 论文

摘要

这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 01:43

# 大型视觉-语言模型中的视觉因果推理基准评测

来源:https://arxiv.org/html/2506.11034v2

Aneesh Komanduri, Karuna Bhaila, Xintao Wu  
阿肯色大学电气工程与计算机科学系  
\{akomandu, kbhaila, xintaowu\}@uark\.edu

###### 摘要

大型语言模型(LLMs)在各种语言任务中展现出了卓越的能力,尤其是其涌现出的上下文学习能力。将LLMs扩展以融入视觉输入后,大型视觉-语言模型(LVLMs)在识别和视觉问答(VQA)等任务中表现出了令人印象深刻的能力。尽管人们对LLMs在因果发现和反事实推理等因果推理任务中的实用性兴趣日益浓厚,但展示LVLMs在视觉因果推理任务上能力的工作相对较少。我们借此机会正式引入一个用于LVLMs多模态上下文学习的综合性因果推理基准。我们的CausalVLBench包含三个代表性任务:因果结构推断、干预目标预测和反事实预测。我们在三个因果表示学习数据集上评估了最先进的开源LVLMs在因果推理任务上的能力,并展示了它们的基本优势和劣势。我们希望我们的基准能够阐明现有视觉-语言模型的缺陷,并推动改进LVLMs视觉因果推理能力的新方向和范式。我们的代码和数据可在https://github.com/Akomand/CausalVLBench获取。

CausalVLBench:大型视觉-语言模型中的视觉因果推理基准评测

Aneesh Komanduri, Karuna Bhaila, Xintao Wu  
阿肯色大学电气工程与计算机科学系  
\{akomandu, kbhaila, xintaowu\}@uark\.edu

## 1 引言

随着人们越来越重视开发能够模拟人类推理和思维模式的预训练模型,大量文献也聚焦于评估这些模型在复杂推理任务上的表现Nie et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib27)); Mitchell et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib26))。由于人类智能通常以因果推理为标志,即区分原因和结果的能力,研究人员也优先评估预训练模型在因果推断任务上的表现Zhang et al. (2023a (https://arxiv.org/html/2506.11034v2#bib.bib44)); Kıcıman et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib15)); Jin et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib13))。评估任务涵盖因果效应推断Jin et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib13))、因果发现Jiralerspong et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib14)); Vashishtha et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib37))以及反事实推理。然而,这些工作大多聚焦于分析LLMs的性能,而评估大型视觉-语言系统因果推理能力的工作相对较少。借助对比语言-图像预训练方法(如CLIPRadford et al. (2021 (https://arxiv.org/html/2506.11034v2#bib.bib31)))的突破,LVLMs引发了关于视觉信息增强的语言模型能力的新研究问题。LVLMs通常通过将类似CLIP的视觉编码器集成到LLM架构中,并通过投影对齐两种模态来构建,已在识别、定位和VQALi et al. (2025b (https://arxiv.org/html/2506.11034v2#bib.bib22))等任务中展现出巨大潜力。近期,Zong et al. (2025 (https://arxiv.org/html/2506.11034v2#bib.bib47))通过多模态上下文学习(ICL)在各种任务上对LVLMs进行了基准测试,并且正在持续努力将推理能力融入并改进DeepSeek R1Guo et al. (2025 (https://arxiv.org/html/2506.11034v2#bib.bib12))和OpenAI o3等模型。与对LLMs的因果评估类似,检查LVLMs的因果推理能力非常重要,因为构建能够推理和规划的语言与视觉智能体对于LLMs和LVLMs在真实场景中的可靠使用至关重要Gkountouras et al. (2025 (https://arxiv.org/html/2506.11034v2#bib.bib11))。然而,对于AI系统来说,从高维数据(例如包含物理和动态系统中复杂因果依赖关系的图像)中学习因果关系要困难得多Scholkopf et al. (2021 (https://arxiv.org/html/2506.11034v2#bib.bib35)); Komanduri et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib17))。

在本工作中,我们研究了LVLMs的因果推理能力。此前,Chen et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib7))在因果动机的VQA任务上评估了LVLMs的性能,其中因果关系是根据从图像场景图表示中提取的可观察交互来定义的。然而,他们的评估聚焦于源自人与物体交互的场景特定关系。相比之下,我们关注的是LVLMs对由确定性因果机制描述的系统(例如,图2(a) (https://arxiv.org/html/2506.11034v2#S4.F2.sf1)中光源位置导致阴影长度变化)执行形式化视觉因果推理的能力。我们将视觉因果推理任务表述为LVLMs解开因果变量并推理其关系的能力,这是因果表示学习的基本目标Scholkopf et al. (2021 (https://arxiv.org/html/2506.11034v2#bib.bib35))。我们进一步在零样本和少样本学习设置下评估LVLMs的视觉因果推理能力。在这种设置下评估LVLMs的因果推理能力对于在不同领域构建稳健的AI系统具有重要意义。

我们的贡献是:
(1)我们将LVLMs中的因果推理表述为从视觉线索推断因果机制。
(2)我们构建了一个基准CausalVLBench,包含三个代表性任务:因果结构推断、干预目标预测和反事实预测,以评估LVLMs在零样本和少样本设置下的视觉因果推理能力。
(3)我们研究了无因果图提示、演示选择以及零样本思维链对LVLMs性能的影响。
(4)我们对多个LVLMs进行了严格的实证评估,以评估它们在理解物理系统中潜在因果机制方面的表现。我们主要使用开源模型进行实验,以保持透明度和可复现性。

我们的实验表明,在结合文本和图像模态的同时进行形式化因果推理对当前最先进的LVLMs来说具有挑战性。我们希望我们的评估能够阐明现有模型的缺陷,并推动开发新的训练范式以促进大型多模态模型中的因果推理Vashishtha et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib36)); Rajendran et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib32))。

## 2 相关工作

#### 因果关系与LLMs。
近期研究表明,LLMs能够在很大程度上回答L1\mathcal{L}_{1}(观测性)问题,但在回答L2\mathcal{L}_{2}(干预性)和L3\mathcal{L}_{3}(反事实)问题上存在困难Zhang et al. (2023a (https://arxiv.org/html/2506.11034v2#bib.bib44))。Zečević et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib43))研究了大型语言模型的因果推理能力,并推测它们可能是“因果鹦鹉”,可能只是从训练数据中学习因果事实,而非真正进行因果推理。作者提出了“因果事实相关性”的概念,即利用Pearl因果层级定理(CHT)的一个漏洞来表面地谈论因果关系。也就是说,LLMs可能只是学习训练分布中嵌入的关于因果事实的相关性。LLMs已在各种不同的因果推断任务上得到评估。Jin et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib13))开发了CLADDER数据集来测试LLMs在因果效应估计任务上的能力,并得出结论:LLMs在此类任务上表现相当糟糕。一些工作探索了将LLMs作为领域专家用于因果结构学习任务的可用性Vashishtha et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib37)); Feder et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib10)); Romanou et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib34)); Cohrs et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib8)); Jiralerspong et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib14))。另一个方向从潜在空间探测了LLMs的可解释性Rohekar et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib33)); Park et al. (2023 (https://arxiv.org/html/2506.11034v2#bib.bib28)); Rajendran et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib32))。

#### 基准评估。
因果评估基准已涵盖各种领域和模态。近期,出现了一些仅关注文本模态的基准,任务包括数学推理(Wang,2024 (https://arxiv.org/html/2506.11034v2#bib.bib39))、常识因果(Miliani et al.,2025 (https://arxiv.org/html/2506.11034v2#bib.bib25))和因果效应估计(Jin et al.,2023 (https://arxiv.org/html/2506.11034v2#bib.bib13))。扩展到视觉-语言设置,Chen et al. (2024 (https://arxiv.org/html/2506.11034v2#bib.bib7))在因果推断任务上评估了视觉-语言模型。然而,他们的方法侧重于从表示人与物体交互的场景图中提取因果关系。类似地,Li et al. (2025a (https://arxiv.org/html/2506.11034v2#bib.bib21))提出了一个多模态因果推理基准,但仍聚焦于高层因果关系。Liu et al. (2025 (https://arxiv.org/html/2506.11034v2#bib.bib24))提出了一个用于因果推理任务的基准3D数据集,并使用闭源大型视觉-语言模型评估了若干任务。相比之下,我们关注具有物理和确定性解释(即物理机制)的因果关系,并在超越因果结构推断的新任务上评估预训练大型视觉-语言模型的形式化因果推理能力,包括干预目标预测和反事实推理。

## 3 预备知识

#### 因果推断。
我们的工作主要依赖于Pearl (2009 (https://arxiv.org/html/2506.11034v2#bib.bib29))的因果关系框架,该框架以数学形式化了因果推理。该框架包含三级因果推断层级,称为“因果阶梯”Pearl and Mackenzie (2018 (https://arxiv.org/html/2506.11034v2#bib.bib30))或“Pearl因果层级(PCH)”(Bareinboim et al.,2022 (https://arxiv.org/html/2506.11034v2#bib.bib5))。

- •第1级,即L1\mathcal{L}_{1},指随机变量之间的统计关联,涉及对联合分布和条件分布的推理。该层级描述诸如“我生病时应该多久吃一次药?”的问题。
- •第2级,即L2\mathcal{L}_{2},支持对变量进行干预以推理其效应。我们可以通过do算子(即do(X=x)X=x)对随机变量XX进行干预。该层级描述诸如“如果我吃药,我的病会痊愈吗?”的问题。
- •第3级,即L3\mathcal{L}_{3},处理反事实推理(即“如果……会怎样?”的问题),以想象世界可能变得不同的替代情景。该层级描述诸如“如果我当时吃了药,我的病会痊愈吗?”的问题。

要一起推理所有这些量,需要Pearl (2009 (https://arxiv.org/html/2506.11034v2#bib.bib29))提出的结构因果模型(SCM)形式体系,定义如下。

###### 定义1 结构因果模型(SCM)由元组⟨Z,U,F⟩\langle Z,U,F\rangle形式化定义,其中ZZ是nn个内生变量的集合,UU是nn个外生噪声变量的集合,FF是一组形式为Zi=fi(Zpai,Ui)Z_{i}=f_{i}(Z_{pa_{i}},U_{i})的结构方程,其中ZpaiZ_{pa_{i}}是ZiZ_{i}的因果父节点。条件分布P(Zi|Zpai)P(Z_{i}|Z_{pa_{i}})定义了ZiZ_{i}在其父节点条件下的条件分布。联合观测分布可以分解如下:
P(Z1,...,Zn)=∏i=1nP(Zi|Zpai)P(Z_{1},\dots,Z_{n})=\prod_{i=1}^{n}P(Z_{i}|Z_{pa_{i}})
(1)
SCM所蕴含的观测(L1\mathcal{L}_{1})、干预(L2\mathcal{L}_{2})和反事实(L3\mathcal{L}_{3})分布形成一个层级,即L1⊂L2⊂L3\mathcal{L}_{1}\subset\mathcal{L}_{2}\subset\mathcal{L}_{3},其中每一层编码了前一层无法表达的更丰富的信息。

#### 上下文学习。
给定一个预训练的大型视觉-语言模型MθM_{\theta}、一条文本指令II、一个支持集S=(Xi,Yi)S=(X_{i},Y_{i})(包含查询示例XX及其对应答案YY,即演示),以及一个测试查询X∗X^{*},上下文学习的目标是估计以下条件分布:
pθ(Y∗|I,X∗,S)p_{\theta}(Y^{*}|I,X^{*},S)
(2)
在视觉-语言模型的上下文中,XX采用图像加文本提示的形式,输出YY是生成的文本。

参见图1说明:不同的因果推理任务,包括因果结构推断(标准和交错)、干预目标预测以及反事实预测。

## 4 CausalVLBench

在本文中,我们研究大型视觉-语言模型扩展设置下的因果推理问题。我们提出三个主要的因果推理任务:因果结构推断、干预目标预测和反事实预测。设X=(V,Q)X=(V,Q)分解为视觉和文本查询。设Z={Z1,...,Zn}Z=\{Z_{1},\dots,Z_{n}\}为控制图像所示系统并在系统提示II中描述的因果变量集合。对于所有任务表述,我们使用prompt(⋅)\textbf{prompt}(\cdot)表示一个函数,该函数将包含一组因果变量和/或因果图的输入转换为合适的文本提示。

参见图注
(a) 摆
参见图注
(b) 水流
参见图注
(c) 因果电路

图2:评估中使用的所有数据集的因果系统

#### 任务1:因果结构推断。
因果发现是指从观测或干预数据中学习因果结构Vowels et al. (2021 (https://arxiv.org/html/2506.11034v2#bib.bib38))。在此任务中,我们提示LVLM从输入图像和文本中推断因果图。对应于使用观测和干预数据进行因果发现,我们设计了两个独特的设置来评估视觉-语言模型从各自上下文中推导因果关系的能力。

- •任务1A:标准因果结构推断。给定单张图像和一条提供图像中感兴趣变量高层描述的指令提示,我们通过一系列是/否问题提示LVLM推断给定变量之间的因果结构。
- •任务1B:交错因果结构推断。给定一个图像对和

相似文章

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。