面向以对象为中心的视觉推理的弱监督概念学习

arXiv cs.LG 论文

摘要

本文提出了一种两阶段的神经符号框架,利用弱监督(仅需 1% 的标签)结合基于 Slot 的变分自编码器(VAE),学习用于以对象为中心的视觉推理的可解释符号,在领域泛化方面优于基础模型。

arXiv:2605.08201v1 公告类型:新文章 摘要:神经符号系统有望将深度神经网络(DNN)对原始传感器输入的处理能力与符号人工智能的少样本性能相结合。两阶段方法明确地将基于 DNN 的感知与随后的基于规则的推理解耦。这避免了端到端可微分方法在优化和可解释性方面的问题,但需要为感知输出提供昂贵的标签。本文针对感知阶段引入了一种高效的弱监督方案,为以对象为中心的推理任务中的逻辑归纳提供输出符号的 grounding(语义关联)。该方法将用于实现以对象为中心架构的基于 Slot 的结构与用于自监督的变分自编码器(VAE)相结合,在潜在维度上与概念引导相竞争,以实现人类可解释的 grounding。得到的预测结果被转化为符号背景知识,供推理框架使用,例如归纳逻辑编程(ILP)、决策树和贝叶斯网络。我们在合成数据集和真实世界数据集上进行的广泛实证评估表明,我们的方法可以发现用于以对象为中心推理的复杂抽象规则,同时将监督标签减少至仅 1%,并且在显著的领域偏移下依然保持鲁棒性。值得注意的是,在 1% 的监督条件下,它甚至在领域泛化方面优于最先进的(SOTA)基础模型基线。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:04

# 面向以对象为中心的视觉推理的弱监督概念学习

来源:https://arxiv.org/html/2605.08201
Bettina Finzel 班贝格大学,德国 [email protected]
Gesina Schwalbe 乌尔姆大学,德国;吕贝克大学,德国 [email protected]

###### 摘要

神经符号系统有望将深度神经网络(DNN)对原始传感器输入的处理能力与符号人工智能(AI)的少样本性能相结合。

两阶段方法明确地将基于 DNN 的感知与后续的基于规则的推理解耦。这避免了端到端可微方法在优化和可解释性方面的问题,但需要为感知输出提供昂贵的标签。本文引入了一种高效的弱监督方案用于感知阶段,以在面向对象的推理任务中为其输出符号进行接地(grounding),以便进行逻辑归纳。该方法将基于槽位(slot-based)的架构用于实现以对象为中心的特性,并结合变分自编码器(VAE)进行自监督,在潜在维度上与概念引导相互竞争,以实现人类可解释的接地。生成的预测结果被转化为符号背景知识,供推理框架使用,例如归纳逻辑编程(ILP)、决策树和贝叶斯网络。我们在合成数据集和真实世界数据集上进行了广泛的实证评估,表明我们的方法可以发现用于面向对象推理的复杂抽象规则,同时将监督标签减少到仅 1%,即使在显著领域偏移(domain shift)下也保持鲁棒性。值得注意的是,在 1% 的监督下,它在领域泛化方面甚至超越了最先进的基线基础模型。

图 1:我们两阶段神经符号视觉推理器的架构和训练方案,第一阶段结合了带有槽位注意力和概念头的 VAE。

## 1 引言

连接主义与符号范式之间的二分法定义了人工智能研究景观的很大一部分 [23]。一方面,深度学习模型通过从海量数据集中提取特征,在感知任务中取得了前所未有的成功 [6]。另一方面,符号 AI,特别是 ILP [24],为透明、人类可读的推理以及从结构化知识中的鲁棒泛化提供了强大的框架。一个核心且未解决的挑战是**符号接地问题** [1]:如何自主地将高维、非结构化的感官数据(如图像)映射到离散、符号化且人类可解释的背景知识,以便推理引擎进行操作。完全无监督的学习解耦表示的方法,包括端到端的神经符号方法 [12, 5],缺乏归纳偏置,并且往往无法产生与显著的人类可解释概念一致的表示 [17, 11]。而完全监督的概念学习则依赖于昂贵的高密度注释,限制了可扩展性。

在这项工作中,我们在这些极端之间寻找平衡,提出了一种由最小监督信号引导的神经符号框架。我们的假设是,稀疏标签足以引导生成模型学习高保真度、以对象为中心的符号背景知识,适用于后续推理。我们的方法是一个两阶段系统:

(1) **感知模块**:一个基于槽位的 VAE [18],仅使用 1% 的概念标签进行训练,学习解耦场景中对象的核心属性(例如,形状、颜色、大小)。

(2) **符号推理引擎**:VAE 的预测结果被转换为逻辑谓词,作为推理框架(如 ILP 系统 Popper [4])的背景知识,从而从少量视觉示例中归纳出复杂的关联规则。

我们将感知与推理解耦,增强了灵活性和可解释性,允许我们将感知模块与针对给定任务**最优**的下游推理器配对。这是一个关键优势,因为我们的研究发现,对于组合规则,ILP (Popper) 对感知噪声具有完美的鲁棒性,而贝叶斯网络在概率计数方面表现更优。

我们的主要**贡献**包括:

- • 一种**弱监督的、以对象为中心的 VAE 架构**,展示了从极少监督中优越的概念泛化能力。我们在一个真实世界的医疗案例研究中显示,仅使用 1% 的标签,我们的模型在领域偏移下的性能显著超过了 DINOv2 等基础模型。
- • 一种灵活的、**两阶段神经符号推理管道**,允许利用不同推理器在不同逻辑任务(如组合推理与数值推理)中的专长。
- • 对**感知-推理瓶颈**的**广泛实证分析**:虽然谓词保真度随着监督减少而下降,但对于某些类型的规则,ILP (Popper [4]) 等推理器对感知噪声保持鲁棒性。对于复杂的多概念合取,我们将其确定为剩余挑战及未来工作的方向,即同时准确预测所有所需概念。

## 2 相关工作

### 2.1 以对象为中心的表示学习

场景由对象组成的前提是一种强大的归纳偏置。Slot Attention [18] 等无监督模型通过迭代注意力机制展示了将场景分割为以对象为中心的“槽位”的显著能力。所得表示具有排列等变性,为下游任务提供了结构化基础。然而,正如 Locatello 等人 [17] 所示,如果没有强大的归纳偏置,无监督学习解耦表示在根本上是病态的。像 $\beta$-VAE [7] 或 FactorVAE [13] 这样的方法鼓励潜在空间中的统计独立性,但这并不能保证学习到的因子会与语义上有意义的概念对齐。例如,对人类有意义的概念往往是统计上*相关*的(例如,概念*apple*和*red*是相关的)。

我们选择带有 Slot Attention 的 VAE 是鉴于其在对象发现方面的已验证功效;通过引入弱监督信号 [15],我们明确引导解耦过程朝向所需的概念背景知识。

### 2.2 神经符号方法

弥合神经-符号差距是现代 AI 的核心目标。方法大致可分为三种范式。首先,**端到端可微系统**如 DeepProblog [20] 将概率逻辑推理直接集成到神经网络中以进行联合优化。然而,由于通过梯度下降在巨大的组合搜索空间中导航的挑战,这种紧密耦合的系统通常难以训练,特别是在标签稀疏的复杂感知数据上。其次,**隐式神经推理器**如神经符号概念学习器(NS-CL)[21] 或 VQA Transformer [19] 也保持模块化结构,但使用神经网络进行感知和推理。这些模型*隐式*执行推理,学习一个近似逻辑规则的函数,而不产生显式的人类可读程序。我们的两阶段方法提供了一种务实的**模块化、显式推理**替代方案,将感知(深度生成模型)与推理(专用符号求解器)解耦。这种模块化提供了两个关键优势:(1) **灵活性**,因为相同的生成谓词可以输入不同的推理器,允许选择最佳工具;(2) **可解释性**,通过提供清晰的符号谓词检查点以及作为输出的显式、可验证的逻辑规则。

## 3 我们的方法

我们的神经符号框架包括两个主要阶段:一个从弱监督视觉数据中学习概念的感知模块,以及一个将这些概念翻译为符号词汇以供下游推理引擎使用的谓词生成管道,如图 1 所示。

### 3.1 感知模块

感知模块是一个集成了**槽位注意力**机制 [18] 的变分自编码器(VAE),选择该设计是因为其在学习结构化、以对象为中心的表示方面的已验证优势。VAE 作为稳健的生成基础,与学习解耦潜在空间的最先进方法一致 [13, 16]。虽然标准 VAE 捕捉全局场景表示,但集成的 Slot Attention 模块执行关键的对象发现任务。它使用迭代、竞争的注意力机制,将 CNN 编码器中的感知特征分组为固定数量的以对象为中心的特征向量 $z_{\text{slot}}^{(i)}$,即*槽位*。重要的是,共享权重确保每个槽位是一个通用表示单元,能够绑定到任何对象,而不是专门针对特定对象类型。这简化了谓词值的读出。

然而,理论上,没有归纳偏置就不可能纯无监督地学习语义上有意义的概念 [27]。因此,我们引入**弱监督信号**。这种最小监督(来自少至 1% 的标签)充当关键的归纳偏置,引导 VAE 的潜在空间与所需的人类可解释概念(形状、颜色等)对齐。这确保生成的谓词不仅一致,而且在语义上接地且可解释。

#### 结构化潜在空间。

一个关键的架构选择是对每个槽位的潜在空间进行显式划分。潜在表示 $z_{\text{slot}}$ 是子向量的连接,每个子向量致力于特定的概念属性:

$$
z_{\text{slot}} = [z_{\text{coord}} \parallel z_{\text{presence}} \parallel z_{\text{shape}} \parallel z_{\text{color}} \parallel z_{\text{size}} \parallel z_{\text{material}}] \quad (1)
$$

这一结构通过使用单独的**概念头**(conceptual heads)来强制执行——实现为 2 层 MLP [19]——每个头将槽位的特征表示投影到高斯分布的均值 ($\mu$) 和对数方差 ($\log \sigma^2$) 上(参见 VAEs [7])。分类值(例如,形状)随后由由这些采样的潜在子向量馈送的单独预测网络导出。值得注意的是,我们添加了用于坐标 ($coord$) 和存在预测的特殊头。$z_{\text{slot}}$ 的这种划分鼓励将不同的语义属性编码到潜在代码的非重叠部分,如图 2 所示。

图 2:潜在空间的 UMAP 可视化,按不同的真实概念着色。
(a) 按坐标
(b) 按颜色
(c) 按形状

#### 弱监督训练目标。

在训练期间,我们优化复合损失函数 $L_{\text{total}}$。关键在于,损失的监督部分 ($L_{\text{sup}}, L_{\text{coord}}, L_{\text{presence}}$) 仅应用于训练数据的一小部分:

$$
L_{\text{total}} = L_{\text{recon}} + \beta L_{\text{KL}} + \delta L_{\text{sup}} + \lambda L_{\text{coord}} + \gamma L_{\text{presence}} \quad (2)
$$

其中 $L_{\text{recon}}$ 是像素级均方误差 (MSE) 重建损失;$L_{\text{KL}}$ 是 VAE 的 Kullback-Leibler 散度项($\beta$ 通过预热计划增加 [7]);$L_{\text{coord}}$ 是预测坐标上的 MSE;$L_{\text{presence}}$ 是专用存在预测头上的二元交叉熵 (BCE) 损失;$L_{\text{sup}}$ 是其余头上的监督概念 (Huber) 损失,通过**匈牙利算法** [14] 匹配的槽位 $\leftrightarrow$ 真实对象对计算得出。

### 3.2 自动化谓词生成管道

在推理期间,VAE 用于通过执行以下管道将给定输入图像转换为符号:

1. **推理与过滤**:模型的前向传递产生 $k$ 个槽位表示及其属性和存在预测。存在概率低于阈值(此处使用:0.5)的槽位被丢弃。
2. **符号接地**:对于每个活动槽位(例如,`obj_i`),预测的 logits 被转换为符号原子。分类 logits 的 argmax 确定谓词(例如,`color(obj_i, red)`)。
3. **背景知识构建**:对所有活动槽位和概念重复此操作,生成完整的符号场景描述(一阶逻辑谓词),形成推理的背景知识。

## 4 实验与结果

我们的实证评估旨在通过四个研究问题系统地调查我们神经符号架构的弱监督 (RQ1)、鲁棒性 (RQ2, RQ4) 和推理能力 (RQ3)。

**数据集**:我们使用 CLEVR [9]、CLEVR-Tex [10]、CLEVR 的 2D 版本 [1]、dSprites [22]、3D-Shapes [3] 数据集,并使用 HAM [28] 和 Melanoma [8] 数据集在真实世界医学成像任务中进行案例研究。

图 3:从左到右:所用数据集 Clevr, Clevr-Tex, Clevr 2D 版本, 3D shapes, melanoma, HAM10000, Dsprites 的样本

#### 可重复性细节:

SlotVAE 使用 Adam 优化器训练 200 个 epoch(批量大小 64),学习率为 $4 \times 10^{-4}$。架构包含 5 层 CNN 编码器和 4 层解码器。Slot 注意力配置为 10 个槽位,3 次注意力迭代,隐藏层为 64。关键损失函数权重为 $\beta_{\text{final}}=0.0001$,$\delta=10.0$,$\gamma=5.0$,以及 $\lambda_{\text{coord}}=5.0$。

**SlotVAE 模型**:对于类似 CLEVR 的

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。