KODA:面向视觉-语言基础模型的对比表示比较与对齐

arXiv cs.LG 论文

摘要

本文介绍了KODA(Kernel Optimization for Discrepancy Analysis,差异分析核优化),一种基于核的框架,用于比较和对齐视觉-语言模型表示,通过识别在CLIP、SigLIP和BLIP等模型中聚类方式不同的样本子集。该方法使用对比嵌入聚类和随机低维近似,能够扩展到大型数据集,同时提供表示之间可解释的结构差异。

arXiv:2606.04180v1 公告类型:新 摘要:视觉-语言基础模型(如CLIP和SigLIP)为多模态学习系统提供了广泛使用的表示。虽然这些模型通常通过下游性能进行比较,但这种评估往往无法解释它们的表示在结构上如何不同。在这项工作中,我们通过对比嵌入聚类任务来研究这个问题:识别在一个表示中聚类较弱但在另一个表示中聚类较强的样本子集。我们提出了\emph{差异分析核优化(KODA)},一种基于核的对比表示比较与对齐框架。KODA通过模态级核组合构建统一的多模态核,并将差异发现形式化为一个约束优化问题,该问题在一种表示中搜索连贯结构,同时抑制参考表示中的连贯性。这产生了与特定样本子集和模态交互相关的可解释差异方向。为了将KODA扩展到大型视觉-语言数据集,我们使用随机投影开发了联合核的随机低维近似,包括用于平移不变核的随机傅里叶特征。实验表明,KODA能识别出视觉-语言表示中一致且可解释的差异结构,并提供用于表示对齐的样本子集。代码可在https://github.com/yokiwuuu/KODA获取。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:22

# 视觉-语言基础模型的对比表征比较与对齐
来源:https://arxiv.org/html/2606.04180
###### 摘要

视觉-语言基础模型,如 CLIP 和 SigLIP,为多模态学习系统提供了广泛使用的表征。虽然这些模型通常通过下游性能进行比较,但这种评估往往无法解释它们的表征在结构上究竟有何不同。在本工作中,我们通过*对比嵌入聚类*任务来研究这一问题:识别在一个表征下聚类松散而在另一表征下聚类紧密的样本子集。我们提出*用于差异分析的核优化方法 (KODA)*,这是一个基于核的对比表征比较与对齐框架。KODA 通过按模态的核组合构建统一的多模态核,并将差异发现表述为一个约束优化问题,该问题在一个表征中寻找连贯结构,同时抑制参考表征中的连贯性。这产生了与特定样本子集和模态交互相关联的可解释的差异方向。为了将 KODA 扩展到大型视觉-语言数据集,我们开发了使用随机投影的联合核随机低维近似,包括用于平移不变核的随机傅里叶特征。在实验上,KODA 识别了视觉-语言表征中一致且可解释的差异结构,并提供了用于表征对齐的样本子集。代码可在 https://github.com/yokiwuuu/KODA 获取。

## 1 引言

多模态嵌入模型已成为现代机器学习系统的核心组件,能够在共享的语义空间中联合表示图像、文本及其他模态。对比式视觉-语言嵌入,如 CLIP (Radford 等人,2021) 及相关的范式,包括 ALIGN (Jia 等人,2021)、BLIP (Li 等人,2022) 和 BLIP-2 (Li 等人,2023),已在跨模态检索和迁移中展现出强大的性能,现在被广泛用作更大流水线中的固定表征接口。因此,许多视觉-语言基础模型及其公开变体共存,它们在架构、训练目标以及数据来源上各不相同 (Cherti 等人,2023)。这种多样性激发了设计原则性方法的动机,用于比较表征并刻画它们如何在数据上诱导出不同的结构,而不仅仅报告聚合的下游指标。

参见图注

图 1:KODA 用于*对比嵌入聚类*的概述,其目标是发现被两种嵌入不同表示的样本簇。我们展示了在 MS-COCO 数据集上,针对 BLIP 和 CLIP 嵌入,由 KODA 识别出的对比簇。

大多数现有的多模态表征比较依赖于下游任务性能,例如在基准数据集上的检索准确率或零样本分类。虽然这些评估对于模型排名有效,但它们在解释表征如何组织数据方面提供的见解有限。在视觉-语言环境中,两个模型可能达到相似的总体准确率,但对图像-文本配对数据产生不同的分组方式,例如,通过强调不同的语义属性、组合模式或稀有概念。识别这些细粒度差异可以支持可解释性导向的工作流程,包括有针对性的数据整理、模型选择以及表征对齐。

近期一系列关于可解释嵌入比较的工作开始研究被两种表示以不同方式组织的样本组。特别是,Jalali 等人 (2025a) 提出的 SPEC 框架,通过在共享参考数据集上构建核相似性矩阵,并分析其核差矩阵的特征分解来比较两种嵌入。这种设定促成了我们称之为*对比嵌入聚类*的任务:识别在一个表示下聚类松散但在另一表示下聚类紧密的样本子集。然而,SPEC 中的核差构造并未明确强制实现这种非对称目标;其特征方向可能反映两种嵌入中都存在的结构,或聚合了多种效应,而不是隔离出相对于指定参考嵌入而言分组松散的子集。

在本工作中,我们将对比嵌入聚类形式化为一个约束优化问题。给定由两种表示诱导的核相似性矩阵 \(K_A\) 和 \(K_B\),KODA 寻找在一种表示下强分组,而在另一种表示下被明确约束为弱分量的成分。我们引入*用于差异分析的核优化方法* (KODA),它解决以下问题:

\[
\max_{x \in \mathbb{R}^n} \quad x^\top K_A x \quad \text{subject to} \quad x^\top K_B x \le \epsilon, \quad \|x\|_2 = 1.
\tag{1}
\]

为了识别多个差异模式,我们求解一系列这样的问题,并在当前解与先前解之间施加正交性约束。尽管这个优化问题是非凸的,我们证明它可以借由结构化谱计算高效求解。

我们进一步将 KODA 扩展到多模态表征的比较,通过按模态的核乘法构建统一的核。这种乘积核公式使得能够在相同的约束框架内直接比较配对数据(如图像-文本样本)上的表示。然而,由于有效特征维度可能在模态间成倍缩放,精确的协方差算子实现在多模态设置中变得不可行。

为了实现可扩展的计算,我们开发了基于随机投影和随机傅里叶特征 (Rahimi 和 Recht, 2007) 的近似方法,这些方法在保持近似保证的同时,降低了联合核特征映射的有效维度。我们在广泛使用的视觉-语言表示模型上评估 KODA,包括 CLIP (Radford 等人,2021)、ALIGN (Jia 等人,2021) 以及 BLIP 风格模型 (Li 等人,2022, 2023),并使用诸如 MS-COCO (Lin 等人,2014) 等标准基准。我们的实验表明,KODA 识别出一致的差异结构,在寻找多个差异模式方面优于核差基线方法,并提供可用于表征对齐的样本子集。

## 2 相关工作

**多模态嵌入模型**。视觉-语言嵌入模型现已成为跨模态检索、零样本识别以及多模态生成式 AI 流水线中的标准组件。代表性方法包括 CLIP (Radford 等人,2021)、ALIGN (Jia 等人,2021) 和 BLIP / BLIP-2 (Li 等人,2022, 2023),同时还有扩展性研究以及扩大可用变体空间的公共训练工作 (Cherti 等人,2023)。SigLIP (Zhai 等人,2023) 和 SigLip 2 (Tschannen 等人,2025) 提出了一种基于 Sigmoid 损失的替代预训练目标。虽然这些模型通常通过下游基准进行比较,但此类评估往往对两种嵌入如何组织*同一组*配对数据提供的见解有限。

**表示学习中的可解释性**。一系列广泛的研究致力于直接解释学习到的表示,通常通过将内部方向或单元与人类可理解的概念联系起来。网络剖析 (Bau 等人,2017) 通过测量隐藏单元与语义概念之间的对齐程度,量化了视觉表示的可解释性。基于概念的解释方法使用概念的示例来定义表示空间中的方向:TCAV (Kim 等人,2018) 通过方向导数测量概念敏感性,而 ACE (Ghorbani 等人,2019) 自动提取概念并评估其重要性,减少了对人工指定概念集的依赖。概念瓶颈模型 (Koh 等人,2020) 进一步强调可解释性,通过围绕一组有监督概念明确结构化表示,并允许对该表示进行干预。最近,Gong 等人 (2025b) 通过无监督对抗性微调配合范数正则化,提高了 CLIP 的视觉可解释性,通过特征归因和网络剖析分析展示了改进效果。这些工作激励了旨在识别*数据集中哪些部分*对应显著表示结构的分析,但它们并未直接针对嵌入的差异发现。

**用于特征表征的核方法**。核方法提供了一种灵活的方式,通过成对相似性结构而非仅仅下游任务准确率来比较、对齐、融合和评估学习到的特征表示。最近的工作利用核矩阵来解释嵌入空间之间的差异并对其诱导的聚类结构进行对齐 (Jalali 等人,2025a),以及通过将 CLIP 的视觉嵌入与更强的以视觉为中心的嵌入(如 DINOv2)对齐来改进视觉-语言表示 (Gong 等人,2025a)。作为补充,核积特征映射和最大核熵方法已被用于融合和恢复嵌入,同时保留成对相似性信息 (Wu 等人,2025;Wu 和 Farnia, 2026)。基于核的评分也已成为生成模型评估的核心,从基于 MMD 的比较 (Gretton 等人,2012) 和核初始距离 (Bińkowski 等人,2018;Wang 等人,2025) 开始,扩展到基于熵和谱的方法用于衡量多样性、新颖性和提示感知评估,包括 RKE (Jalali 等人,2023)、Vendi (Friedman 和 Dieng, 2023;Ospanov 等人,2024)、KEN (Zhang 等人,2024, 2025) 以及条件核熵 (Jalali 等人,2025b;Ospanov 等人,2025;Jalali 等人,2026)。嵌入的核方法应用也被探索用于模型评估、选择和模型混合构建 (Stein 等人,2023;Hu 等人,2025a;Rezaei 等人,2025;Hu 等人,2025b;Jafari 和 Farnia, 2026)。这些方法激励我们将嵌入和基础模型不仅视为用于预测的特征向量,也视为核诱导的表示,其几何结构可以被系统地比较和评估。

## 3 预备知识

### 3.1 嵌入映射与比较设定

令 \(\mathcal{X}\) 表示输入空间,令 \(\psi: \mathcal{X} \to \mathcal{S}\) 是一个到表示空间 \(\mathcal{S}\)(通常是欧几里得空间)的嵌入映射。我们考虑两个嵌入映射:
\[
\psi_1: \mathcal{X} \to \mathcal{S}_1, \quad \psi_2: \mathcal{X} \to \mathcal{S}_2,
\]
它们可能具有不同的输出维度,因此对相同的输入诱导出不同的相似性结构。我们假设可以访问一个参考数据集 \(\{x_i\}_{i=1}^n \subset \mathcal{X}\),该数据集从某个底层分布中采样得到。我们的目标是通过 \(\psi_1\) 和 \(\psi_2\) 在这个参考集上诱导的几何结构来比较它们,而无需依赖有标签的下游任务。

### 3.2 核函数与核诱导的二次型

核函数 \(k: \mathcal{X} \times \mathcal{X} \to \mathbb{R}\) 分配一个相似性分数,并承认一个特征映射 \(\phi: \mathcal{X} \to \mathcal{H}\) 到一个(可能是无限维的)希尔伯特空间 \(\mathcal{H}\),使得:
\[
k(x, x') = \langle \phi(x), \phi(x') \rangle_{\mathcal{H}}.
\]
给定样本 \(x_1, \ldots, x_n\),关联的核矩阵 \(K \in \mathbb{R}^{n \times n}\) 为:
\[
K_{ij} = k(x_i, x_j),
\tag{2}
\]
并且是半正定的。常见的归一化示例包括余弦核 \(k_{\mathrm{cos}}(u,v) = \frac{u^\top v}{\|u\|_2 \|v\|_2}\)(对于非零 \(u, v\))和高斯(RBF)核 \(k_{\mathrm{rbf}}(u,v) = \exp\left(-\|u-v\|_2^2 / (2\sigma^2)\right)\),两者都满足 \(k(x,x)=1\)。

对于任何 \(v \in \mathbb{R}^n\) 且 \(\|v\|_2 = 1\),二次型
\[
v^\top K v
\tag{3}
\]
是 \(K\) 在 \(v\) 处的瑞利商,因此位于 \([\lambda_{\min}(K), \lambda_{\max}(K)]\) 中,并由 \(K\) 的一个主特征向量最大化。此外,当 \(\phi\) 是有限维且 \(K = \Phi \Phi^\top\),其中 \(\Phi_{i:} = \phi(x_i)^\top\),我们恒有:
\[
v^\top K v = \|\Phi^\top v\|_2^2 = \left\| \sum_{i=1}^n v_i \phi(x_i) \right\|_2^2,
\tag{4}
\]
这在解释和优化参考集上基于核的标准时非常有用。当 \(\phi(x) \in \mathbb{R}^d\) 时,经验协方差矩阵(算子)为:
\[
C_X := \frac{1}{n} \Phi^\top \Phi = \frac{1}{n} \sum_{i=1}^n \phi(x_i) \phi(x_i)^\top \in \mathbb{R}^{d \times d}.
\tag{5}
\]
矩阵 \(K/n\) 和 \(C_X\) 共享相同的非零特征值(包括重数),因为它们是 \(\Phi\) 和 \(\Phi^\top\) 以相反顺序相乘的结果。

### 3.3 平移不变核与随机傅里叶特征

为了扩展核计算的规模,我们使用随机傅里叶特征 (RFF) (Rahimi 和 Recht, 2007; Sutherland 和 Schneider, 2015) 来处理 \(\mathbb{R}^d\) 上的平移不变核。考虑形如 \(k(x, x') = \kappa(x - x')\) 的核,其中 \(\kappa\) 是连续且正定的。根据博赫纳定理,存在一个概率

相似文章

SOCO:视觉基础模型中语义对象对应性的基准测试

Hugging Face Daily Papers

SOCO基准通过一致的部件级标注和关键点描述来评估视觉模型中的结构化对象理解,揭示了语言驱动定位与视觉对应之间的差距,同时证明了其对下游任务性能的强大预测能力。