用于检索和图卷积网络分类的上下文感知可解释表示
摘要
本文提出了一种无监督框架,结合流形学习和可解释图嵌入,以解决视觉表示中的几何和可解释性差距,提升图像检索和GCN分类任务的性能。
arXiv:2608.29004v1 公告类型:新
摘要:过去几十年中,视觉信息建模和表示的进展显著,主要得益于卷积神经网络、基于Transformer的模型和基础模型。尽管如此,关于相似性评估本质和模型透明度的关键挑战被忽视了。一个主要关注点是几何差距,传统的成对度量无法捕捉数据集流形的内在几何结构。此外,可解释性差距依然存在,因为表示往往与人类认知不匹配。因此,如何在保持低维度和下游任务高效性的同时,为表示提供可解释性,仍是一个开放挑战。本文提出了一种新颖的无监督框架,将流形学习策略与基于排序的可解释图嵌入相结合。我们的方法通过首先利用流形分析表征数据集的上下文信息,随后生成稀疏、自解释的嵌入,有效地弥合了这些差距。所提出的方法采用灵活的表述,允许不同的流形学习和表示学习策略。在多样数据集和特征上的广泛实验评估表明,我们的上下文感知表示不仅提供了内在的可解释性和降维效果,还在下游任务中维持或提升了效能,特别是在图像检索和使用图卷积网络(GCN)的半监督分类中。
查看缓存全文
缓存时间: 2026/09/01 13:04
# 面向检索与图卷积网络分类的上下文感知可解释表示 来源:https://arxiv.org/html/2608.29004 会议:国际多媒体检索大会;2026年6月16–19日;荷兰阿姆斯特丹国际多媒体检索大会(ICMR '26),2026年6月16–19日,荷兰阿姆斯特丹DOI:10.1145/3805622.3810617(https://doi.org/10.1145/3805622.3810617)ISBN:979-8-4007-2617-0/2026/06CCS:信息系统数据库中的Top-k检索CCS:计算方法学计算机视觉任务CCS:计算方法学图像表示Thiago César Castilho Almeida https://orcid.org/0000-0002-2167-0463所属机构:圣保罗州立大学(UNESP),里约克拉罗,圣保罗,巴西邮箱:[[email protected]](mailto:[email protected])Gustavo Rosseto Letício https://orcid.org/0009-0008-3715-8991所属机构:圣保罗州立大学(UNESP),里约克拉罗,圣保罗,巴西邮箱:[[email protected]](mailto:[email protected]),Vinicius Atsushi Sato Kawai https://orcid.org/0000-0003-0153-7910所属机构:圣保罗州立大学(UNESP),里约克拉罗,圣保罗,巴西邮箱:[[email protected]](mailto:[email protected])以及Daniel Carlos Guimarães Pedronette https://orcid.org/0000-0002-2867-4838所属机构:圣保罗州立大学(UNESP),里约克拉罗,圣保罗,巴西邮箱:[[email protected]](mailto:[email protected]) © cc ###### 摘要 过去几十年中,视觉信息建模与表示的进展显著,主要得益于卷积神经网络、基于Transformer的模型以及基础模型。尽管取得了这些进步,但在相似性评估的本质和模型透明度方面,一些关键挑战被忽视了。一个主要关注点是几何差距,其中传统的成对度量无法捕捉数据流形的内在几何结构。此外,可解释性差距依然存在,因为表示通常缺乏与人类认知的一致性。因此,如何在保持低维度和下游任务高效性的同时,为表示提供可解释性,仍然是一个未解决的挑战。在本文中,我们提出了一种新的无监督框架,该框架将流形学习策略与基于排名的可解释图嵌入相结合。我们的方法通过首先通过流形分析表征数据集的上下文信息,然后生成稀疏、自解释的嵌入,有效地弥合了这些差距。所提出的方法采用灵活的公式化,允许使用不同的流形学习和表示学习策略。在多个数据集和特征上的广泛实验评估表明,我们的上下文感知表示不仅提供了内在的可解释性和降维,还在下游任务中保持或提升了有效性,特别是在图像检索和使用图卷积网络的半监督分类中。 ###### 关键词: 表示学习,流形学习,无监督学习,排名 ††cc-许可:by已接受版本发布于2026年国际多媒体检索大会论文集。DOI:https://doi.org/10.1145/3805622.3810617。 ## 1.引言 信息检索和机器学习的基本支柱建立在两个相互关联的组成部分上:数据表示策略和相似性评估机制。近几十年来,多媒体检索在深度学习的驱动下经历了深刻的变革。卷积神经网络和视觉Transformer的出现已经弥合了“语义鸿沟”,将原始数据映射到编码复杂模式的密集潜在空间中。然而,一个关键的不对称性依然存在:虽然表示学习进展迅速,但用于比较这些表示的方法并未同步发展。 尽管现代潜在空间具有非线性性质,但相似性评估主要仍基于简单的成对度量,如欧几里得距离。这些度量受到“维数灾难”的影响,无法捕捉数据的内在曲率,导致一种被称为几何差距的不匹配。此外,这些密集表示的各个维度缺乏明确的语义含义。这种不透明性造成了第二个障碍,即可解释性差距,这阻碍了检索系统在需要信任和人类理解的高风险领域的应用。因此,该领域面临着双重负担:优化检索准确性的同时,确保特征空间对人类观察者保持语义连贯性。 现有方法孤立地解决这些差距:可解释性方法,如解耦表示学习和自解释模型,要么施加了严格的假设,要么需要昂贵的监督,而基于图的方法(能捕捉流形结构)严重依赖邻域质量,这在欧几里得度量在高维空间中可能无法保证。即使是最近的基于排名的可解释方法,通过将嵌入维度与语义原型对齐,也继承了这一几何缺陷,因为它们依赖于嘈杂的初始邻域。 在本文中,我们提出了一种新方法,将流形学习的鲁棒性与基于排名的嵌入的透明度相结合。我们认为排名结构为编码拓扑提供了最佳框架,因为它们本质上对原始特征空间的尺度变化具有弹性。通过利用流形学习在构建图之前“展开”数据几何结构,我们确保后续原型选择在拓扑上是准确的。这生成了向量表示,其中每个维度对应一个高效的原型,同时通过上下文感知处理弥合几何差距,并通过自解释维度弥合可解释性差距。 本工作的主要贡献总结如下: - •上下文感知与可解释的基于排名的框架:我们引入了一种模块化的无监督公式化,利用流形学习中的上下文排名信息在嵌入前校正数据几何结构,允许集成不同的流形学习算法和不同的基于排名的表示学习策略。 - •低维且有效的表示:我们证明了我们的方法在显著降低维度并为每个维度提供语义可解释性的同时,保持或超越了高维特征的有效性。 - •表示的鲁棒性:所提出的方法在多个任务上进行了评估,包括基于内容的图像检索和半监督分类,证明了其作为通用表示的鲁棒性。 在不同公开数据集上的实验评估,使用先进的CNN和Transformer主干网络,表明所提出的方法在提供定性见解的同时,性能优于原始特征。 ## 2.相关工作 本节回顾了三个关键领域的现有文献:网络表示学习、解耦表示学习以及设计即解释模型,特别是那些采用基于原型推理的模型。 ### 2.1.网络表示学习 网络表示学习将节点从高维图结构映射到低维向量空间,同时保持拓扑性质。早期的“浅层嵌入”方法受到自然语言处理的启发,如DeepWalk和Node2vec,将图上的随机游走视为句子,优化节点共现。同时,像LINE这样的方法侧重于保持显式的一阶和二阶邻近性。 该领域随后转向图神经网络,它将节点属性与结构信息相结合。像GCN和GAT这样的架构利用消息传递机制来聚合邻居信息。为了处理未标记数据,已经开发了如GraphMAE和DGI等无监督框架,以最大化互信息或重构掩码特征。 然而,标准GNN的一个主要限制是它们产生“黑盒”表示,其中维度在语义上是不透明的。为了解决这个问题,可解释图嵌入方法应运而生。事后方法,如DINE,将现有嵌入分解为稀疏、可解释的向量。最近,基于排名的方法,如RaDE和GRaCE,直接从图结构生成可解释嵌入。与传统的GNN不同,这些方法构建的维度明确编码了与特定原型节点的相似性,确保了语义对齐。虽然有效,但这些方法通常依赖于通过标准距离度量构建的输入图,如果初始拓扑结构未得到充分优化,它们仍然容易受到几何差距的影响。 ### 2.2.解耦表示学习 表示学习的一个主要目标是分离数据潜在的解释因子,这个概念被称为解耦表示学习。在计算机视觉中,像β-VAE这样的变分自编码器强制要求潜在维度之间的统计独立性。这些原理已通过像DisenGCN和DiSeNE这样的方法应用于图,这些方法将输入图分解为独立的因子图。 然而,将严格的解耦应用于通用检索是有问题的。如指出的,在没有强归纳偏置的情况下,无监督解耦在理论上是不可能的。此外,解耦表示学习依赖于语义因子在统计上独立的假设。在复杂的多媒体流形中,概念自然相关。强行要求独立可能会扭曲数据的内在几何结构。 相比之下,基于排名的策略采用了表示覆盖性的理念,而不是统计正交性。方法如RaDE和GRaCE不是强迫潜在维度成为独立因子,而是选择互补原型,以最大化数据流形的覆盖范围。这种方法尊重自然相关性,提供了一种几何上更忠实的可解释性形式,其中维度代表具体的示例,而不是抽象的独立因子。 ### 2.3.设计即解释模型 为了避免事后解释器的不可靠性,最近的研究倾向于设计上可解释的模型。概念瓶颈模型将输入映射到一组人类可理解的属性,然后再进行预测。虽然最近的工作利用大型语言模型自动化概念发现,但这些方法受到语言鸿沟的困扰,假设所有判别性视觉特征都可以用语言描述,这限制了它们在专业或抽象领域的应用。 为了绕过语言瓶颈,基于原型模型采用了“这个看起来像那个”的范式。像ProtoPNet和TesNet这样的架构将原型学习为特定的图像块。虽然透明,但它们需要专门的训练流程,并且难以适应预训练的主干网络。 最近的“免训练”方法,如KMEx和IDEAL,试图使用聚类或密度峰值在预训练模型的冻结潜在空间中识别原型。然而,一个关键限制依然存在:这些方法依赖于潜在空间是欧几里得空间的假设。如前所述,高维空间通常表现出非欧几里得流形结构。在这种扭曲的空间中依赖于简单距离会导致几何差距,其中选择的原型可能并不真正具有代表性。这激发了我们提出的方法,该方法在原型选择之前集成流形学习以展开数据几何结构,确保解释在拓扑上是准确的。 ## 3.提出的方法 参见说明图1.所提出的上下文感知与可解释的基于排名的框架概述。我们提出了一种完全无监督的模块化框架,将流形学习与基于排名的可解释嵌入相结合,以同时解决几何和可解释性差距。我们假设排名列表是对特征空间的稳健区域离散化。利用这一视角,我们的框架将原始特征转换为稀疏、可解释的嵌入,其中上下文被直接编码。
相似文章
生成内容丰富化
本文提出了一种联合对抗框架,使用图卷积网络在生成语义更丰富的视觉内容之前丰富稀疏的场景图。该方法在表示层面显式地进行场景丰富,生成视觉上合理且结构连贯的图像。
针对文本和多媒体数据的有效图与排名上下文嵌入
本文介绍了GRaCE,这是一个无监督框架,用于通过基于排名的度量生成可解释的图嵌入,在文本和图像数据的检索、分类和聚类任务中优于现有方法。
学习一致性表征:一种拓扑可解释性方法
本文介绍了一致性(coherence)这一几何约束,受大脑中网格细胞和头朝向细胞的启发。一致性确保特征响应数据流形上的几何连通区域,从而提升可解释性;作者提出了一个可微分的目标函数(Coh),并在合成数据、旋转MNIST和BERT词元嵌入上进行了验证。
基于自适应谱带宽控制的几何感知图构建
本文提出了一种用于核化图构建的自适应谱带宽控制方法,旨在使核谱性质与内在流形维度对齐,展示了在CIFAR-100上的自监督学习嵌入任务中的改进。
跨多层级抽象的图表示学习统一视角
本文提出了一种统一的对比学习框架,用于跨多个抽象层级(节点、邻近性、簇、图)学习图表示,并引入了一种无需参数的自适应加权机制,能够自适应地为相似度分数分配权重,在分类、聚类和链接预测等下游任务上优于现有最先进方法。