AvAtar:通过主动最优传输学习对齐

arXiv cs.LG 论文

摘要

提出AvAtar,一个基于最优传输的原理性主动对齐框架,通过主动获取高质量监督来改进对齐效果,并利用伴随状态方法实现高效的梯度计算。

arXiv:2605.24395v1 Announce Type: new 摘要:对齐在许多机器学习问题中扮演着基础角色,例如多网络分析、多模态学习和点云配准。近期工作越来越多地利用最优传输(OT)进行分布对齐,其有效性在很大程度上依赖于稀疏的监督信号,而这些监督在实际中难以或昂贵地获取。然而,现有工作大多忽略了如何在OT框架下主动获取高质量监督以提升对齐性能。在本文中,我们提出了一个基于最优传输的原理性主动对齐框架,称为AvAtar。我们通过衡量候选样本对全局对齐结果的梯度影响来量化其信息量,该影响通过从全局对齐结果到候选样本所有可能监督的梯度传播(利用熵正则化OT公式)进行计算。尽管由于OT的约束性质而难以对其进行微分,但我们利用伴随状态方法将计算重新表述为一个线性系统,可通过共轭梯度法以线性复杂度求解并保证收敛。通过使用有效的效用函数编码全局对齐结果,AvAtar适用于OT框架下的一般对齐问题。在三个代表性对齐任务上的大量实验证明了所提出的AvAtar的有效性、可扩展性和泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:06

# AvAtar:通过主动最优传输学习对齐

来源:https://arxiv.org/html/2605.24395

###### 摘要

对齐在许多机器学习问题中扮演着基础性角色,例如多网络分析、多模态学习和点云配准。近期研究越来越多地利用最优传输(OT)进行分布对齐,其有效性在很大程度上依赖于稀疏的监督信息,而在实践中获取高质量监督既困难又昂贵。然而,现有工作大多忽略了如何在OT框架下主动获取高质量监督以提升对齐性能。在本文中,我们提出了一种基于最优传输的原则性主动对齐框架,名为AvAtar。我们通过衡量候选对象对全局对齐结果的基于梯度的影响来量化其信息量,该影响通过熵正则化OT公式计算从全局对齐结果到候选对象所有可能监督信号的梯度传播。由于OT的约束性质使得通过其进行微分具有挑战性,我们利用伴随状态方法将计算重新表述为一个线性系统,可通过共轭梯度法以线性复杂度和保证收敛性求解。通过使用有效的效用函数编码全局对齐结果,AvAtar适用于OT框架下的一般对齐问题。在三个代表性对齐任务上的大量实验证明了所提出的AvAtar的有效性、可扩展性和泛化能力。

机器学习,ICML

## 1 引言

对齐是许多机器学习问题的关键基石,包括但不限于多网络分析(Du et al., 2021;Yan et al., 2022;Tang et al., 2023;Wang et al., 2023;Yu et al., 2025a;Zeng et al., 2023b, 2024b, 2024a, 2025c)、多模态和跨域学习(Yilmaz et al., 2019;Chen et al., 2020;Cheng et al., 2022;Xu et al., 2024;Yoo et al., 2024;Ning et al., 2025)以及点云配准(Yu et al., 2021, 2023;Haitman et al., 2024)。这些问题的总体目标是找到两组数据点之间有意义的对应关系,从而促进各种下游机器学习任务。例如,对齐不同网络的节点可以实现跨社交平台的个性化推荐,并有助于交易网络中的欺诈检测(Zeng et al., 2023a;Yu et al., 2025b)。对齐不同数据模态的实体(例如图像-文本匹配)能够实现跨模态数据的自动标注,用于多模态基础模型的大规模预训练(Han et al., 2021;Gan et al., 2022;Liang et al., 2024;Bartan et al., 2025;Wei et al., 2026)。

近年来,最优传输(OT)(Gabriel and Marco, 2019)已被越来越多地用作解决一般对齐问题的有效工具。通过将待对齐的两组对象(例如两个网络的节点)与作为边际约束的两个离散概率分布相关联,基于OT的对齐方法根据针对特定任务精心设计的代价函数,从求解的传输计划中推断出对象级别的对齐。借助信息丰富的代价函数和约束优化,基于OT的方法自然能从全局视角学习鲁棒且确定性的对齐(Yu et al., 2025b, a),并在各种对齐任务中展现出卓越性能(Chen et al., 2020;Qin et al., 2023;Yu et al., 2025b)。尽管取得了成功,图1显示基于OT的对齐方法对监督的数量和质量敏感(Yu et al., 2025a),然而在实践中获取高质量监督成本高昂(Zhou et al., 2021;Gan et al., 2022;Liu et al., 2024;Li et al., 2024)。迄今为止,很少有研究探讨如何在弱监督或无监督设置下主动获取高质量监督,以有效提升基于OT方法的性能。

尽管存在关于主动对齐的稀疏文献,但它们对于基于OT的方法存在以下三个关键局限性。首先(局限性#1),现有的主动对齐方法并非针对OT定制,因此未能利用OT对齐背后的关键组成部分,例如代价函数和边际约束,而这些直接影响对齐性能(Malmi et al., 2017;Cheng et al., 2019;Zhou et al., 2021)。其次(局限性#2),缺乏一种原则性的方法来量化新获取的监督如何通过OT公式传播,使得难以评估查询对对对齐结果的直接影响(Malmi et al., 2017;Cheng et al., 2019)。第三(局限性#3),以往关于主动对齐的工作主要集中在设计特定任务的查询策略(Ren et al., 2019;Zhou et al., 2021),例如基于主动一致性的网络对齐方法,这些方法不易推广到其他对齐方法(例如基于OT的方法)或其他对齐任务(例如跨域对齐)。

参见图示 (a) 网络对齐
参见图示 (b) 图像-文本定位
图1:基于主动OT的对齐方法对监督质量和数量的敏感性(网络对齐和图像-文本定位)。观察结果:(1) 数量:随着监督水平提高,基于OT方法性能最多提升15%。(2) 质量:在相同的监督数量下,不同的查询策略(例如提出的AvAtar-L2(红色)与随机(蓝色))可能导致基于OT方法性能显著差异(最多7%)。

在本文中,我们通过提出一个基于最优传输的原则性主动对齐框架AvAtar来解决这些局限性。AvAtar本质上是为基于OT的对齐设计的,它通过候选者对OT全局对齐结果的后验查询影响来评估其信息量,综合利用OT的关键元素来选择最佳候选进行查询(局限性#1)。为了量化候选者的后验查询影响,AvAtar计算从全局对齐结果到候选者所有可能监督信号的梯度传播,通过熵正则化OT公式精确捕捉新标签如何通过梯度影响基于OT的对齐(局限性#2)。然而,通过OT公式进行微分是一个主要挑战,因为传输计划是隐式定义为大规模约束优化问题的解。为了解决这个问题,我们利用伴随状态方法将基于梯度的影响计算重新表述为一个线性系统,可以通过共轭梯度法以线性复杂度和保证收敛性高效求解。通过在OT的传输计划上定义有效的效用函数来编码全局对齐结果,AvAtar只需最小修改即可适用于跨不同对齐任务的基于OT的对齐方法(局限性#3)。

为了验证AvAtar的有效性,我们在三个代表性对齐任务上进行了全面实验,包括网络对齐(NA)和两个跨域对齐(CDA)任务:图像-文本检索和图像-文本定位。涵盖8个数据集、4种基于OT的对齐算法和9种基线主动学习方法的广泛实验表明,在相同查询预算下,AvAtar始终优于现有的主动学习方法。我们还通过实验证明AvAtar在对齐性能和效率之间取得了良好平衡,使其适用于大规模对齐问题。

我们的主要贡献总结如下:
- **问题**:据我们所知,我们是首个正式提出针对基于OT对齐的主动学习这一及时且重要问题的工作。
- **方法**:我们提出了一种新颖方法AvAtar,通过候选者对对齐结果的影响(以通过OT公式的梯度传播衡量)来量化其信息量。
- **分析**:我们对AvAtar进行了广泛的理论分析,确立了其正确性、线性时间复杂度和线性收敛性。
- **评估**:在多种对齐任务上的大量实验表明,AvAtar持续提升对齐性能,并在有效性和效率之间取得了良好平衡。

## 2 预备知识

在本节中,我们在2.1节介绍最优传输的预备知识,随后在2.2节介绍基于OT的对齐问题。在本文中,我们使用粗体大写字母表示矩阵(如\(\mathbf{T}\)),粗体小写字母表示向量(如\(\boldsymbol{\mu}\)),花体大写字母表示集合(如\(\mathcal{X}\)),小写字母表示标量(如\(k\))。表1总结了本文使用的主要符号。

### 2.1 最优传输

OT已成为对齐两个分布的强大数学工具(Santambrogio, 2015)。设\(\boldsymbol{\mu} = \sum_{i=1}^n \mu_i \delta_{x_i}\)和\(\boldsymbol{\nu} = \sum_{j=1}^m \nu_i \delta_{y_j}\)为两个离散概率分布,其中\(\delta\)表示狄拉克测度。离散最优传输问题寻求一个最优传输计划\(\mathbf{T}\),使得总传输成本最小化,如下所示:

\[
\min_{\mathbf{T} \in \Pi(\boldsymbol{\mu}, \boldsymbol{\nu})} \langle \mathbf{C}, \mathbf{T} \rangle
\tag{1}
\]

其中\(\Pi(\boldsymbol{\mu}, \boldsymbol{\nu}) := \{ \mathbf{T} \in \mathbb{R}_+^{n \times m} \mid \mathbf{T} \mathbf{1}_m = \boldsymbol{\mu}, \mathbf{T}^\top \mathbf{1}_n = \boldsymbol{\nu} \}\),\(\mathbf{C} \in \mathbb{R}_{\geq 0}^{n \times m}\)是代价矩阵,\(\mathbf{C}_{i,j}\)度量将质量从\(\boldsymbol{\mu}\)的支持点\(x_i\)传输到\(\boldsymbol{\nu}\)的点\(y_j\)的代价。式(1)的最优值定义了在代价矩阵\(\mathbf{C}\)下\(\boldsymbol{\mu}\)和\(\boldsymbol{\nu}\)之间的Wasserstein距离,得到的传输计划编码了两个分布点之间的软对应关系。

虽然式(1)导致一个立方复杂度的线性规划问题,对大规模应用不可行,(Gabriel and Marco, 2019)引入熵正则化到式(1)中以近似原始OT公式:

\[
\min_{\mathbf{T} \in \Pi(\boldsymbol{\mu}, \boldsymbol{\nu})} \langle \mathbf{C}, \mathbf{T} \rangle - \epsilon \, \text{Ent}(\mathbf{T})
\tag{2}
\]

其中\(\text{Ent}(\mathbf{T}) := -\sum_{i,j} \mathbf{T}_{i,j} (\log \mathbf{T}_{i,j} - 1)\),\(\epsilon > 0\)表示熵正则化权重。式(2)产生了一个\(\epsilon\)-强凸优化问题,可以通过Sinkhorn算法以二次复杂度更高效地求解(Nemirovski and Rothblum, 1999)。

### 2.2 基于OT的对齐

基于OT的对齐问题的一般定义可总结如下(Zeng et al., 2023a;Yu et al., 2025b;Chen et al., 2020):

###### 定义2.1. 基于OT的对齐
给定:(1) 待对齐的两组对象\(\mathcal{X} = \{x_i\}_{i=1}^n\)和\(\mathcal{Y} = \{y_j\}_{j=1}^m\),及其相关的边际分布\(\boldsymbol{\mu}, \boldsymbol{\nu}\),(2) 代价函数\(\mathbf{C} \in \mathbb{R}^{n \times m}\),(3) 对齐监督矩阵\(\mathbf{H} \in \{0,1\}^{n \times m}\),其中\(\mathbf{H}_{i,j}=1\)表示\(x_i\)和\(y_j\)之间的先验对齐。
输出:一个最优传输计划\(\mathbf{T}^* \in \Pi(\boldsymbol{\mu}, \boldsymbol{\nu})\),指示\(\mathcal{X}\)和\(\mathcal{Y}\)之间的软对应关系:

\[
\mathbf{T}^* = \mathop{\arg\min}_{\mathbf{T} \in \Pi(\boldsymbol{\mu}, \boldsymbol{\nu})} \langle \tilde{\mathbf{C}}, \mathbf{T} \rangle, \quad \tilde{\mathbf{C}} = (\mathbf{1}_{n \times m} - \beta \mathbf{H}) \odot \mathbf{C}
\tag{3}
\]

式(3)遵循常见做法(Zeng et al., 2023a;Yu et al., 2025b),通过惩罚对齐对的代价项将监督信息整合到基于OT的对齐中。式(3)中的\(\beta\)表示惩罚因子。在无监督设置下,\(\mathbf{H}\)成为零矩阵,使得式(3)等价于式(1)。

表1:符号与记号

## 3 问题定义

我们研究基于最优传输的主动对齐问题,其目标是通过选择最有信息量的候选对象进行查询(即获取其对齐标签),从而最大化提升基于OT的对齐方法的性能。

相似文章

面向网络对齐的可扩展最优传输算法

arXiv cs.LG

FastAlign 提出了一种可扩展、感知稀疏性的最优传输网络对齐框架,在实现最先进精度的同时,将计算时间在 CPU 上最多减少 9.45 倍,在 GPU 上最多减少 32.54 倍。

SAOT:基于结构感知最优传输的自监督持续图学习

arXiv cs.LG

提出SAOT,一种用于自监督持续图学习的结构感知最优传输框架,能够跨任务保留关系结构。在多个基准测试中相较于现有最佳方法取得了显著性能提升,其中在Products-CL上改进幅度高达15%。

一个旋钮统御所有:冷启动主动学习的统一最优传输视角

arXiv cs.AI

本文提出了一个用于冷启动主动学习的统一最优传输框架,引入了一种基于Sinkhorn的算法(ε-AS),该算法根据数据自适应调整正则化强度,并在六个数据集上取得了最先进的结果,包括相比先前方法将ImageNet-1k准确率提升1.29%,同时将选择时间减少56.2%。