一个旋钮统御所有:冷启动主动学习的统一最优传输视角

arXiv cs.AI 论文

摘要

本文提出了一个用于冷启动主动学习的统一最优传输框架,引入了一种基于Sinkhorn的算法(ε-AS),该算法根据数据自适应调整正则化强度,并在六个数据集上取得了最先进的结果,包括相比先前方法将ImageNet-1k准确率提升1.29%,同时将选择时间减少56.2%。

arXiv:2608.03249v1 公告类型:新 摘要:冷启动主动学习(CSAL)旨在没有任何先验知识或人工协助的情况下,从无标注数据池中选择一个有价值的子集。现有方法基于典型性、覆盖度或多样性采取不同路径。每种方法都依赖于自身的归纳偏置,因此在某些任务上表现良好,而在其他任务上表现不佳。我们认为真正的挑战不是再设计一种选择启发式方法,而是让CSAL自动适应手头的数据和任务。为此,我们从最优传输的视角重新审视CSAL。首先,我们提出一个广义传输选择框架,该框架揭示了现有方法的共享分配结构,并精确地包含了代表性公式。其次,我们引入一个理论分析,刻画了由熵正则化控制的权衡,并为冷启动选择建立了任务无关的极小极大界。这些结果为根据无标注数据调整正则化强度提供了原则性基础。第三,我们推导出一个数据自适应的正则化规则,并提出一种新的基于Sinkhorn的CSAL算法,称为$\epsilon$-Adaptive Selection($\epsilon$-AS)。在六个公共数据集和多个标注预算上的大量实验表明,$\epsilon$-AS始终取得最先进的性能。在ImageNet-1k上,相比ActiveFT,它将平均准确率提升了1.29%,同时将选择时间减少了56.2%。代码将在https://github.com/Z-yiwei/OT-CSAL发布。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:39

# 一个旋钮掌控全局:冷启动主动学习的统一最优传输视角

来源:https://arxiv.org/html/2608.03249
Ning Zhu1, Xiaochuan Ma2, Juntao Xu1, Jingze Liang1, Mengfei Zhao, An Chen1, Liang-Jian Deng3

###### 摘要

冷启动主动学习(Cold-Start Active Learning, CSAL)的目标是在没有任何先验知识或人工辅助的情况下,从一个无标签数据池中选取一个有价值的子集。现有方法基于典型性(typicality)、覆盖性(coverage)或多样性(diversity)等不同路线展开。每种方法都依赖自身的归纳偏置,因此在某些任务上表现优异,而在其他任务上则表现不佳。我们认为,真正的挑战并非再设计一种新的选择启发式规则,而是让 CSAL 能够根据数据和任务自动适应。为此,我们通过最优传输的视角重新审视 CSAL。首先,我们提出一个广义传输选择框架,该框架揭示了现有方法共有的分配结构,并精确涵盖了若干代表性公式。其次,我们引入理论分析,刻画了由熵正则化控制的权衡,并建立了冷启动选择的任务无关极小极大界。这些结果为依据无标签数据自适应调整正则化强度提供了原则性基础。第三,我们推导出一条数据自适应的正则化规则,并提出一种新的基于 Sinkhorn 的 CSAL 算法,称为 ε-自适应选择(ε-AS)。在六个公共数据集和多种标注预算下的大量实验表明,ε-AS 始终取得最优性能。在 ImageNet-1k 上,它比 ActiveFT 的平均准确率提升了 1.29%,同时选择时间减少了 56.2%。代码将在 https://github.com/Z-yiwei/OT-CSAL 发布。

## I. 引言

参见图1:固定的几何选择规则无法在不同数据集间稳定迁移。每个单元格给出一种方法在某个数据集上的准确率排名。基线方法的排名波动很大,而 ε-AS 在全部六个数据集上都排名第一。

现代机器学习在很大程度上得益于大规模标注数据集(Penget al.2025 (https://arxiv.org/html/2608.03249#bib.bib34))。然而,获取标注往往代价高昂且速度缓慢(Renet al.2025 (https://arxiv.org/html/2608.03249#bib.bib24))。暖启动主动学习(warm-start active learning, AL)通过仅查询最具信息量的样本来减轻这一负担(Settles2009 (https://arxiv.org/html/2608.03249#bib.bib21))。这些方法假设已有部分训练的任务模型,并在多轮重训练和选择中获取标签(Settles2009 (https://arxiv.org/html/2608.03249#bib.bib21); Renet al.2021 (https://arxiv.org/html/2608.03249#bib.bib37))。这种设置在两方面存在脆弱性。首先,多轮循环不断消耗专家精力和计算资源。其次,初始标注子集的随机性可能导致次优性能和稳定性问题(Hacohenet al.2022 (https://arxiv.org/html/2608.03249#bib.bib10); Yehudaet al.2022 (https://arxiv.org/html/2608.03249#bib.bib11))。为此,冷启动主动学习(CSAL)应对的是更具挑战性的设置:学习器需要在一轮中、在没有任何先验知识的情况下选择所有有信息量的样本。这消除了获取过程中重复的人类交互,但也移除了暖启动方法所依赖的任务反馈。因此,学习器必须仅依赖预训练特征的几何结构来做出决策(Zhuet al.2024 (https://arxiv.org/html/2608.03249#bib.bib38),2025a (https://arxiv.org/html/2608.03249#bib.bib39))。

现有 CSAL 方法主要沿三条路线展开。基于典型性的方法选择代表稠密局部区域的点(Hacohenet al.2022 (https://arxiv.org/html/2608.03249#bib.bib10); Wanget al.2022 (https://arxiv.org/html/2608.03249#bib.bib14))。基于覆盖性的方法将标注预算在特征空间中铺开(Yehudaet al.2022 (https://arxiv.org/html/2608.03249#bib.bib11); Sener and Savarese2018 (https://arxiv.org/html/2608.03249#bib.bib15); Mishal and Weinshall2025 (https://arxiv.org/html/2608.03249#bib.bib13))。多样性正则化的连续方法优化一组分离的原型,然后将其转换为查询样本(Xieet al.2023 (https://arxiv.org/html/2608.03249#bib.bib12); Mahmoodet al.2022 (https://arxiv.org/html/2608.03249#bib.bib17))。每条路线都固守不同的几何偏好。典型性可能忽视稀疏区域,激进的覆盖性可能偏向非典型点,而连续多样性可能施加与下游任务不匹配的偏好。CSAL 设置中没有任何标签可供我们在这些偏好之间进行选择。因此,一种方法可能在某个数据集上表现强劲,而在另一个数据集上表现不佳。如图1 (https://arxiv.org/html/2608.03249#Sx1.F1) 所示,现有方法在不同数据集上的排名差异显著。我们认为,关键问题并非缺乏选择启发式规则,而是在局部代表性与全局覆盖性之间的恰当平衡随数据池和预算变化时,仍使用固定的几何偏置。一个稳健的 CSAL 方法应该从无标签数据本身自适应地调整这种平衡。

在本文中,我们迈出第一步,探讨三条路线有何共同之处。尽管它们的目标各不相同,但都将其对无标签数据池的责任分配给一组有限的代表点,然后将这些代表点转化为标注查询。我们通过一个广义传输选择框架形式化这一共享结构。该框架精确还原了基于典型性的 TypiClust、基于覆盖性的 ProbCover 和基于多样性的 ActiveFT 的评估公式,同时保留它们各自不同的选择规则。因此,它为三条路线提供了统一视角,而不将它们视为完全相同的算法。统一视角也使得一个更原则性的问题成为可能:选择行为应如何随数据变化,而不是由方法选择而固定不变?

我们从两个互补的角度在理论上回答这一问题。首先,我们证明熵正则化刻画了几何拟合与弥散分配之间的单调权衡。其次,我们建立了一个任务无关的极小极大界,该界确定了决定 CSAL 难度的几何分辨率。这些结果为自适应选择正则化强度而非固守固定几何偏置提供了理论支持。基于这一理论,我们进一步提出 ε-自适应选择(ε-AS),一种新颖的 CSAL 算法,它使熵正则化自适应于无标签数据池和标注预算。由此产生的方法将统一传输视角转化为实用的选择器,而无需用户为每个新数据集在典型性、覆盖性和连续多样性目标之间做出选择。

在六个公共数据集和多种标注预算下的大量实验表明,ε-AS 始终达到最优性能,并在总共 26 个设置中的 25 个中获得最高点估计。它比最准确的基线 ActiveFT 提高了 1.29%,同时选择时间减少了 56.2%。

本文的贡献可以总结如下:
1. 我们引入了一个广义传输框架,揭示了三条代表性 CSAL 路线共有的分配结构,并涵盖了它们的公式。
2. 我们通过建立单调熵权衡和 CSAL 的任务无关极小极大界,为自适应传输选择提供了理论基础。
3. 我们提出一种新的基于 Sinkhorn 的 CSAL 算法 ε-AS,它建立在统一框架和理论结果之上。
4. 在六个数据集和多种预算下的大量实验表明,ε-AS 在实用选择效率下达到了最先进的准确率。

## II. 相关工作

#### 暖启动主动学习

经典主动学习从带标签的种子集开始,在任务模型训练与标签获取之间交替进行(Settles2009 (https://arxiv.org/html/2608.03249#bib.bib21); Renet al.2021 (https://arxiv.org/html/2608.03249#bib.bib37))。深度方法估计预测不确定性(Galet al.2017 (https://arxiv.org/html/2608.03249#bib.bib22); Kirschet al.2019 (https://arxiv.org/html/2608.03249#bib.bib26)),或在梯度或 Fisher 表示中将不确定性与多样性相结合(Ashet al.2020 (https://arxiv.org/html/2608.03249#bib.bib16),2021 (https://arxiv.org/html/2608.03249#bib.bib27)),或优化可扩展的批次目标(Citovskyet al.2021 (https://arxiv.org/html/2608.03249#bib.bib28); Colemanet al.2020 (https://arxiv.org/html/2608.03249#bib.bib29))。它们的获取分数依赖于任务反馈,并且可能对初始种子和训练协议敏感(Mittalet al.2019 (https://arxiv.org/html/2608.03249#bib.bib19); Munjalet al.2022 (https://arxiv.org/html/2608.03249#bib.bib20))。

#### 冷启动主动学习

CSAL 在没有目标标签或训练好的任务模型的情况下选择初始标注批次。现有工作涵盖三条几何路线和第四组任务特定混合方法。

基于典型性的方法偏好稠密或原型区域。CALR 结合目标域对比特征、层次聚类和信息密度(Jinet al.2022a (https://arxiv.org/html/2608.03249#bib.bib71)),而 TypiClust、USL 和基础模型聚类则从学习到的划分中选择代表性实例(Hacohenet al.2022 (https://arxiv.org/html/2608.03249#bib.bib10); Wanget al.2022 (https://arxiv.org/html/2608.03249#bib.bib14); Yuan and Hong2024 (https://arxiv.org/html/2608.03249#bib.bib45))。

基于覆盖性的方法通过 CoreSet、ProbCover、DCoM、广义覆盖或 γ-管几何体在特征空间中铺开查询(Sener and Savarese2018 (https://arxiv.org/html/2608.03249#bib.bib15); Yehudaet al.2022 (https://arxiv.org/html/2608.03249#bib.bib11); Mishal and Weinshall2025 (https://arxiv.org/html/2608.03249#bib.bib13); Baeet al.2024 (https://arxiv.org/html/2608.03249#bib.bib48); Caoet al.2022 (https://arxiv.org/html/2608.03249#bib.bib72))。

多样性正则化的连续方法优化连续代表点或分布性子集目标。ActiveFT 使用学习到的原型之间的吸引与排斥(Xieet al.2023 (https://arxiv.org/html/2608.03249#bib.bib12)),而 Wasserstein 选择将离散子集与数据池分布进行匹配(Mahmoodet al.2022 (https://arxiv.org/html/2608.03249#bib.bib17))。

任务特定混合方法将几何与辅助无标签信号相结合。DEUCE 使用双重多样性和不确定性进行文本分类(Guoet al.2024 (https://arxiv.org/html/2608.03249#bib.bib51)),相关获取规则扩展到视觉-语言模型(Safaei and Patel2025 (https://arxiv.org/html/2608.03249#bib.bib54))。CSAL-3D 和 CSCS 将代表性与自监督不确定性或难度相结合,用于医学分割(Zhuet al.2025c (https://arxiv.org/html/2608.03249#bib.bib52); Hattatet al.2026 (https://arxiv.org/html/2608.03249#bib.bib76))。MedCAL-Bench 进一步研究医学任务中的基础模型和选择策略(Zhuet al.2025b (https://arxiv.org/html/2608.03249#bib.bib77))。

这些路线在如何平衡局部代表性、全局覆盖性和辅助难度信号方面存在差异。

#### 用于选择的最优传输

最优传输通过最小成本耦合来比较测度(Villani2009 (https://arxiv.org/html/2608.03249#bib.bib8); Peyré and Cuturi2019 (https://arxiv.org/html/2608.03249#bib.bib7); Suet al.2025 (https://arxiv.org/html/2608.03249#bib.bib25))。熵正则化使得高效的 Sinkhorn 缩放成为可能(Cuturi2013 (https://arxiv.org/html/2608.03249#bib.bib1); Altschuleret al.2017 (https://arxiv.org/html/2608.03249#bib.bib9))。对于数据选择,Wasserstein 匹配已被表述为离散子集优化问题(Mahmoodet al.2022 (https://arxiv.org/html/2608.03249#bib.bib17)),AQOT 使用熵正则化传输在迭代主动学习中结合信息量和代表性(Zhuet al.2023 (https://arxiv.org/html/2608.03249#bib.bib73))。部分最优传输(partial OT)可以通过松弛源边际来暴露支撑子集(Riazet al.2023 (https://arxiv.org/html/2608.03249#bib.bib74)),而 UniPROT 通过部分 OT 子模重构选择均匀加权的原型(Chandaet al.2026 (https://arxiv.org/html/2608.03249#bib.bib75))。这些工作将传输用于主动查询、支撑缩减或原型构建。我们则用它来揭示代表性 CSAL 公式之间的分配结构,并将均衡熵正则化与无标签几何分辨率联系起来。经典量化和内在维数估计刻画了这种分辨率如何随预算变化(Lloyd1982 (https://arxiv.org/html/2608.03249#bib.bib69); Levina and Bickel2004 (https://arxiv.org/html/2608.03249#bib.bib65))。

## III. 预备知识

路线图。在本节中,我们首先定义 CSAL 问题。然后介绍全文使用的特征几何与传输约束。

#### 问题设置。

令 U=\\{x_i\\}_{i=1}^n 为无标签数据池,b\\ll n 为标注预算,φ 为冻结的特征提取器。选择器 A 观察 U 和 φ,但不获取任何任务标签,并在一轮中返回 S=A(U)⊂[n],且 |S|=b。然后对所选样本进行标注,并用于训练预测器 h_S。对于固定的学习器和损失函数,理想选择器最小化

A⋆∈argmin_A E[R(h_{A(U)})]. (1)

等式 (1) (https://arxiv.org/html/2608.03249#Sx3.E1) 通过下游预测器来评估选择器。然而,选择器无法访问标签。因此,我们从无标签分配问题入手。

#### 几何分辨率。

我们使用归一化特征 z_i:=φ(x_i)/‖φ(x_i)‖_2∈S^{D-1}。样本与代表点之间的比较使用余弦代价

C(z,μ):=1−⟨z,μ⟩,

d(z,μ):=‖z−μ‖_2=√(2C(z,μ)).

对于特征分布 P,定义

m_P(b):=inf_{μ_1,...,μ_b∈S^{D-1}} E_{z∼P} min_{k∈[b]} C(z,μ_k).

量 m_P(b) 是使用 b 个锚点时能够达到的最小平均表示代价。它衡量了预算 b 下的几何分辨率。更大的预算会在特征空间中放置更多锚点,因此往往会降低这一代价。我们的统计结果使用有界归一化几何以及量化律 m_P(b)=Θ(b^{−2/d_{int}})、有限数据池目标精度以及解码选择的几何保真度。

#### 传输约束。

传输计划 π∈R_+^{n×b} 记录了每个数据池样本的质量如何分配给 b 个代表点。我们使用均匀数据池权重 a=(1/n) 1_n 和代表点权重 u=(1/b) 1_b。相关的可行集为

Π_a^{sr}:={π∈R_+^{n×b}: π 1_b = a},

Π(a,u):={π∈Π_a^{sr}: π^⊤ 1_n = u}.

相似文章

一个基于最优传输理论的在线增量学习潜在空间培育方法

Hugging Face Daily Papers

本文介绍了MMOT,一种基于最优传输理论的在线混合模型学习框架,通过动态质心更新和改进的类别相似性估计来应对分布漂移下的增量学习。该方法包含一种动态保持策略,用于缓解灾难性遗忘并在潜在空间中维持类别可分离性。

AvAtar:通过主动最优传输学习对齐

arXiv cs.LG

提出AvAtar,一个基于最优传输的原理性主动对齐框架,通过主动获取高质量监督来改进对齐效果,并利用伴随状态方法实现高效的梯度计算。

通过隐式梯度传输加速基于 LMO 的优化

arXiv cs.LG

本文提出了 LMO-IGT,这是一类新的随机优化方法,它利用隐式梯度传输来加速收敛,同时保持每次迭代仅计算一次梯度的结构。文中引入了一个统一的理论框架,并展示了相较于 Muon 等现有基于 LMO 的优化器,该方法具有更优的性能。