无标签数据元学习:利用预训练模型和未标注数据的高效任务生成

arXiv cs.LG 论文

摘要

提出一种无标签数据的元学习方法,通过将预训练模型的软标签分配给未标注数据来生成任务,避免了计算昂贵的模型逆推。与最先进的DFML方法相比,实现了高达104倍的加速和8.4%-36.4%的准确率提升。

arXiv:2607.02850v1 公告类型:新论文 摘要:无标签数据的元学习对于实际应用至关重要,因为获取带标签的数据集可能成本高昂或因隐私问题受限。无数据元学习(DFML)通过利用预训练模型而不访问训练数据来应对这一挑战。然而,现有的DFML方法依赖模型逆推生成训练数据,这一过程通常困难且计算成本高,因为需要生成符合原始分布的高维数据。为解决这一局限,我们提出了一种新颖的元学习设置,通过联合利用预训练模型和未标注数据来避免模型逆推。我们的方法通过将预训练模型中的软标签分配给未标注数据来生成元训练任务。由于这些任务的质量可能不同,我们引入了一种基于任务置信度和类别分布平衡的任务加权机制,以确保有效的元学习。大量实验表明,我们的方法大幅降低了计算成本并提升了泛化能力,与最先进的DFML方法相比,在少样本分类准确率上实现了高达104倍的加速和8.4%至36.4%的提升。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:39

# 无标签数据下的元学习:利用预训练模型与无标签数据高效生成任务
来源:https://arxiv.org/html/2607.02850
Lei Sun 奈良先端科学技术大学院大学 信息科学系 日本 奈良 sun\.lei\.sn5@is\.naist\.jp & Yusuke Tanaka NTT通信科学实验室,NTT公司 日本 京都 理化学研究所 先进智能研究中心 日本 埼玉 ysk\.tanaka@ntt\.com & Tomoharu Iwata NTT通信科学实验室,NTT公司 日本 京都 tomoharu\.iwata@ntt\.com

###### 摘要

无标签数据的元学习对于现实应用至关重要,因为获取带标签的数据集可能成本高昂或因隐私问题而受到限制。无数据元学习(DFML)通过利用预训练模型而无需访问训练数据来解决这一挑战。然而,现有DFML方法依赖模型反演来生成训练数据,这一过程通常困难且计算成本高,因为需要生成与原始分布相匹配的高维数据。为克服这一局限,我们提出一种新颖的元学习设定,通过联合利用预训练模型和无标签数据来避免模型反演。我们的方法通过将预训练模型生成的软标签分配给无标签数据来构建元训练任务。由于这些任务的质量可能参差不齐,我们引入一种基于任务置信度和类别分布平衡性的任务加权机制,以确保有效的元学习。大量实验表明,我们的方法大幅降低了计算成本并提升了泛化能力,与最先进的DFML方法相比,实现了高达104倍的加速,并在少样本分类准确率上提升了8.4%至36.4%。

## 1 引言

元学习,又称“学会学习”,使模型能够利用解决多样任务积累的先验经验,从而获得对未见但相关任务进行高效学习的归纳偏置(Finn et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib2); Snell et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib1); Li et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib3); Iwata and Kumagai, 2020 (https://arxiv.org/html/2607.02850#bib.bib23); Sun et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib15); Iwata and Kumagai, 2022 (https://arxiv.org/html/2607.02850#bib.bib24))。传统的元学习方法通常依赖于一组带有标签数据集的任务。然而,在许多现实场景中,由于数据隐私、安全风险和使用限制等问题,带标签的数据往往难以甚至无法获取(Chen et al., 2019 (https://arxiv.org/html/2607.02850#bib.bib5); Truong et al., 2021 (https://arxiv.org/html/2607.02850#bib.bib6))。事实上,许多个人和机构在GitHub或Hugging Face等平台上发布针对特定任务的预训练模型,却很少提供其原始训练数据。

为解决这一限制,研究人员提出了无数据元学习(DFML)(Hu et al., 2023a (https://arxiv.org/html/2607.02850#bib.bib7); Wei et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib8); Hu et al., 2023b (https://arxiv.org/html/2607.02850#bib.bib9); Wang et al., 2022 (https://arxiv.org/html/2607.02850#bib.bib10))。DFML旨在直接从一组预训练模型中提取知识,而无需访问其原始训练数据,从而实现对未见任务的适应。然而,现有的DFML方法依赖模型反演来重建训练分布,这需要高昂的计算成本,并导致预测精度下降。具体来说,这些方法通常通过模型反演训练生成器(Frikha et al., 2023 (https://arxiv.org/html/2607.02850#bib.bib30); Patel et al., 2023 (https://arxiv.org/html/2607.02850#bib.bib31)),以合成近似每个预训练模型原始训练分布的图像。由于该过程涉及生成高维数据,需要数百次迭代的生成-前向-反向步骤,导致极其耗时的恢复过程。此外,通过模型反演恢复原始训练分布通常很困难,因为它无法始终生成与原始分布匹配的高质量数据。使用低质量或不匹配的数据进行元学习会导致误差累积,并降低DFML方法的性能。

为克服这一局限,我们提出一种新的问题设定,在元训练阶段通过联合利用预训练模型和无标签数据来避免模型反演。图1 (https://arxiv.org/html/2607.02850#S1.F1)展示了所提出的问题设定。在此设定下,我们开发了一种元学习方法,通过将由多个预训练模型生成的软标签(即类别上的概率分布)分配给无标签数据集来构建元训练任务。

在所提出的设定中,我们假设可以在无标签实例上评估预训练模型以生成软标签。我们考虑的预训练模型是在分类任务上训练的,这些任务与目标任务具有相同的输入模态以及相同或相关的应用领域,尽管它们的原始训练数据可能与目标任务中使用的数据不同。预训练模型在架构、规模和收敛程度上也可能存在异质性。

由于预训练模型的训练领域和收敛程度可能存在差异,生成的软标签的质量也可能不同。因此,直接使用这些模型生成的任务可能会在元训练过程中引入噪声。为此,有必要量化每个元训练任务的质量。为解决这一问题,我们提出一种结合两个因素的任务加权策略:(i) 任务内所有样本软标签的平均负熵,反映整体任务置信度;(ii) 任务内所有样本平均软标签的熵,指示样本在各类别间的分布均衡程度。具体而言,因素(i)的值越高,代表任务置信度越高,从而提供更清晰的监督信号,增强元训练过程中的稳定性。然而,过高的负熵可能表明样本集中在少数类别中,可能导致类别偏差,对模型泛化产生负面影响。因此,我们引入因素(ii)来量化类别分布均衡性,其值越高表示类别分布越均匀。

所提出的方法避免了模型反演,从而降低了计算成本,并引入了一种任务加权策略,用于评估由不同预训练模型生成的任务的有用性,从而实现更有效的元训练。相反,元训练阶段需要与目标任务相关(不要求完全相同)的无标签数据。此处,“相关”意味着无标签数据与目标任务来自相同的输入模态和应用领域,尽管它们可能与目标任务中使用的数据不同。这一要求通常是可行的,因为收集无标签数据通常比收集带标签数据更容易。例如,在医疗诊断中,目标任务可能涉及仅从少量带标签样本诊断特定疾病,而医院通常可以通过常规临床实践收集大量无标签医学图像,如X光或CT扫描。虽然这些无标签数据可能涉及与目标任务不同的疾病类别或患者群体,但由于它们来自相同的医学影像领域,仍可视为相关。

本文的主要贡献如下:(i) 我们提出一种元学习设定,能够联合利用预训练模型和无标签数据,更贴近现实场景。(ii) 我们提出一种任务构建方法,通过利用预训练模型从无标签数据集生成的软标签来避免数据恢复。(iii) 我们提出一种任务加权机制,能够识别不同预训练模型生成任务的有用性,从而产生有效的元训练算法。(iv) 大量实验验证了我们的方法在多个基准上的优越性。

参见图注图1:所提出设定的示意图。在元训练阶段,仅可获得预训练模型和与目标任务相关的无标签数据,而预训练模型的原始训练数据集无法访问。在元测试阶段,模型通过少量带标签样本适应目标任务。表1:所提出设定与相关问题设定的比较。我们从四个方面进行了比较。第一项(A)表示在相应的训练或适应阶段是否可以在没有带标签训练数据的情况下进行学习。第二项(B)表示是否可以使用无标签数据。第三项(C)表示是否将预训练模型用作可用信息来源。最后一项(D)表示该设定是否支持适应未见过的目标任务。
## 2 相关工作

已有许多元学习方法被提出(Finn et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib2); Snell et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib1); Li et al., 2017 (https://arxiv.org/html/2607.02850#bib.bib3); Iwata and Kumagai, 2020 (https://arxiv.org/html/2607.02850#bib.bib23); Sun et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib15); Iwata and Kumagai, 2022 (https://arxiv.org/html/2607.02850#bib.bib24)),但它们通常依赖于一组带有标签数据集的任务。在实践中,由于高昂的成本和隐私问题,获取带标签的数据往往成本高昂或不可行。无数据元学习(DFML)(Hu et al., 2023a (https://arxiv.org/html/2607.02850#bib.bib7); Wei et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib8); Hu et al., 2023b (https://arxiv.org/html/2607.02850#bib.bib9); Wang et al., 2022 (https://arxiv.org/html/2607.02850#bib.bib10))通过利用多个预训练模型,在无需访问原始训练数据的情况下实现对未见任务的适应,从而解决了这一问题。然而,现有的DFML方法依赖基于模型反演的数据恢复,这计算成本高昂,并且无法有效利用现实场景中经常可用的无标签数据。

无监督元学习(UML)(Hsu et al., 2019 (https://arxiv.org/html/2607.02850#bib.bib25); Khodadadeh et al., 2019 (https://arxiv.org/html/2607.02850#bib.bib26); Jang et al., 2023 (https://arxiv.org/html/2607.02850#bib.bib17))从无标签数据中构建合成任务,以获取对未见任务学习的归纳偏置。这些方法通常需要大规模的无标签数据集,这在实践中很难获得,尤其是在医疗和金融等敏感领域,跨机构数据共享受到严格限制。此外,UML方法不利用已有的预训练模型。

无源域适应(SFDA)(Mitsuzumi et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib27); Karim et al., 2023 (https://arxiv.org/html/2607.02850#bib.bib28); Lee et al., 2022 (https://arxiv.org/html/2607.02850#bib.bib29))利用来自源域的预训练模型和目标域的无标签数据来实现域适应。虽然SFDA和所提出的方法都利用无标签数据和预训练模型来提高性能,但现有的SFDA方法仅适用于目标任务已预定义的情况,不能直接扩展到元学习框架。

知识蒸馏(KD)(Gou et al., 2021 (https://arxiv.org/html/2607.02850#bib.bib19); Wang and Yoon, 2021 (https://arxiv.org/html/2607.02850#bib.bib35); Moslemi et al., 2024 (https://arxiv.org/html/2607.02850#bib.bib36))使用预训练教师模型的预测来训练学生模型。虽然KD和所提出的方法都利用了预训练模型生成的软标签,但标准KD通常旨在训练学生模型匹配教师模型在预定义任务上的预测,而不是为了实现对新任务的适应。一些研究已将KD融入元学习框架,例如KD-MAML(Zhang et al., 2020 (https://arxiv.org/html/2607.02850#bib.bib18)),它依赖带标签数据来构建元训练任务。相比之下,我们的方法利用无标签数据和多个预训练模型构建元训练任务,无需访问这些模型最初训练所用的数据。表1 (https://arxiv.org/html/2607.02850#S1.T1)总结了每种问题设定的假设。

参见图注图2:所提出方法的示意图。在元训练阶段,我们利用预训练模型为无标签数据集分配软标签,生成元训练数据集。然后根据这些软标签计算任务权重,并通过最小化加权元训练损失来训练模型。在元测试阶段,训练好的模型利用少量带标签数据预测输入实例的标签。
## 3 问题形式化

在元训练阶段,我们得到一组预训练模型,记为M={Mt}t=1T\\mathcal\{M\}=\\\{M\_\{t\}\\\}\_\{t=1\}^\{T\},其中每个预训练模型Mt:X→ΔCt−1M\_\{t\}:\\mathcal\{X\}\\to\\Delta^\{C\_\{t\}\-1\}通过生成在CtC\_\{t\}个类别上的概率分布,对输入空间X\\mathcal\{X\}进行分类。这里,ΔCt−1\\Delta^\{C\_\{t\}\-1\}表示所有非负且和为1的CtC\_\{t\}维向量的集合。注意,这些模型的原始训练数据不可访问,且可能与目标任务中使用的数据不同。此外,我们得到一个无标签数据集U=\{xnu\}n=1N\\mathcal\{U\}=\\\{\\mathbf\{x\}\_\{n\}^\{\\mathrm\{u\}\}\\\}\_\{n=1\}^\{N\},其中每个xnu∈X\\mathbf\{x\}\_\{n\}^\{\\mathrm\{u\}\}\\in\\mathcal\{X\}表示第nn个输入实例,NN表示实例数量。该无标签数据集可能与目标任务中使用的数据不同,但假定与目标任务来自相同的输入模态和应用领域。

在元测试阶段,我们得到一个目标任务的数据集,称为支撑集S=\{\(xns,yns\)\}n=1NS\\mathcal\{S\}=\\\{\(\\mathbf\{x\}\_\{n\}^\{\\mathrm\{s\}\},y\_\{n\}^\{\\mathrm\{s\}\}\)\\\}\_\{n=1\}^\{N\_\{\\mathcal\{S\}\}\},其中每个xns∈X\\mathbf\{x\}\_\{n\}^\{\\mathrm\{s\}\}\\in\\mathcal\{X\}表示第nn个输入实例,ynsy\_\{n\}^\{\\mathrm\{s\}\}代表对应xns\\mathbf\{x\}\_\{n\}^\{\\mathrm\{s\}\}的标签。这里,实例数量NSN\_\{\\mathcal\{S\}\}很小。我们的目标是提高目标任务中测试标签的预测性能。

总体而言,预训练模型的原始训练数据、无标签数据以及目标任务中使用的数据假定共享相同的输入模态,并来自相同或相关的应用领域,尽管它们之间可能有所不同。

## 4 所提出的方法

我们提出一种元学习方法,从预训练模型和无标签数据中学习。我们的方法旨在利用无标签数据和预训练模型构建一组元训练任务。为实现这一目标,我们通过使用预训练模型M\\mathcal\{M\}为无标签数据集U\\mathcal\{U\}分配软标签,生成元训练数据集。用于元训练任务的数据集表示为U^=\{U^

相似文章

先学移动再学做事:面向VLA的任务无关预训练

Hugging Face Daily Papers

任务无关预训练(TAP)将VLA训练分解为从无标签交互数据中进行的自监督运动技能学习,然后是轻量级的语言接地,以最少的专家演示实现了强大的性能。它匹配或超越了在数百万条专家轨迹上训练的模型,同时对真实世界扰动具有鲁棒性。

使用大型语言模型标注实体匹配的训练数据

arXiv cs.CL

本文研究使用大型语言模型作为教师模型来标注实体匹配的训练数据,结果表明,在机器标注数据上训练的学生模型与在人工标注基准上训练的模型性能相当,并且具有显著的成本和速度优势。