少样本学习中样本选择策略的自动组合

arXiv cs.CL 论文

摘要

本文提出 ACSESS 方法,用于自动组合多种样本选择策略来改进少样本学习的性能,涵盖上下文学习和梯度优化两种方法。该工作在包含文本和图像两种模态的 14 个数据集上证明,策略组合的效果始终优于单个选择方法。

arXiv:2402.03038v2 公告类型:替换交叉 摘要:在少样本学习中,样本的选择对模型性能有重大影响。虽然有效的样本选择策略在监督学习设置中已被充分研究,但大语言模型研究中普遍忽视了这些策略,倾向于采用针对特定上下文学习场景的策略。本文提出了一种新方法,用于样本选择策略的自动组合(ACSESS),以利用各种已有选择目标的优势和互补性。我们在 6 个文本数据集和 8 个图像数据集上,研究并比较了 23 种样本选择策略对 5 个上下文学习模型和 3 种少样本学习方法(元学习、少样本微调)性能的影响。实验结果表明,通过 ACSESS 方法组合多种策略的效果始终优于所有单个选择策略,且与上下文学习特定基线相当或更优。最后,我们证明了即使在较小数据集上,样本选择仍然有效,当仅选择少数样本时效果最佳,而随着样本数量增加,其优势逐渐减弱。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:32

# 少样本学习的样本选择策略自动组合

来源:https://arxiv.org/html/2402.03038

Branislav Pecher♠†、Ivan Srba†、Maria Bielikova†、Joaquin Vanschoren‡

♠Brno University of Technology信息技术学院,Brno,Czechia
†Kempelen Institute of Intelligent Technologies,Bratislava,Slovakia
‡Eindhoven University of Technology,Eindhoven,Netherlands

\{branislav\.pecher, ivan\.srba, maria\.bielikova\}@kinit\.sk, j\.vanschoren@tue\.nl

###### 摘要

在少样本学习中,样本的选择对模型性能有重大影响。虽然有效的样本选择策略在监督学习设置中已有充分研究,但关于大语言模型的研究在很大程度上忽视了它们,更倾向于采用针对特定上文学习设置定制的策略。本文提出了一种新方法——样本选择策略自动组合(ACSESS),以充分利用各种既有选择目标的优势和互补性。我们调查并比较了23种样本选择策略对5个上文学习模型和3种少样本学习方法(元学习、少样本微调)在6个文本和8个图像数据集上的影响。实验结果表明,通过ACSESS方法组合策略的效果始终优于所有单个选择策略,并与上文学习特定的基准方法相当或更优。最后,我们证明了即使在较小的数据集上,样本选择仍然有效,当仅选择少数几个样本时获益最大,而随着样本数量增加,其优势逐渐减弱。

## 1 引言

许多领域因数据收集/标注成本或隐私考虑而面临标记数据稀缺的问题,这使得训练典型的深度学习模型不可行。少样本学习解决了在仅有少量标记样本可用时适配模型到新任务的挑战(Song等人,2023)。存在两种主要方法:1)上文学习,其中预训练的大语言模型基于少量示例进行条件化,无需任何参数更新(Dong等人,2022;Liu等人,2023);2)基于梯度的少样本学习,包括元学习和微调,将来自相关数据集的知识通过基于梯度的训练迁移到新问题(Song等人,2023;Chen等人,2019;Vanschoren,2018;Hospedales等人,2021)。有关它们差异的更多详情见附录J。

样本的选择在两种方法中都至关重要,因为性能会根据样本质量的不同而大幅波动。不同领域的现有研究,如在LLM对齐中(Zhou等人,2024),已证明策划一个较小的高质量样本子集可以带来比在全套可用样本上训练更好的性能。这也适用于少样本学习,特别是对于噪声或不平衡数据集,或对样本选择敏感的上文学习(Pecher等人,2024;Agarwal等人,2021;Köksal等人,2022)。

许多研究已提出了多种样本选择策略来识别最优样本集。这样的样本选择策略遵循其特定的目标,通过考虑可用样本的一个或几个属性,例如最大化选定样本的相似性、多样性、信息性或质量(Li和Qiu,2023;Zhang等人,2022;Chang和Jia,2023)。随着大语言模型的普及,许多新的选择策略被提出用于上文学习。然而,它们通常仅针对特定设置定制,限制了其适用性。同时,被证明在监督设置中表现良好的既有长期存在的选择策略(如主动学习)大多被忽视为LLM样本选择的一部分(Pecher等人,2024;Albalak等人,2024)。

在这项工作中,我们证明了既有策略可以匹配或超越上文学习特定策略的性能。为实现这一点,我们自动且最优地组合既有样本选择策略使用的样本选择目标,以识别具有互补特性的样本。为了充分利用不同样本选择策略的优势,我们提出了ACSESS,一种样本选择策略自动组合的有效方法。首先,识别可以改善少样本学习整体成功的相关策略的子集。随后,使用基于其预期贡献的权重将识别出的策略的选择目标组合在一起,以识别最具信息性和高质量的样本,可提供最大的益处。

我们的贡献和发现如下¹¹为了支持结果的可复现性和扩展,我们在https://github.com/kinit-sk/ACSESS上公开发布了实验源代码:

- 我们提供了首项大规模研究,涵盖23种样本选择策略,在5个上文学习模型和3种少样本学习方法(包括元学习和少样本微调)上进行,涉及6个文本和8个图像数据集。我们表明样本选择可以获得一致的收益(上文学习可达55个百分点,基于梯度的少样本学习可达33个百分点),尽管效果在很大程度上取决于数据集和方法。

- 我们提出了ACSESS,一种自动组合和加权样本选择目标的方法,以充分利用其优势并识别具有互补特性的样本(即信息性、代表性和可学习性)。我们的结果表明,通过ACSESS方法识别的既有策略的组合始终导致与现有上文学习特定基准方法相当或更优的性能。

- 通过消融研究,我们发现以下关键见解:1)当样本数量较少或使用噪声数据集时,样本选择的影响更大;2)在较高的样本数量(平均30-40个)时,样本选择的影响可以忽略不计,因为所有策略都回归到随机选择;3)超过一定点后,使用更多样本带来的性能提升变得可以忽略不计(上文学习为30个样本;基于梯度的少样本学习为50个样本);4)即使在小数据集大小(从仅25%的数据集选择时可实现相似性能用于上文学习,或从10%的数据集选择用于基于梯度的少样本学习),样本选择也很有益。

## 2 相关工作

大量工作致力于为上文学习选择高质量样本,发现整体性能对此选择很敏感,导致结果的大幅变动(Pecher等人,2024;Köksal等人,2022;Zhang等人,2022)。在监督设置中,选择主要关注于将数据集蒸馏到较少数量的样本(Yu等人,2023)、选择代表完整集的核心集(Guo等人,2022)或使用主动学习减少标注成本(Ren等人,2021)。然而,这些策略对其他少样本学习方法的影响仍未充分探索。

在大多数样本选择策略中,样本选择目标考虑可用样本的单一属性。为此,各种启发式方法和无监督指标用作估计其提升模型性能潜力的指标。对于上文学习,最流行的方法是基于与测试样本的相似性选择样本,仅在采用的相似性度量和表示上有所不同(Liu等人,2022;An等人,2023;Zemlyanskiy等人,2022;Gupta等人,2022;Pasupat等人,2021;Wang等人,2022;Nashid等人,2023;Agrawal等人,2023;Gao等人,2021)。除了相似性,样本通常基于其信息性或不确定性选择,通常使用主动学习策略(Köksal等人,2022;Schröder等人,2022;Margatina等人,2021;Park等人,2022;Mavromatis等人,2023)、样本偏差(Ma等人,2023)或对抗训练(Agarwal等人,2021)。其他方法为每个样本定义质量概念,要么通过提示LLM对样本评分(Shin等人,2021),要么通过观察样本的包含或移除如何影响性能(Maronikola​​kis等人,2023;Nguyen和Wong,2023)。考虑代表性时,样本基于其代表完整数据集的程度选择(Guo等人,2022;Killamsettty等人,2021;Mirzasoleimanetal,2020;Paul等人,2021;Coleman等人,2020)。

可学习性指标要么确定学习特定样本有多容易(Swayamdipta等人,2020;Zhang和Plank,2021),要么确定样本被学习后被遗忘的频率(Toneva等人,2018)。最后,一些方法同时平衡多个样本属性。通常,样本的相似性与其多样性结合(Wu等人,2023;Qin等人,2023),或样本的信息性与其代表性平衡(Su等人,2022;Levy等人,2023;Ye等人,2023;Liu和Wang,2023)。在特定情况下,进行两步样本搜索,例如查找信息丰富样本的集合,然后使用多样性引导搜索来改进该集合(Li和Qiu,2023),或使用不同的不确定性度量来选择顶部样本(Diao等人,2024)。

较新的策略利用优化来选择单个代表样本集。一个可能性是训练样本检索器,如单独的评分模型(Rubin等人,2022;Luo等人,2023;Li等人,2023;Wang等人,2023;Aimen等人,2023),或定义样本优良性的代理评分器并使用多臂老虎机选择最佳范例(Purohit等人,2024,2025)。另一个选项是利用强化学习(Zhang等人,2022;Shum等人,2023;Scarlatos和Lan,2023)。最后,数据模型方法训练线性模型来预测样本集的性能增益,以选择将导致最高可能性能提升的子集(Ilyas等人,2022;Chang和Jia,2023;Jundi和Lapesa,2022;Vilar等人,2023)。

在这项工作中,我们调查既有单属性策略的目标组合是否可以与专门针对上文学习定制的策略的选择相媲美。与Li和Qiu(2023)以及Purohit等人(2024,2025)的相关工作类似,我们选择单个样本集,但不仅关注上文学习。实质上,我们通过探索和有效组合对少样本学习性能重要的样本属性来补充Agarwal等人(2021)的工作。最后,我们提出的方法受到数据模型方法(Ilyas等人,2022)的启发,但在策略级别而不是样本级别执行选择。

## 3 ACSESS:选择策略的自动组合

尽管现有的样本选择策略数量众多,但大多数仍受限于单一目标,通常仅考虑一个样本属性。这种狭隘的焦点经常导致选择不理想,而通过适当组合多个捕获互补样本属性的目标可以实现更大的性能收益。例如,最具信息性的样本如果难以学习或经常被遗忘,可能不会为使用基于梯度训练的少样本方法贡献太多。另一方面,对于上文学习,决策边界上的样本(通常难以学习)可能会提供更多益处。我们提议选择由

相似文章

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。

ALPINE: 参数与样本高效的小样本学习自适应定位

Hugging Face Daily Papers

ALPINE 介绍了一种超轻量级的空间关系架构,用于小样本图像分类,与基线模型如 Prototypical Networks 和 MAML 相比,它用更少的参数实现了精度提升,收敛更快,鲁棒性更好。

多样本思维链上下文学习:让上下文学习真正学会

Hugging Face Daily Papers

本文研究了推理任务的多样本思维链上下文学习,揭示了标准扩展规则并不适用,并提出了Curvilinear Demonstration Selection (CDS)方法以改进示例排序,最高可获得5.42个百分点的性能提升。