GLOBE:用于核心集选择的轨迹对齐梯度匹配与结构化稀疏优化

arXiv cs.LG 论文

摘要

本文介绍了GLOBE,一种轨迹对齐的核心集选择框架,它利用跨多个检查点的梯度轨迹和多阶匹配与结构化稀疏优化来选择紧凑且具有代表性的训练子集,在六个基准上优于现有方法。

arXiv:2608.02690v1 公告类型:新 摘要:深度神经网络的设备端训练从根本上受到大规模数据集的计算和内存成本的限制。核心集选择通过仅保留真实训练样本的紧凑子集提供了一种实用的解决方案。然而,现有的基于梯度的方法通常依赖在单个模型快照处计算的梯度,并采用贪婪或基于追踪的选择过程,这限制了它们捕捉不断变化的优化动态和处理强相关样本的能力。我们提出GLOBE(Gradient Local-Balanced Extraction),一种轨迹对齐的核心集选择框架,将样本选择形式化为全局优化的稀疏加权问题。GLOBE通过跨多个训练检查点构建的梯度轨迹来表示每个样本,从而捕捉其在优化不同阶段的影响。为了保留完整数据集的训练行为,我们引入了一个多阶匹配目标,联合对齐梯度轨迹的一阶均值和投影非中心二阶矩。GLOBE进一步结合Group LASSO、Elastic Net正则化和非负预算约束,以在稳定相关轨迹权重的同时实现组级和样本级稀疏性。最后,类平衡Top-K选择在有限采样预算下保持足够的类别覆盖。在六个基准和五个评估架构上的实验表明,GLOBE在下游测试准确率方面持续优于现有的核心集选择方法,尤其是在低保留率下。这些结果凸显了将动态梯度信息、多阶分布匹配和结构化稀疏性相结合以实现数据高效学习的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# GLOBE:用于核心集选择的轨迹对齐梯度匹配与结构化稀疏优化
Source: https://arxiv.org/html/2608.02690
Hetian Liu1, 3\equalcontrib, Jin Cui1\equalcontrib, Mengcheng Shi2, Yanbin Hu1,3, Xinyue Long1,3, Boran Zhao1,3\corresponding, Pengju Ren1

###### 摘要

深度神经网络的设备端训练从根本上受到大规模数据集计算与内存成本的制约。核心集选择通过仅保留真实训练样本中的紧凑子集,提供了一种实用解决方案。然而,现有的基于梯度的方法通常依赖单一模型快照处计算的梯度,并采用贪心或追踪式选择流程,这限制了其捕捉动态优化演化过程以及处理强相关样本的能力。我们提出GLOBE(Gradient Local–Balanced Extraction,梯度局部-均衡抽取),一个轨迹对齐的核心集选择框架,将样本选择形式化为一个全局优化的稀疏加权问题。GLOBE通过在多个训练检查点上构建的梯度轨迹来表示每个样本,从而捕捉样本在优化不同阶段的影响。为保持完整数据集的训练行为,我们引入一个多阶匹配目标,联合对齐梯度轨迹的一阶均值与投影非中心二阶矩。GLOBE进一步结合Group LASSO、弹性网络正则化以及非负预算约束,以诱导组级和样本级稀疏性,同时稳定相关轨迹的权重。最后,类别平衡的Top-K选择在有限采样预算下保证充分的类别覆盖。在六个基准数据集和五个评估架构上的实验表明,GLOBE在后续测试准确率方面持续优于现有核心集选择方法,尤其是在低保留率场景下。这些结果凸显了结合动态梯度信息、多阶分布匹配与结构化稀疏性用于数据高效学习的有效性。

## 引言

深度神经网络(DNNs)近年来取得了显著进展,并在计算机视觉(Carion等2020 (https://arxiv.org/html/2608.02690#bib.bib1);Dosovitskiy等2020a (https://arxiv.org/html/2608.02690#bib.bib2);Liu等2021 (https://arxiv.org/html/2608.02690#bib.bib3))、自然语言处理(Vaswani等2017 (https://arxiv.org/html/2608.02690#bib.bib4);Devlin等2019 (https://arxiv.org/html/2608.02690#bib.bib6);Brown等2020 (https://arxiv.org/html/2608.02690#bib.bib5))以及科学计算(Raissi等2018 (https://arxiv.org/html/2608.02690#bib.bib7);Lu等2021 (https://arxiv.org/html/2608.02690#bib.bib8))等特定任务上达到甚至超越了人类水平。与此同时,随着物联网和自动驾驶等边缘智能应用的快速发展,以及人们对通信延迟和数据隐私的日益关注,直接在边缘设备上训练和更新神经网络的需求不断增长。然而,DNN的成功高度依赖大规模训练数据(Russakovsky等2015 (https://arxiv.org/html/2608.02690#bib.bib10);Lin等2014 (https://arxiv.org/html/2608.02690#bib.bib9)),而边缘设备通常在计算资源、存储容量和能源预算方面受到严格限制,使得直接在完整数据集上训练模型不切实际。因此,在保持训练效用的同时缩减数据规模,已成为设备端学习面临的重要挑战。为解决这一问题,研究者提出了多种数据集压缩技术(Yu等2023 (https://arxiv.org/html/2608.02690#bib.bib11)),其中数据集蒸馏(Loo等2022 (https://arxiv.org/html/2608.02690#bib.bib12);Zhao等2023 (https://arxiv.org/html/2608.02690#bib.bib13);Cazenavette等2023 (https://arxiv.org/html/2608.02690#bib.bib14);Wang等2018 (https://arxiv.org/html/2608.02690#bib.bib15))和核心集选择(Iyer等2021 (https://arxiv.org/html/2608.02690#bib.bib16);Mirzasoleiman等2020a (https://arxiv.org/html/2608.02690#bib.bib18);Killamsetty等2021a (https://arxiv.org/html/2608.02690#bib.bib17))是两种代表性范式。数据集蒸馏合成一组训练样本以近似完整数据集的训练效果,而核心集选择直接从原始数据中识别出具有代表性的子集。相比之下,核心集选择在计算效率与数据保真度之间取得了较好平衡,适合资源受限的边缘部署。

参见图注
图1:传统基于梯度的核心集选择与GLOBE的对比。传统方法使用单一模型快照的梯度来选取样本,而GLOBE对多检查点梯度轨迹进行建模,匹配其一阶与二阶统计量,并通过结构化稀疏优化获得紧凑且具有代表性的核心集。基于梯度匹配的核心集选择方法旨在构建一个小子集,其梯度接近完整数据集的梯度,从而识别最具代表性的训练样本。然而,如图1 (https://arxiv.org/html/2608.02690#Sx1.F1)所示,CRAIG(Mirzasoleiman等2020b (https://arxiv.org/html/2608.02690#bib.bib19))和GradMatch(Killamsetty等2021a (https://arxiv.org/html/2608.02690#bib.bib17))等代表性方法主要依赖在固定模型快照处计算的单步梯度,这限制了它们捕捉训练动态随时间演化的能力。此外,许多现有方法(Mirzasoleiman等2020b (https://arxiv.org/html/2608.02690#bib.bib19);Killamsetty等2021a (https://arxiv.org/html/2608.02690#bib.bib17),b (https://arxiv.org/html/2608.02690#bib.bib20))采用贪心优化流程,例如基于设施位置的贪心选择或正交匹配追踪。这些方法通常做出局部短视的决策,当样本之间存在强相关性时可能性能下降。此外,为降低逐样本梯度提取的计算成本,现有方法普遍使用轻量级代理网络。然而,代理网络与目标模型之间的结构差异可能引入额外的梯度偏差,进而影响所选核心集的质量。

在本工作中,我们从动态视角和分布视角重新审视基于梯度的核心集选择。我们首先引入梯度轨迹,它聚合训练过程中多个检查点上的逐样本梯度,以联合刻画优化路径的时间演化和多阶段几何结构。为更准确地近似完整数据集的梯度分布,我们构建了一个两层匹配目标,联合对齐梯度轨迹的一阶统计量(即均值)和二阶统计量(即协方差)。这一设计同时捕捉了整体梯度方向和样本梯度之间的相关结构。随后,我们将核心集选择形式化为具有结构化稀疏约束的样本权重优化问题。具体而言,Group LASSO在基于相似性的组上诱导组级稀疏性,而弹性网络促进样本级稀疏性并稳定保留组内相关样本的权重。最后,我们引入一种轻量级的教师-代理对齐机制,确保使用紧凑代理模型计算的梯度轨迹能够忠实反映目标模型的梯度行为。

基于上述设计,我们提出GLOBE(Gradient Local–Balanced Extraction)。我们的主要贡献如下:

- •我们引入多检查点梯度轨迹以及一个多阶匹配目标,用于保持全数据轨迹分布的一阶均值与投影二阶矩。
- •我们将核心集选择形式化为一个全局优化的稀疏加权问题,结合Group LASSO与弹性网络,在诱导组级和样本级稀疏性的同时稳定相关样本权重。
- •在六个基准数据集和五个架构上的实验表明,GLOBE持续优于现有方法,尤其在低保留率场景下表现突出。

## 相关工作

### 数据集压缩

数据集压缩方法大致可分为数据集蒸馏(Loo等2022 (https://arxiv.org/html/2608.02690#bib.bib12);Zhao等2023 (https://arxiv.org/html/2608.02690#bib.bib13);Cazenavette等2023 (https://arxiv.org/html/2608.02690#bib.bib14);Zhao和Bilen2023 (https://arxiv.org/html/2608.02690#bib.bib21))和核心集选择(Iyer等2021 (https://arxiv.org/html/2608.02690#bib.bib16);Mirzasoleiman等2020a (https://arxiv.org/html/2608.02690#bib.bib18);Killamsetty等2021a (https://arxiv.org/html/2608.02690#bib.bib17))。数据集蒸馏优化一组合成样本,使在其上训练的模型能达到与使用完整数据集相当的性能。代表性方法包括基于双层优化的数据集蒸馏(Feng等2024 (https://arxiv.org/html/2608.02690#bib.bib26))、梯度匹配(Zhao等2020 (https://arxiv.org/html/2608.02690#bib.bib22);Kim等2022 (https://arxiv.org/html/2608.02690#bib.bib23))、分布匹配(Zhao和Bilen2023 (https://arxiv.org/html/2608.02690#bib.bib21))以及训练轨迹匹配(Cui等2023b (https://arxiv.org/html/2608.02690#bib.bib24);Liu等2023 (https://arxiv.org/html/2608.02690#bib.bib25))。然而,这些方法通常需要反复训练模型并执行梯度反向传播以优化合成样本,导致大量计算开销。此外,合成样本可能存在可解释性有限和跨模型架构泛化受限的问题。相比之下,核心集选择直接从原始数据集中选取代表性样本,从而保留了真实数据的语义内容。现有方法主要基于几何覆盖(Sener和Savarese2017 (https://arxiv.org/html/2608.02690#bib.bib28);Wei等2015 (https://arxiv.org/html/2608.02690#bib.bib29))、不确定性(Gal等2017 (https://arxiv.org/html/2608.02690#bib.bib30);Yoo和Kweon2019 (https://arxiv.org/html/2608.02690#bib.bib31))或决策边界信息(Ducoffe和Precioso2018 (https://arxiv.org/html/2608.02690#bib.bib32);Margatina等2021 (https://arxiv.org/html/2608.02690#bib.bib33))来评估样本重要性。尽管核心集选择能够保留完整数据集中的大量信息,其效果仍高度依赖于选择准则。因此,准确刻画每个样本的贡献仍是一个关键挑战。

### 基于梯度的数据集压缩

梯度信号直接反映每个样本如何影响模型参数更新,因此被广泛用于数据集压缩。在数据集蒸馏中,早期方法通过匹配真实数据与合成数据的单步梯度来优化合成样本。后续方法通过累积多个参数更新上的误差或执行顺序匹配,扩展了单步梯度匹配(Du等2023a (https://arxiv.org/html/2608.02690#bib.bib35),b (https://arxiv.org/html/2608.02690#bib.bib36)),另一条工作线则直接匹配更长的训练轨迹(Cazenavette等2022 (https://arxiv.org/html/2608.02690#bib.bib37);Cui等2023a (https://arxiv.org/html/2608.02690#bib.bib38))以保留更完整的训练动态。在核心集选择中,GraNd(Paul等2021 (https://arxiv.org/html/2608.02690#bib.bib27))使用梯度范数估计样本重要性,CRAIG(Mirzasoleiman等2020b (https://arxiv.org/html/2608.02690#bib.bib19))选择代表性样本以近似全数据梯度,GradMatch(Killamsetty等2021a (https://arxiv.org/html/2608.02690#bib.bib17))采用正交匹配追踪构建加权子集。然而,现有基于梯度的核心集选择方法通常依赖在固定训练快照处由单一模型计算的梯度,难以捕捉样本贡献在不同训练阶段的变化。此外,它们主要关注均值梯度匹配,而较少关注样本梯度之间的相关结构。当候选样本高度相关时,贪心选择和正交匹配追踪也可能产生局部短视且不稳定的解。

### 核心集选择的稀疏优化

稀疏优化为从大型候选池中选择紧凑的代表性样本集提供了自然框架(Elhamifar等2012b (https://arxiv.org/html/2608.02690#bib.bib39),a (https://arxiv.org/html/2608.02690#bib.bib40))。最小绝对收缩与选择算子(LASSO)通过l1\\ell\_\{1\}正则化促进样本级稀疏性,将许多样本系数精确驱动为零(Tibshirani1996 (https://arxiv.org/html/2608.02690#bib.bib41))。然而,真实数据集通常包含具有强相关特征或梯度的样本,此时LASSO可能表现出不稳定的选择行为,并任意只保留相关候选中的一部分(Zou和Hastie2005 (https://arxiv.org/html/2608.02690#bib.bib42);Meinshausen和Yu2009 (https://arxiv.org/html/2608.02690#bib.bib43))。弹性网络结合了l1\\ell\_\{1\}与l2\\ell\_\{2\}正则化(Zou和Hastie2005 (https://arxiv.org/html/2608.02690#bib.bib42))。其中l1\\ell\_\{1\}项保持样本级稀疏性,l2\\ell\_\{2\}项则促进更平滑的系数收缩,提高相关样本间的稳定性。Group LASSO进一步在预定义组上施加结构化稀疏性,允许整组相关样本被联合选择或丢弃(Yuan和Lin2006 (https://arxiv.org/html/2608.02690#bib.bib44))。在本工作中,我们将这些结构化稀疏正则项与梯度轨迹匹配相结合,将核心集选择形式化为一个统一的权重优化问题,以实现稳定且具有代表性的样本选择。

## 方法

### 问题定义

给定一个带标签数据集D=\{\(xi,yi\)\}i=1N,\\mathcal\{D\}=\\\{\(x\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{N\},我们的目标是构建一个大小为KK的紧凑核心集S⊂D\\mathcal\{S\}\\subset\\mathcal\{D\},使其近似完整数据集的训练动态。

我们不显式选择样本,而是将核心集构建视为学习一个稀疏权重向量ω∈R≥0N。\\omega\\in\\mathbb\{R\}\_\{\\geq 0\}^\{N\}。系数ωi\\omega\_\{i\}量化样本ii在重建全数据梯度轨迹统计量中的贡献。随后,我们使用系数幅度,通过类别平衡的Top-K选择获得离散核心集。

设θ\\thetata表示轻量级代理模型的参数,J\\mathcal\{J\}表示被跟踪层的索引集合。对于训练样本\(xi,yi\)\(x\_\{i\},y\_\{i\}\),我们将其在层j∈Jj\\in\\mathcal\{J\}处的梯度定义为

gi\(j\)\(θ\)=∇θ\(j\)l\(xi,yi;θ\)g\_\{i\}^\{\(j\)\}\(\\theta\)=\\nabla\_\{\\theta^\{\(j\)\}\}\\ell\(x\_\{i\},y\_\{i\};\\theta\)(1)经典梯度匹配构建一个加权子集,使其聚合梯度近似完整数据集的平均梯度:

minS⊂D∑j∈Jαj\|∑xi∈Sωigi\(j\)\(θ\)−1N∑i=1Ngi\(j\)\(θ\)\|2,\\min\_\{\\begin\{subarray\}\{c\}

相似文章