在LLM后训练中基于流形覆盖和稀疏特征覆盖的层次化数据选择
摘要
该论文提出MASS框架,用于LLM后训练的层次化数据选择,通过流形覆盖和稀疏特征覆盖筛选高价值数据子集,实验表现优于现有基线。
查看缓存全文
缓存时间: 2026/08/19 10:16
# 通过流形覆盖和稀疏特征覆盖实现LLM后训练的层级数据选择
来源:https://arxiv.org/html/2608.16927
作者:AAAI Press Staff¹
AAAI Style Contributions by Peter Patel Schneider, Sunil Issar, J\. Scott Penberthy, George Ferguson, Hans Guesgen, Francisco Cruz\\equalcontrib\\corresponding, Marc Pujol\-Gonzalez\\equalcontrib\\corresponding
Peng Sun¹, Yi Yang¹, Antong Zhang², Chunxiao Li³, Yanbo Wang⁴, Dianbo Liu⁵, Xin Chen⁶, Kai Yu⁷, Lu Chen⁷, Tianfan Fu¹\\corresponding
###### 摘要
随着监督微调数据持续扩展,从大规模候选池中选择高价值子集对于降低训练成本、提升模型性能至关重要。现有方法常在原始嵌入空间中直接度量多样性,但几何度量会混杂主导语义方向、细粒度监督差异与局部噪声。我们通过将数据选择构建为由粗到细的层级覆盖问题来应对这一局限,并提出MASS方法。MASS使用密集自编码器学习低维主流形坐标进行粗粒度语义分组,再采用TopK稀疏自编码器在各组内执行质量感知的稀疏特征覆盖。在Vision Flan和LLaVA\-CoT上的实验表明,MASS在不同数据预算下均持续优于现有数据选择基线,且在多种设置下仅用少量数据即可匹配甚至超越全数据训练效果。
## 1 引言
随着大模型监督微调数据规模持续增长,从大规模候选池中选择高价值子集已成为降低训练成本、提升模型性能的重要问题(Ivisonet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib25); Liuet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib26))。现有数据选择方法通常使用嵌入来表征数据分布,并通过相似性度量与聚类来保持样本多样性与覆盖度(Debet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib24); Biet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib17))。部分方法进一步引入质量或重要性信号以提升所选子集的有效性(Leeet al\.2024 (https://arxiv.org/html/2608.16927#bib.bib19); Yanet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib23))。尽管这些方法在实践中有效,但大多数仍依赖于原始嵌入空间中的几何关系,隐式假设该空间中的邻域关系与聚合模式与数据选择所需的语义覆盖和监督差异相匹配。然而我们发现这一假设并不充分。对于复杂的指令数据,原始嵌入空间中的几何关系不仅反映主导语义方向,还会受到方向内细粒度属性、响应格式变化及局部噪声的影响(Chenet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib27))。我们的嵌入几何分析进一步表明,数据分布具有高度全局变异性,难以用少量线性方向概括。相反,局部邻域表现出显著更低的有效维度,其邻域结构更符合非线性流形假设(如附录A (https://arxiv.org/html/2608.16927#A1)所示)。因此,在原始嵌入空间中直接进行扁平化多样性度量,可能会将全局语义结构、局部细粒度差异与任务无关扰动混入单一选择标准。
基于此观察,我们认为数据选择应被构建为由粗到细的层级覆盖问题:所选子集应首先保留对主要语义流形区域的覆盖,进而覆盖每个区域内的细粒度监督特征。为此,我们提出MASS(流形感知稀疏选择方法)。MASS首先使用密集自编码器学习稳定的低维主流形坐标,并在此空间中进行粗粒度分组。随后采用TopK稀疏自编码器提取稀疏特征,在每个粗粒度组内执行细粒度覆盖选择。此外,MASS引入外部质量评分以避免仅因增加多样性而选择低质量样本。我们在涵盖通用指令与推理任务的Vision\-Flan和LLaVA\-CoT上评估了MASS。实验结果表明,MASS在不同数据预算下均持续优于现有数据选择基线,且在某些设置中仅用少量数据即可超越全数据训练性能。进一步的消融研究表明,密集自编码器学习的主流形坐标提供了更可靠的粗粒度分组,稀疏自编码器学习的特征提升了组内细粒度覆盖,而质量信号进一步增强了所选样本的有效性。我们的主要贡献总结如下:
- •我们将监督微调数据选择重新定义为结合粗粒度主流形覆盖与细粒度监督特征覆盖的层级覆盖问题。
- •我们提出MASS方法,通过密集自编码器构建主流形分组,利用TopK稀疏自编码器执行组内稀疏特征覆盖,并融入质量信号进行样本选择。
- •我们在多数据集、数据预算、嵌入来源和目标模型上验证了MASS的有效性与鲁棒性。
## 2 相关工作
#### 数据选择
数据选择旨在从大规模训练数据中识别高价值子集,在保持甚至提升模型性能的同时降低训练成本。现有方法通常从样本重要性或覆盖多样性角度选择数据:前者包括基于训练动态的方法(如EL2N(Paulet al\.2021 (https://arxiv.org/html/2608.16927#bib.bib14))、LESS(Xiaet al\.2024 (https://arxiv.org/html/2608.16927#bib.bib12))和OPUS(Wanget al\.2026 (https://arxiv.org/html/2608.16927#bib.bib13))),以及基于模型自身行为或性能的方法(如ScalSelect(Wuet al\.2026 (https://arxiv.org/html/2608.16927#bib.bib15))和CVS(Sunet al\.2026 (https://arxiv.org/html/2608.16927#bib.bib21)));后者包括基于表示相似性的方法(如SemDeDup(Abbaset al\.2023 (https://arxiv.org/html/2608.16927#bib.bib16))和PRISM(Biet al\.2025 (https://arxiv.org/html/2608.16927#bib.bib17))),以及基于多样性共识的方法(如ICONS(Wuet al\.2024 (https://arxiv.org/html/2608.16927#bib.bib22))和INSTAG(Luet al\.2023 (https://arxiv.org/html/2608.16927#bib.bib18)))。此外,COINCIDE(Leeet al\.2024 (https://arxiv.org/html/2608.16927#bib.bib19))和XMAS(Naharaset al\.2025 (https://arxiv.org/html/2608.16927#bib.bib20))等方法进一步结合样本重要性与数据多样性,在实践中展现出更稳定的选择性能。尽管这些方法有效,但大多依赖全局评分或分布级相似性度量,而MASS将数据选择构建为由粗到细的层级覆盖问题,既保留主流形覆盖,又建模局部细粒度监督特征覆盖,并将样本质量作为辅助信号。
#### 自编码器与流形表示
自编码器通过编码器-解码器架构将高维输入压缩至低维潜在空间,并通过重建目标学习紧凑表示(Baldi and Hornik1989 (https://arxiv.org/html/2608.16927#bib.bib1); Hinton and Salakhutdinov2006 (https://arxiv.org/html/2608.16927#bib.bib3))。先前研究表明,低维潜在表示能保留数据的主要变化方向,因此被广泛用于非线性降维、表示学习与流形结构建模(Kramer1991 (https://arxiv.org/html/2608.16927#bib.bib2); Hinton and Salakhutdinov2006 (https://arxiv.org/html/2608.16927#bib.bib3); Bengioet al\.2013 (https://arxiv.org/html/2608.16927#bib.bib4))。在MASS中,我们采用密集自编码器压缩条件表示并学习低维主流形坐标,用于构建稳定的粗粒度语义分组。与直接在原始嵌入空间中聚类相比,密集自编码器的瓶颈结构有助于抑制冗余维度和局部扰动,从而更好地表征数据分布的主导结构。
#### 稀疏自编码器
稀疏自编码器源于稀疏编码与字典学习,旨在用少量激活特征重建输入表示,从而获得更具选择性和可解释性的潜在特征(Olshausen and Field1997 (https://arxiv.org/html/2608.16927#bib.bib5); Aharonet al\.2006 (https://arxiv.org/html/2608.16927#bib.bib6))。近年来,稀疏自编码器被广泛用于语言模型的机制可解释性研究,将模型内部激活分解为更具语义一致性的特征(Hubenet al\.2024 (https://arxiv.org/html/2608.16927#bib.bib7); Brickenet al\.2023 (https://arxiv.org/html/2608.16927#bib.bib8))。后续工作进一步提出TopK SAE(Makhzani and Frey2013 (https://arxiv.org/html/2608.16927#bib.bib9))、门控SAE(Rajamanoharanet al\.2024a (https://arxiv.org/html/2608.16927#bib.bib10))和JumpReLU SAE(Rajamanoharanet al\.2024b (https://arxiv.org/html/2608.16927#bib.bib11))以改进稀疏性控制、死特征与重建质量之间的权衡。不同于以往主要关注解释模型内部激活的研究,MASS将TopK SAE应用于输入-响应监督联合表示,并利用稀疏特征覆盖增益进行数据选择,从而提升每个主流形区域内细粒度监督信号的多样性。
## 3 方法
### 3\.1 问题定义
给定数据集$D$,数据选择旨在找到预算子集$D^{\prime}\subseteq D$且$|D^{\prime}|=P$,使得在$D^{\prime}$上的训练能够接近甚至超越在$D$上的训练性能。令$f(\cdot)$表示模型性能,我们将目标定义为:
$$\max_{D^{\prime}\subseteq D}f(D^{\prime})\quad\mathrm{s.t.}\quad|D^{\prime}|=P.\tag{1}$$
### 3\.2 MASS:流形感知稀疏选择
我们提出MASS——一种用于SFT数据选择的流形感知稀疏选择方法。MASS使用密集自编码器学习低维主流形坐标进行粗粒度语义分组,并采用TopK稀疏自编码器捕捉细粒度稀疏监督特征。随后通过结合稀疏特征覆盖与外部质量评分,在每个组内执行贪婪选择,在保留流形覆盖的同时提升细粒度多样性与样本质量。整体流程如图1 (https://arxiv.org/html/2608.16927#S3.F1)所示,实现细节见附录B (https://arxiv.org/html/2608.16927#A2)。
#### 双视图编码
给定候选样本$z_{i}$,我们将其表示为输入-响应对:$z_{i}=(q_{i},a_{i})$,(2)其中$q_{i}$表示输入(可包含文本指令、视觉信息或其他上下文内容),$a_{i}$表示响应。对每个样本,我们构建两类嵌入。第一类是条件嵌入:$e_{i}^{c}=E_{\mathrm{emb}}(q_{i})$,(3)仅编码输入中的语义信息,用于后续的主流形坐标学习与粗粒度分组。第二类是监督嵌入:$e_{i}^{s}=E_{\mathrm{emb}}(q_{i},a_{i})$,(4)编码由输入和响应共同形成的完整监督信号,用于后续的稀疏特征学习与组内细粒度覆盖。两类嵌入均通过冻结的嵌入模型提取,随后独立进行中心化和$L_{2}$归一化。下文中$e_{i}^{c}$与$e_{i}^{s}$表示预处理后的嵌入。
图1:MASS概述。MASS首先使用密集自编码器从输入侧表示中学习低维主流形坐标,并进行粗粒度分组。随后采用TopK稀疏自编码器从输入-响应表示中提取稀疏监督特征。最后,在每个组内,MASS通过结合特征覆盖增益与质量评分进行贪婪样本选择,生成最终选定的子集。
#### 用于主流形编码的密集自编码器
我们在条件嵌入空间中训练密集自编码器,将高维嵌入映射到稳定的低维主流形坐标。具体而言,训练时给定$e_{i}^{c}$,我们构造固定幅度的扰动:$u_{i}=\frac{\epsilon_{i}}{\|\epsilon_{i}\|_{2}}$,$\epsilon_{i}\sim\mathcal{N}(0,I)$。(5)随后将该扰动应用于$e_{i}^{c}$并归一化作为密集自编码器输入:$\widetilde{e}_{i}^{c}=\mathrm{Norm}\bigl(e_{i}^{c}+\delta u_{i}\bigr)$,(6)其中$\delta$为小的固定常数,$\mathrm{Norm}(\cdot)$表示$L_{2}$归一化。密集自编码器由编码器$\phi_{\mathrm{dae}}$和解码器$\psi_{\mathrm{dae}}$组成。$\phi_{\mathrm{dae}}$将扰动后的高维表示压缩为维度32的低维潜在表示:$h_{i}=\phi_{\mathrm{dae}}(\widetilde{e}_{i}^{c})$,(7)其中$h_{i}$被视为样本在条件嵌入空间中的低维主流形坐标。$\psi_{\mathrm{dae}}$随后将该坐标重建回原始嵌入空间:$\hat{e}_{i}^{c}=\mathrm{Norm}\bigl(\psi_{\mathrm{dae}}(h_{i})\bigr)$。(8)训练目标为最小化原始条件嵌入与密集自编码器重建之间的平方距离:
$$\mathcal{L}_{\mathrm{DAE}}=\frac{1}{N}\sum_{i=1}^{N}\left\|e_{i}^{c}-\hat{e}_{i}^{c}\right\|_{2}^{2}.\tag{9}$$
#### 用于稀疏特征编码的稀疏自编码器
我们在监督嵌入空间中训练TopK稀疏自编码器,以刻画完整样本的细粒度稀疏特征。与密集自编码器不同,稀疏自编码器以$e_{i}^{s}$为输入,因为样本的有效训练信号不仅来自输入$q_{i}$,还来自响应$a_{i}$。具体而言,稀疏自编码器由编码器$\phi_{\mathrm{sae}}$和解码器$\psi_{\mathrm{sae}}$组成。给定监督表示$e_{i}^{s}$,$\phi_{\mathrm{sae}}$首先产生过完备特征预激活,随后通过ReLU非线性变换获得非负激活值:$r_{i}=\mathrm{ReLU}\bigl(\phi_{\mathrm{sae}}(e_{i}^{s})\bigr)$。(10)接着应用TopK操作进行显式稀疏化:$k_{i}=\mathrm{TopK}(r_{i},K)$,(11)其中$k_{i}$是最多包含$K$个非零激活的稀疏向量。相似文章
LLM微调中数据选择的长期影响
本文研究了多阶段LLM微调中数据选择策略的长期影响,揭示了短视选择会损害未来适应能力。为此,提出了一种长期视角感知选择(LHAS)目标以缓解这些问题。
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
基于多目标强化学习的LLM预训练整体数据调度器
介绍了一种基于强化学习的整体数据调度器(HDS),该框架利用多目标奖励函数在LLM预训练过程中动态调整数据混合策略,使达到目标困惑度所需的迭代次数减少44%,并在MMLU上提升7.2%。
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
# Paper page - MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning Source: [https://huggingface.co/papers/2605.07850](https://huggingface.co/papers/2605.07850) We propose**MatryoshkaLoRA**, a general, Matryoshka\-inspired training framework for LoRA that learns accurate hierarchical low\-rank representations by inserting a fixed, carefully crafted diagonal matrix**P**between the existing LoRA adapters to scale their sub\-ranks accordingly\. By introducing
持续LLM升级循环:一种用于从稠密到稀疏LLM的预测器门控按组稀疏训练方案
本文提出了一种用于大语言模型的从稠密到稀疏的持续训练方法,采用预测器门控的按组稀疏性实现4倍FFN稀疏度,并在Qwen2.5-8B上通过长上下文训练进行了验证。