DRIFT:通过在线策略数据归因优化指令数据
摘要
DRIFT提出了一种方法,利用在线策略影响函数来优化大型语言模型监督微调的训练数据分布,持续提升现有基线的性能上限。
arXiv:2606.18307v1 公告类型:新
摘要:优化监督微调(SFT)的训练数据分布决定了大型语言模型(LLM)的能力。虽然现有的数据筛选方法在预算有限的情况下擅长加速训练,但它们在提升能力上限方面并不适用。这里的挑战不再是从中识别出能够保持性能的更小子集,而是优化数据分布,使其包含最能提升最终模型的实例。为了解决这个问题,我们探索使用影响函数(IF)进行实例级数据归因。我们发现,标准的IF公式在此设置中存在两个结构性问题:由离线策略验证目标导致的邻近性差距,以及对梯度范数的严重偏置。我们提出DRIFT(基于在线策略影响函数的监督微调数据优化)。DRIFT不依赖外部参考数据,而是利用模型的在线策略生成结果作为验证目标,经验上最大限度地缩小了参数邻近性差距,并更好地符合IF的局部邻域假设。它进一步基于轨迹正确性应用符号加权,并针对梯度攻击问题对影响分数进行去偏,从而允许一小部分验证查询作为可靠锚点来归因整个数据集。在7B参数指令模型和推理模型上的实验表明,DRIFT持续提升了这两类模型的性能上限,优于现有的数据筛选基线。
查看缓存全文
缓存时间: 2026/06/18 05:40
# 通过在线策略数据归因精炼指令数据
来源:https://arxiv.org/html/2606.18307
Zefan Wang Lincheng Li Tianyu Yu Yuan Yao 清华大学 zefan\.wang\.thu@gmail\.com yaoyuanthu@gmail\.com
###### 摘要
优化监督微调(SFT)的训练数据分布决定了大型语言模型(LLMs)的能力。虽然现有的数据筛选方法在有限预算下能加速训练,但不太适合提升能力上限。这里的挑战不再是找出一个能保持性能的较小子集,而是将数据分布精炼为最能提升最终模型的实例。为解决此问题,我们探索使用影响函数(IF)进行实例级数据归因。我们发现,标准IF公式在此场景下由于两个结构性问题而表现不佳:由非策略验证目标导致的邻近性差距,以及对梯度范数的严重偏差。我们提出DRIFT(通过在线策略影响函数进行数据精炼的监督微调)。DRIFT不依赖外部参考数据,而是利用模型自身的在线策略生成结果作为验证目标,这经验性地最小化了参数邻近性差距,并更好地符合IF的局部邻域假设。它还根据轨迹正确性应用符号加权,并针对梯度操纵问题对影响分数进行去偏,从而允许少量验证查询作为可靠锚点来归因整个数据集。在7B参数指令和推理模型上的实验表明,DRIFT持续提升了两种模型的能力上限,优于现有数据筛选基线。
## 1 引言
监督微调(SFT)是使大型语言模型(LLMs)与人类指令对齐并增强其下游任务能力的关键阶段(Ouyang等人,2022年(https://arxiv.org/html/2606.18307#bib.bib15);Wei等人,2022年(https://arxiv.org/html/2606.18307#bib.bib16))。在此阶段,数据混合及其不同训练样本的比例对塑造模型能力起着关键作用(Zhou等人,2024年(https://arxiv.org/html/2606.18307#bib.bib17);Ye等人,2024年(https://arxiv.org/html/2606.18307#bib.bib18))。尽管意义重大,数据混合策略与LLM最终性能之间的精确关系在很大程度上仍不明确(Li等人,2025年(https://arxiv.org/html/2606.18307#bib.bib19))。
现有的数据筛选研究主要分为三种范式。首先,领域级数据混合(Xie等人,2023a(https://arxiv.org/html/2606.18307#bib.bib9);Liu等人,2024(https://arxiv.org/html/2606.18307#bib.bib10);Peng等人,2020(https://arxiv.org/html/2606.18307#bib.bib11))调整大类别的采样权重,但本质上粒度粗糙,无法考虑实例级别的巨大质量差异。其次,数据选择(Wettig等人,2024(https://arxiv.org/html/2606.18307#bib.bib4);Xia等人,2024(https://arxiv.org/html/2606.18307#bib.bib6);Ivison等人,2025(https://arxiv.org/html/2606.18307#bib.bib7);Xie等人,2023b(https://arxiv.org/html/2606.18307#bib.bib3))识别小子集以在有限计算预算下提升性能。由于与预训练相比,SFT通常不是资源受限的场景,这种效率优先的重点不太适合在穷尽训练后提升模型的性能上限。第三,在线批处理(Wang等人,2024a(https://arxiv.org/html/2606.18307#bib.bib12);Albalak等人,2023(https://arxiv.org/html/2606.18307#bib.bib14))在训练过程中动态构建数据混合。虽然概念上有吸引力,但频繁重新评估数据权重会破坏高度优化的SFT基础设施(Shoeybi等人,2019(https://arxiv.org/html/2606.18307#bib.bib13))。
为了解决这些局限性,我们将重点从预算受限训练转向通过实例级数据归因实现能力最大化。与之前选择子集以提高训练效率的方法(Wettig等人,2024(https://arxiv.org/html/2606.18307#bib.bib4);Xia等人,2024(https://arxiv.org/html/2606.18307#bib.bib6))不同,我们解决一个实际但未被充分探索的场景:**使用原始训练数据集作为候选池,精炼一个已经充分训练的模型**。在此设置中,模型已经吸收了通用数据分布,导致传统的数据选择方法只能带来边际收益。打破这种饱和需要重新校准数据分布,使优化强调最能改进当前模型的实例,而不是识别容易学习的样本。
在饱和模型中实现细粒度归因需要一个更稳健和更有原则的评分机制来评估每个训练样本的贡献(Pruthi等人,2020(https://arxiv.org/html/2606.18307#bib.bib20);Ilyas等人,2022(https://arxiv.org/html/2606.18307#bib.bib21))。影响函数(IF)(Koh和Liang,2017(https://arxiv.org/html/2606.18307#bib.bib22);Grosse等人,2023(https://arxiv.org/html/2606.18307#bib.bib23))为此提供了数学上严格的工具,明确估计增加训练样本权重对特定验证集的影响。然而,标准IF公式在应用于LLM时显得脆弱。理论分析(Bae等人,2022(https://arxiv.org/html/2606.18307#bib.bib2))揭示了IF近似仅在收敛参数的微观局部邻域内成立。然而,当验证目标是外部参考响应时,减少其损失可能需要显著的全局参数偏移,从而产生**邻近性差距**,可能违反局部泰勒近似。借鉴近期在线策略微调的研究(Mukherjee等人,2025(https://arxiv.org/html/2606.18307#bib.bib71)),我们假设使用模型自身生成的响应作为验证目标会引发局部参数更新,从而更好地保持IF的理论完整性。
基于这一见解,我们提出**DRIFT**(通过在线策略影响函数进行数据精炼的监督微调)。DRIFT提示基础模型生成对验证查询的响应作为IF优化目标,弥合了数据归因与在线策略学习范式之间的差距。虽然直接的在线策略微调(如自蒸馏)天生数据饥饿,且在查询稀缺时容易过拟合(Singh等人,2023(https://arxiv.org/html/2606.18307#bib.bib76);Shumailov等人,2023(https://arxiv.org/html/2606.18307#bib.bib75)),但DRIFT通过严格将生成结果用作归因锚点而非直接训练信号来规避此限制。通过为正确轨迹分配正权重、为错误轨迹分配负权重,我们将IF优化目标转变为一种奖励加权的对比公式,类似于简化的策略梯度估计器。这使得有限的验证查询集能够稳健地归因整个SFT数据集,强化有益模式同时惩罚不良模式。
除了验证目标的选择,IF在LLM中的第二个结构性弱点在于对梯度范数偏差的敏感性。原始影响分数被梯度的大小严重扭曲,导致归因偏向于梯度范数异常大的样本,而不是对验证目标真正有用的样本。为了明确缓解此问题,DRIFT结合了一个特定任务的正交化去偏步骤,使最终分数受梯度大小的影响更小。
在7B参数指令和推理型LLM上的广泛实验证明了我们方法的有效性。在精炼全训练模型的严格设置下,DRIFT持续优于现有数据筛选基线。总体而言,我们的结果表明,在线策略验证目标与适当的梯度去偏对于使IF数据归因具有原则性和稳健性至关重要。
## 2 预备知识
### 2.1 影响函数及其对LLM的实际近似
影响函数(IF)提供了一个数学上严格的框架,用于估计训练样本 \(z_{train}\) 对特定验证目标 \(z_{val}\) 的影响,而无需重新训练模型。设 \(\theta^{*}\) 为训练到最小化经验风险 \(\frac{1}{n}\sum_{i=1}^{n}L(z_{i};\theta)\) 的模型参数。标准IF近似了如果 \(z_{train}\) 被增加一个无穷小的权重 \(\epsilon\) 时验证损失 \(L(z_{val};\theta^{*})\) 的变化。这一影响分数由下式给出:
\[
\mathcal{I}(z_{train},z_{val}) = -\nabla_{\theta}L(z_{val};\theta^{*})^{\top} H_{\theta^{*}}^{-1} \nabla_{\theta}L(z_{train};\theta^{*}),
\]
(1)
其中 \(H_{\theta^{*}} = \frac{1}{n}\sum_{i=1}^{n}\nabla_{\theta}^{2}L(z_{i};\theta^{*})\) 是经验风险的Hessian矩阵。
为了使数据归因在LLM规模下计算可行,通常近似计算逆Hessian \(H_{\theta^{*}}^{-1}\)(Grosse等人,2023(https://arxiv.org/html/2606.18307#bib.bib23);Choe等人,2024(https://arxiv.org/html/2606.18307#bib.bib72))甚至直接避开(Zhu等人,2025(https://arxiv.org/html/2606.18307#bib.bib61);Xia等人,2024(https://arxiv.org/html/2606.18307#bib.bib6)),将估计简化为梯度的内积。此外,为了克服存储数十亿参数密集梯度的巨大内存成本,梯度稀疏化和随机投影被广泛采用(Park等人,2023(https://arxiv.org/html/2606.18307#bib.bib41);Muhamed等人,2024(https://arxiv.org/html/2606.18307#bib.bib8))。具体来说,高维梯度 \(\nabla_{\theta}L(z;\theta^{*}) \in \mathbb{R}^{D}\) 通过稀疏随机投影矩阵 \(P \in \mathbb{R}^{d \times D}\) 映射到低维空间 \(\mathbb{R}^{d}\)(\(d \ll D\))。此操作的数学有效性基于Johnson-Lindenstrauss引理(William和Lindenstrauss,1984(https://arxiv.org/html/2606.18307#bib.bib62)),表明任意两个梯度之间的内积在很大程度上得以保持。设 \(\phi(z;\theta^{*}) = P \nabla_{\theta}L(z;\theta^{*})\) 表示投影后的梯度。近似的IF计算如下:
\[
\mathcal{I}(z_{train},z_{val}) \approx \phi(z_{train};\theta^{*})^{\top} \phi(z_{val};\theta^{*}).
\]
(2)
##### 梯度操纵问题。
依赖原始内积使得归因面临严重的内在梯度范数偏差:梯度范数异常高的训练样本会主导IF分数,无论它们对验证目标是否实际有用。例如,估计往往不成比例地偏向于响应较短的样本(Xia等人,2024(https://arxiv.org/html/2606.18307#bib.bib6))或离群样本(Muhamed等人,2024(https://arxiv.org/html/2606.18307#bib.bib8))。虽然已经探索了梯度归一化的必要性(Xia等人,2024(https://arxiv.org/html/2606.18307#bib.bib6)),但具体策略尚无定论。
### 2.2 影响函数的脆弱性
尽管理论优雅,IF本质上是留一法(LOO)重训练损失的一阶泰勒近似。设 \(\theta_{-train}\) 表示不包含特定训练样本 \(z_{train}\) 的重训练得到的最优参数,对验证目标 \(z_{val}\) 的真实LOO效应是 \(\Delta L_{LOO} = L(z_{val};\theta_{-train}) - L(z_{val};\theta^{*})\)。现有研究(Bae等人,2022(https://arxiv.org/html/2606.18307#bib.bib2))分析了IF估计与 \(\Delta L_{LOO}\) 之间的误差,揭示了IF实际上近似了一个不同的目标:近端Bregman响应函数(PBRF)。与允许全局无约束更新以达到 \(\theta_{-train}\) 的LOO不同,PBRF将参数偏移限制在 \(\theta^{*}\) 周围的局部邻域内:
\[
\theta_{PBRF} = \arg\min_{\theta} \left( L(z_{val};\theta) + \frac{1}{2\tau} \|\theta - \theta^{*}\|_{H_{\theta^{*}}}^{2} \right),
\]
(3)
图1:持续训练过程中模型邻近性的演变。这些图显示了与均匀加权基线相比,参数L2范数和稀疏性的相对变化(\(\Delta\))。在线策略验证导致参数偏移显著减少,我们假设这更好地符合IF的局部邻域假设。
其中 \(\tau\) 控制邻域大小。此框架识别了几个使得IF在深度神经网络中脆弱的关键差距。
#### 2.2.1 非收敛差距。
IF的理论推导严格假设模型已收敛到局部最小值,此时经验梯度 \(g = \frac{1}{n}\sum_{i=1}^{n}\nabla_{\theta}L(z_{i};\theta^{*}) = 0\)。当 \(g \neq 0\) 时,在 \(\theta^{*}\) 周围的泰勒展开在参数偏移估计中引入了一个残差误差项,其大小与 \(\|H_{\theta^{*}}^{-1}g\|\) 成比例。在实践中,将IF应用于部分训练或未收敛的模型会导致不稳定的估计,因为非零经验梯度主导了预期的LOO效应。这一理论约束自然符合我们精炼已经充分训练的SFT模型的范式。通过在收敛模型上操作而不是从头训练,我们避免了高昂的重训练成本并限制了非收敛差距,更好地满足了IF的理论前提。
#### 2.2.2 邻近性差距与在线策略缓解。
全局最优 \(\theta_{-train}\) 与局部最优 \(\theta_{PBRF}\) 之间的差异被定义为**邻近性差距**。PBRF中二次近似的有效性严格要求参数偏移 \(\|\theta_{-train} - \theta^{*}\|\) 是微小的。为了理解验证目标的选择如何影响这一偏移,我们首先分析PBRF框架下对于*纯*在线策略似然目标的预期参数更新。
###### 定理1(在线策略目标的预期参数偏移)
设 \(\theta^{*}\) 为收敛的参数。在PBRF框架下,由纯在线策略验证目标 \(z_{val}^{on} \sim \pi_{\theta^{*}}\) 引起的预期一阶参数偏移严格为零,即 \(\mathbb{E}_{z_{val}^{on}} [\theta_{PBRF} - \theta^{*}] = \mathbf{0}\)。
##### 非形式化证明。
根据分数函数恒等式,模型自身输出分布上的对数似然的预期梯度严格为零。由于Hessian固定在 \(\theta^{*}\),预期参数偏移是此零梯度的线性变换,结果为零。
##### 备注(直观联系):
在对齐的、在线策略数据上微调LLM可以更新相对较小的子网络,而不是导致全局参数偏移(Mukherjee相似文章
用于优化离散扩散语言模型的漂移目标
本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。
基于块策略漂移门控的在线策略蒸馏
本文提出了一种轻量级的基于块策略漂移门控方法,通过根据新旧学生概率变化对损失进行加权,改进了语言模型的在线策略蒸馏,在数学基准上取得了更高的推理准确性。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
过滤后重加权:重新思考在线策略蒸馏中的优化粒度
介绍FiRe-OPD,一种用于大语言模型在线策略蒸馏的方法,它过滤低质量轨迹并应用软重加权来强调信息丰富的令牌,在强到弱、单教师和多教师设置中实现了改进的性能。
通过在线策略蒸馏实现数据高效的自回归到扩散语言模型
本文介绍了OPDLM,一种通过在线策略蒸馏将自回归语言模型转换为扩散语言模型的方法,所需训练令牌数量减少15倍到7000倍,同时保留原始模型的知识。