面向大型语言模型的 Compatibility-Aware Dynamic Fine-Tuning

arXiv cs.CL 论文

摘要

介绍 Compatibility-Aware Dynamic Fine-Tuning (CADFT),这是 Dynamic Fine-Tuning 的扩展,在 LLM 监督微调中控制样本级优化方差,从而提高稳定性和泛化能力。

arXiv:2606.11206v1 Announce Type: new 摘要:监督微调(SFT)是对齐大型语言模型(LLMs)的主流范式,但存在优化不稳定和泛化能力有限的问题。近期研究将此归因于病态梯度缩放,并提出了动态微调(DFT)在词元级进行校正。然而,DFT 假设所有演示都是同等合适的学习目标,这一假设与大规模指令数据的强异质性相悖——在这种数据中,演示与策略的不匹配会导致样本级的高方差更新。我们提出了兼容感知动态微调(CADFT),这是 DFT 的一个原则性扩展,用于控制样本级优化方差。CADFT 从模型似然中推导出一个动态且依赖策略的兼容性信号,用以调节监督更新,抑制来自不兼容演示的高方差梯度。我们还提出了一种延迟、低频的兼容性引导重写策略,将持续不兼容的演示转化为可学习的目标。我们证明,CADFT 可解释为一种方差控制估计器,将 DFT 中的词元级稳定性推广到样本级。大量实验表明,该方法在保持完全监督且不依赖显式奖励建模的同时,提升了稳定性、泛化能力以及冷启动强化学习的初始化效果。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:35

# 兼容性感知的深度动态微调方法

来源: https://arxiv.org/html/2606.11206

Yucheng Zhou¹,†, Junwei Sheng¹,†††Equal Contribution., Qianning Wang², Jianbing Shen¹,🖂

¹SKL-IOTSC, CIS, 澳门大学
²奥克兰理工大学
[email protected], [email protected]

###### 摘要

监督微调(SFT)是对大型语言模型(LLM)进行对齐的主流范式,但它存在优化不稳定性和泛化能力有限的问题。最近的工作将这一问题归因于病态的梯度缩放,并提出了动态微调(DFT)在词元级别进行修正。然而,DFT假设所有示范都是同等合适的学习目标,这一假设与大规模指令数据的强异质性相违背——其中示范-策略不匹配会在样本级别引发高方差更新。我们提出了**兼容性感知的动态微调(CADFT)**,这是DFT的一个原则性扩展,用于控制样本级别的优化方差。CADFT从模型似然中推导出一个动态的、依赖于策略的兼容性信号,用于调节监督更新,抑制来自不兼容示范的高方差梯度。我们进一步提出一种延迟、低频的兼容性引导重写策略,将持久不兼容的示范转化为可学习的目标。我们证明CADFT可以被解释为一种方差控制的估计器,将DFT中的词元级稳定推广到样本级。大量实验表明,CADFT在语言、代码和多模态推理任务中持续提升了优化稳定性、泛化能力和冷启动强化学习初始化效果,同时始终保持全监督且不依赖显式奖励建模。

## 1 引言

监督微调(SFT)是将大型语言模型(LLM)与下游任务和指令遵循行为对齐的主要范式。通过在教师强制框架下最大化专家示范的似然,SFT提供了一个简单、稳定且可扩展的训练框架(Ouyang et al., 2022; Chung et al., 2024; Wei et al., 2022)。尽管在实证上取得了成功,但近期的理论和实证研究表明,标准SFT存在一个根本性的优化病理问题。从策略优化的角度看,SFT梯度隐式对应一个扭曲的目标函数,其中低概率词元会产生不成比例的大梯度更新(Wu et al., 2025; Chu et al., 2025)。这种逆概率放大导致高梯度方差、训练不稳定以及泛化能力差,尤其是在分布偏移下的推理密集型任务中(Chu et al., 2025; Lin et al., 2017; Zheng et al., 2025)。

动态微调(DFT)最近被提出,旨在词元级别解决这一问题(Wu et al., 2025)。DFT将SFT重新表述为一种概率感知的目标函数,修正由稀有词元引起的病态梯度缩放,从而产生有界且更稳定的更新。关键的是,DFT在不引入强化学习组件(如奖励模型、在策略采样或策略优化算法)的前提下实现了这一点。

然而,DFT隐含假设数据集中的所有示范都是同等合适的学习目标。实际上,大规模指令数据集具有高度异质性:有些示范与模型当前的归纳偏好和能力水平高度一致,而另一些则过于复杂、结构混乱或语义不匹配。即使词元级梯度不稳定被修正,这种**示范-策略不匹配**仍会在样本级别引发高方差更新,导致学习效率低下和优化不稳定(Zhou et al., 2023; Bengio et al., 2009)。这一观察表明,稳定监督微调不仅需要控制词元级梯度如何缩放,还需要在当前模型状态下控制哪些示范对参数更新产生较强影响,以及影响的程度。换句话说,有效的微调需要一种机制来调节示范与演进策略之间的样本级兼容性。

在这项工作中,我们提出了**兼容性感知的动态微调(CADFT)**,这是DFT的一个原则性扩展,将动态的、依赖于策略的兼容性信号纳入监督目标中。CADFT将兼容性视为一个相对度量,通过模型自身的似然计算并根据训练过程自适应归一化。该信号用于调节样本级更新的强度,抑制由不兼容示范引起的高方差梯度,同时保留有信息量的监督。重要的是,CADFT不会直接丢弃低兼容性的示范。为了避免永久忽略困难但可能有价值的数据,我们进一步引入了一个保守的、延迟的重写机制,选择性地将持久不兼容的示范重新表述为模型当前可行区域内的目标。重写仅在热启动阶段之后以低频方式激活,防止过早的自我强化,并保持训练稳定性。CADFT保留了DFT的监督学习范式,不引入强化学习、奖励建模或策略优化机制。从理论角度看,CADFT可被理解为DFT的一个方差控制扩展,将词元级稳定推广到样本级。实验表明,CADFT在语言、代码和多模态推理任务中持续改善了优化稳定性、泛化性能和下游强化学习初始化效果。

我们的主要贡献如下:

- • 我们证明低兼容性样本会引发更高方差的梯度更新,缓解这类更新可提升优化稳定性和泛化能力。
- • 我们提出**兼容性感知的动态微调(CADFT)**,一种简单且原则性的方法,在全监督框架内引入动态归一化的兼容性信号来调节样本级更新强度。
- • 我们引入一种延迟、低频的兼容性引导重写策略,将不兼容的示范转化为可学习的目标。
- • 我们提供CADFT作为方差控制估计器的理论解释,并在数学推理、代码生成、多模态推理和冷启动强化学习场景中实证其有效性。

## 2 相关工作

### 2.1 SFT与RL在LLM对齐中的应用

监督微调(SFT)通过最大化专家示范的似然(Wei et al., 2022; Zhou et al., 2023; Chung et al., 2024)来使LLM与下游任务对齐(Zhou et al., 2025a, 2026a, 2026b; Hu et al., 2025),本质上执行模仿学习或行为克隆(Mandlekar et al., 2021)。然而,SFT会过拟合训练分布,在OOD输入上泛化能力差(Zhou et al., 2024),而强化学习则通过奖励信号优化任务级目标以获得更好的泛化(Christiano et al., 2017; Ouyang et al., 2022; Bai et al., 2022),但代价是显著的计算开销和不稳定性(Schulman et al., 2017; Strubell et al., 2019)。实证研究证实,基于RL的微调在推理密集型任务上具有更好的鲁棒性,因此SFT与RL之间的泛化差距成为核心对齐挑战(Chu et al., 2025; Swamy et al., 2025)。

为弥合这一差距,混合方法结合了SFT和RL:RLHF利用学习到的奖励模型改进SFT(Ouyang et al., 2022),DPO直接基于偏好数据优化而不需要显式奖励(Rafailov et al., 2023),群体相对变体减少了对绝对奖励的依赖(Shao et al., 2024),负感知微调利用错误生成作为隐式负反馈(Chen et al., 2025),自奖励视觉语言模型通过迭代自反馈优化提示(Yang et al., 2025)——所有这些方法都超越了纯监督学习(Ouyang et al., 2022; Rafailov et al., 2023)。理论上,Du等人(2025)将RLHF重新解释为奖励加权的SFT,Wang等人(2025)将SFT分析为具有隐式奖励的RL,Qin和Springenberg(2025)将SFT建模为带有重要性加权的离线RL;然而,这些期望级别的分析并未刻画所得梯度估计器的方差,而方差对于稳定优化至关重要。更广泛地看,结构化约束和反馈机制进一步凸显了原则性目标设计的重要性(Askell et al., 2021),医学VL模型中的异常感知反馈(Zhou et al., 2025b; Zheng et al., 2026)、情感支持的评分引导强化学习(Yuan et al., 2025)以及手语翻译中的强化VL框架(Rao et al., 2025)也佐证了这一点。

### 2.2 稳定SFT与梯度重加权

多项工作通过损失重加权或目标修改来稳定SFT。MixCE结合前向和反向交叉熵以平衡模式覆盖和模式寻找行为(Zhang et al., 2023),类似的重要性加权思想也出现在基于示范的离线RL中(Mandlekar et al., 2021; Qin and Springenberg, 2025)。自回归生成的熵引导优化(Song et al., 2026)也证明在训练过程中控制熵能产生更稳定、更连贯的合成。Wu等人(2025)指出,SFT梯度等价于一个带有隐式奖励和逆概率重要性加权的离线策略梯度估计器,并提出了动态微调(DFT),通过使用模型自身概率重新缩放词元级梯度来修正由此产生的病态缩放。与Focal Loss(Lin et al., 2017)等启发式方法不同,DFT关注的是方差修正而非强调困难样本。Abdolmaleki等人(2025)进一步表明,在正负反馈混合下不恰当的反馈加权会导致不稳定,这加强了原则性梯度控制的必要性。

### 2.3 数据质量与样本兼容性

虽然DFT稳定了词元级优化,但它假设所有示范都是同等合适的学习目标(Wu et al., 2025)。实际上,异质数据集可能引发示范-策略不匹配和样本级高方差更新(Mandlekar et al., 2021; Liu and Zhang, 2025)。Liu和Zhang(2025)在知识蒸馏中表明,选择性地降低低兼容性样本的权重可提高稳定性,先前关于课程学习的工作也进一步证实,监督的有效性取决于样本难度与模型能力之间的对齐(Mandlekar et al., 2021; Liu and Zhang, 2025; Chu et al., 2025)。不加区分地在低兼容性示范上更新会迫使模型记忆其无法可靠内化的模式(Liu and Zhang, 2025; Chu et al., 2025)。受这些发现的启发,我们的工作引入了DFT的兼容性感知扩展,在全监督框架内解决样本级别的示范-策略不匹配问题。

总之,先前的工作要么通过结合RL来改进SFT,要么通过稳定词元级梯度来改进;我们的工作首次统一了词元级和样本级的方差控制(Wu et al., 2025; Liu and Zhang, 2025)。

## 3 兼容性感知的动态微调

![图1](https://arxiv.org/html/2606.11206/figures/overview.png)

图1: 兼容性感知动态微调(CADFT)整体框架。CADFT扩展了DFT,引入了一个样本级兼容性信号来调节更新强度,并可选择性地指导延迟的示范重写。

在本节中,我们介绍**兼容性感知的动态微调(CADFT)**,这是一个稳健的对齐框架,旨在异质数据分布下稳定监督微调。我们首先回顾动态微调(DFT),然后介绍一个动态的、样本级的兼容性信号用于更新重加权,最后描述可选的延迟重写机制。整体流程总结在算法1中。

### 3.1 预备知识

令 \(\mathcal{D}=\{(x, y)\}\) 表示指令-响应对的数据集,\(\pi_\theta(y|x)\) 表示参数为 \(\theta\) 的语言模型。标准监督微调(SFT)最小化负对数似然:

\[
\mathcal{L}_{\text{SFT}}(x, y) = -\sum_{t=1}^{|y|} \log \pi_\theta(y_t \mid x, y_{<t}).
\]

梯度(针对单个响应序列)为:

\[
\nabla_\theta \mathcal{L}_{\text{SFT}}(x, y) = -\sum_{t=1}^{|y|} \Big[ \nabla_\theta \log \pi_\theta(y_t \mid x, y_{<t}) \Big].
\]

将SFT梯度解释为离线策略梯度估计:\(\nabla_\theta \mathcal{L}_{\text{SFT}} = \mathbb{E}_{p(x)}\mathbb{E}_{\pi_{\text{exp}}(y|x)}[ \sum_t (1/\pi_\theta(y_t|\cdot)) \cdot \nabla_\theta \pi_\theta(y_t|\cdot) ]\),其中 \(\pi_{\text{exp}}\) 是示范分布(Wu et al., 2025)。共享权重 \(1/\pi_\theta(y_t|\cdot)\) 在词元概率较小时会放大梯度,导致高方差。

动态微调(DFT)通过以下目标函数修正这种缩放:

\[
\mathcal{L}_{\text{DFT}}(x, y) = -\sum_{t=1}^{|y|} \Big[ \alpha \cdot \log \pi_\theta(y_t \mid x, y_{<t}) + (1 - \alpha) \cdot \log (1 - \pi_\theta(y_t \mid x, y_{<t})) \Big],
\]

其中 \(\alpha\) 是平衡系数。等效地,梯度权重变为 \( \alpha / \pi_\theta(y_t|\cdot) - (1 - \alpha) / (1 - \pi_\theta(y_t|\cdot)) \),这避免了逆概率放大。

### 3.2 兼容性信号

尽管DFT减轻了词元级方差,但它假设在样本级别所有示范同等重要。为缓解此问题,我们定义样本 \(i\) 的兼容性指标。令 \( \pi_{\theta^{(k)}} \) 为训练步数 \(k\) 时的模型,我们通过累积对数似然或归一化词元级概率的和来定义样本 \(i\) 的兼容性 \(c_i^{(k)}\):

\[
c_i^{(k)} = \frac{1}{T} \sum_{t=1}^{T} \log \pi_{\theta^{(k)}}(y_{i,t} \mid x_i, y_{i,<t}),
\]

或等效使用归一化词元概率: \(c_i^{(k)} = \frac{1}{T} \sum_{t=1}^{T} f(\pi_{\theta^{(k)}}(y_{i,t} \mid \cdot))\),其中 \(f\) 为单调函数(如恒等函数或对数函数)。然后归一化:\(\tilde{c}_i^{(k)} = \frac{\exp(c_i^{(k)} / \tau)}{\sum_j \exp(c_j^{(k)} / \tau)}\),其中 \(\tau\) 为温度参数。

### 3.3 兼容性感知的DFT损失

CADFT通过兼容性信号重新加权DFT损失:

\[
\mathcal{L}_{\text{CADFT}}(x_i, y_i) = w_i \cdot \mathcal{L}_{\text{DFT}}(x_i, y_i),
\]

其中 \(w_i = \max(\tilde{c}_i^{(k)}, \varepsilon)\),\(\varepsilon\) 为小的正数,确保始终有非零梯度。通过这种方式,不兼容的示范(低 \(\tilde{c}_i^{(k)}\))对总梯度的贡献减小,从而稳定训练。

### 3.4 延迟重写机制

为了处理始终不兼容的示范(例如模型无法在合理似然下生成的复杂推理步骤),我们引入一个延迟重写模块。在固定步数 \(K_{\text{warmup}}\) 之后,每 \(K_{\text{interval}}\) 步,对兼容性低于阈值 \(\eta\) 的样本,调用语言模型(使用当前策略 \(\pi_{\theta^{(k)}}\))重新生成响应,同时保持指令 \(x\) 固定。新响应 \(y'\) 被添加到训练集(如果其兼容性高于旧响应),从而促进课程学习效应。

### 3.5 理论分析

我们可以将CADFT解释为一种方差控制的估计器。标准SFT的梯度方差由词元级逆概率项主导。DFT通过有界权重降低方差。CADFT通过抑制低兼容性样本(这些样本往往具有更大的梯度范数)进一步降低样本级方差。形式化地,梯度方差满足 \(\text{Var}(\nabla \mathcal{L}_{\text{CADFT}}) \leq \text{Var}(\nabla \mathcal{L}_{\text{DFT}})\),当样本兼容性分布非均匀时严格不等。

### 3.6 算法总结

算法1总结了CADFT的训练流程。  

**算法1** 兼容性感知动态微调(CADFT)  
**输入:** 数据集 \(\mathcal{D}\),初始模型 \(\pi_{\theta}\),容量阈值 \(\tau\),温度 \(\tau_c\),重写阈值 \(\eta\),热启动步数 \(K_{\text{warmup}}\),重写间隔 \(K_{\text{interval}}\),系数 \(\alpha\)。  
**输出:** 微调后的模型 \(\pi_{\theta^*}\)。

1. 初始化 \(\theta\)。  
2. 对于每个训练步 \(k\):  
   * 采样批次 \(\mathcal{B} \subseteq \mathcal{D}\)。  
   * 对每个样本 \(i \in \mathcal{B}\),计算兼容性 \(c_i^{(k)}\)(基于当前模型似然)。  
   * 归一化兼容性 \(\tilde{c}_i^{(k)} = \text{softmax}(c_i^{(k)} / \tau_c)\)。  
   * 计算权重 \(w_i = \max(\tilde{c}_i^{(k)}, \varepsilon)\)。  
   * 计算损失 \(\mathcal{L}_{\text{CADFT}} = \sum_i w_i \cdot \mathcal{L}_{\text{DFT}}(x_i, y_i)\)。  
   * 反向传播并更新 \(\theta\)。  
   * 如果 \(k > K_{\text{warmup}}\) 且 \(k \mod K_{\text{interval}} = 0\):  
        - 对 \(\tilde{c}_i^{(k)} < \eta\) 的样本,生成新的响应 \(y_i'\)。  
        - 如果 \(c_i'(y_i') > c_i^{(k)}\),用 \((x_i, y_i')\) 替换 \((x_i, y_i)\)。  

3. 返回 \(\theta^*\)。

在前面的章节中,我们建立了CADFT的公式。后续部分将提供全文中使用的实施细节、实验设置和消融研究。

相似文章

面向大型语言模型归因引导的持续学习

arXiv cs.LG

本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。