基于跨难度优化动态的大语言模型课程学习研究
摘要
本文通过分析不同难度水平间的优化动态,研究大语言模型中的课程学习,并提出一种名为迁移感知动态课程采样(TDCS)的新方法,该方法基于迁移关系动态调整训练数据。
arXiv:2608.17268v1 公告类型:新
摘要:课程学习在大语言模型的后训练中被广泛采用,通过组织从易到难的训练数据。然而,其在不同推理任务上的效果差异显著,表明没有单一课程是普遍最优的,并引发一个根本问题:课程学习何时有效?本文通过分析不同课程调度引发的优化动态来回答这个问题。我们展示不同难度水平之间的迁移关系表征了课程学习引发的优化动态,这反过来解释了不同课程调度的有效性,并将此关系形式化为相对迁移,这是跨难度知识迁移的一个原则性度量。基于此度量,我们推导出迁移感知动态课程采样(TDCS),该方法根据训练过程中估计的迁移关系动态调整采样分布。在多个推理基准上的大量实验表明,TDCS在不同任务、模型规模和训练范式中均优于代表性调度策略。更重要的是,我们的工作通过跨难度迁移提供了课程学习的统一优化解释。
查看缓存全文
缓存时间: 2026/08/19 10:25
# 通过跨难度优化动态理解大语言模型中的课程学习
来源:https://arxiv.org/html/2608.17268
1\]复旦大学\\通信作者
###### 摘要
###### 摘要
课程学习通过将训练数据从易到难组织起来,已被广泛应用于大语言模型的后训练阶段。然而,其效果在不同推理任务上差异显著,表明不存在普遍最优的单一课程,并引出一个根本性问题:什么决定了课程学习何时有效?本文通过分析不同课程调度所诱导的优化动态来回答此问题。我们发现,不同难度级别之间的迁移关系表征了课程学习诱导的优化动态,进而解释了不同课程调度方案的有效性,并将此关系形式化为“相对迁移”,一种衡量跨难度知识迁移的合理度量。基于此度量,我们推导出转移感知动态课程采样(TDCS),该方法在整个训练过程中根据估计的迁移关系动态调整采样分布。在多个推理基准上的大量实验表明,TDCS在不同任务、模型规模和训练范式下均能持续优于代表性调度策略。更重要的是,我们的工作通过跨难度迁移为课程学习提供了一个基于优化的统一解释。
††脚注文本:*同等贡献。
†通信作者。## 1引言
大语言模型(LLMs)通过监督微调(SFT)在广泛的推理任务中取得了显著成功。随着后训练数据集在规模和多样性上的持续增长,如何有效组织训练数据对于提升优化性能和模型泛化能力变得愈发重要。因此,训练数据调度已成为LLM后训练的基本组成部分,旨在确定在整个优化过程中训练样本的呈现顺序\[30 (https://arxiv.org/html/2608.17268#bib.bib2),20 (https://arxiv.org/html/2608.17268#bib.bib3),15 (https://arxiv.org/html/2608.17268#bib.bib4),5 (https://arxiv.org/html/2608.17268#bib.bib12)\]\。
在各种调度策略中,课程学习(CL)\[1 (https://arxiv.org/html/2608.17268#bib.bib5),24 (https://arxiv.org/html/2608.17268#bib.bib7),22 (https://arxiv.org/html/2608.17268#bib.bib9),35 (https://arxiv.org/html/2608.17268#bib.bib14),23 (https://arxiv.org/html/2608.17268#bib.bib16)\]通过将训练样本从易到难组织起来,可以说是应用最广泛的范式。该策略最初提出于传统机器学习领域,并在众多学习问题中展示了持续的优化和泛化效益\[11 (https://arxiv.org/html/2608.17268#bib.bib15)\]。受其成功启发,近期许多LLM后训练方法都融入了课程学习,根据预定义的难度指标对训练样本进行排序,并逐步让模型接触更具挑战性的样本\[31 (https://arxiv.org/html/2608.17268#bib.bib6),28 (https://arxiv.org/html/2608.17268#bib.bib8),13 (https://arxiv.org/html/2608.17268#bib.bib13)\]。因此,固定的从易到难课程是现有LLM后训练流程中常用的默认调度策略。
尽管课程学习已被广泛采用,但其效果在不同推理任务上差异显著。现有研究通过大规模实证评估(涵盖不同模型、任务和难度指标)记录了这一现象:它们表明课程学习在某些场景下可能优于随机采样,但在其他情况下则效果不佳甚至适得其反\[9 (https://arxiv.org/html/2608.17268#bib.bib10),7 (https://arxiv.org/html/2608.17268#bib.bib11),26 (https://arxiv.org/html/2608.17268#bib.bib17),30 (https://arxiv.org/html/2608.17268#bib.bib2)\]。虽然这些研究揭示了固定课程调度的局限性,但它们主要提供了经验观察和对难度指标的分析,留下了一个根本问题未解答:*什么决定了课程学习是否有效?* 如果不理解底层机制,仅靠经验尝试很难设计出更有效的课程策略。
本文通过分析不同课程调度所诱导的优化动态来重新审视课程学习。我们不将课程学习视为预定义的训练启发式方法,而是旨在理解决定课程调度成功与否的优化机制。为此,我们首先在多个推理基准上进行了系统的实证研究。我们的结果揭示,没有任何单一的固定调度策略能在所有不同推理任务中持续表现最佳,这表明课程学习的有效性从根本上依赖于任务,而非普遍最优。
为回答此问题,我们研究了课程学习所诱导的优化动态。具体来说,我们分析在训练过程中,对一个难度级别的优化如何影响其他难度级别的优化:优化一个难度级别可能促进或干扰其他难度级别的优化,整体的迁移关系决定了固定课程调度是否有效。基于一阶优化分析,我们形式化了这种迁移关系为*相对迁移*,一种衡量跨难度知识迁移的合理度量。这一分析为课程学习在不同推理任务上的成功或失败提供了一个统一的解释,超越了以往的经验观察。
在此理论理解的基础上,我们推导出转移感知动态课程采样(TDCS),这是一个自适应课程学习框架,在整个训练过程中根据估计的迁移关系动态调整采样分布。TDCS不是遵循预定义的从易到难调度,而是根据跨难度级别的估计迁移效益来分配训练样本。大量实验证明,由此产生的采样策略在多个推理基准和模型规模上持续优于现有的固定调度策略,并能进一步推广到下游的自我改进设置。
我们的主要贡献总结如下:
- • 我们对LLM推理的课程学习进行了系统的实证研究,表明没有任何固定的调度策略能在所有不同推理任务中持续表现最佳。
- • 我们通过分析跨难度知识迁移,对课程学习何时成功或失败提供了理论解释,并通过“相对迁移”形式化了该机制。
- • 基于所提出的迁移分析,我们推导出转移感知动态课程采样(TDCS),该方法在多个推理基准、模型规模和自我改进设置上持续优于现有固定调度策略。
## 2相关工作
### 2\.1课程学习
课程学习根据预定义的难度度量将训练样本从易到难组织,以促进优化\[1 (https://arxiv.org/html/2608.17268#bib.bib5),17 (https://arxiv.org/html/2608.17268#bib.bib18),10 (https://arxiv.org/html/2608.17268#bib.bib19)\]。此后提出了众多变体,包括自步学习和导师引导的课程设计\[8 (https://arxiv.org/html/2608.17268#bib.bib20),14 (https://arxiv.org/html/2608.17268#bib.bib21),19 (https://arxiv.org/html/2608.17268#bib.bib22)\]。
近期,课程学习在LLM后训练中得到广泛应用。现有方法基于推理复杂度、模型置信度、训练损失或估计的样本难度构建课程,展示了在推理和指令跟随任务上的性能提升\[9 (https://arxiv.org/html/2608.17268#bib.bib10),7 (https://arxiv.org/html/2608.17268#bib.bib11),12 (https://arxiv.org/html/2608.17268#bib.bib23),25 (https://arxiv.org/html/2608.17268#bib.bib24),18 (https://arxiv.org/html/2608.17268#bib.bib25)\]。然而,它们主要关注设计难度指标或课程调度。
相比之下,我们的工作研究了课程学习背后的优化机制。我们不是提出另一个预定义的调度,而是通过跨难度优化分析解释不同课程调度何时以及为何变得有效。
### 2\.2自适应数据调度
自适应数据调度不依赖于预定义的课程,而是在训练过程中根据优化状态动态调整采样分布\[27 (https://arxiv.org/html/2608.17268#bib.bib26),4 (https://arxiv.org/html/2608.17268#bib.bib27),16 (https://arxiv.org/html/2608.17268#bib.bib28)\]。现有方法使用训练损失、不确定性、梯度信息或强化学习目标等信号估计样本重要性,并自适应地分配训练资源以提高优化效率\[21 (https://arxiv.org/html/2608.17268#bib.bib29),34 (https://arxiv.org/html/2608.17268#bib.bib30),3 (https://arxiv.org/html/2608.17268#bib.bib31),33 (https://arxiv.org/html/2608.17268#bib.bib1)\]。
虽然这些方法通过自适应样本选择提高了训练效率,但其调度决策主要由反映当前训练状态的优化信号驱动。相比之下,我们的工作关注不同难度级别之间的迁移关系,为课程调度提供了一个基于迁移的标准,而不仅仅依赖优化启发式方法。
## 3经验观察
表 1:不同任务的难度定义\.任务难度定义数独(Sudoku)空白单元格数量KodCodeGPT通过率iGSM推理步骤
表 2:调度策略性能比较\.任务课程(Curriculum)混合(Mix)随机(Random)数独0\.2050\.1900\.164iGSM0\.3500\.3900\.353代码(Code)0\.5800\.5820\.607
参考标题\(a\)
参考标题\(b\)
参考标题\(c\)
图 1:不同调度的逐步准确率变化\.为研究课程学习在大语言模型中的有效性,我们在三个具有自然定义难度级别的推理基准上进行了初步实验:数独、KodCode\[29 (https://arxiv.org/html/2608.17268#bib.bib34)\]和iGSM\[32 (https://arxiv.org/html/2608.17268#bib.bib35)\],分别涵盖逻辑推理、代码生成和数学推理。
根据表2中的难度定义(https://arxiv.org/html/2608.17268#S3.T2),训练数据被划分为数独和KodCode的四个难度级别,以及iGSM的五个难度级别。我们比较了三种代表性的训练调度:课程调度(Curriculum),从易到难训练模型;随机调度(Random),从所有难度级别中均匀采样训练样本;以及混合调度(Mix),遵循课程调度,但每个阶段用随机采样替换一半样本。所有方法在相同的训练预算下进行训练。
表2(https://arxiv.org/html/2608.17268#S3.T2)报告了三种调度策略的最终性能。令人惊讶的是,课程调度并未始终优于其他方法。相反,课程调度在数独上表现最佳,混合调度在iGSM上达到最高准确率,而随机调度在KodCode上表现最好。这些结果表明,课程学习对大语言模型并非普遍有益,没有任何单一的调度策略能在所有不同推理任务中持续取得最佳性能。
然而,最终性能仅反映了优化结果。为获得更全面的视角,我们在图1(https://arxiv.org/html/2608.17268#S3.F1)中进一步比较了不同调度策略的训练动态。三个任务表现出显著不同的优化行为。虽然在数独和KodCode上,单一调度策略在整个训练过程中持续占优,但iGSM上的最优策略随着训练的进行而变化。
这些观察表明,课程学习的有效性不能完全由课程调度本身来解释。相反,它们提出了一个重要问题:什么优化机制决定了课程调度是否成功?为回答此问题,我们接下来研究课程学习诱导的优化过程,重点关注一个难度级别的优化如何影响其他难度级别。
## 4课程学习的优化分析
### 4\.1建模知识迁移
第3节的实证观察表明,没有任何单一的调度策略能在所有不同推理任务中持续表现最佳。因此,理解底层的优化机制对于解释课程学习的有效性至关重要。
在本节中,我们不分析课程调度本身,而是研究课程学习诱导的优化动态。具体来说,我们研究对一个难度级别的优化如何影响另一个难度级别的优化目标。我们将这种跨难度交互称为知识迁移。
假设当前优化步骤是基于难度级别\(j\)的样本进行的。我们感兴趣的是量化此更新如何影响另一个难度级别\(i\)的损失。这种跨难度交互表征了课程学习过程中的知识迁移。
令训练步\(t\)的模型参数表示为\(w_{t}\)。在对难度级别\(j\)的数据执行一次梯度下降步骤后,模型更新为
\(w_{t+1} = w_{t} - \eta g_{j},\) (1)
其中\(\eta\)是学习率,\(g_{j} = \nabla L_{j}(w_{t})\)是在难度级别\(j\)上计算得到的梯度。
然后我们分析此次更新后难度级别\(i\)的损失。应用一阶泰勒展开得到
\(L_{i}(w_{t+1}) \approx L_{i}(w_{t}) + \nabla L_{i}(w_{t})^{T}(w_{t+1} - w_{t}).\) (2)
由于
\(\nabla L_{i}(w_{t}) = g_{i},\) (3)
将公式(1)代入公式(2)得到
\(L_{i}(w_{t+1}) \approx L_{i}(w_{t}) - \eta g_{i}^{T} g_{j}.\) (4)
因此,优化难度级别\(j\)后难度级别\(i\)的预期损失变化可近似为
\(\Delta L_{i} = L_{i}(w_{t+1}) - L_{i}(w_{t}) \approx -\eta g_{i}^{T} g_{j}.\) (5)
公式(5)表明,优化一个难度级别对另一个难度级别的影响取决于一个梯度在另一个梯度诱导的下降方向上的投影。当\(g_{i}^{T} g_{j} > 0\)时,优化难度级别\(j\)会减少难度级别\(i\)的损失,表示正向知识迁移。相反,负值意味着优化一个难度级别会增加另一个难度级别的损失,导致优化冲突。
然而,仅凭\(g_{i}^{T} g_{j}\)本身无法在不同目标难度级别之间公平地比较迁移效果,因为其大小也受目标梯度\(g_{i}\)的规模影响。为了独立于梯度大小来比较迁移效应,我们通过优化难度级别\(j\)来衡量难度级别\(i\)实现的损失减少。相似文章
解构NLP中的课程学习:迈向统一分类法
本文提出了一种用于NLP中课程学习的细粒度分类法,将难度评估与训练调度分离,从而能够系统性地分析和比较CL策略。它识别了先前工作中存在的不可比问题,并提供了一个设计和评估CL方法的框架。
面向大型语言模型归因引导的持续学习
本文提出了一种面向大型语言模型的归因引导持续微调框架,该框架能够估计 Transformer 层中特定任务相关的参数重要性并相应地调节梯度,在保持新任务性能的同时缓解了灾难性遗忘。
通用推理的可迁移性:多领域RLVR的自动化课程设计
本文提出了一种迁移感知课程(TAC),这是一种基于多臂老虎机风格的多领域RLVR在线课程,通过梯度几何对齐优先选择其更新能惠及其他领域的领域。与固定课程和仅基于可学习性的课程相比,TAC在Qwen3-1.7B和Llama3.2-3B上提升了宏观平均准确率。
DyCon: 通过演化难度建模的动态推理控制
本文介绍了DyCon,一种无需训练的框架,利用步骤级嵌入来建模演化的任务难度,并动态控制大型推理模型(LRMs)的推理深度,有效减少过度思考,在不牺牲准确性的情况下提高效率。
DataFlex:面向大语言模型数据驱动动态训练的统一框架
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。