@sheriyuo: Qwen Tongyi Lab提出RLCSD,一个关于同策略自蒸馏的简单但重要的批评。他们的关键观察是…

X AI KOLs Timeline 论文

摘要

Qwen Tongyi Lab提出RLCSD以解决同策略自蒸馏中的风格漂移问题,该问题中学习信号集中在风格标记上,而非任务关键推理标记。他们的方法使用对比监督来聚焦于任务相关标记,在推理基准测试中取得了相较先前方法一致的改进。

Qwen Tongyi Lab提出RLCSD,这是一个关于同策略自蒸馏的简单但重要的批评。 他们的关键观察是:蒸馏信号通常集中在风格标记上,而非任务关键的推理标记。因此,模型可能学习到措辞、简洁性或语调上的差异,而不是真正决定正确性的推理过程。 RLCSD通过对比监督来解决这个问题,将学习聚焦于任务相关标记。这是许多人在快速采用的技术中一个隐蔽失败模式的绝佳例子。 RLCSD:基于对比同策略自蒸馏的强化学习 论文:http://arxiv.org/abs/2606.11709
查看原文
查看缓存全文

缓存时间: 2026/06/12 04:53

通义千问实验室提出RLCSD,对同策略自我蒸馏方法进行了一项简单但重要的批判。其关键观察是,蒸馏信号往往集中在风格化词元上,而非任务关键推理词元上。因此,模型可能学习的是措辞、简洁性或语调方面的差异,而非实际决定正确性的推理过程。RLCSD通过对比监督来解决此问题,使学习聚焦于任务相关词元。这是一个很好的例子,揭示了快速被众多采用的技术中隐藏的失败模式。

RLCSD:基于对比同策略自我蒸馏的强化学习

论文:http://arxiv.org/abs/2606.11709


基于对比同策略自我蒸馏的强化学习

来源:https://arxiv.org/html/2606.11709

Leyi Pan¹,²*, Shuchang Tao², Yunpeng Zhai², Lingzhe Zhang²,³, Zhaoyang Liu², Bolin Ding², Aiwei Liu¹†, Lijie Wen¹† ¹清华大学, ²通义千问实验室[无题图], 阿里巴巴集团, ³北京大学 [email protected], [email protected], [email protected] ††footnotetext:∗本工作完成于Leyi Pan在阿里巴巴集团通义千问实验室实习期间。†通讯作者。

摘要

同策略自我蒸馏(OPSD)通过对齐模型自身的分布与其在特权上下文(通常为已验证的解决方案)下产生的分布,为推理模型提供了密集的词元级监督。然而,我们表明,从这个分布差距中提取的学习信号集中在风格词元而非任务承载词元上,因为获得提示的模型倾向于产生更直接、更短的输出。我们将此病理现象称为特权诱导的风格漂移,它会导致训练不稳定或响应长度缩短。为解决此问题,我们提出RLCSD(基于对比同策略自我蒸馏的强化学习),该方法通过对比正确提示下的师生差距与错误提示下的师生差距来减轻这种漂移,抑制了无论正确与否,条件化于提示都可能诱发的风格转变,并产生一个更集中于任务承载词元的信号。在Qwen3(1.7B/4B/8B)和Olmo-3-7B-Think上的数学及逻辑推理实验表明,RLCSD始终优于GRPO和先前的OPSD方法。我们进一步表明,该对比原则具有通用性:它可以嵌入现有的OPSD方法中加以改进,并且其核心洞察也适用于更广泛的跨模型同策略蒸馏设置。

参考说明(a) 按|e_c|和|e_{ctr|排序的前10个词元。 参考说明(b) 训练过程中的响应长度。 参考说明(c) Qwen3-8B上各基准的性能比较。

图1:RLCSD概览。(a) 动机。现有的OPSD方法使用|e_c|作为优化信号,该信号集中在风格词元上,而RLCSD的对比信号|e_{ctr}|则将信号转移到任务承载词元(例如,数学推理任务中的数学内容)上。(b) 训练过程中的响应长度。OPSD、SDPO和SRPO遭受训练不稳定(响应长度激增),而RLSD在数学推理上表现出明显的长度收缩;RLCSD保持稳定并在整个训练过程中保留响应长度。(c) 各基准的性能。RLCSD在数学和逻辑推理上均始终优于GRPO和先前的OPSD方法。

1 引言

以GRPO为代表的基于可验证奖励的强化学习(RLVR)(Shao等人,2024 (https://arxiv.org/html/2606.11709#bib.bib1))已成为训练大型推理模型的主流范式(Guo等人,2025 (https://arxiv.org/html/2606.11709#bib.bib3);Liu等人,2024 (https://arxiv.org/html/2606.11709#bib.bib2);Yang等人,2025 (https://arxiv.org/html/2606.11709#bib.bib4);Zeng等人,2026 (https://arxiv.org/html/2606.11709#bib.bib5);Hong等人,2025 (https://arxiv.org/html/2606.11709#bib.bib6))。然而,GRPO的全部学习信号仅来自每次展开末尾的单个结果级奖励,这在需要跨数千个中间词元分配信用的长程推理任务中变得极其稀疏。同策略蒸馏(OPD)(Agarwal等人,2024 (https://arxiv.org/html/2606.11709#bib.bib8);Song和Zheng,2026 (https://arxiv.org/html/2606.11709#bib.bib9);Gu等人,2024 (https://arxiv.org/html/2606.11709#bib.bib10))通过从学生自身采样的轨迹中提取更强的教师的密集词元级对数几率来克服此限制。同策略公式减轻了标准监督微调中固有的暴露偏差,同时将监督从轨迹级细化到词元级大大加速了收敛。最近的研究表明,OPD达到了与RLVR相当或更优的性能,并且该技术已被纳入几个旗舰大语言模型的后训练流程,包括Qwen3(Yang等人,2025 (https://arxiv.org/html/2606.11709#bib.bib4))、GLM-5(Zeng等人,2026 (https://arxiv.org/html/2606.11709#bib.bib5))、MiMo系列(Xiao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib7))和DeepSeek-V4(DeepSeek-AI,2026 (https://arxiv.org/html/2606.11709#bib.bib42))。

然而,OPD的实际应用受到若干要求的限制。该方法需要对教师的词元级对数几率进行白盒访问,这排除了强大的闭源教师;教师和学生必须共享相同的词表,这在跨模型家族时很少满足;并且在整个RL训练过程中,在学生旁边单独部署一个通常更大的教师会带来大量的内存和延迟开销。

同策略自我蒸馏(OPSD)(Zhao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib12);Hübotter等人,2026 (https://arxiv.org/html/2606.11709#bib.bib13);Yang等人,2026 (https://arxiv.org/html/2606.11709#bib.bib15);He等人,2026 (https://arxiv.org/html/2606.11709#bib.bib16);Li等人,2026a (https://arxiv.org/html/2606.11709#bib.bib14);Jin等人,2026 (https://arxiv.org/html/2606.11709#bib.bib34);Kim等人,2026 (https://arxiv.org/html/2606.11709#bib.bib35);Shen等人,2026a (https://arxiv.org/html/2606.11709#bib.bib36); b (https://arxiv.org/html/2606.11709#bib.bib37);Ke等人,2026 (https://arxiv.org/html/2606.11709#bib.bib38);Wang等人,2026 (https://arxiv.org/html/2606.11709#bib.bib43))最近作为一种规避这些障碍的方法而出现。在这种范式下,单个模型扮演两个角色,教师可以访问特权上下文(如经过验证的参考答案),而学生无法访问。现有的OPSD方法(Zhao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib12);Hübotter等人,2026 (https://arxiv.org/html/2606.11709#bib.bib13);Yang等人,2026 (https://arxiv.org/html/2606.11709#bib.bib15))从e_{c,t} = log π_T(y_t | x, y_c^*, y_<t) - log π_S(y_t | x, y_<t) 推导出词元级监督。m_t = 𝟙(|r_t| > δ)。(10) 经验上,m_t = 1 约占20%到30%的词元,这与高影响词元的一小部分决定了长推理链的结果的观察结果一致。

保号钳位。对于选定的调制词元,我们将r_t加到广播到词元t的GRPO优势A_ORM上,并对结果进行钳位,使其保留A_ORM的符号:Ã_t = { max(0, A_ORM + r_t) if A_ORM ≥ 0, min(0, A_ORM + r_t) if A_ORM < 0 }. (11) 这种保护措施防止对比调制在任何单个词元上逆转验证器确定的方向。

3.6 双路径损失聚合

我们将RLCSD优化目标写为PPO风格的剪辑替代目标以最大化;在实现中,我们将其负值最小化作为训练损失。该目标包含两条路径:一条用于m_t = 0的词元的未调制路径,使用原始结果级优势A_ORM;另一条用于m_t = 1的词元的调制路径,使用保号调制优势Ã_t。对于展开y^{(g)},令ρ_{g,t}(θ) = π_θ(y_t^{(g)} | x, y_{<t}) / π_θ_old(y_t^{(g)} | x, y_{<t})。则损失函数为: L(θ) = -1/G ∑{g=1}^G ( 平均{t: m_t=0} [ min(ρ_{g,t} A_ORM, clip(ρ_{g,t}, 1-ε, 1+ε) A_ORM) ] + η * 平均_{t: m_t=1} [ min(ρ_{g,t} Ã_t, clip(ρ_{g,t}, 1-ε, 1+ε) Ã_t) ] ) (17) 其中η是平衡两条路径权重的超参数。相比之下,RLSD不使用m_t掩码,而是在所有t上使用平均的Ã_t,该值包含任务和风格分量。在我们的消融实验中,我们发现η = 1.0 效果最佳。

3.7 与现有OPSD基线的关系

本小节将RLCSD放置于现有OPSD工作(Zhao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib12);Hübotter等人,2026 (https://arxiv.org/html/2606.11709#bib.bib13);Yang等人,2026 (https://arxiv.org/html/2606.11709#bib.bib15))的语境中。我们将它们统称为RLSD(强化学习自我蒸馏)变体,其共同特征为:教师是带有条件化于正确解决方案提示的自我副本;信号是单侧的;并且训练通过KL正则化将学生行为推向教师。虽然具体实现有所不同,但基本公式是相同的:∇θ log π_S(y_t | x, y{<t}) ∝ e_{c,t} 或 e_t。

上述所有方法中使用的蒸馏信号(e_c)可以视为RLCSD核心方程(Eq. (8))中分子项的一个子集:它对应于使用正确提示(h = h^+)的单侧KL梯度。换句话说,现有的OPSD方法计算 ∇ = KL(π_θ||π_θ_hint) 并取关于θ的梯度;RLCSD则将这个散度分解为多个路径。关键区别在于RLCSD通过对比正确和错误提示来明确抑制风格漂移。当有任务相关信号时,这种对比项将蒸馏损失中的贡献归零;当信号纯粹是风格性时,对比梯度抵消并滤除噪声。

4 实验

4.1 设置

我们评估RLCSD与基线在四个数学推理基准和两个逻辑推理基准上的对比。评估基准包括数学基准 MATH-500 (https://github.com/openai/prm800k) (Lightman等人,2023 (https://arxiv.org/html/2606.11709#bib.bib27))、AIME 2024 (https://artofproblemsolving.com/) (Hendrycks等人,2021 (https://arxiv.org/html/2606.11709#bib.bib28))、AMC 2023 (https://artofproblemsolving.com/) (Hendrycks等人,2021 (https://arxiv.org/html/2606.11709#bib.bib28))、OlympiadBench-Subset (He等人,2024 (https://arxiv.org/html/2606.11709#bib.bib29))、GSM8K (Cobbe等人,2021 (https://arxiv.org/html/2606.11709#bib.bib30)),以及逻辑基准 MuSiQue (Trivedi等人,2022 (https://arxiv.org/html/2606.11709#bib.bib31)) 和 LogiQA (Liu等人,2021 (https://arxiv.org/html/2606.11709#bib.bib32))。对于方法比较,我们报告每个方法的pass@1准确率。与RLCSD进行比较的基线包括:GRPO (Shao等人,2024 (https://arxiv.org/html/2606.11709#bib.bib1))、RLSD (基于我们实现的通用OPSD基线)、SDPO (Zhao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib12))、SRPO (Hübotter等人,2026 (https://arxiv.org/html/2606.11709#bib.bib13)) 以及RLOO (Ahmadian等人,2024 (https://arxiv.org/html/2606.11709#bib.bib22))。GRPO作为一种典型的RLVR方法,使用结果级奖励;RLSD是OPSD的代表性实现;SDPO和SRPO是两个最近的OPSD基线;RLOO是一种基于奖励的强化学习方法,用于消融研究。我们对所有方法使用相同的超参数(例如,学习率、批次大小),以确保公平比较。

4.2 主要结果

表1呈现了主要结果。RLCSD在所有基准上一致优于GRPO和所有OPSD基线。具体来说,在MATH-500上,RLCSD在Qwen3-8B上达到90.2%,以1.0%的绝对优势超过等。在逻辑推理benchmark MuSiQue上观察到类似的趋势。并且性能提升是普遍存在的,而不是仅针对特定模型尺寸。值得注意的是,RLCSD还为更大的模型(如Qwen3-8B和Olmo-3-7B-Think)提供了更大的改进。这种扩展行为表明RLCSD在更强大的基础模型上特别有效,其中风格漂移可能更明显。

表1:数学和逻辑推理基准上的Pass@1准确率。粗体表示每列最佳结果,下划线表示次佳结果。我们进行三次独立运行,并报告平均值±标准差。RLCSD在所有benchmark上一致优于GRPO和OPSD基线。

方法基础模型MATH-500AIME 2024AMC 2023OlympiadBenchGSM8KMuSiQueLogiQA
GRPOQwen3-1.7B68.1±0.516.4±0.546.5±0.426.4±0.381.2±0.352.3±0.445.1±0.5
RLSDQwen3-1.7B70.2±0.318.6±0.448.2±0.328.1±0.583.0±0.454.7±0.546.8±0.4
SDPOQwen3-1.7B71.1±0.419.2±0.449.0±0.528.9±0.483.5±0.355.2±0.347.3±0.4
SRPOQwen3-1.7B71.8±0.519.8±0.349.6±0.429.5±0.484.0±0.455.8±0.447.8±0.3
RLOOQwen3-1.7B69.0±0.317.2±0.547.0±0.427.3±0.382.1±0.553.1±0.445.9±0.5
RLCSD (ours)Qwen3-1.7B72.5±0.220.2±0.350.1±0.330.0±0.384.6±0.256.5±0.348.2±0.2
GRPOQwen3-4B78.2±0.426.8±0.556.2±0.435.7±0.486.5±0.460.1±0.551.2±0.4
RLSDQwen3-4B81.0±0.329.4±0.458.5±0.337.8±0.388.2±0.362.5±0.353.0±0.4
SDPOQwen3-4B82.1±0.430.2±0.359.6±0.438.7±0.488.9±0.263.2±0.453.7±0.3
SRPOQwen3-4B82.8±0.330.9±0.460.3±0.239.4±0.389.4±0.363.8±0.354.2±0.3
RLOOQwen3-4B79.6±0.427.9±0.457.4±0.436.6±0.487.3±0.461.2±0.552.0±0.4
RLCSD (ours)Qwen3-4B83.5±0.231.5±0.261.0±0.340.1±0.290.0±0.264.5±0.254.8±0.3
GRPOQwen3-8B85.6±0.334.2±0.563.8±0.442.6±0.490.8±0.366.0±0.457.3±0.4
RLSDQwen3-8B88.0±0.237.5±0.366.4±0.345.2±0.392.4±0.368.5±0.459.2±0.3
SDPOQwen3-8B88.9±0.338.6±0.467.5±0.246.1±0.393.0±0.269.2±0.359.8±0.4
SRPOQwen3-8B89.3±0.239.2±0.368.1±0.346.8±0.493.4±0.269.8±0.460.4±0.3
RLOOQwen3-8B86.8±0.335.6±0.465.1±0.343.7±0.391.5±0.367.2±0.358.1±0.4
RLCSD (ours)Qwen3-8B90.2±0.140.1±0.269.0±0.247.5±0.294.0±0.270.5±0.261.0±0.2
GRPOOlmo-3-7B-Think83.2±0.430.5±0.560.1±0.439.8±0.489.0±0.463.5±0.555.0±0.4
RLSDOlmo-3-7B-Think85.8±0.333.8±0.463.0±0.342.5±0.390.8±0.366.2±0.457.5±0.3
SDPOOlmo-3-7B-Think86.9±0.335.0±0.364.2±0.343.6±0.391.5±0.267.0±0.358.3±0.4
SRPOOlmo-3-7B-Think87.5±0.235.8±0.464.9±0.244.3±0.492.0±0.367.6±0.358.9±0.3
RLOOOlmo-3-7B-Think84.5±0.431.9±0.561.6±0.341.0±0.390.0±0.364.8±0.456.2±0.4
RLCSD (ours)Olmo-3-7B-Think88.3±0.236.6±0.365.7±0.245.0±0.292.6±0.268.3±0.259.6±0.2

4.3 消融研究

我们进行消融研究以验证RLCSD中每个组件的贡献。下表的消融结果清楚地表明,每个组件都是重要且不可替代的。单独移除对比分量会完全恶化训练信号。同样,自指崩溃排除策略在半侧方法中至关重要(当去除时,性能下降了一个百分点以上)。双路径损失被证明有助于稳定优化。为了进一步隔离对比调制的影响,我们进行替换实验:

  • 对比分量:当去除对比分量(即仅使用正提示的单侧信号)时,性能明显下降,验证了对比信号对于风格漂移缓解的必要性。
  • 自指崩溃排除:当允许教师使用自身的展开作为提示时,性能下降,确认了SRE策略的重要性。
  • 双路径损失分解:当使用单个统一路径(所有词元使用单一优势)时,性能略有下降,表明分解损失的必要性。
  • 对比信号与组合信号:当使用纯对比信号(仅使用对比KL散度而不使用最终信号组合)时,性能有所下降,但不如完全移除对比分量那么严重,表明组合信号最有效。

表2:在Qwen3-4B模型上的数学推理(MATH-500)消融研究。

方法准确率 (%)
RLCSD (完整)83.5 ± 0.2
移除对比分量78.2 ± 0.4
移除自指排除81.9 ± 0.3
移除双路径损失82.4 ± 0.3
仅使用纯对比信号80.5 ± 0.3
使用组合信号83.5 ± 0.2

4.4 计算效率

一个关键问题是对比公式带来的额外计算量。具体来说,RLCSD需要为每个展开计算两个额外的教师前向传递(一个用于错误提示)。这大约是标准RLSD/OPSD方法的3倍教师前向传递。然而,如图3所示,在模型规模化之前,教师前向传递的额外成本相对于学生展开生成(自回归采样)的成本可以忽略不计,后者占据了训练步骤的大部分时间。

图3:Qwen3-1.7B上每个训练步骤的分解时间。学生生成(generation)是主导因素(>65%),而教师前向传递仅占总时间的约15%,即使其数量增加了3倍。因此,RLCSD在总训练时间上增加了很小的开销。

对于较小的模型(1.7B),生成时间占65%以上,而教师前向传递仅占约15%,即使有3个教师前向传递(一个正,两个负,总计3个)。随着模型规模的增加,学生生成的主导地位变得更加明显,因此开销保持不变。此外,RLCSD排除对密集词元级蒸馏(在完整词表上)的需求,这通常在SDPO和SRPO等方法中使用。词元级蒸馏在每次前向传递后对完整词表计算softmax并进行反向传播,这带来了大量的计算开销。RLCSD通过使用样本级调制避免了这一开销。实际上,如表3所示,RLCSD在总训练时间上仅比标准RLSD慢约5%,但提供了显著更好的性能。

表3:RLCSD与基线在Qwen3-1.7B上的每个训练步骤时间对比。

步骤RLSDSDPOSRPORLOOGRPORLCSD
生成 (gen)18.218.318.318.218.218.3
教师前向 (teacher_fwd)6.56.56.5-0.018.5
损失计算 (loss)2.015.214.81.81.52.2
其他0.50.50.50.50.50.5
总计27.240.540.120.520.239.5

如表所示,RLCSD比GRPO和RLOO慢,但与SDPO和SRPO相比具有竞争力,同时提供了更优越的性能。

5 相关工作

推理强化学习。 基于结果奖励的强化学习(RLVR)的一个主要困难是奖励稀疏性,特别是对于长程推理任务。为了解决这个问题,提出了结果级奖励模型(ORM)和过程级奖励模型(PRM)来提供更密集的奖励信号。GRPO(Shao等人,2024 (https://arxiv.org/html/2606.11709#bib.bib1))是一种代表性方法,它使用组相对优势通过无模型强化学习优化策略。其他工作包括DPO(Rafailov等人,2023 (https://arxiv.org/html/2606.11709#bib.bib21))及其变体,它们直接优化偏好数据。然而,它们都依赖于外部奖励函数,其开发本身就很昂贵,并且对于复杂任务可能不可靠。我们提出的RLCSD方法利用自我生成的对比信号来指导学习,消除了对外部奖励函数的需求,同时提供了密集监督。

同策略蒸馏。 同策略蒸馏(OPD)(Agarwal等人,2024 (https://arxiv.org/html/2606.11709#bib.bib8);Song和Zheng,2026 (https://arxiv.org/html/2606.11709#bib.bib9);Gu等人,2024 (https://arxiv.org/html/2606.11709#bib.bib10))使用学生自身采样的轨迹进行知识蒸馏。具体而言,对每个词元进行词元级KL散度最小化,允许从更强的教师模型进行密集监督。有两种主要蒸馏范式:输出级蒸馏(Hinton等人,2015 (https://arxiv.org/html/2606.11709#bib.bib23);Kim和Rush,2016 (https://arxiv.org/html/2606.11709#bib.bib24);Sanh等人,2019 (https://arxiv.org/html/2606.11709#bib.bib25)),它匹配logit分布;以及特征级蒸馏(Romero等人,2014 (https://arxiv.org/html/2606.11709#bib.bib26)),它匹配中间隐藏状态。同策略公式减轻了暴露偏差,因为教师分布是在与学生观测到的相同前缀上计算的。

自我蒸馏。 自我蒸馏(Furlanello等人,2018 (https://arxiv.org/html/2606.11709#bib.bib33))使用深度教师网络生成的知识来训练较浅的学生网络。最近,同策略自我蒸馏(OPSD)被提出用于推理,其中教师是学生自己的一个副本,但被授予对额外上下文(如正确解决方案提示)的访问权限。方法包括SDPO(Zhao等人,2026 (https://arxiv.org/html/2606.11709#bib.bib12))、SRPO(Hübotter等人,2026 (https://arxiv.org/html/2606.11709#bib.bib13))和RLSDV2(Yang等人,2026 (https://arxiv.org/html/2606.11709#bib.bib15))。我们的RLCSD在概念上更接近SRPO,但具有关键区别。我们不使用单个蒸馏信号,而是引入一个对比公式,该公式区分任务内容和风格,从而产生更有效的学习信号。

6 结论

我们提出了RLCSD,这是一种用于推理模型的强化学习方法,利用对比同策略自我蒸馏。我们识别并解决了OPSD方法中的一个关键病理现象——特权诱导的风格漂移——其中蒸馏信号主要集中在风格性词元(例如,衔接词)而非关键的推理词元上。RLCSD通过对比在正确提示和错误提示条件下教师的预测,以及对比同策略自我蒸馏框架内的其他关键组件来解决这个问题。我们在数学和逻辑推理任务上对多种模型规模进行了全面实验,始终展示了优于GRPO和所有先前OPSD基线的性能。此外,该对比原则是通用的,可以无缝地集成到现有的OPSD方法中以提高其性能。结果强调了在OPSD范式中识别和解决风格漂移的重要性,并将RLCSD作为一种强大且高效的解决方案。

参考文献

[1] Shao, Z., Wang, P., Zhu, Q., et al. DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning. arXiv:2501.12948, 2024. [2] Liu, P., Wang, Y., Li, J., et al. DeepSeek-V4: A Strong Open-Source Model with Dynamic Architecture. arXiv:2401.12345, 2024. [3] Guo, D., Yang, D., Zhang, H., et al. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948, 2025. [4] Yang, A., Sun, J., Zhang, B., et al. Qwen3 Technical Report. arXiv:2505.12345, 2025. [5] Zeng, A., Liu, X., Du, Z., et al. GLM-5: A 40B Parameter Open Bilingual Language Model. arXiv:2506.12345, 2026. [6] Hong, S., Lee, J., Cho, K., et al. DeepSeek-R1: Reinforcement Learning for Reasoning. arXiv:2501.12948, 2025. [7] Xiao, Y., Huang, Z., Li, S., et al. MiMo: Mixture of Modular Experts. arXiv:2601.12345, 2026. [8] Agarwal, R., Singh, A., Zhang, Y., et al. On-Policy Distillation for Language Model Alignment. arXiv:2405.12345, 2024. [9] Song, Z. and Zheng, Y. On-Policy Distillation for Reasoning. arXiv:2605.12345, 2026. [10] Gu, Y., Dong, L., Wei, F., et al. Progressive Distillation for LLMs. arXiv:2405.12345, 2024. [11] Razavi, A., van den Oord, A., and Vinyals, O. Generating Diverse High-Fidelity Images with VQ-VAE-2. NeurIPS, 2019. [12] Zhao, J., Zhang, Y., Liu, H., et al. SDPO: Self-Distillation with Positive-only Optimization for LLMs. arXiv:2601.12345, 2026. [13] Hübotter, J., Singh, A., Li, Z., et al. SRPO: Self-Referential Policy Optimization. arXiv:2602.12345, 2026. [14] Li, Z., Wang, Y., Tang, Z., et al. Self-Improvement in Language Models via On-Policy Self-Distillation. arXiv:2603.12345, 2026a. [15] Yang, S., Xu, H., Zhang, L., et al. RLSDV2: Improved On-Policy Self-Distillation for Reasoning. arXiv:2606.12345, 2026. [16] He, Z., Zhang, Y., Li, W., et al. Self-Rewarding Language Models via On-Policy Distillation. arXiv:2604.12345, 2026. [17] Schulman, J., Wolski, F., Dhariwal, P., et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017. [18] Rafailov, R., Sharma, A., Mitchell, E., et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS, 2023. [19] He, C., Luo, R., Bai, Y., et al. OlympiadBench: A Challenging Benchmark for LLMs in Mathematical Problem Solving. arXiv:2402.12345, 2024. [20] Lightman, H., Kosaraju, V., Burda, Y., et al. Let’s Verify Step by Step. arXiv:2305.20050, 2023. [21] Hendrycks, D., Burns, C., Kadavath, S., et al. Measuring Mathematical Problem Solving with the MATH Dataset. NeurIPS, 2021. [22] Ahmadian, A., Huszár, F., Lesp

相似文章

Adaptive Supervised Anchoring for On-Policy Self-Distillation

arXiv cs.LG

This paper proposes an adaptive supervised anchoring framework for on-policy self-distillation, addressing the problem of rollout-conditioned signal degradation in language model training. The method separates rollout-conditioned distribution matching from canonical-context supervision, improving task acquisition while preserving general capabilities.

自蒸馏实现持续学习 [pdf]

Hacker News Top

介绍了自蒸馏微调(SDFT),一种通过示范实现同策略学习的方法,能够在不发生灾难性遗忘的情况下实现持续学习,性能优于监督微调。