CADENCE: 通过覆盖自适应在线策略蒸馏缩小推理差距

Hugging Face Daily Papers 论文

摘要

CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。

在线策略知识蒸馏将推理能力从大型教师模型转移到紧凑学生模型,但现有方法存在三个复合失效模式:(i) 冷启动崩溃,即新学生模型对教师偏好的token分配接近零的概率;(ii) 状态无关的散度调度,即仅基于时间的前向/反向KL插值忽略了学生的覆盖状态;(iii) 二元奖励稀疏性,即通过/失败信号丢弃了部分正确轨迹中的信息。 我们提出了 CADENCE,这是一个为每个问题提供针对性修复的统一框架。其 DRIFT 机制在学生采样的轨迹上调度前向KL和反向KL替代目标的逐token凸组合(逐token替代目标,而非序列级KL梯度估计器)。六个组件对其进行扩展:(A) COVA,一种覆盖自适应β调度,加速前向到反向的过渡;(B) FTB,一种分叉token增强,通过全局归一化的熵参考将梯度集中在高熵位置;(C) CCD,一种密集奖励,为不正确但接近的轨迹添加数值接近的部分分数;(D) LAP,一种偏好简洁的正确 rollout 强化;(E) EMR,一种熵匹配校准正则化器;(F) BSD,一种自举自蒸馏阶段。 在 GSM8K 和 MATH-500 上(采用修正的512 token协议,5个随机种子,报告标准差),CADENCE 将0.5B学生模型从1.5B教师模型蒸馏至69.8 ± 0.5%的GSM8K pass@1(预训练模型为48.7%;教师差距闭合63.2%),并使用3B教师模型达到72.1 ± 0.4%(闭合76.2%),比最强同计算量使用标签的基线(DRIFT+二元奖励)高出+4.4 ± 0.7个点。所有实验在单个 Apple Mac Studio(M系列,64GB统一内存)上运行,表明原则性蒸馏无需数据中心级硬件即可实现强推理质量。
查看原文
查看缓存全文

缓存时间: 2026/07/30 13:48

论文页面 - CADENCE:通过覆盖自适应在线策略蒸馏弥合推理差距

来源:https://huggingface.co/papers/2607.16955

摘要

在线策略知识蒸馏将推理能力从大型教师模型迁移至紧凑学生模型,但现有方法存在三种复合失效模式:(i)冷启动崩溃——新学生模型对教师偏好token分配近乎零概率质量;(ii)状态无关的散度调度——仅依赖时间的正向/反向KL散度插值忽略学生模型的覆盖状态;(iii)二元奖励稀疏性——通过/失败信号丢弃部分正确轨迹中的信息。我们提出CADENCE,一个统一框架,针对每种失效模式提供定向修复方案。其DRIFT机制在学生采样轨迹上调度逐token的正向KL和反向KL替代目标函数的凸混合(逐token替代函数,而非序列级KL梯度估计器)。六个组件扩展该框架:(A)COVA,覆盖自适应β调度,加速从正向到反向的过渡;(B)FTB,分叉token增强,通过全局归一化熵参考在高熵位置集中梯度;(C)CCD,密集奖励,为错误但接近的轨迹添加数值邻近部分信用;(D)LAP,长度优先的正确轨迹强化;(E)EMR,熵匹配校准正则化器;(F)BSD,引导式自蒸馏阶段。在GSM8K和MATH-500(校正后512token协议,5个随机种子,报告标准差)上,CADENCE将0.5B学生模型从1.5B教师模型中蒸馏,达到69.8±0.5% GSM8K pass@1(预训练模型为48.7%;教师差距关闭63.2%),使用3B教师模型时达到72.1±0.4%(关闭76.2%),比最强的计算量匹配标签使用基线(DRIFT+二元奖励)高出+4.4±0.7个百分点。所有实验均在单个Apple Mac Studio(M系列,64GB统一内存)上运行,表明基于原则的蒸馏无需数据中心级硬件即可实现强推理质量。

查看arXiv页面 (https://arxiv.org/abs/2607.16955)查看PDF (https://arxiv.org/pdf/2607.16955)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16955)

在你的代理中获取此论文:

hf papers read 2607\.16955

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.16955 以从本页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.16955 以从本页面链接它。

引用此论文的Space0

没有Space链接到此论文

在Space README.md 中引用 arxiv.org/abs/2607.16955 以从本页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从本页面链接它。

相似文章

通过混合策略蒸馏进行推理压缩

arXiv cs.AI

本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。

更好的起点,更好的终点:压缩推理的自举迭代自推理蒸馏

arXiv cs.CL

提出了BIRD,一种两阶段自推理蒸馏方法,该方法在策略训练之前自举简洁的推理轨迹,在MATH-500和AIME基准测试上实现了更强的精度-效率权衡。在Qwen3-8B上,准确率从86.2%提升至92.0%,同时平均响应长度从3,099个token降至1,115个token。