SAKI:基于最大耦合路由的教师监督在线策略蒸馏
摘要
SAKI引入了一种用于在线策略蒸馏的监督分配方法,该方法使用KL约束的教师引导展开和最大耦合来路由令牌级监督,从而提高小模型在数学推理基准测试上的性能。
查看缓存全文
缓存时间: 2026/09/30 04:20
论文页面 - SAKI:基于最大耦合路由的教师监督在线策略蒸馏
来源:https://huggingface.co/papers/2609.36601 发布于9月29日
·
提交者:https://huggingface.co/vzl123
Zela (https://huggingface.co/vzl123) 于9月30日
摘要
在线策略蒸馏(On-policy distillation, OPD)通过让学生模型在自身生成的轨迹上进行训练,减少了训练-测试状态不匹配的问题。但较弱的学生模型可能会访问到与教师模型未对齐的前缀序列,在这些位置进行的监督代表性较弱。我们提出了SAKI(监督分配与KL约束插值,Supervision Allocation with KL-constrained Interpolation),该方法结合了受KL约束的教师引导轨迹生成与最大耦合机制,并重用实际发生/校正事件来路由逐词元的监督。接受位置保留采样词元的反向KL监督,而校正位置则直接对教师模型概率最高的词元进行监督。在最大耦合下,校正概率恰好等于TV(p_t,q_t),因此相同的信任域半径既控制了轨迹偏离程度,也为干预和专业化监督频率提供了上界。我们进一步实现了一种引擎内置的推测性验证器,它在保留精确的q轨迹分布与耦合语义的同时,将匹配工作负载轨迹生成的吞吐量提高了4.22倍。在七个数学推理基准测试中,SAKI对于1.7B和0.6B学生模型,在Mean@8和Pass@8指标上均优于匹配的教师引导基线方法。位置控制与固定前缀分析进一步支持将基于校正触发的路由作为一种冲突自适应的监督信号。
查看 arXiv 页面 (https://arxiv.org/abs/2609.36601) 查看 PDF (https://arxiv.org/pdf/2609.36601) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.36601)
在你的代理中获取此论文:
hf papers read 2609.36601
没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无关联模型
在模型 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该模型。
引用本文的数据集 0
无关联数据集
在数据集 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该数据集。
引用本文的空间 0
无关联空间
在空间 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该空间。
包含本文的收藏夹 0
无包含本文的收藏夹
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 可将此页面链接至该收藏夹。
相似文章
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减
识别了在线策略蒸馏中的监督保真度衰减(SFD),即随着学生序列变长,教师监督质量下降,并提出了前瞻组奖励(LGR)以缓解SFD,从而提升数学和代码基准测试的性能。
On-Policy 蒸馏中的 Off-Policy 教师问题
该论文指出了 On-Policy 蒸馏中存在的一种 off-policy 不对称性:教师必须监督来自学生自身生成的、其未训练过的前缀。为此,论文提出了 SCOUT——一个通过可验证奖励的 RL 持续适应教师的协同训练框架,在不同配置、模型规模和推理领域上均一致地提升了蒸馏效果。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。