SAKI:基于最大耦合路由的教师监督在线策略蒸馏

Hugging Face Daily Papers 论文

摘要

SAKI引入了一种用于在线策略蒸馏的监督分配方法,该方法使用KL约束的教师引导展开和最大耦合来路由令牌级监督,从而提高小模型在数学推理基准测试上的性能。

在线策略蒸馏(OPD)通过在自身生成的轨迹上训练学生来减少训练-测试状态不匹配,但弱学生可能会访问教师未对齐的前缀,这些地方的监督代表性较低。我们引入了SAKI(基于KL约束插值的监督分配),它结合了KL约束的教师引导展开和最大耦合,并重用已实现的接受/纠正事件来路由令牌级监督。接受的位置保留采样令牌的反向KL监督,而纠正位置则接收教师最高概率令牌的直接监督。在最大耦合下,纠正概率正好是TV(p_t, q_t),因此相同的信任域半径控制展开偏差,并干预和专门监督频率的上限。我们进一步实现了一个引擎驻留的推测验证器,该验证器保留了精确的q轨迹分布和耦合语义,同时将匹配工作负载的展开吞吐量提高了4.22倍。在七个数学推理基准测试中,SAKI在Mean@8和Pass@8上改进了匹配的教师引导基线,适用于1.7B和0.6B的学生。放置控制和固定前缀分析进一步支持纠正触发路由作为冲突自适应监督信号。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:20

论文页面 - SAKI:基于最大耦合路由的教师监督在线策略蒸馏

来源:https://huggingface.co/papers/2609.36601 发布于9月29日

·

提交者:https://huggingface.co/vzl123

Zela (https://huggingface.co/vzl123) 于9月30日

摘要

在线策略蒸馏(On-policy distillation, OPD)通过让学生模型在自身生成的轨迹上进行训练,减少了训练-测试状态不匹配的问题。但较弱的学生模型可能会访问到与教师模型未对齐的前缀序列,在这些位置进行的监督代表性较弱。我们提出了SAKI(监督分配与KL约束插值,Supervision Allocation with KL-constrained Interpolation),该方法结合了受KL约束的教师引导轨迹生成与最大耦合机制,并重用实际发生/校正事件来路由逐词元的监督。接受位置保留采样词元的反向KL监督,而校正位置则直接对教师模型概率最高的词元进行监督。在最大耦合下,校正概率恰好等于TV(p_t,q_t),因此相同的信任域半径既控制了轨迹偏离程度,也为干预和专业化监督频率提供了上界。我们进一步实现了一种引擎内置的推测性验证器,它在保留精确的q轨迹分布与耦合语义的同时,将匹配工作负载轨迹生成的吞吐量提高了4.22倍。在七个数学推理基准测试中,SAKI对于1.7B和0.6B学生模型,在Mean@8和Pass@8指标上均优于匹配的教师引导基线方法。位置控制与固定前缀分析进一步支持将基于校正触发的路由作为一种冲突自适应的监督信号。

查看 arXiv 页面 (https://arxiv.org/abs/2609.36601) 查看 PDF (https://arxiv.org/pdf/2609.36601) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.36601)

在你的代理中获取此论文:

hf papers read 2609.36601

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无关联模型

在模型 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该模型。

引用本文的数据集 0

无关联数据集

在数据集 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该数据集。

引用本文的空间 0

无关联空间

在空间 README.md 中引用 arxiv.org/abs/2609.36601 可将此页面链接至该空间。

包含本文的收藏夹 0

无包含本文的收藏夹

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 可将此页面链接至该收藏夹。

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

On-Policy 蒸馏中的 Off-Policy 教师问题

Hugging Face Daily Papers

该论文指出了 On-Policy 蒸馏中存在的一种 off-policy 不对称性:教师必须监督来自学生自身生成的、其未训练过的前缀。为此,论文提出了 SCOUT——一个通过可验证奖励的 RL 持续适应教师的协同训练框架,在不同配置、模型规模和推理领域上均一致地提升了蒸馏效果。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。