SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
摘要
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
查看缓存全文
缓存时间: 2026/06/12 06:51
论文页面 - SG-OPD:基于符号一致性门控与分阶段教师采样的符号门控策略内蒸馏
来源:https://huggingface.co/papers/2606.09304
摘要
符号门控策略内蒸馏通过引入一个二元验证器来过滤教师信号,从而改进了标准策略内蒸馏,在数学推理任务上取得了更好的性能。
策略内蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation)(OPD)在自身轨迹上训练学生模型 (https://huggingface.co/papers?q=student),并依赖更强大教师模型 (https://huggingface.co/papers?q=teacher) 提供的密集逐 token 监督 (https://huggingface.co/papers?q=dense%20per-token%20supervision),其性能通常优于策略外蒸馏和标准强化学习。然而,我们发现其有效性隐含地依赖于两个在实践中经常失效的假设:学生模型 (https://huggingface.co/papers?q=student) 与教师模型 (https://huggingface.co/papers?q=teacher) 之间的轨迹级对齐 (https://huggingface.co/papers?q=trajectory-level%20alignment),以及教师模型 (https://huggingface.co/papers?q=teacher) 偏好的均匀 token 级可靠性 (https://huggingface.co/papers?q=token-level%20reliability)。因此,我们提出符号门控策略内蒸馏 (https://huggingface.co/papers?q=On-Policy%20Distillation)(SG-OPD),该方法在两种互补粒度上使用二元验证器 (https://huggingface.co/papers?q=binary%20verifier) 作为教师模型 (https://huggingface.co/papers?q=teacher) 的信任信号:分阶段教师采样 (https://huggingface.co/papers?q=phased%20teacher%20sampling) 在冷启动阶段混合由验证器认可的教师模型 (https://huggingface.co/papers?q=teacher) 轨迹;符号一致性门控 (https://huggingface.co/papers?q=sign-consistency%20gate) 在教师模型 (https://huggingface.co/papers?q=teacher) 与验证器正确方向一致的 token 上外推蒸馏更新 (https://huggingface.co/papers?q=distillation%20update),在意见不一致时则内插更新。在竞赛级数学推理基准上的实验表明,SG-OPD 始终优于标准 OPD,在每样本和每问题层面分别平均提升 1.98 和 7.50。
查看 arXiv 页面 (https://arxiv.org/abs/2606.09304)
查看 PDF (https://arxiv.org/pdf/2606.09304)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.09304)
在你的智能体中获取此论文:
hf papers read 2606.09304
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2606.09304 即可从此页面链接。
引用此论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.09304 即可从此页面链接。
引用此论文的 Space0
没有与此论文关联的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.09304 即可从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
OmniOPD: 通过推测验证实现无Logit的同策略蒸馏
OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
传递接力棒:轨迹中继在策略蒸馏
提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。