@ethantsliu: 一些蒸馏技术:OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(…
摘要
此推文讨论了用于语言模型的OPD、OPSD、RLSD和OPD^2蒸馏技术,强调了使用对数概率差异来隔离训练后的改进。
查看缓存全文
缓存时间: 2026/07/20 13:26
一些蒸馏技术:
OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(x, y) x opsd (优势方向, opsd 幅度) OPD^2: log π_teacher − log π_teacher-base
Xiuyu Li (@sheriyuo): OPD 通常复制教师模型偏好的一切,包括在推理调优之前继承的习惯。
OPD2 则使用推理教师与其自身基础检查点之间的 token 级 logprob 变化,因此奖励能够隔离出后训练实际添加的内容。
在线策略
相似文章
OmniOPD: 通过推测验证实现无Logit的同策略蒸馏
OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
OISD: 语言模型的在策略内部自蒸馏
OISD是一种新的自蒸馏框架,通过在GRPO后训练期间将预测信号从最终层转移到中间层,使用logit和注意力对齐来提升语言模型推理能力。