@ethantsliu: 一些蒸馏技术:OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(…

X AI KOLs Timeline 论文

摘要

此推文讨论了用于语言模型的OPD、OPSD、RLSD和OPD^2蒸馏技术,强调了使用对数概率差异来隔离训练后的改进。

一些蒸馏技术: OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(x, y) x opsd (优势方向, opsd幅度) OPD^2: log π_teacher − log π_teacher-base
查看原文
查看缓存全文

缓存时间: 2026/07/20 13:26

一些蒸馏技术:

OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(x, y) x opsd (优势方向, opsd 幅度) OPD^2: log π_teacher − log π_teacher-base

Xiuyu Li (@sheriyuo): OPD 通常复制教师模型偏好的一切,包括在推理调优之前继承的习惯。

OPD2 则使用推理教师与其自身基础检查点之间的 token 级 logprob 变化,因此奖励能够隔离出后训练实际添加的内容。

在线策略

相似文章

OmniOPD: 通过推测验证实现无Logit的同策略蒸馏

Hugging Face Daily Papers

OmniOPD 提出了一种无Logit的同策略蒸馏方法,利用块级语义相似性和推测验证,在黑盒教师指导下训练学生模型,在数学基准上相比标准OPD实现了高达+28.64%的提升。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。

OISD: 语言模型的在策略内部自蒸馏

arXiv cs.LG

OISD是一种新的自蒸馏框架,通过在GRPO后训练期间将预测信号从最终层转移到中间层,使用logit和注意力对齐来提升语言模型推理能力。