通过在线策略蒸馏实现数据高效的自回归到扩散语言模型
摘要
本文介绍了OPDLM,一种通过在线策略蒸馏将自回归语言模型转换为扩散语言模型的方法,所需训练令牌数量减少15倍到7000倍,同时保留原始模型的知识。
arXiv:2606.06712v1 公告类型:新
摘要:我们研究将自回归模型(ARLM)转换为扩散语言模型(DLM)的方法。与从头开始预训练不同,先前的工作将ARLM中的因果注意力替换为双向注意力,然后使用DLM目标训练得到的模型。然而,这些方法面临两种分布偏移。首先,从下一个词预测目标过渡到DLM目标可能会丢弃ARLM在训练过程中获得的知识。其次,标准DLM存在训练-推理不匹配问题,因为训练损失定义在随机掩码序列上,而非推理过程中基于置信度解码所产生的轨迹。为了解决这两个挑战,我们引入了在线策略扩散语言模型(OPDLM),其中采用在线策略蒸馏(OPD)进行ARLM到DLM的转换。具体来说,OPDLM通过自在线策略蒸馏进行训练:学生模型(一个具有双向注意力的ARLM)生成自己的轨迹,教师模型(原始的冻结ARLM)通过在这些轨迹上提供目标logits来蒸馏其知识。通过直接以在线策略方式训练,OPDLM消除了DLM中的训练-推理不匹配,同时从原始模型蒸馏增强了ARLM知识的保留。实验结果表明,OPDLM所需的训练令牌数量减少15倍到7000倍,同时在多种任务上表现强劲。OPDLM避免了DLM预训练的过高成本,并将DLM转换定位为一种ARLM后训练形式。
查看缓存全文
缓存时间: 2026/06/08 09:20
# 通过在线策略蒸馏实现数据高效的自回归到扩散语言模型 来源:https://arxiv.org/abs/2606.06712 查看 PDF(https://arxiv.org/pdf/2606.06712) > 摘要:我们研究将自回归模型(ARLM)转化为扩散语言模型(DLM)的过程。与从头开始预训练不同,先前的工作将 ARLM 中的因果注意力替换为双向注意力,然后使用 DLM 目标训练所得模型。然而,这些方法会引入两种分布偏移。首先,从下一个词元预测目标过渡到 DLM 目标可能会丢弃 ARLM 在训练期间获得的知识。其次,标准 DLM 存在训练-推理不匹配问题,因为训练损失定义在随机掩蔽序列上,而非推理时由基于置信度的解码产生的轨迹上。为应对这两大挑战,我们提出了一种在线策略扩散语言模型(OPDLM),其中采用在线策略蒸馏(OPD)实现 ARLM 到 DLM 的转化。具体而言,OPDLM 通过自在线策略蒸馏进行训练:学生模型(一个具有双向注意力的 ARLM)生成自身轨迹,而教师模型(原始冻结的 ARLM)通过在这些轨迹上提供目标 logits 来蒸馏其知识。通过直接以在线策略方式训练,OPDLM 消除了 DLM 中的训练-推理不匹配问题,同时从原始模型进行蒸馏增强了 ARLM 的知识保留。实验结果表明,OPDLM 所需训练 token 数仅为传统方法的 15 倍至 7,000 倍,且在广泛任务中表现强劲。OPDLM 避免了 DLM 预训练的高昂成本,并将 DLM 转化定位为一种 ARLM 后训练形式。 ## 提交历史 来自:苏兴宇 \[查看邮件(https://arxiv.org/show-email/046fb24e/2606.06712)\] **\[v1\]** 2026 年 6 月 4 日,星期四 20:58:08 UTC(1,688 KB)
相似文章
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
EasyOPD: 一种易用的面向大语言模型在策略蒸馏框架
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
基于轨迹的在策略蒸馏用于掩码扩散语言模型
一篇论文提出了基于轨迹的在策略蒸馏(TOPD),一种教师监督框架,用于将推理能力迁移到掩码扩散语言模型,无需奖励估计,在显著的计算加速下实现了与经过RL训练的模型相当的准确率。