MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏
摘要
MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。
查看缓存全文
缓存时间: 2026/07/01 15:43
论文页面 - MOPD:面向大语言模型后训练中能力融合的多教师在线策略蒸馏
来源:https://huggingface.co/papers/2606.30406 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
多教师在线策略蒸馏(MOPD)通过专门的强化学习教师和在线策略蒸馏,高效地将多个领域能力融合到大语言模型中,实现了优于现有方法的性能。
现代大语言模型(LLM)在后训练阶段依赖强化学习(https://huggingface.co/papers?q=reinforcement%20learning)来提升特定能力,但将多种能力整合到单一模型仍然困难。现有方法如离线微调(https://huggingface.co/papers?q=Off-Policy%20Finetune)和混合RL(https://huggingface.co/papers?q=Mix-RL)要么效率低下,要么性能损失。在这项工作中,我们提出了多教师在线策略蒸馏(https://huggingface.co/papers?q=On-Policy%20Distillation)(MOPD),一种用于融合多个领域RL教师(https://huggingface.co/papers?q=domain%20RL%20teachers)能力的后训练(https://huggingface.co/papers?q=post-training)范式:我们首先为每个领域运行专门的RL以获得一组领域教师,然后将这些教师在其自身轨迹上蒸馏给学生模型。这消除了暴露偏差(https://huggingface.co/papers?q=exposure%20bias),并提供了密集优化信号(https://huggingface.co/papers?q=dense%20optimization%20signal)。在Qwen3-30B-A3B(https://huggingface.co/papers?q=Qwen3-30B-A3B)上,MOPD优于混合RL(https://huggingface.co/papers?q=Mix-RL)、级联RL(https://huggingface.co/papers?q=Cascade%20RL)、离线微调(https://huggingface.co/papers?q=Off-Policy%20Finetune)和参数合并(https://huggingface.co/papers?q=Param-Merge)基线,几乎继承了每位教师的全部能力。MOPD还支持领域教师的并行独立开发,消除了多领域后训练(https://huggingface.co/papers?q=post-training)中典型的跨领域耦合。MOPD已部署在工业级前沿模型MiMo-V2-Flash(https://huggingface.co/papers?q=MiMo-V2-Flash)的后训练中,证明了其在前沿规模LLM中实现能力融合的实际价值。
查看arXiv页面 (https://arxiv.org/abs/2606.30406)查看PDF (https://arxiv.org/pdf/2606.30406)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30406)
在你的代理中获取此论文:
hf papers read 2606\.30406
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型README.md中引用 arxiv.org/abs/2606.30406 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集README.md中引用 arxiv.org/abs/2606.30406 即可从此页面链接。
引用此论文的Spaces0
没有Space链接到此论文
在Space README.md中引用 arxiv.org/abs/2606.30406 即可从此页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)中即可从此页面链接。
相似文章
Open-MOPD:诊断与修复多教师在策略蒸馏中的能力不平衡
本文介绍了Open-MOPD,这是一个通过平衡token级预算来诊断和修复多教师在策略蒸馏中能力不平衡的框架,通过动态分配和奖励刷新,将头空间恢复率从35.6%提高到83.4%。
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
基于同伴成功与失败的多 rollout 在策略蒸馏
提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。
基于前缀重放的多轮在线策略蒸馏
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。