超越教师分配:领域归一化多教师在策略蒸馏
摘要
本文提出了领域归一化多教师在策略蒸馏(DN-MOPD),以解决合并专家语言模型时反馈不平衡的问题,并在数学和指令跟随等基准测试中展示了性能提升。
查看缓存全文
缓存时间: 2026/09/29 08:15
论文页面 - 超越教师分配:领域归一化多教师在策略蒸馏
来源:https://huggingface.co/papers/2609.35347
摘要
强化学习可以将一个语言模型转化为多个专家模型,每个模型擅长单一技能,如数学、编程或遵循指令,但用户需要的是一个具备所有这些技能的模型。多教师在策略蒸馏(MOPD)通过让专家教导一个共享学生模型来实现融合:学生对每个提示进行回答,而该提示所属领域的专家对每个词元给出反馈。这种路由机制决定了由哪个专家进行教学,但并未决定其反馈对共享学生模型的影响力强度。我们在三个规模的 Qwen3.5 模型上发现,MOPD 训练的学生模型并未超过由最佳单一专家模型教导的学生模型,且几乎未能获得数学专家模型的优势。反馈存在不平衡:指令遵循反馈的分散程度是数学反馈的数倍,并主导了学生的更新过程。我们提出了领域归一化 MOPD(DN-MOPD),该方法保留了路由机制,并根据每个领域测量的反馈分散度重新缩放其反馈。在六个公开基准测试上,DN-MOPD 在所有规模上、跨三个随机种子以及两种答案长度限制下,均提升了平均分数并恢复了大部分损失的数学性能。使用固定领域权重的对照实验表明,收益主要来自降低指令遵循反馈的权重,而非仅提升数学反馈的权重;且接近 DN-MOPD 所测得权重的固定权重能取得相当的效果。因此,结合专家模型不仅需要决定由哪个专家教学,还需要确定其反馈的权重。
查看 arXiv 页面 (https://arxiv.org/abs/2609.35347)查看 PDF (https://arxiv.org/pdf/2609.35347)项目主页 (https://lixin.ai/DN-MOPD/)GitHub5 (https://github.com/LiXin97/DN-MOPD)添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.35347)
在你的智能体中获取此论文:
hf papers read 2609\.35347
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.35347 以从本页面链接。
引用此论文的数据集1
XINLI1997/DN-MOPD-Data 浏览器• 约 2 小时前更新 • 26.7k (https://huggingface.co/datasets/XINLI1997/DN-MOPD-Data)
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.35347 以从本页面链接。
包含此论文的收藏集1
相似文章
Open-MOPD:诊断与修复多教师在策略蒸馏中的能力不平衡
本文介绍了Open-MOPD,这是一个通过平衡token级预算来诊断和修复多教师在策略蒸馏中能力不平衡的框架,通过动态分配和奖励刷新,将头空间恢复率从35.6%提高到83.4%。
MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏
MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。
MOPD-Router:重新思考多教师在策略蒸馏中的教师路由
MOPD-Router 提出了一种 token 级路由框架,用于多教师在策略蒸馏,无需域标签即可利用无标签数据和跨域监督。实验表明,在无标签和有标签场景中,相比标准方法,性能有显著提升。
基于同伴成功与失败的多 rollout 在策略蒸馏
提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。