超越教师分配:领域归一化多教师在策略蒸馏

Hugging Face Daily Papers 论文

摘要

本文提出了领域归一化多教师在策略蒸馏(DN-MOPD),以解决合并专家语言模型时反馈不平衡的问题,并在数学和指令跟随等基准测试中展示了性能提升。

强化学习可以将一个语言模型转变为多个专家,每个专家擅长单一技能,如数学、编码或遵循指令,但用户需要一个具备所有这些技能的模型。多教师在策略蒸馏(MOPD)通过让专家教导一个学生来合并它们:学生回答每个提示,该提示领域的专家对每个标记给出反馈。这种路由决定了哪个专家教学,但并未决定其反馈对共享学生的影响强度。在三种尺寸的Qwen3.5模型中,我们发现MOPD的学生并未超越由最佳单一专家教导的学生,并且几乎没有获得数学专家的优势。反馈是不平衡的:指令跟随反馈的分散度是数学反馈的数倍,并主导了学生的更新。我们提出了领域归一化MOPD(DN-MOPD),它保留路由并根据测量的分散度重新缩放每个领域的反馈。在六个公开基准测试中,DN-MOPD在每个尺寸上都提高了MOPD的平均分数,跨越三个随机种子和两个答案长度限制,并恢复了大部分丢失的数学性能提升。固定领域权重的控制实验表明,性能提升主要来自降低指令跟随反馈,而不是仅提高数学反馈,并且接近DN-MOPD测量值的固定权重表现相当。因此,合并专家不仅需要决定哪个专家教学,还需要决定其反馈的权重。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:15

论文页面 - 超越教师分配:领域归一化多教师在策略蒸馏

来源:https://huggingface.co/papers/2609.35347

摘要

强化学习可以将一个语言模型转化为多个专家模型,每个模型擅长单一技能,如数学、编程或遵循指令,但用户需要的是一个具备所有这些技能的模型。多教师在策略蒸馏(MOPD)通过让专家教导一个共享学生模型来实现融合:学生对每个提示进行回答,而该提示所属领域的专家对每个词元给出反馈。这种路由机制决定了由哪个专家进行教学,但并未决定其反馈对共享学生模型的影响力强度。我们在三个规模的 Qwen3.5 模型上发现,MOPD 训练的学生模型并未超过由最佳单一专家模型教导的学生模型,且几乎未能获得数学专家模型的优势。反馈存在不平衡:指令遵循反馈的分散程度是数学反馈的数倍,并主导了学生的更新过程。我们提出了领域归一化 MOPD(DN-MOPD),该方法保留了路由机制,并根据每个领域测量的反馈分散度重新缩放其反馈。在六个公开基准测试上,DN-MOPD 在所有规模上、跨三个随机种子以及两种答案长度限制下,均提升了平均分数并恢复了大部分损失的数学性能。使用固定领域权重的对照实验表明,收益主要来自降低指令遵循反馈的权重,而非仅提升数学反馈的权重;且接近 DN-MOPD 所测得权重的固定权重能取得相当的效果。因此,结合专家模型不仅需要决定由哪个专家教学,还需要确定其反馈的权重。

查看 arXiv 页面 (https://arxiv.org/abs/2609.35347)查看 PDF (https://arxiv.org/pdf/2609.35347)项目主页 (https://lixin.ai/DN-MOPD/)GitHub5 (https://github.com/LiXin97/DN-MOPD)添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.35347)

在你的智能体中获取此论文:

hf papers read 2609\.35347

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.35347 以从本页面链接。

引用此论文的数据集1

XINLI1997/DN-MOPD-Data 浏览器• 约 2 小时前更新 • 26.7k (https://huggingface.co/datasets/XINLI1997/DN-MOPD-Data)

引用此论文的 Space0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.35347 以从本页面链接。

包含此论文的收藏集1

相似文章

MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏

Hugging Face Daily Papers

MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。

基于同伴成功与失败的多 rollout 在策略蒸馏

arXiv cs.LG

提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。