multi-teacher-distillation

标签

Cards List
#multi-teacher-distillation

D^3-MOPD:高效多教师蒸馏的自适应动态领域调度

Hugging Face Daily Papers · 2026-08-25 缓存

D³-MOPD是一个用于多教师蒸馏的零开销调度器,基于每个领域的反向KL轨迹动态调整领域采样比例,从而提高收敛效率并缩小大部分学生与教师之间的性能差距。

0 人收藏 0 人点赞
#multi-teacher-distillation

Open-MOPD:诊断与修复多教师在策略蒸馏中的能力不平衡

Hugging Face Daily Papers · 2026-08-19 缓存

本文介绍了Open-MOPD,这是一个通过平衡token级预算来诊断和修复多教师在策略蒸馏中能力不平衡的框架,通过动态分配和奖励刷新,将头空间恢复率从35.6%提高到83.4%。

0 人收藏 0 人点赞
#multi-teacher-distillation

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL · 2026-07-09 缓存

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

0 人收藏 0 人点赞
#multi-teacher-distillation

InternScience/Agents-A1 · Hugging Face

Reddit r/LocalLLaMA · 2026-06-30 缓存

Agents-A1 是 InternScience 推出的 35B 参数混合专家(MoE)智能体模型,通过长程轨迹缩放和多教师多领域蒸馏技术,在与 GPT-5.5 和 DeepSeek-V4-pro 等前沿规模系统的对比中展现出具有竞争力的性能。

0 人收藏 0 人点赞
#multi-teacher-distillation

MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏

Hugging Face Daily Papers · 2026-06-29 缓存

MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈