off-policy-distillation

标签

Cards List
#off-policy-distillation

让数据决定:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由

arXiv cs.LG ↗ · 2026-07-21 缓存

本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈