BitTide
菜单
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
off-policy-distillation
标签
Cards
List
#off-policy-distillation
让数据决定:基于离策略蒸馏的持续预训练中的监督分析、能力权衡与自适应目标路由
arXiv cs.LG
↗
· 2026-07-21
缓存
本文分析了用于大语言模型预训练的离策略蒸馏方法,刻画了训练目标如何塑造令牌级监督和下游能力,并提出了自适应目标路由,将不同目标应用于不同数据领域,将预训练重新定义为一种数据条件监督设计问题。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交