标签
本文提出了主动无任务蒸馏(ATD),这是一种仅通过单一词汇回复对与任务无关的提示进行提示,从而将能力从教师模型转移到学生模型的方法,旨在探究后训练的行为痕迹。
本文研究了测试时的强弱能力迁移,表明更强的模型能够构建推理时框架,在不进行参数更新的情况下,使较弱模型的性能近乎翻倍。
本文提出了 ReAD,这是一种强化引导的能力蒸馏框架,通过考虑大型语言模型中的跨能力迁移来优化 token 预算。与现有基线相比,该方法在提升下游效用的同时,减少了有害溢出。