标签
SMOPD是一种仅使用损失的稳定方法,用于多轮在策略自蒸馏,通过选择性令牌熵掩蔽来提高脏历史设置下的准确性,并展示了在Qwen3模型上的改进。
提出了 EKSFT,一种面向大型语言模型的选择性微调方法,该方法掩码具有高熵或与参考模型高KL散度的令牌,在注入任务知识的同时保留预训练分布。在数学推理基准上的实验表明,它优于标准SFT,并改进了后续的RL微调。