有没有人比较过Qwen3.6-27B上的预训练、SFT/LoRA和强化后训练?
摘要
一位社区成员询问关于Qwen3.6-27B上预训练、SFT/LoRA和强化后训练的直接比较,引用了最近关于灾难性遗忘及缓解策略的研究。
Qwen3.6-27B:SFT vs 持续预训练 vs RL?我有兴趣适配Qwen3.6-27B,但如果目标是添加能力而不削弱基础模型已有的良好表现,我越来越不确定传统的SFT/LoRA是否是最佳途径。
最近的一些研究让这个问题变得特别有趣:“强化微调自然缓解遗忘” - arXiv:2507.05386 发现在其实验中,SFT导致的灾难性遗忘远多于强化微调。
“在线策略数据在缓解遗忘中的作用” - arXiv:2510.18874 报告称,在Qwen和Llama模型中,在线策略/RL训练通常比SFT更好地保留先前能力。
“RL也会遗忘!迈向持续策略优化” - arXiv:2607.04364 显示RL也可能导致灾难性遗忘,因此这显然不是一个完整的解决方案。
“通过损失自适应学习实现无遗忘微调” - arXiv:2605.20005 报告称改变优化调度大幅减少了遗忘,包括在Qwen3上的实验。
这些研究大多不是专门针对Qwen3.6-27B的,这也是我对社区结果感兴趣的原因。
有没有人直接比较过Qwen3.6-27B上的持续预训练、SFT/LoRA和强化后训练?
我特别感兴趣的是,改进一个领域是否会导致不相关领域的退化,例如编码、推理、指令遵循、工具使用、长上下文行为或通用知识。
对于测试过的人,哪种训练方法效果最好,您之后是否将原始模型与训练后的检查点进行了基准测试?
我也很好奇,持续预训练后再进行少量SFT或RL是否比直接进行大规模SFT更安全。
实际的之前/之后结果以及训练参数将特别有用。
相似文章
我创造了一种名为RPS的LLM后训练方法。初步结果显示它提高了Qwen3-8b的程序合成可靠性。[R]
RPS是一种受神经科学启发的两阶段LLM后训练方法,结合了课程学习和学习率衰减。初步结果显示,与等学习率训练相比,在Qwen3-8b上程序合成可靠性得到提升。
灾难性遗忘的机制起源:为什么RL比SFT更好地保留电路?
本文研究了LLM中灾难性遗忘的机制起源,发现强化学习比监督微调更好地保留了内部计算电路,从而减少了对先前能力的遗忘。
近期LLM的进步主要来自预训练还是后训练?
一个讨论问题,探讨近期LLM的进步更多是由预训练还是后训练技术(如RL和微调)驱动,因为两者都需要大量计算资源。
真正的持续学习模型(原型)
一位开发者声称使用LoRA构建了真正的持续学习模型原型,让Qwen4B无需重新训练即可获得即时、可泛化的记忆,并邀请独立研究人员验证该机制。
我训练了TIME:基于Qwen模型的短时上下文触发思考而非过度思考
一个个人项目最终产出了一篇ACL 2026论文,介绍了TIME方法,训练Qwen3模型进行短时、上下文触发的思考,而非过度推理。该工作使用了QLoRA和四阶段课程,所有数据和代码均已开源发布。