有没有人比较过Qwen3.6-27B上的预训练、SFT/LoRA和强化后训练?

Reddit r/LocalLLaMA 新闻

摘要

一位社区成员询问关于Qwen3.6-27B上预训练、SFT/LoRA和强化后训练的直接比较,引用了最近关于灾难性遗忘及缓解策略的研究。

Qwen3.6-27B:SFT vs 持续预训练 vs RL?我有兴趣适配Qwen3.6-27B,但如果目标是添加能力而不削弱基础模型已有的良好表现,我越来越不确定传统的SFT/LoRA是否是最佳途径。 最近的一些研究让这个问题变得特别有趣:“强化微调自然缓解遗忘” - arXiv:2507.05386 发现在其实验中,SFT导致的灾难性遗忘远多于强化微调。 “在线策略数据在缓解遗忘中的作用” - arXiv:2510.18874 报告称,在Qwen和Llama模型中,在线策略/RL训练通常比SFT更好地保留先前能力。 “RL也会遗忘!迈向持续策略优化” - arXiv:2607.04364 显示RL也可能导致灾难性遗忘,因此这显然不是一个完整的解决方案。 “通过损失自适应学习实现无遗忘微调” - arXiv:2605.20005 报告称改变优化调度大幅减少了遗忘,包括在Qwen3上的实验。 这些研究大多不是专门针对Qwen3.6-27B的,这也是我对社区结果感兴趣的原因。 有没有人直接比较过Qwen3.6-27B上的持续预训练、SFT/LoRA和强化后训练? 我特别感兴趣的是,改进一个领域是否会导致不相关领域的退化,例如编码、推理、指令遵循、工具使用、长上下文行为或通用知识。 对于测试过的人,哪种训练方法效果最好,您之后是否将原始模型与训练后的检查点进行了基准测试? 我也很好奇,持续预训练后再进行少量SFT或RL是否比直接进行大规模SFT更安全。 实际的之前/之后结果以及训练参数将特别有用。
查看原文

相似文章

真正的持续学习模型(原型)

Reddit r/ArtificialInteligence

一位开发者声称使用LoRA构建了真正的持续学习模型原型,让Qwen4B无需重新训练即可获得即时、可泛化的记忆,并邀请独立研究人员验证该机制。