我训练了1B模型遵循指令,结果它更不听话了...
摘要
作者用相同的SFT方法训练了1B、2B和3B模型,观察到1B和2B模型的指令遵循能力(IFEval)退步了,而3B模型却提升了,这可能与学习率或模型容量不同有关。
相同的SFT配方(SlimOrca 50K,LoRA r=16,1个epoch)。从头训练了三个参数规模分别为1B、2B和3B的模型。SFT前后的IFEval得分:
|模型|原始值|SFT后|差值|
|:-|:-|:-|:-|
|1B|20.50|14.75|**-5.75**|
|2B|21.94|17.03|**-4.91**|
|3B|23.14|25.18|**+2.04**|
好吧,SFT本来应该教会模型遵循指令的。但问题是,1B模型反而学坏了。2B稍微好一点,但也不乐观。直到3B模型才终于理解了状况。不过实验设置略有不同:3B用的学习率是5e-5,其他两个用的是2e-4。所以,可能是模型容量的问题,也可能是更温和的学习率起了作用。我打算用5e-5重新跑一下2B模型看看。在我消耗算力之前,想请教大家几个问题:
1. 有人在小模型上观察过SFT后IFEval退步的现象吗?
2. 这是不是某个我遗漏的已知问题?
3. 对背后的机制有什么最佳猜测?
如果需要深究的话,我还有完整的数据凭证可以提供。
相似文章
对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好
一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。
跨对齐训练、模型生物和玩具模型的共享SFT经验
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
SEIF:用于指令遵循的自我演化强化学习
本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
改进前沿大语言模型中的指令层级
OpenAI提出了一种利用指令层级任务的训练方法,通过教导模型根据信任级别(系统 > 开发者 > 用户 > 工具)正确优先处理指令,以提高大语言模型的安全性和可靠性。该方法通过强化学习使用名为IH-Challenge的新数据集,应对提示注入攻击并增强安全可控性。