我训练了1B模型遵循指令,结果它更不听话了...

Reddit r/LocalLLaMA 新闻

摘要

作者用相同的SFT方法训练了1B、2B和3B模型,观察到1B和2B模型的指令遵循能力(IFEval)退步了,而3B模型却提升了,这可能与学习率或模型容量不同有关。

相同的SFT配方(SlimOrca 50K,LoRA r=16,1个epoch)。从头训练了三个参数规模分别为1B、2B和3B的模型。SFT前后的IFEval得分: |模型|原始值|SFT后|差值| |:-|:-|:-|:-| |1B|20.50|14.75|**-5.75**| |2B|21.94|17.03|**-4.91**| |3B|23.14|25.18|**+2.04**| 好吧,SFT本来应该教会模型遵循指令的。但问题是,1B模型反而学坏了。2B稍微好一点,但也不乐观。直到3B模型才终于理解了状况。不过实验设置略有不同:3B用的学习率是5e-5,其他两个用的是2e-4。所以,可能是模型容量的问题,也可能是更温和的学习率起了作用。我打算用5e-5重新跑一下2B模型看看。在我消耗算力之前,想请教大家几个问题: 1. 有人在小模型上观察过SFT后IFEval退步的现象吗? 2. 这是不是某个我遗漏的已知问题? 3. 对背后的机制有什么最佳猜测? 如果需要深究的话,我还有完整的数据凭证可以提供。
查看原文

相似文章

SEIF:用于指令遵循的自我演化强化学习

Hugging Face Daily Papers

本文介绍了 SEIF,这是一个自我演化的强化学习框架,通过迭代难度自适应以及教官和跟随者组件的协同训练,增强大语言模型(LLM)的指令遵循能力。

改进前沿大语言模型中的指令层级

OpenAI Blog

OpenAI提出了一种利用指令层级任务的训练方法,通过教导模型根据信任级别(系统 > 开发者 > 用户 > 工具)正确优先处理指令,以提高大语言模型的安全性和可靠性。该方法通过强化学习使用名为IH-Challenge的新数据集,应对提示注入攻击并增强安全可控性。