标签
本文进行了理论与实证分析,表明SFT在多任务LLM训练中存在任务冲突,而RL能够实现稳定共存,并提出Parallel-RL范式以实现高效的多任务训练。
本文研究了为什么更大的模型表现优于较小的模型,将其归因于梯度干扰减少和资源分配优化,这使得它们即使在无限数据下也能学习罕见且复杂的任务。在合成数据和OLMo模型上的实验验证了,更大的模型由于对常见任务的梯度更新较弱,能够避免覆盖罕见任务的特征。