gradient-interference

标签

Cards List
#gradient-interference

SFT冲突,RL共存:LLM多任务学习的理论与实证分析

Hugging Face Daily Papers · 2026-08-06 缓存

本文进行了理论与实证分析,表明SFT在多任务LLM训练中存在任务冲突,而RL能够实现稳定共存,并提出Parallel-RL范式以实现高效的多任务训练。

0 人收藏 0 人点赞
#gradient-interference

为什么更大的模型能学到更多:容量、干扰与罕见任务保留的影响

Hugging Face Daily Papers · 2026-05-28 缓存

本文研究了为什么更大的模型表现优于较小的模型,将其归因于梯度干扰减少和资源分配优化,这使得它们即使在无限数据下也能学习罕见且复杂的任务。在合成数据和OLMo模型上的实验验证了,更大的模型由于对常见任务的梯度更新较弱,能够避免覆盖罕见任务的特征。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈