为什么更大的模型能学到更多:容量、干扰与罕见任务保留的影响
摘要
本文研究了为什么更大的模型表现优于较小的模型,将其归因于梯度干扰减少和资源分配优化,这使得它们即使在无限数据下也能学习罕见且复杂的任务。在合成数据和OLMo模型上的实验验证了,更大的模型由于对常见任务的梯度更新较弱,能够避免覆盖罕见任务的特征。
查看缓存全文
缓存时间: 2026/05/29 07:01
论文页面 - 为什么更大的模型学得更多:容量、干扰与稀有任务保留的影响
来源: https://huggingface.co/papers/2605.29548
摘要
更大的模型由于梯度干扰减少和资源分配更优,在复杂和稀有任务上表现优于小模型,使其能够学习到小模型即使有无限数据也会错过的任务特征。
更大的模型能学到小模型学不到的任务。是什么驱动了这一现象?我们提出了一个简单的现象学论证,表明幂律缩放(https://huggingface.co/papers?q=power-law%20scaling)已经暗示,更大的模型能够学习到小模型即使在无限训练数据下也无法学习的数据分布部分。为了验证这一主张并找出其原因,我们研究模型缩放(https://huggingface.co/papers?q=model%20scaling)对一种由多种任务组成的合成设置的影响,这些任务呈现单调缩放曲线。结果指向数据引起的资源(神经元(https://huggingface.co/papers?q=neurons))竞争。具体来说,较小的模型将其神经元(https://huggingface.co/papers?q=neurons)分配给高频或低复杂度任务,因此它们学会了在稀有和复杂任务上表现不佳的解决方案。此外,即使存在能够表达所需任务的解决方案,这种情况也会发生。然后我们评估更大的模型如何绕过这个数据中心的瓶颈,发现这归因于一种减弱的干扰机制:更大的模型能为常见任务分配足够的资源,使得这些任务的梯度更新(https://huggingface.co/papers?q=gradient%20updates)变弱,这意味着它们不会在稀有任务特征(https://huggingface.co/papers?q=task%20features)缓慢积累时将其覆盖。最后,为了进一步验证这些主张,我们在不同频率和复杂度的新任务上预训练了 OLMo 模型(4M 到 4B 参数)。结果与合成数据实验的结果一致:只有更大的 OLMo 模型能学习到不频繁且复杂的任务,并且这些更大的模型在其表征中嵌入了更多任务特征(https://huggingface.co/papers?q=task%20features),任务之间的梯度干扰(https://huggingface.co/papers?q=gradient%20interference)也更少。总体而言,我们提供了一个以数据为中心的解释,说明为什么更大的模型能学到小模型学不到的任务。这有助于解释为什么更大的模型在实践中表现更好,并且可以为有关模型大小(https://huggingface.co/papers?q=model%20sizing)和训练数据混合(https://huggingface.co/papers?q=training%20data%20mixtures)的实际问题提供参考。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29548)查看 PDF (https://arxiv.org/pdf/2605.29548)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29548)
在你的智能体中获取这篇论文:
hf papers read 2605\.29548
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接它。
相似文章
@ChrisGPotts:我们理所当然地认为更大的模型比小的更好,但为什么会这样?我们的新论文,由Jing Hua领导……
本文探讨了为什么更大的模型性能优于较小的模型,通过形式化分析和实验将其归因于数据引发的神经资源竞争。
@rohanpaul_ai: 一篇来自斯坦福、MIT、哈佛和Anthropic的优秀论文。给出了关于为何大型模型能学习……的清晰训练解释。
一项来自斯坦福、MIT、哈佛和Anthropic的论文解释,大型AI模型能更好地学习稀有技能,因为训练期间它们遗忘更少;其额外容量保护弱学习信号不被常见任务覆盖。
大型模型优势所在:约束引导推理的首要地位
本文介绍了AdvCluster,一个自动化框架,用于识别和分类大型语言模型相对于小型模型在数学、物理、化学和编程基准测试中的推理优势。研究发现,大型模型在约束引导推理方面表现更佳——识别和组织约束以排除不可行路径并验证中间步骤。
更少数据,更快训练:重复小数据集通过采样偏差加速学习
本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。
@omarsar0:Meta 令人印象深刻的新论文。(收藏)缩放定律假设模型规模和训练数据独立作用于损失…
Meta 研究人员提出了 Skaling 定律,这是一种广义的缩放定律,通过单个交互指数将模型容量和数据耦合起来,将预测误差降低 1.5–3 倍,并使得全网格外推所需的计算量减少约 10 倍。