为什么更大的模型能学到更多:容量、干扰与罕见任务保留的影响

Hugging Face Daily Papers 论文

摘要

本文研究了为什么更大的模型表现优于较小的模型,将其归因于梯度干扰减少和资源分配优化,这使得它们即使在无限数据下也能学习罕见且复杂的任务。在合成数据和OLMo模型上的实验验证了,更大的模型由于对常见任务的梯度更新较弱,能够避免覆盖罕见任务的特征。

更大的模型能学习到较小模型无法学习到的任务。是什么驱动了这一现象?我们发展了一个简单的现象学论证,认为幂律缩放已经表明,即使在无限训练数据下,更大的模型也能学习到数据分布中较小模型无法学习到的部分。为了验证这一说法并找出其原因,我们研究了模型缩放对由多种任务组成的合成设置的影响,这些任务显示出单调的缩放曲线。结果指向了数据引起的神经元资源竞争。具体来说,较小的模型会将其神经元分配给高频或低复杂度的任务,因此它们学习到的解决方案在罕见和复杂任务上表现不佳。而且,即使存在能够表达所需任务的解决方案,这种情况也会发生。然后,我们评估了更大的模型如何绕过这一以数据为中心的瓶颈,发现这源于一种减少干扰的机制:更大的模型可以为常见任务分配足够的资源,使得这些任务的梯度更新变得微弱,从而在缓慢积累过程中不会覆盖罕见任务的特征。最后,为了进一步验证这些说法,我们在不同频率和复杂性的新任务上预训练了OLMo模型(参数从4M到4B)。结果与我们合成数据实验的结果一致:只有更大的OLMo模型能学习不频繁且复杂的任务,这些更大的模型在其表示中嵌入了更多任务特征,并且任务之间的梯度干扰更少。总体而言,我们提供了一个以数据为中心的解释,说明为什么更大的模型能学习到较小模型无法学习的任务。这有助于解释为什么更大的模型在实践中表现更好,并且可以为关于模型规模和训练数据混合的实际问题提供参考。
查看原文
查看缓存全文

缓存时间: 2026/05/29 07:01

论文页面 - 为什么更大的模型学得更多:容量、干扰与稀有任务保留的影响

来源: https://huggingface.co/papers/2605.29548

摘要

更大的模型由于梯度干扰减少和资源分配更优,在复杂和稀有任务上表现优于小模型,使其能够学习到小模型即使有无限数据也会错过的任务特征。

更大的模型能学到小模型学不到的任务。是什么驱动了这一现象?我们提出了一个简单的现象学论证,表明幂律缩放(https://huggingface.co/papers?q=power-law%20scaling)已经暗示,更大的模型能够学习到小模型即使在无限训练数据下也无法学习的数据分布部分。为了验证这一主张并找出其原因,我们研究模型缩放(https://huggingface.co/papers?q=model%20scaling)对一种由多种任务组成的合成设置的影响,这些任务呈现单调缩放曲线。结果指向数据引起的资源(神经元(https://huggingface.co/papers?q=neurons))竞争。具体来说,较小的模型将其神经元(https://huggingface.co/papers?q=neurons)分配给高频或低复杂度任务,因此它们学会了在稀有和复杂任务上表现不佳的解决方案。此外,即使存在能够表达所需任务的解决方案,这种情况也会发生。然后我们评估更大的模型如何绕过这个数据中心的瓶颈,发现这归因于一种减弱的干扰机制:更大的模型能为常见任务分配足够的资源,使得这些任务的梯度更新(https://huggingface.co/papers?q=gradient%20updates)变弱,这意味着它们不会在稀有任务特征(https://huggingface.co/papers?q=task%20features)缓慢积累时将其覆盖。最后,为了进一步验证这些主张,我们在不同频率和复杂度的新任务上预训练了 OLMo 模型(4M 到 4B 参数)。结果与合成数据实验的结果一致:只有更大的 OLMo 模型能学习到不频繁且复杂的任务,并且这些更大的模型在其表征中嵌入了更多任务特征(https://huggingface.co/papers?q=task%20features),任务之间的梯度干扰(https://huggingface.co/papers?q=gradient%20interference)也更少。总体而言,我们提供了一个以数据为中心的解释,说明为什么更大的模型能学到小模型学不到的任务。这有助于解释为什么更大的模型在实践中表现更好,并且可以为有关模型大小(https://huggingface.co/papers?q=model%20sizing)和训练数据混合(https://huggingface.co/papers?q=training%20data%20mixtures)的实际问题提供参考。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29548)查看 PDF (https://arxiv.org/pdf/2605.29548)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29548)

在你的智能体中获取这篇论文:

hf papers read 2605\.29548

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.29548 即可从此页面链接它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中即可从此页面链接它。

相似文章

大型模型优势所在:约束引导推理的首要地位

arXiv cs.CL

本文介绍了AdvCluster,一个自动化框架,用于识别和分类大型语言模型相对于小型模型在数学、物理、化学和编程基准测试中的推理优势。研究发现,大型模型在约束引导推理方面表现更佳——识别和组织约束以排除不可行路径并验证中间步骤。

更少数据,更快训练:重复小数据集通过采样偏差加速学习

arXiv cs.LG

本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。