@Pavel_Izmailov: 新论文:从学习稀疏注意力模式中随机涌现能力!主要收获:当LLM学习……

X AI KOLs Timeline 论文

摘要

新论文发现,LLM中的涌现能力随机地从学习稀疏注意力模式中产生;瓶颈在于学习关注哪些token,这一过程缓慢且不可预测。

新论文:从学习稀疏注意力模式中随机涌现能力! 主要收获:当LLM学习算法任务时,瓶颈在于弄清楚关注哪些token。这一学习过程缓慢且不可预测,并且架构有重大影响。 🧵 https://t.co/d2jEkwkJSm
查看原文
查看缓存全文

缓存时间: 2026/06/26 22:16

新论文:从学习稀疏注意力模式中随机涌现新能力!

核心要点:当 LLM 学习算法任务时,瓶颈在于找出哪些 token 需要关注。这种学习过程缓慢且不可预测,而架构设计影响巨大。

我们在一系列不同规模和随机种子下,用 Pythia 模型对一些任务进行了实验。仅随机种子不同的模型,可能在任务上成功或失败,而它们成功的时间点也可能相差很大。

当模型找到正确的注意力模式时,学习会突然发生!

为了更详细地研究这一现象,我们在合成任务上训练 LLM,在这些任务中我们知道正确的注意力模式,并能完全控制任务的各个方面。

我们发现,在这些纯算法任务上,学习过程是多次突然跳跃和平台期的结合,每次跳跃对应着找到一种注意力模式。

学习的难度很大程度上取决于任务的属性。极稀疏或极密集的注意力模式很容易找到,但其他模式则非常困难。而且,增加上下文长度(S)会使任务变得更加困难。

一个有趣的点:如果你通过注意力偏置告诉模型正确的 token,那么在这些算法任务上的学习速度会指数级提升。找出注意力模式确实是瓶颈所在。

架构也会对学习产生巨大影响。更多的注意力头有助于更快地发现正确的注意力模式。而 MLP 混合器也能在其中一项任务上以指数级速度学习!

我个人认为,注意力学习很困难,它可能成为训练过程中的一大瓶颈,尤其是在长上下文任务中。而架构和损失函数影响巨大,因此我对改善这种学习持乐观态度。

论文:http://arxiv.org/abs/2606.25010
博客文章:http://vatsal0.github.io/blog/emergence.html…

由 @vatsalbaherwani 领导,与出色的合作者 @charllechen, @ShikaiQiu 和 @andrewgwils 共同完成

另见 Vatsal 在此处的讨论串:

相似文章

LLMs 现在变得复杂了

Hacker News Top

文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。