@Pavel_Izmailov: 新论文:从学习稀疏注意力模式中随机涌现能力!主要收获:当LLM学习……
摘要
新论文发现,LLM中的涌现能力随机地从学习稀疏注意力模式中产生;瓶颈在于学习关注哪些token,这一过程缓慢且不可预测。
查看缓存全文
缓存时间: 2026/06/26 22:16
新论文:从学习稀疏注意力模式中随机涌现新能力!
核心要点:当 LLM 学习算法任务时,瓶颈在于找出哪些 token 需要关注。这种学习过程缓慢且不可预测,而架构设计影响巨大。
我们在一系列不同规模和随机种子下,用 Pythia 模型对一些任务进行了实验。仅随机种子不同的模型,可能在任务上成功或失败,而它们成功的时间点也可能相差很大。
当模型找到正确的注意力模式时,学习会突然发生!
为了更详细地研究这一现象,我们在合成任务上训练 LLM,在这些任务中我们知道正确的注意力模式,并能完全控制任务的各个方面。
我们发现,在这些纯算法任务上,学习过程是多次突然跳跃和平台期的结合,每次跳跃对应着找到一种注意力模式。
学习的难度很大程度上取决于任务的属性。极稀疏或极密集的注意力模式很容易找到,但其他模式则非常困难。而且,增加上下文长度(S)会使任务变得更加困难。
一个有趣的点:如果你通过注意力偏置告诉模型正确的 token,那么在这些算法任务上的学习速度会指数级提升。找出注意力模式确实是瓶颈所在。
架构也会对学习产生巨大影响。更多的注意力头有助于更快地发现正确的注意力模式。而 MLP 混合器也能在其中一项任务上以指数级速度学习!
我个人认为,注意力学习很困难,它可能成为训练过程中的一大瓶颈,尤其是在长上下文任务中。而架构和损失函数影响巨大,因此我对改善这种学习持乐观态度。
论文:http://arxiv.org/abs/2606.25010
博客文章:http://vatsal0.github.io/blog/emergence.html…
由 @vatsalbaherwani 领导,与出色的合作者 @charllechen, @ShikaiQiu 和 @andrewgwils 共同完成
另见 Vatsal 在此处的讨论串:
相似文章
@dwarkesh_sp: 我们在整个互联网上预训练LLM。你可能认为这解释了它们如何学到这么多涌现能力:知识隐含在训练数据中。但事实上,模型能做到训练数据中从未演示过的事情!@svlevine 认为,涌现能力的真正来源是组合性:
Dwarkesh Patel 发推文提到 Sergey Levine 的观点:LLM 中的涌现能力源于组合性,而不仅仅是训练数据。
@Pavel_Izmailov: 新论文:潜在上下文语言模型(LCLMs)!思想:将16个token编码为1个潜在token,让LLM处理t…
介绍潜在上下文语言模型(LCLMs),该模型将16个token编码为1个潜在token,以提高性能、速度和内存使用。
通过CoRe注意力头对多模态大语言模型中功能稀疏性的机制洞察
本文识别了多模态大语言模型中一种特殊的注意力头子集,称为CoRe头,它们在跨模态检索中表现出功能稀疏性。因果干预实验表明,这些头对多模态推理至关重要,利用这种稀疏性可以加速推理。
LLMs 现在变得复杂了
文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。
@gurtej__gill_: Ting Wen Ko 和 Jonas Geiping 的这篇新论文揭示了一个非常疯狂的现象:当 LLM 长时间互相交谈时……
一篇新论文揭示,当 LLM 长时间对话时,它们不会陷入随机混乱,而是收敛到可预测的“吸引子状态”。一些模型会主导对话并强迫对方模仿其风格,而另一些模型则高度可塑,这对多智能体 AI 系统的设计具有重要意义。