标签
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。
新论文发现,LLM中的涌现能力随机地从学习稀疏注意力模式中产生;瓶颈在于学习关注哪些token,这一过程缓慢且不可预测。
Dwarkesh Patel 发推文提到 Sergey Levine 的观点:LLM 中的涌现能力源于组合性,而不仅仅是训练数据。