@dwarkesh_sp: 我们在整个互联网上预训练LLM。你可能认为这解释了它们如何学到这么多涌现能力:知识隐含在训练数据中。但事实上,模型能做到训练数据中从未演示过的事情!@svlevine 认为,涌现能力的真正来源是组合性:

X AI KOLs Timeline 新闻

摘要

Dwarkesh Patel 发推文提到 Sergey Levine 的观点:LLM 中的涌现能力源于组合性,而不仅仅是训练数据。

我们在整个互联网上预训练LLM。你可能认为这解释了它们如何学到这么多涌现能力:知识隐含在训练数据中。但事实上,模型能做到训练数据中从未演示过的事情!@svlevine 认为,涌现能力的真正来源是组合性:
查看原文

相似文章

@oneill_c: https://x.com/oneill_c/status/2077453217609453784

X AI KOLs Timeline

一位研究人员讨论了LLMs中的持续学习挑战,将其比作健忘的实习生,并探索了扩展上下文窗口、构建有状态记忆以及将上下文压缩为潜在表示等方法,引用了他们在Still上的工作。