@alesfav: 人工智能需要比我们多得多的数据。一个想法或许能缩小差距:不要预测原始信号(词元),而是预测你自己的…

X AI KOLs Following 论文

摘要

本线程展示了一个理论结果,表明预测抽象的潜在表征(如JEPA和data2vec)而非原始词元,可以指数级地缩小人工智能与人类学习之间的数据差距。

人工智能需要比我们多得多的数据。一个想法或许能缩小差距:不要预测原始信号(词元),而是预测你自己的抽象潜在表征(JEPA、data2vec)。 与 @DanKorchinski 和 @MatthieuWyart 一起,在一个玩具模型上,我们证明了这有多大帮助:差距是指数级的。 🧵 https://t.co/I51Q6Jwiqr
查看原文
查看缓存全文

缓存时间: 2026/06/02 01:39

人工智能对数据的需求远高于人类。一个可能缩小这一差距的构想是:不直接预测原始信号(token),而是预测自身抽象的潜在表征(JEPA、data2vec)。

在与 @DanKorchinski、@MatthieuWyart 合作的一个玩具模型中,我们证明了这种方法的显著效果:数据需求差距是指数级的。

我们研究了恢复层级语法中隐藏的潜在树结构。

基于token的自监督学习存在“深度代价“:所需数据量随树的深度呈指数级增长。我们证明,通过在潜在表征上进行迭代监督可以避免这一困境——仅需恒定于深度的数据即可恢复树结构!

令人惊讶的是,我们发现data2vec仅凭单一模块就实现了这一点。通过其教师模型,它隐式地在每一层级对潜在表征进行监督,达到了相同的深度恒定数据缩放效果。

层级结构是在训练过程中逐渐展开,而非预先堆叠到架构中。

这一结果也暗示,显式的堆叠架构(如H-JEPA)可能是冗余的。

仍有许多开放性问题!

我们的论文:

感谢分享!这听起来确实非常有趣。我们很快就会拜读您的研究!

感谢。我们确实尽量在正文中减少数学内容,以直觉引导为主,甚至征求了神经科学领域朋友的意见。核心思想很简单:token预测需要透过许多低层选择推断高层原因,因此数据成本随深度增长。

谢谢!是的,这一构想已有前身:预测编码、BYOL、DINO等,我们在引言中引用了这些工作。此处因篇幅限制提及data2vec/JEPA,且它们作为“预测自身潜在表征“的现代表述,最契合我们分析的设定。

潜在表征预测通过逐层学习来规避瓶颈:先学习某一层级,再将已学层级作为下一层级的目标/上下文。

我们或许会在未来撰写更易读的博文版本!

相似文章

The data black hole at the center of AI

Reddit r/artificial

本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。

Yann LeCun 的赌注:智能始于世界

Reddit r/singularity

对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。