@alesfav: 人工智能需要比我们多得多的数据。一个想法或许能缩小差距:不要预测原始信号(词元),而是预测你自己的…
摘要
本线程展示了一个理论结果,表明预测抽象的潜在表征(如JEPA和data2vec)而非原始词元,可以指数级地缩小人工智能与人类学习之间的数据差距。
查看缓存全文
缓存时间: 2026/06/02 01:39
人工智能对数据的需求远高于人类。一个可能缩小这一差距的构想是:不直接预测原始信号(token),而是预测自身抽象的潜在表征(JEPA、data2vec)。
在与 @DanKorchinski、@MatthieuWyart 合作的一个玩具模型中,我们证明了这种方法的显著效果:数据需求差距是指数级的。
我们研究了恢复层级语法中隐藏的潜在树结构。
基于token的自监督学习存在“深度代价“:所需数据量随树的深度呈指数级增长。我们证明,通过在潜在表征上进行迭代监督可以避免这一困境——仅需恒定于深度的数据即可恢复树结构!
令人惊讶的是,我们发现data2vec仅凭单一模块就实现了这一点。通过其教师模型,它隐式地在每一层级对潜在表征进行监督,达到了相同的深度恒定数据缩放效果。
层级结构是在训练过程中逐渐展开,而非预先堆叠到架构中。
这一结果也暗示,显式的堆叠架构(如H-JEPA)可能是冗余的。
仍有许多开放性问题!
我们的论文:
感谢分享!这听起来确实非常有趣。我们很快就会拜读您的研究!
感谢。我们确实尽量在正文中减少数学内容,以直觉引导为主,甚至征求了神经科学领域朋友的意见。核心思想很简单:token预测需要透过许多低层选择推断高层原因,因此数据成本随深度增长。
谢谢!是的,这一构想已有前身:预测编码、BYOL、DINO等,我们在引言中引用了这些工作。此处因篇幅限制提及data2vec/JEPA,且它们作为“预测自身潜在表征“的现代表述,最契合我们分析的设定。
潜在表征预测通过逐层学习来规避瓶颈:先学习某一层级,再将已学层级作为下一层级的目标/上下文。
我们或许会在未来撰写更易读的博文版本!
相似文章
AI在分析方面越来越强,但问题仍然在于数据。
作者认为,AI分析的质量更多受到数据获取和可靠性的限制,而非推理能力;结构化数据集能显著提升输出效果。
The data black hole at the center of AI
本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。
Yann LeCun 的赌注:智能始于世界
对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。
@datologyai:为什么更大的模型能保留稀有技能而较小模型会失去?Jing Huang(斯坦福 NLP)指出干扰……
这篇文章讨论了斯坦福 NLP 的 Jing Huang 在 Summer of Data 活动中的演讲,解释了更大的 AI 模型由于任务干扰和更大的容量而能更好地保留稀有技能。
AI并不聪明,那么人工智能的下一步是什么?
Yann LeCun批评当前的LLMs并非真正智能,并描述了他的新公司AMI Labs正在开发的联合嵌入预测架构(JEPA),旨在创建更灵活、能够理解物理世界的人工智能。