Yann LeCun 的赌注:智能始于世界

Reddit r/singularity 新闻

摘要

对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/27 01:50

# JEPA 与世界模型赌注 来源:https://aryeian.blog/articles/jepa-world-models.html 如今人工智能领域最昂贵的争论,并非"开放权重对封闭权重",也不是"智能体对副驾驶"。 而是智力是否始于语言。 主流答案一直是肯定的,或者说几乎如此。拿一个Transformer,喂给它文本,疯狂扩展规模,再给它装上视觉、工具使用、记忆、强化学习、产品截图和氛围。这个模型一开始只是个自动补全工具,却不知怎的变得足够有用,以至于人人都假装这个本体论是干净的。 其实并不干净。 Yann LeCun的对应赌注是JEPA,全称联合嵌入预测架构(Joint Embedding Predictive Architecture)。这个主张简单得足以构成威胁:真正的智能并非始于生成词语。它始于构建世界的内部模型,然后利用这些模型预测如果你采取行动会发生什么。 这就是为什么LeCun的新公司AMI Labs据报道在2026年3月筹集了10.3亿美元来构建世界模型。对于一个仍然主要是研究项目的方向来说,这简直是巨额资金。但荒诞如今已成常态。我们给了自动补全一个万亿美元估值的资本表。财务理智的门槛早就被抛到九霄云外了。 ## 核心论点 大语言模型学会了语言。JEPA试图学习后果。区别很重要,因为智能体不仅需要回答问题。它们需要在现实因为错误选择而惩罚它们之前,选择行动。 ## 为什么下一像素预测会失败 播客从显而易见的地方开始:下一token预测在语言上出奇地有效。你把文本给模型,隐藏下一个token,训练它预测缺失的部分。大规模这样做,你就能得到具有有用内部表征的GPT风格模型。 那么,为什么不对视频做同样的事情呢? 取几帧。预测下一帧。在像素上训练。理论上,模型学会了世界如何运动。 在实践中,它学会了模糊。 原因并不神秘。如果一个球可能向左或向右弹,而你的模型被迫输出一个像素级的未来,安全的答案是所有可能未来的平均值。取一个左弹和一个右弹的平均值,你会得到一团模糊。自回归地重复这个过程,你的未来就变成了一锅粥。 语言可以部分避开这个问题,因为token是离散的。"左"和"右"是不同的输出。视频没有一个整洁的50,000 token词汇。一帧是数百万个连续值,其中大多数无关紧要。 汽车后面移动的树叶有很多像素。它们不应该得到很多智能。 图01 · 错误的目标吞噬模型 两种自监督目标 语言:预测下一个token the ball bounced to the left / right 离散选择。歧义可以保持明确。 视频:预测下一帧像素 average future 连续像素。歧义变成模糊。 生成式视频预测要求模型渲染每一个不确定性。JEPA改变了目标,使模型可以专注于重要的状态。 ## JEPA将损失移至意义空间 JEPA并不要求模型生成缺失的图像、帧、文本或动作。它要求模型预测一个嵌入。 这个设置很简洁: **编码X。编码Y。训练一个预测器将embedding(X)映射到embedding(Y)。** 这就是全部技巧。该系统仍然是预测性的,但它是在隐空间中预测。它预测未来的压缩表征,而不是原始的感官表面。 这就是为什么该架构并非仅仅作为品牌策略而"非生成式"。它之所以是非生成式的,因为生成表面通常是错误的任务。如果我问你杯子被推下桌子后会发生什么,你不需要幻觉出每一个光子。你需要的是有用的状态转换:杯子掉落,重力获胜,地板参与进来。 地板可不会被散文打动。 图02 · JEPA示意图 联合嵌入预测架构 上下文X:可见视频块 目标Y:缺失的未来状态 编码器:状态向量 目标编码器:目标向量 预测器:预测embedding(Y) 嵌入空间中的损失:匹配有意义的未来 无需像素重建。无需字幕。学习预测重要内容的表征。 目标不是"画出缺失的块"。目标是"预测缺失块的表征"。这一句话构成了大部分哲学转变。 ## 老问题:坍缩 联合嵌入系统有一个愚蠢的失败模式。如果目标说"使两个嵌入相似",模型可以通过对所有内容返回相同的嵌入来作弊。 狗?同一个向量。 卡车?同一个向量。 创始人假装路线图在掌控之中?同一个向量,不幸地合理。 这就是表征坍缩。损失看起来很开心。模型什么也没学到。 这里的历史很重要。LeCun在20世纪90年代研究过孪生网络。后来的对比学习系统通过使用负样本避免了坍缩:把匹配对拉近,把非匹配对推远。这很有效,但大规模使用时计算开销可能会变得很大。 Barlow Twins是其中一个更干净的转变。它不依赖大量的负样本,而是试图使两个扭曲视图之间的互相关矩阵看起来像单位矩阵。相同的特征应该在视图之间一致。不同的特征不应变得冗余。 这听起来很学术,直到你意识到它解锁了什么:一条可信的路径,让自监督视觉模型学习有用的表征,而无需重建像素,也无需将每个批次变成对比学习的笼中格斗。 2021年:Barlow Twins通过冗余减少攻击坍缩问题 2023年:I-JEPA预测图像目标块的表征 2025年:V-JEPA 2将视频世界模型扩展到超过一百万小时 LeCun 2022年的立场文件实际上并非关于在聊天上击败ChatGPT。而是关于自主机器智能。这意味着能够感知、预测、规划并随时间行动的系统。 世界模型是其中的引擎。 在时间**t**,智能体有一个状态。它想象一个动作。世界模型预测下一个状态。然后智能体搜索可能的动作序列,直到找到一个能导向目标的序列。 这听起来像经典控制,因为它就是经典控制,只是穿上了神经网络的外衣。新的部分是状态和转移模型是在隐表征中学习的,而不是用手写方程来写的。 对于简单系统,方程胜出。如果你是NASA且物理定律已知,就用方程。不要凭感觉编码轨道力学。 有趣的情况是混乱的系统:工厂、身体、化工厂、发动机、厨房里的机器人。这些系统你可以观察到模式,但无法干净地写出整个动力学模型。 图03 · 动作条件规划 世界模型作为动作搜索引擎 当前状态:图像、传感器、记忆 编码器:隐状态 z 预测器:z + 想象的动作 -> 预测状态(会发生什么?) 规划器:搜索动作序列,根据目标评分 推理变成了搜索,而非一步模仿 在机器人场景中,模型预测以动作为条件的下一个隐状态。规划意味着在接触真实世界之前,在学习的模型内部测试假设的动作。 ## 为什么LeCun一直批评VLA 视觉-语言-动作模型是当前令人印象深刻的机器人演示技术栈。它们接收摄像头帧、语言指令和机器人状态,然后输出动作。最好的演示确实令人惊叹。机器人叠衣服、移动物体、开锁,每个季度看起来都不再像实验室玩具。 LeCun的批评并非VLA演示是假的。而是学习信号对于鲁棒智能体来说是错误的。 大多数VLA系统严重依赖行为克隆。它们从演示中学习。这可以让你走得很远,但它有一个残酷的扩展问题:现实世界包含的变体比你数据集中的演示要多。 第二个批评更尖锐。VLA系统在行动时通常没有明确的学习模型来预测候选动作的后果。它们可能会内部推理。它们可能会泛化。但控制循环仍然过于接近"看到状态,输出动作,重复"。 LeCun的讽刺简洁有力:"VLA注定失败。" 我不会说得这么自信。VLA的人并非在睡觉。但批评在方向上是严肃的。如果你想要可靠的智能体,你最终需要一些东西可以在行动之前问:*如果我这样做,接下来会发生什么?* ### VLA风格的行为克隆 - 从演示中学习动作。 - 可以产生惊人的端到端机器人行为。 - 泛化取决于数据的覆盖范围和结构。 - 规划可能难以检查和控制。 ### JEPA风格的世界模型规划 - 从观察和动作条件视频中学习状态转移。 - 通过搜索预测的隐未来进行规划。 - 可以在不模仿精确人类轨迹的情况下解决任务。 - 仍然处于早期阶段,特别是对于长周期现实世界控制。 ## 目前实际有效的成果 诚实的回答:足以引起兴趣,但不足以宣布胜利。 I-JEPA表明,预测图像表征可以在没有手工数据增强的情况下学习语义视觉特征。V-JEPA将这一想法扩展到视频。V-JEPA 2则大力扩展:Meta报告称在超过100万小时的互联网视频上进行预训练,具备强大的运动理解能力、最先进的动作预期能力,以及在不到62小时的无标签机器人视频上训练动作条件模型后,实现了零样本机器人抓取放置。 最后一句话听起来像是基金申请书学会了举重。但细节很重要。 它不是一个通用的家庭机器人。它明天不会取代多模态大语言模型。它是一个研究系统,展示了隐视频预测可以支持物理环境中的理解、预测和规划。 VL-JEPA是另一个线索。它不是在训练期间自回归地生成答案token,而是预测目标文本的连续嵌入。在受控比较中,论文报告了更少的可训练参数却获得了更强的性能。这并没有杀死token生成。它说明了对于某些多模态任务,token生成可能是错误的训练目标。 LeWorldModel是更新的一部分,感觉更接近核心赌注。它从头到尾训练一个紧凑的JEPA世界模型,仅使用两个损失项,然后利用学到的隐模型进行规划。报告的系统小巧、快速,在几个控制任务上具有竞争力。但它仍然生活在受限环境中。这两件事可以同时成立。 证据指向何处 JEPA在物理和多模态问题的表征与规划框架方面最强。大语言模型在语言界面和推理主力方面最强。近期未来可能不是JEPA取代大语言模型。而是JEPA为智能体提供更好的世界状态层,而语言模型仍然是界面。 ## 困难在于时间 短周期预测是一回事。长周期行动是另一回事。 如果一个机器人需要推动一个方块,它可以预测几步之后。如果它需要清洁厨房十分钟,像素级细节就变成了毒药。你看得越远,你能负担的细节就越少。 LeCun的答案是层次结构。 低级模型预测短期细节。高级模型预测长期抽象。高级说"去机场"。低级处理鞋子、门、电梯、出租车、尴尬的人际互动,以及行李箱轮子决定今天就是它最后一天的事实。 这很可能是正确的形状。但这也是研究债务所在。从数据中学习正确的抽象层次结构不是一个微不足道的细节。它是问题的大部分。 > 一个无法跨时间规划的世界模型,只是一个更好看的表征。 ## 我的看法 LeCun关于缺失环节的判断是正确的。 他关于JEPA是否是实现该缺失环节的获胜方案,可能正确也可能不正确。 这是两个不同的主张。人们将它们混为一谈,因为讨论很懒惰,而Twitter训练每个人将细微差别简化为站队。我们可以做得更好。勉强,但依然可以。 大语言模型的道路给了我们语言能力、工具使用、编码、摘要、检索以及能够在宽容环境中完成有用工作的智能体外壳。这并非毫无意义。这是历史上最大的软件变革之一。 但在世界中运作的智能体需要的不仅仅是语言能力。它们需要预测状态。它们需要持久记忆。它们需要不确定性。它们需要规划。它们需要在执行之前模拟候选动作。 换句话说,它们需要像世界模型一样的东西。 未来几年有趣的问题不是JEPA能否在基准测试中获胜。而是它能否成为一种无聊的生产级基础组件。它能否扩展到混乱的长周期任务?它能否与语言模型集成而不变成另一种不透明的糊状物?它能否通过让智能体在现实行动之前搜索未来,从而使它们更加安全? 这才是标准。 不是酷炫的机器人视频。 不是带"世界模型"字样的论文标题。 而是一个能够行动的系统,因为它可以预测后果,并且能够充分解释这种预测,使人类操作员有理由信任它。 这是一条比扩展下一token预测更艰难的道路。 但它也可能更接近智能。 ## 来源 - 主要文本基础:伴随本文提供的两份Welch Labs JEPA播客文字稿。 - Yann LeCun, "A Path Towards Autonomous Machine Intelligence" (https://openreview.net/pdf?id=BZ5a1r-kVsf), 2022. - Barlow Twins: Self-Supervised Learning via Redundancy Reduction (https://arxiv.org/abs/2103.03230), 2021. - Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture (https://arxiv.org/abs/2301.08243), 2023. - Meta AI on V-JEPA (https://ai.meta.com/blog/v-jepa-yann-lecun-ai-model-video-joint-embedding-predictive-architecture/), 2024. - V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (https://arxiv.org/abs/2506.09985), 2025. - VL-JEPA: Joint Embedding Predictive Architecture for Vision-language (https://arxiv.org/abs/2512.10942), 2025 and 2026 revision. - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels (https://arxiv.org/abs/2603.19312), 2026. - Hierarchical Planning with Latent World Models (https://arxiv.org/abs/2604.03208), 2026. - TechCrunch on AMI Labs raising $1.03B (https://techcrunch.com/2026/03/09/yann-lecuns-ami-labs-raises-1-03-billion-to-build-world-models/), 2026. - Yann LeCun照片 (https://commons.wikimedia.org/wiki/File:Yann_LeCun_(29146901108).jpg),Jeremy Barande / École polytechnique Université Paris-Saclay, CC BY-SA 2.0.

相似文章

LeCun对世界模型的看法

Reddit r/artificial

Yann LeCun讨论了他在巴黎的新实验室AMI Labs,他专注于世界模型作为LLMs的替代方案,以及他对能够在物理世界中规划和行动的AI的愿景,该愿景得到了10亿美元投资的支持,并采用了JEPA架构。