那么,Yann LeCun 的 "World Models" 和 JEPA 究竟是什么?它真的能替代 LLM 吗?
摘要
讨论了 Yann LeCun 近期 arXiv 论文中的 "World Models" 和 JEPA,澄清了它并非 LLM 的替代品,而是一个针对机器人、自动驾驶和工业控制等领域视觉处理优化的模型。
这个话题有点晚了,因为[白皮书发布在 arXiv 上](https://arxiv.org/abs/2603.19312)差不多两个月前,但这里没人提过,所以我想还是说说。先说点背景。Yann LeCun 是深度学习和卷积神经网络的先驱,曾担任 Meta(前 Facebook)的 AI 研究总监和首席 AI 科学家,后来在[在 "有趣" 的](https://www.businessinsider.com/yann-lecun-alexandr-wang-criticism-inexperienced-meta-ai-future-2026-1)[情况下](https://www.businessinsider.com/yann-lecun-alexandr-wang-criticism-inexperienced-meta-ai-future-2026-1)离开 Meta,并于 2025 年成为 Advanced Machine Intelligence (AMI Labs) 的执行主席。他因对人工智能的基础性贡献而获得 2018 年 ACM 图灵奖。arXiv 论文中描述的 "LeWorldModel" 似乎不是[LLM 的 "替代品"](https://www.youtube.com/watch?v=6uW_GZdX1rU&t=67s)。AI 领域对此存在很多混淆。[在采访中](https://www.youtube.com/watch?v=ngBraLDqzdI&t=357s),Yann 非常明确地表示,他认为 LLM 仍然具有重要价值。这不是一个二选一的问题。总之,据我所见,JEPA 模型并非针对语言优化,而是针对[需要视觉处理的 AI](https://arxiv.org/abs/2506.09985),例如机器人、自动驾驶和工业控制。JEPA 不像 LLM 那样处理语言,它处理的是像素。总之,想知道这里是否有人有其他想法或不同意。
相似文章
LeCun对世界模型的看法
Yann LeCun讨论了他在巴黎的新实验室AMI Labs,他专注于世界模型作为LLMs的替代方案,以及他对能够在物理世界中规划和行动的AI的愿景,该愿景得到了10亿美元投资的支持,并采用了JEPA架构。
@AbdelStark: 是时候让世界服下JEPA药丸了!awesome-jepa:一份精心整理的论文、模型、代码、数据集和学习资源列表……
一份精心整理的关于Joint Embedding Predictive Architectures(JEPA)的论文、模型、代码、数据集和学习资源列表,这是Yann LeCun提出的用于世界模型的自监督方法。
Sub-JEPA:对LeCun团队的LeWorldModel的一个简单修复,可一致提升性能 [P]
Sub-JEPA通过在冻结的随机正交子空间中应用高斯正则化来改进LeWorldModel,在基准测试中一致优于原始版本,改进幅度高达+10.7个百分点。
Yann LeCun 的赌注:智能始于世界
对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。
@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……
VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。