World Labs' Fei-Fei Li on Creating Large World Models
摘要
李飞飞阐述World Labs专注于构建大型世界模型以解锁空间智能,认为这是继语言模型后的下一个前沿,并从进化史、应用场景、技术分类等角度论证其价值,同时表达了对AI安全务实态度和教育变革必要性的看法。
暂无内容
查看缓存全文
缓存时间: 2026/06/05 11:11
TL;DR: 李飞飞阐述了她联合创立的World Labs专注于构建大型世界模型以解锁空间智能,认为这是继语言模型后的下一个前沿,并从进化史、应用场景、技术分类(渲染器、规划器、模拟器)等角度论证其价值,同时表达了对AI安全务实态度、教育变革必要性的看法。
## 大型世界模型与空间智能
所有人都把注意力集中在大型语言模型ChatGPT和Claude上,但你却筹集了10亿美元,构建了不同的东西。大型世界模型为我们提供了理由。你押注于什么别人没有押注?嗯,这是我联合创立的创业公司,我们全身心投入空间智能。实现空间智能的手段是构建大型世界模型。那么我们的理由是什么?我们的理由是一个长达5亿年的故事:动物智能始于在物理世界中的看和移动。进化始于我们作为动物,知道世界是什么,知道我们是谁,知道如何移动、如何与之互动。人类生活、工作、私人生活的很大一部分与感知、理解、推理以及与世界的互动有关,包括创意、生产力和虚拟世界的想象世界。因此,解锁机器中的这种能力——生成陌生的3D、4D世界的能力,在任何世界中推理的能力,以及教导智能体或机器人、或帮助人类与世界互动的能力——正是空间智能的意义所在。这就是我们专注的领域。
## 世界模型能做什么语言模型不能做
消灭文字。用文字灭火,或煎一个蛋饼?嗯。我认为,创造力方面,人们设计东西。无论是设计室内空间、机器、家居还是故事。很多都超出了文字的范围。我们也使用智能体,无论是在虚拟世界中用于娱乐如游戏,还是用于更严肃的工业应用,如数字孪生设计、检测或优化任务。或者我们构建机器人来帮助我们做很多事情,从灭火到医疗场景再到制造业,这些都是解锁空间智能和构建世界模型的下游应用。
## 世界模型的“ChatGPT时刻”会是什么样子
这是个好问题,Emily,因为聊天是一种消费行为,ChatGPT时刻通常用来描述一个病毒式的、公众的消费时刻,让人感觉接近我能在世界模型领域做的事情。我们试图解锁的空间智能。我仍在试图弄清楚是否存在对应的消费时刻,因为我们讨论的应用往往首先进入专业人士——专业创作者、设计师、开发者、研究人员和工程师——他们将其用于机器人、工业设计等。所以可能未必有一个消费时刻,但也可能有。我很想用一种更简单的方式设计我的家,比如点击一下就能改变窗帘的颜色。听起来很酷。
## 世界模型的分类与优势:渲染器、规划器、模拟器
在过去六个月里,Jonathan最后开始研究世界模型。Google推出了Project Genie。Nvidia有自己的世界模型Cosmos。Nvidia也是你的投资者之一。你有什么是他们没有的?在竞争对手中,你最大的优势在哪里?嗯,首先,我们在2024年开始了这项工作。我仍然记得当我们出去谈论我们的模型和空间智能时,仅仅一年后,人们还在谈论大语言模型。所以我们确实在理解这将是下一个前沿方面有了先发优势。我对此非常兴奋。那么,他们有什么是我们没有的?首先,我认为我们有一个不可思议的团队。我们有信念。他们肯定没有教母。但世界很大,我认为这就像大语言模型一样,会有很多公司在世界模型方面做出令人难以置信的工作。就在24小时前,我们对“世界模型”这个词被如此混淆并以多种不同方式使用感到厌烦,所以我们实际上发布了一篇博客,解释什么是世界模型的功能分类法,而不是把所有东西混为一谈。
在我看来,目前有三种被称为世界模型的方式,与空间智能相关。第一种我称之为**渲染器**,模型在屏幕上生成美丽的像素,大多像视频生成模型,消费者主要是人眼。虽然模型承诺生成美丽的像素,但它不一定承诺物理、动力学和几何正确性。因为那只是服务于人类视觉消费,不一定用于计算和其他任务。另一种世界模型我们称之为**规划器**,更适用于机器和机器人,它输出基于输入的世界状态或动作的正确下一步动作。这种世界模型在机器人应用中很常见,并且你在那种语境下会听到它。第三种,我认为是三者中的关键,是**模拟器**。它既被人类也被机器消费,试图尊重世界的结构、物理和动力学,真正模拟3D、4D信息以及语义信息。模拟器可以变成渲染器,也可以变成规划器,但这一层在我看来是解锁空间智能的关键路径。这就是我们的实验室正在努力的方向。
## 机器人技术与世界模型:缩小炒作与现实差距
这一切都与机器人技术有关。我想听听你对这个领域以及特别是人形机器人的看法。人形机器人的资金达到了60亿美元。但它们仍然不能像你一样快地装好我的洗碗机,也不能帮我取亚马逊包裹。世界模型和世界实验室能缩小炒作与现实之间的差距吗?这是有意为之的问题,Emily。首先,这是我的工作。我明白。首先,机器人技术将是人类工业化中最重要的革命之一。60亿美元太小了,对吧?看看自动驾驶汽车的投资,看看语言模型的投资,所需资金远超60亿美元。我不是说现在就是这样。我认为投资需要时间,也希望能不是炒作,而是深思熟虑地投资于正确的努力。例如,解锁世界建模、空间智能和模拟层,都是这一重要努力的一部分。我们能缩小差距吗?我确实相信世界实验室正在研究物理智能领域最关键的技術之一。显然,这就是希望所在。
## AI安全:警惕危言耸听,注重科学基础
你在AI安全方面更为谨慎,对末日论和过度监管持怀疑态度。纵观整个行业,你觉得哪里是真正的安全工作,哪里是安全表演?有人做对了吗?总的来说,我对任何危言耸听的言论都更加谨慎,说实话这让我很无趣。我认为炒作太多。显然,我们需要构建正确的技术,我们需要为技术设置护栏。无论你用负责任、安全还是可信赖这个词,构建正确的技术和产品,使其能够赋能、增强、提升人类而不是伤害他们,是我们所有工作的目标,无论是不是AI。哪里做对了?我真的希望每家公司、每个正在构建的产品,背后的人都非常注意这一点,并思考我们使用什么数据、构建什么系统、进行什么评估、设置什么护栏、如何与用户和客户沟通、如何与监管机构合作,以便在关键时刻我们是负责任的。我确实相信很多工作正在进行,而不是在表演。例如,制药和医疗保健行业,公司正在整合AI。我实际上刚从医院赶来参加你的讨论,因为我的家人即将在一个小时内接受手术。我刚才在病房里看到AI已经在被使用以及可能在哪里被使用,它已经在发生了。医生使用AI帮助记录病历,放射科医生使用AI辅助阅读MRI和CT扫描。我确实希望我们有更多AI帮助护士和家属。昨晚我拿到了一份很长的放射报告,我做的第一件事就是把它发给AI,让它们帮我解释。所以这一切都在发生,安全措施也在发生。但需要更多以正确的方式、以科学基础的方式进行。这应该是正在进行的对话,而不是你说的表演。
## 教育变革:AI必须改变学习方式
我们都是母亲,都有十几岁的孩子。你认为AI将如何改变大学学习?它必须改变学习。它必须改变K到16年级的学习。我认为这是未来十年人类最大的机遇之一。因为世界上最宝贵的资源是人力资本。当我们有了一项技术,可以回答标准化考试——从普通核心考试到国际数学奥林匹克竞赛——并且比平均人类做得更好,那么这不是人类不好,而是我们需要改变教育系统。我们需要改变评估方式,改变赋能教师教学的方式,教育下一代学生,让他们能够使用这些工具和力量,做我们从未想象过的事情。那么你认为我们的孩子还会学习吗?当然,如果我们正确教导他们,社会为他们做好准备。今天所有的孩子都不应该害怕AI。他们应该感受到人类的能动性,去领导AI、正确使用AI,并利用AI对世界产生他们想要的影响。
## 对AGI的看法:不参与该术语,专注于科学探索
Anthropic的CEO Dario Amodei 认为AGI将在2到3年内到来,通过扩展当前范式就能实现。Demis Hassabis 说我们处于奇点的山麓。你说过你甚至不参与AGI这个术语。他们错了吗?还是说分歧在于我们称之为目标的名称?我不参与AGI这个术语,因为人工智能作为科学领域的奠基者们有一个关于思考和行动的机器的梦想。这是一项科学探索,也是我一生的职业,我仍然在这条探索之路上。现在,我正在将这项科学探索与制造能够改善人们生活的产品结合起来。这就是被称为人工智能的领域。别人叫它什么都可以,叫它苹果也行。我专注于构建一项技术,能够真正改变人们的生活和工作。
## 未来展望:空间智能模型将激发新机会
今年你会推出什么,让我们明年还在谈论它?我希望我们将推出一个关于空间智能的模型,它将激发人们从未见过的、令人难以置信的激动人心的产品机会。
*Source: https://youtu.be/pNYVckbCFuk*
相似文章
走进李飞飞新创办的10亿美元AI公司World Labs
李飞飞的World Labs专注于空间智能AI,融资10亿美元,标志着从大语言模型向世界模型的转变。
@drfeifei: https://x.com/drfeifei/status/2062247238143996275
Fei-Fei Li与World Labs团队提出了世界模型的功能分类法,区分了渲染器、物理引擎以及在强化学习循环中的其他组件,并论证空间智能是人工智能的下一个前沿。
World Models Explained: What Every AI Is Missing
文章详细解释了世界模型的概念,将其与LLM对比,介绍了两大阵营(像素预测与意义预测)及Dreamer v3、GameNGen、Genie、JEPA等代表性工作,并讨论了在自动驾驶和机器人领域的应用,指出世界模型是物理AI的关键组件。
@JonhernandezIA:前 Google 首席科学家 Fei-Fei Li 表示,业界对语言模型的过度聚焦十分危险。大部分真实……
前 Google 首席科学家 Fei-Fei Li 批评了 AI 行业对语言模型的过度关注,她指出,只有当系统通过视觉充分理解物理与空间世界时,真正的 AI 基础设施才会出现。
LeCun对世界模型的看法
Yann LeCun讨论了他在巴黎的新实验室AMI Labs,他专注于世界模型作为LLMs的替代方案,以及他对能够在物理世界中规划和行动的AI的愿景,该愿景得到了10亿美元投资的支持,并采用了JEPA架构。