模拟一切,差不多如此:世界模型的承诺与局限
摘要
一篇Ars Technica的文章探讨了世界模型作为新兴人工智能范式的承诺与局限,将其与大语言模型进行对比,并邀请了专家就其在机器人、研究和资产生成中的应用提供见解。
<p>在过去的几年里,我们许多人经历了一场关于我们现在称之为人工智能的速成课程——但实际上,它主要是关于大语言模型的速成课程。然而,LLM越来越多地不再是唯一一个吸引高期望、大规模融资以及重大研究和产品开发的AI类别。</p>
<p>过去一年里,我们看到了大量关于被称为“世界模型”类别的新的公告,在未来的几个月和几年里,你可能还会看到更多的进展。</p>
<p>世界模型的目标是,代替或补充语言处理,为能够模拟物理世界(至少是一个有用的近似)的AI系统奠定基础。</p><p><a href="https://arstechnica.com/ai/2026/07/simulating-everything-sort-of-the-promise-and-limits-of-world-models/">阅读全文</a></p>
<p><a href="https://arstechnica.com/ai/2026/07/simulating-everything-sort-of-the-promise-and-limits-of-world-models/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/07/13 19:55
# 模拟一切,某种程度上:世界模型的承诺与局限
来源:https://arstechnica.com/ai/2026/07/simulating-everything-sort-of-the-promise-and-limits-of-world-models/
专家们解释它们如何工作、能做什么,以及哪些问题尚未解决。
[](https://cdn.arstechnica.net/wp-content/uploads/2026/07/cracking-open-world-model.jpg)
信用:Aurich Lawson | Getty Images
信用:Aurich Lawson | Getty Images
过去几年,我们许多人经历了一场关于所谓人工智能的速成班——但实际上,这主要是关于大型语言模型的速成班。然而,LLM 已不再是唯一承载高期望、巨额融资以及重大研究和产品开发的 AI 类别。
过去一年,我们在“世界模型”这一类别中看到了大量新公告,未来几个月和几年内你可能会看到更多进展。
世界模型旨在(替代或补充语言处理)为能够模拟物理世界(或至少是有用的近似)的 AI 系统奠定基础。
为了探讨这一想法的不同之处和重要性,Ars 采访了三位从事世界模型及相关技术的专家:麻省理工学院的 Vincent Sitzmann (https://www.vincentsitzmann.com/) 、Runway 的 Anastasis Germanidis (https://agermanidis.com/) 和 World Labs 的 Ben Mildenhall (https://bmild.github.io/) 。
从这些对话中我们了解到,虽然 LLM 作为产品是从界面(聊天)开始,然后寻找用例,但当前世界模型的主要玩家可能正朝着相反方向努力:他们从机器人的具体用例和应用、研究以及资产生成入手,但尚不清楚界面、系统和工具最终会是什么样子。
目录
## 从 LLM 幻灭中驶出的出口匝道
你很快就会看到,LLM 和世界模型在架构以及人们预期它们随时间改进的方式上有很多相似之处。不过,对某些人来说,它们被视为 LLM 局限性的潜在答案,尽管相关研究早于这种当代叙事。
“认为将 LLM 的能力扩展到足以达到人类智能水平的想法完全是胡说八道,”前 Meta 首席 AI 科学家 Yann LeCun 今年早些时候告诉《连线》杂志 (https://www.wired.com/story/yann-lecun-raises-dollar1-billion-to-build-ai-that-understands-the-physical-world/) 。LeCun 的观点在 AI 和 LLM 领域的一些人看来是反主流,但实际上他代表了一大批从业者的看法。
另见 Fei-Fei Li,计算机视觉先驱,共同创立了 World Labs——一家致力于世界模型的新公司。她在去年年底的一篇 Substack 文章中写道 (https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence):
> 如今,领先的 AI 技术,如大型语言模型 (LLM),已经开始改变我们获取和处理抽象知识的方式。然而,它们仍然是黑暗中的文字大师;口才了得但经验不足,知识丰富但缺乏根基。空间智能将改变我们创建和交互真实及虚拟世界的方式——彻底变革叙事、创造力、机器人、科学发现等领域。这是 AI 的下一个前沿。
LeCun 和 Li 的企业都建立在这些想法之上,所以他们这么说并不意外。但你也会从一些主要仍在研究 LLM 的知名人物那里看到类似情绪。
“我认为我们正处于 LLM 泡沫中,而这个泡沫明年可能就会破裂,”Hugging Face(一个托管各种 LLM 仓库的平台)的 CEO Clem Delangue 说道 (https://techcrunch.com/2025/11/18/hugging-face-ceo-says-were-in-an-llm-bubble-not-an-ai-bubble/) 。“但‘LLM’只是 AI 的一个子集,当涉及到将 AI 应用于生物学、化学、图像、音频、视频时,”Delangue 在一次会议上补充道。“我认为我们才刚刚开始,未来几年会看到更多发展。”
## 财务热潮
仅在过去的几个月里,世界模型就从研究课题(当然现在仍是)发展为新的商业项目和巨额融资的基础。几个关键例子:
- 八月,Google DeepMind 发布了 Genie 3 (https://arstechnica.com/ai/2025/08/deepmind-reveals-genie-3-world-model-that-creates-real-time-interactive-simulations/) ,一个在视频生成模型基础上构建实时交互性的模型。
- 十一月,World Labs 推出了 Marble (https://www.worldlabs.ai/blog/marble-world-model) ,一个模型和工具集,允许用户基于文本、图像、视频或其他资产输入,生成可导出为 3D 资产的沉浸式环境。
- 仅仅一个月后,视频生成和电影制作 AI 公司 Runway 宣布了 GWM-1 (https://arstechnica.com/ai/2025/12/with-gwm-1-family-of-world-models-runway-shows-ambitions-beyond-hollywood/) ,一系列基于 Runway 过去视频模型工作构建的专业世界模型。
- 更近一些,Yann LeCun 成立了 Advanced Machine Intelligence (AMI) (https://amilabs.xyz/) ,一家押注 AI 系统真正未来在于与物理世界交互(或至少模拟)的模型,而不仅仅是语言的公司。
这些以及类似的努力获得了大量资金。World Labs 和 AMI 据报道分别在 2 月 (https://techcrunch.com/2026/02/18/world-labs-lands-200m-from-autodesk-to-bring-world-models-into-3d-workflows/) 和 3 月 (https://techcrunch.com/2026/03/09/yann-lecuns-ami-labs-raises-1-03-billion-to-build-world-models/) 各筹集了约 10 亿美元,Runway 也在 2 月筹集了 3.15 亿美元 (https://techcrunch.com/2026/02/10/ai-video-startup-runway-raises-315m-at-5-3b-valuation-eyes-more-capable-world-models/) 。
围绕世界模型的一些活动至少部分旨在构建 AGI 或超级智能的基础,但大多数从事这方面工作的人谈论的是实际应用:训练、测试和驱动机器人;为游戏开发和电影制作生成 3D 资产;科学模拟和建模等等。
不过要注意的是,“世界模型”是一个总称,经常被含糊地使用,缺乏明确定义。
## 定义“世界模型”
“这绝对是一个过载的术语,”Vincent Sitzmann 在与我就世界模型的研究和概念进行长时间对话时告诉我。
Sitzmann (https://www.vincentsitzmann.com/) 是麻省理工学院的助理教授,发表了关于神经渲染、视觉计算和机器人学的研究。他领导麻省理工学院计算机科学与人工智能实验室 (CSAIL) 内的场景表示小组 (https://scenerepresentations.org/) 。
[](https://cdn.arstechnica.net/wp-content/uploads/2026/06/Vincent-Sitzmann-headshot.jpg)
Vincent Sitzmann 领导 MIT CSAIL 的场景表示小组。
Vincent Sitzmann 领导 MIT CSAIL 的场景表示小组。信用:MIT (https://executive.mit.edu/faculty/vincent-sitzmann-003U100000QSrX6IAL.html)
当被要求给出定义时,他只是将世界模型描述为任何接受一次交互的模型,“根据那次交互,它使你能够模拟某个环境中接下来会发生什么。”
在十二月发布其 GWM-1 系列模型时,Runway 将世界模型定义为 (https://runwayml.com/research/introducing-runway-gwm-1) “一个 AI 系统,它构建环境的内部表示,并使用它来模拟该环境中的未来事件。”Runway 补充道,“通用世界模型的目标是表示和模拟广泛的情况和交互——比如在现实世界中遇到的那些。”
我还与 Ben Mildenhall 进行了交谈,他是 World Labs 的联合创始人,前 Google 计算机视觉和物理研究员,也是神经辐射场 (NeRF) (https://arxiv.org/abs/2003.08934) 的共同创建者——这是一种从 2D 图像构建可导航 3D 场景的方法,格式可微,因此在机器学习环境中很有用。
一群大多穿着连帽衫的人合影 (https://cdn.arstechnica.net/wp-content/uploads/2026/06/Mildenhall-Li.jpg)
World Labs 团队合影。左边和中间穿黑色连帽衫的是 Ben Mildenhall;他左边也穿黑色连帽衫的是联合创始人 Fei-Fei Li。
World Labs 团队合影。左边和中间穿黑色连帽衫的是 Ben Mildenhall;他左边也穿黑色连帽衫的是联合创始人 Fei-Fei Li。信用:World Labs (https://www.worldlabs.ai/about)
“将其与 LLM 区分开来的关键因素是展示空间和——或许缺乏更好的词——连续理解的程度,”他说。“与 LLM 交互的一个非常突出的方面是它们是基于回合的。”意思是,用户输入一些文本,暂停,然后得到一段文本回复。相比之下,他将世界模型视为一个同步的实时系统。
“定义世界模型的一个因素是你在与空间世界交互时拥有的自由度,你不需要经历这种中介的线性旅程——先 A 然后 B 然后 A 然后 B 然后 A 然后 B,”他说。当用户或智能体利用世界模型时,他们“实际上能够像对待某种世界一样与之交互,并持续采取行动”,其中“同时发生着并行的事情。”
Mildenhall 的联合创始人 Fei-Fei Li 曾写道 (https://drfeifei.substack.com/p/from-words-to-worlds-spatial-intelligence) ,她认为定义世界模型有三个标准:世界模型“能够生成具有感知、几何和物理一致性的世界”,“天生是多模态的”,并且“能够根据输入动作输出下一个状态。”
这个短语本身并不新鲜;它早已出现在强化学习和机器人学中,用于描述预测环境动态的模型。新的是,试图将这一想法扩展到通用、生成式系统,并在大规模视觉和多模态数据上训练。巨额融资也相对较新。
事实是,存在多种方法和定义。“问 Runway,问我们,问任何人——我们都会给出稍微不同的术语,”Mildenhall 说。
此外,重要的是要意识到“世界模型”正在成为一个品牌术语,与技术术语一样。它被用作营销标签,可以涵盖从基于动作的视频生成到 3D 资产创建再到机器人策略评估的各种内容。虽然人们相信一个基础模型应该能够解决许多这类问题,但公司正在使用这个术语,同时用不同的方法解决不同的技术问题。
## 视频基础
“如今,大多数人提到‘世界模型’时,指的是生成像素,也就是根据动作生成逼真的视频,”Sitzmann 说。
过去几年,我们看到视频生成模型获得了关注。例如,Runway 将其声誉建立在制作视频模型和相关工具上,这些工具被电影制作人 (https://arstechnica.com/culture/2025/06/curated-realities-an-ai-film-festival-and-the-future-of-human-expression/) 、广告商和其他创意领域人员使用。现在焦点已经转移,公司明确表示打算扩展到这些领域之外,专注于像 GWM-1 这样的世界模型,并着眼于未来几年在机器人等领域的应用。
这看起来可能是一个令人震惊的横向转变,但如果你考虑这些世界模型是如何开发的,这是一个自然的下一步。在许多情况下,它们是之前视频模型工作的直接扩展。
“我们开始意识到短格式视频生成任务之外还有更多东西的时刻之一是我们发布相机控制的时候,这样你可以引导相机在场景中移动,”Runway 的 CTO Anastasis Germanidis 在十二月份与我谈论 GWM-1 时说道。“它开始感觉更像一个视频游戏,你在探索这个世界并移动。感觉不再只是创建视频,而是探索一个由这个模型持续渲染的环境。”
一个穿着黑色连帽衫的男人在舞台上做手势说话 (https://cdn.arstechnica.net/wp-content/uploads/2026/06/Anastasis-Germanidis.jpg)
Runway CTO Anastasis Germanidis 在 Cerebral Valley Voice Summit 上发表演讲。
Runway CTO Anastasis Germanidis 在 Cerebral Valley Voice Summit 上发表演讲。信用:Newcomer AI Summits (https://www.youtube.com/watch?v=MQ_5RNvwJYA)
大多数视频扩散模型 (https://www.ibm.com/think/topics/diffusion-models) 同时生成多个帧,一次性去噪 (https://blogs.nvidia.com/blog/what-is-denoising/) 整个序列。
(去噪是许多 AI 图像和视频生成器背后的核心机制。模型从一张充满随机噪声的静态图像或帧开始,去噪过程迭代地预测更清晰的版本,由训练期间学到的模式引导,直到图像解析为最终输出。)
这种方法在连贯性和质量方面有优势,因为每个帧都是在不仅了解过去帧是什么、而且了解未来帧应该是什么的背景下生成的。这对于生成固定长度的视频很好,但不适合世界模型所需的开放式模拟和交互性。用户无法有意义地干预输入并看到即时结果。
对于基于视频的世界模型,一种广泛采用的答案是自回归 (https://en.wikipedia.org/wiki/Autoregressive_model) 扩散,它仍然是一个去噪过程,但帧是顺序去噪的。
Germanidis 在描述 GWM-1 的工作方式时这样解释:
> 通过一次性生成所有帧……未来可以影响过去。你创造的内容没有这种因果性质。因此,与我们采用 GWM 的自回归扩散方法不同,你基本上一次只去噪一帧或几帧。所以你去噪这些帧,呈现给用户,用户可以提供影响下一帧的动作。
这种方法也有一些缺点。它计算成本极高,因为每批帧都需要完整的去噪过程,并且每个帧都需要足够快地分辨出来,以便用户体验到对其输入的及时响应。
此外,模拟会漂移并随时间遗忘早期帧中的信息。“如果你在一个房间里,你离开房间,再回来,你需要确保房间的所有细节都保留在模型的上下文和记忆中,”Germanidis 说。
这些是即使在最大、最前沿的模型中仍在解决中的难题。
### 苦涩的教训
“我们的总体方法是,3D 一致性和状态性应该通过规模和仅仅预测 2D 像素而涌现,”Germanidis 说。“所以我们应该尽可能避免引入任何特定技术来告诉模型这是一个 3D 场景,并且你需要使用这个 3D 表示来指导模型。”
这反映了该领域一个被广泛接受的想法,称为“苦涩的教训”,它源自计算机科学家和强化学习先驱 Richard Sutton 的一篇短篇但有影响力的文章 (http://www.incompleteideas.net/IncIdeas/BitterLesson.html) 。
相似文章
World Models Explained: What Every AI Is Missing
文章详细解释了世界模型的概念,将其与LLM对比,介绍了两大阵营(像素预测与意义预测)及Dreamer v3、GameNGen、Genie、JEPA等代表性工作,并讨论了在自动驾驶和机器人领域的应用,指出世界模型是物理AI的关键组件。
世界模型或将改变一切(20分钟阅读)
文章探讨了世界模型对AI可能产生的范式变革性影响,重点介绍了Yann LeCun和Fei-Fei Li等人在该技术领域的投入,认为其有望成为当前LLM范式的继任者。
你认为World Models会通向AGI吗?
讨论World Models(通过学习内部环境表示来模拟物理和规划行动)是否能够克服类似LLMs的被动预测文本模型的局限性,从而通向AGI。
从生成到模拟:世界模型距离真正的模拟器还有多远?
本文系统性地评估了生成式世界模型在八个能力上与传统模拟器的对比,发现在交互性和可控性方面取得了进展,但在物理保证、状态反馈和长期稳定性方面存在差距。
人工智能的下一步?我们看好世界模型(5分钟阅读)
文章认为,世界模型使人工智能系统能够表示环境、预测结果并做出决策,正在成为下一个主要的人工智能范式,正如著名研究者如Yann LeCun、Demis Hassabis和Fei-Fei Li的共识所示。