为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势

arXiv cs.AI 论文

摘要

本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。

arXiv:2605.23972v1 公告类型:新 摘要:大型语言模型在语言生成和知识密集型任务中表现出色,但在需要因果推理、持久状态追踪和长时域规划的场景中仍存在局限。我们认为,这些局限可能源于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配。为形式化这一区别,我们引入了潜在动态推断(LDI),这是一种概念性视角,将语言和多模态观测解释为底层转移动态的部分证据。为实证研究这一视角,我们引入了Flux,一个完全通过自然语言规则指定的顺序推理环境。作为概念验证案例研究,这些规则首先被编译成一个显式状态转移模拟器,说明在某些情况下,结构化的潜在转移动态可以从文本规则描述中操作性地提取出来。这使得我们可以对纯文本观测下运行的LLM与直接在提取出的潜在状态空间内训练的强化学习智能体进行受控比较。在该案例研究中,能够显式访问潜在状态空间的智能体在长时域游戏过程中表现出更稳定的行为,总胜率约为79%,而LLM仅为11%。定性分析进一步揭示了与不稳定持久状态追踪一致的故障模式,包括无效动作、状态追踪错误和短时域推理失败。Flux环境的完整实现可在https://github.com/FeisalAlaswad/FLUX-RL-Agent获取。在评估的设置中,这些结果表明,如果没有持久状态追踪和转移建模机制,仅凭强大的序列预测可能难以支撑稳健的长时域动态推理。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:03

# 为何通往AGI需要世界模型:LLM的局限与世界模型的潜在超越
来源:https://arxiv.org/html/2605.23972
**Feisal Alaswad**
计算技术系,SRM科学与技术学院,印度泰米尔纳德邦卡滕库拉图尔603203
feisal\.alaswad@hotmail\.com
**Batoul Aljaddouh**
计算技术系,SRM科学与技术学院,印度泰米尔纳德邦卡滕库拉图尔603203
batoul\.aljaddouh@gmail\.com
**Maher Alrahhal**
生物传感与生物传感器组,智能自动化与通信技术研究所,科学与工程学院,沙迦大学,阿联酋
malrahhal@sharjah\.ac\.ae
**Poovammal E**
计算技术系,SRM科学与技术学院,印度泰米尔纳德邦卡滕库拉图尔603203
poovamme@srmist\.edu\.in
**Talal Bonny**
计算机工程系,计算与信息学学院,沙迦大学,阿联酋
tbonny@sharjah\.ac\.ae

###### 摘要

大型语言模型在语言生成和知识密集型任务中表现出色,但在需要因果推理、持久状态追踪和长时域规划的场景中仍然受限。我们认为,这些限制可能源于序列预测与对潜在环境动态进行推理这两者之间在目标层面的不匹配。为了形式化这一区别,我们引入了**潜在动态推断(LDI)**,这是一种概念性视角,将语言和多模态观测视为对底层转移动态的部分证据。为了从实证角度探究这一视角,我们引入了**Flux**,一个完全通过自然语言规则定义的序列推理环境。作为一个概念验证的案例研究,我们首先将规则编译为显式的状态转移模拟器,证明在某些情况下,结构化的潜在转移动态可以从文本规则描述中可操作地提取出来。这使得我们能够在仅处理文本观测的LLM与直接在提取的潜在状态空间中训练的强化学习智能体之间进行受控比较。在这个案例研究中,显式访问潜在状态空间的智能体在长时域游戏中表现出显著更稳定的行为,总胜率约为79%,而LLM仅为11%。定性分析进一步揭示了与不稳定的持久状态追踪相一致的失败模式,包括无效动作、状态追踪错误和短时域推理失败。Flux环境的完整实现可在https://github.com/FeisalAlaswad/FLUX-RL-Agent获取。在评估的设置中,这些结果表明,如果没有持久状态追踪和转移建模的机制,仅凭强大的序列预测可能难以支持稳健的长时域动态推理。

**关键词:** 通用人工智能,世界模型,大型语言模型(LLM),潜在动态推断,因果推理,长时域规划

## 1 引言

通过大规模自回归学习目标训练的模型,在自然语言理解、代码生成和多步推理等广泛任务中表现出了卓越的性能。这些模型利用庞大的文本语料库学习了丰富的语言统计表征,从而在观测数据分布内实现了令人印象深刻的泛化能力[19 (https://arxiv.org/html/2605.23972#bib.bib1), 26 (https://arxiv.org/html/2605.23972#bib.bib2), 35 (https://arxiv.org/html/2605.23972#bib.bib3), 15 (https://arxiv.org/html/2605.23972#bib.bib4), 2 (https://arxiv.org/html/2605.23972#bib.bib5)]。尽管取得了这些进展,越来越多的证据表明,在需要更深层次智能的场景中,LLM表现出了系统性的局限[27 (https://arxiv.org/html/2605.23972#bib.bib6), 30 (https://arxiv.org/html/2605.23972#bib.bib7), 22 (https://arxiv.org/html/2605.23972#bib.bib8), 1 (https://arxiv.org/html/2605.23972#bib.bib10), 9 (https://arxiv.org/html/2605.23972#bib.bib9)]。特别是,在以下场景中它们的性能会下降:

- • 因果推理与反事实推理,需要理解干预措施的影响[13 (https://arxiv.org/html/2605.23972#bib.bib11), 4 (https://arxiv.org/html/2605.23972#bib.bib12), 6 (https://arxiv.org/html/2605.23972#bib.bib13), 3 (https://arxiv.org/html/2605.23972#bib.bib14)]。
- • 在复杂且部分可观测环境中的长时域规划[28 (https://arxiv.org/html/2605.23972#bib.bib15), 29 (https://arxiv.org/html/2605.23972#bib.bib16), 31 (https://arxiv.org/html/2605.23972#bib.bib17)]。
- • 与物理或模拟智能体的接地交互[5 (https://arxiv.org/html/2605.23972#bib.bib18), 32 (https://arxiv.org/html/2605.23972#bib.bib19)]。
- • 环境模拟与未来状态的预测建模[5 (https://arxiv.org/html/2605.23972#bib.bib18), 7 (https://arxiv.org/html/2605.23972#bib.bib20)]。
- • 在不确定性和反馈下的状态化决策制定[33 (https://arxiv.org/html/2605.23972#bib.bib21)]。

这些局限暗示了一个重要的差距:高质量的序列预测并不一定能转化为对系统随时间如何演变的稳健建模。在许多现实世界中,有效推理需要建模状态转移、因果结构以及行动在动态环境中的后果[8 (https://arxiv.org/html/2605.23972#bib.bib22)]。这激发了人们对世界模型的研究:即那些维护显式潜在状态表征以及能够在行动或干预下对状态演化进行建模的转移动态的系统[24 (https://arxiv.org/html/2605.23972#bib.bib23), 11 (https://arxiv.org/html/2605.23972#bib.bib24)]。与自回归序列模型不同,世界模型在潜在环境状态上运行,而非仅仅在观测序列上运行,这使得因果预测、模拟和规划在结构上更加自然。

更广泛地说,这些局限对自回归序列建模作为通用人工智能(AGI)基础的适宜性提出了根本性质疑。许多关于通用智能的定义不仅强调语言流利度,还强调因果推理、规划、环境交互、长时域规划以及维护对不断演变的世界的连贯内部模型的能力。重要的是,一种竞争观点认为,足够大规模的LLM可能通过涌现能力近似出世界模型的行为。然而,我们认为这些限制可能部分源于为序列预测优化的目标与显式环境建模所需的目标之间的不匹配。尽管足够大规模的语言模型可能在受限环境中表现出类似于规划或因果推理的行为,但这种行为并非由自回归目标显式强制,因此在长时域或动态演变条件下可能仍然脆弱。

在这项工作中,我们分析了观测空间序列建模与潜在状态世界建模之间的区别。在此分析基础上,我们引入了**潜在动态推断(LDI)**的视角,该视角将语言解释为对底层环境动态的部分且有损的观测通道,而非孤立的符号序列。从这个角度看,学习可以被解释为一个跨空间推理问题,模型需要从观测数据中恢复潜在状态和转移结构。为了从实证角度探究这一假设,我们引入了**Flux**,这是一个新颖的序列推理环境,旨在比较观测空间推理与显式潜在状态规划。我们评估了前沿的LLM与直接在一个从自然语言规则中提取的形式化世界模型上操作的强化学习智能体,从而能够对动态推理、状态追踪和长时域规划行为进行受控分析。

本工作的主要贡献如下:

- • 我们形式化了自回归序列建模与潜在状态世界模型之间的区别,将其归结为观测预测与环境动态建模之间的目标层面不匹配。
- • 我们分析了这种不匹配对幻觉、因果推理、长时域一致性和接地决策制定的结构性影响。
- • 我们引入了**潜在动态推断(LDI)**,一种概念性视角,将语言和多模态观测解释为潜在状态轨迹和因果动态的间接证据。
- • 我们提出了**Flux**,一个完全通过自然语言规则定义的新颖序列游戏环境,旨在评估潜在状态推理和长时域规划。
- • 我们呈现了一个使用Flux的受控案例研究,作为概念验证,说明从自然语言观测中提取的潜在结构能够支持比仅基于观测空间推理更稳定的状态追踪和规划行为。

## 2 相关工作

LLM推动了人工智能的范式转变,在文本生成、代码合成和知识密集型推理任务中取得了显著成功[25 (https://arxiv.org/html/2605.23972#bib.bib26)]。然而,这种进展并未同等转化为那些智能从根本上根植于与动态环境交互的领域。诸如机器人技术、工业自动化、自动驾驶和手术决策支持等领域,受纯语言模型的改善微乎其微。实时交通控制、具身操作、自适应控制系统和AI辅助手术等任务需要连续状态估计、因果推理和长时域规划——这些能力并非自然由下一个词预测目标所支持[31 (https://arxiv.org/html/2605.23972#bib.bib17), 20 (https://arxiv.org/html/2605.23972#bib.bib25)]。

这一差距促成了越来越多的研究,探究LLM在静态文本基准测试之外的局限性。例如,幻觉已被广泛记录为一个系统性问题,模型输出连贯但事实错误的内容。这种行为越来越被理解为优化统计似然而不强制接地或事实一致性的后果。类似地,最近关于因果推理的研究表明,尽管LLM可以近似观测相关性,但它们在干预性和反事实推理方面存在困难,从而限制了它们在决策关键场景中的适用性[4 (https://arxiv.org/html/2605.23972#bib.bib12)]。

与此同时,强化学习(RL)和具身AI社区长期以来一直强调世界模型对智能行为的重要性。Ha和Schmidhuber的早期工作引入了学习环境紧凑潜在表征以实现模拟和控制的概念[11 (https://arxiv.org/html/2605.23972#bib.bib24)]。以此为基础,基于模型的RL方法(如Dreamer及其扩展DreamerV2、DreamerV3)表明,智能体可以学习潜在动态模型,并在完全想象的轨迹内进行规划[23 (https://arxiv.org/html/2605.23972#bib.bib27), 17 (https://arxiv.org/html/2605.23972#bib.bib28)]。这些方法强调了显式建模状态转移的重要性,而非仅仅依赖观测数据分布。进一步的进展包括PlaNet、MuZero及相关架构,它们将表征学习、动态建模和规划整合到统一框架中[14 (https://arxiv.org/html/2605.23972#bib.bib29), 10 (https://arxiv.org/html/2605.23972#bib.bib30)]。特别是MuZero表明,在隐含学习环境动态的同时,仍能在Atari和围棋等复杂领域取得强劲表现。总的来说,这些方法证明了学习并利用转移动态是复杂环境中有效决策的核心。

最近,将LLM与规划及搜索技术相结合的兴趣日益增长。诸如思维树提示、ReAct以及LLM引导的蒙特卡洛树搜索等方法试图增强语言模型的结构化推理能力[18 (https://arxiv.org/html/2605.23972#bib.bib31), 21 (https://arxiv.org/html/2605.23972#bib.bib32), 34 (https://arxiv.org/html/2605.23972#bib.bib33), 36 (https://arxiv.org/html/2605.23972#bib.bib34)]。尽管这些方法在结构化推理任务上提高了性能,但它们主要依赖外部脚手架,而非学习显式的环境动态。在桥接这一差距的努力也在多模态和具身AI系统中出现,其中语言与感知和行动相集成。然而,大多数现有方法将语言视为接口,而非学习环境结构的基质。因此,它们未能充分利用语言作为环境动态结构化信息来源的潜力。

与先前工作相比,本文探讨了一个假设:语言不仅可以作为接口或输出模态,还可以作为学习环境动态的结构化监督来源。我们在接下来的章节中通过将文本数据解释为潜在状态转移的间接观测,来形式化这一观点。

## 3 形式化分析:序列建模 vs. 世界模型

### 3.1 序列建模 vs. 世界模型

令 \( D \) 表示一个标记序列的数据集。自回归语言模型的训练目标是最大化期望对数似然:
\[
\max_{\theta} \mathbb{E}_{x \sim D} \sum_{t} \log P_{\theta}(x_t \mid x_{<t})
\]

自然语言语料库构成了对智能体与环境交互产生的轨迹的隐含、部分观测,并通过语言表征进行编码。这一视角将文本重新定义为动态过程的压缩且间接的记录,而非静态的符号数据。我们不再将语言视为最终产物,而是将其解释为一种观测通道,通过它间接表达出底层的状态转移和动作。在这种表述下,文本序列可以被解释为从一个潜在的潜在动态系统生成的观测。具体来说,一个标记序列 \( x_{1:T} \) 被假定来自一个相应的(未观测到的)轨迹:
\[
(s_1, a_1, s_2, a_2, \dots, s_T), \quad s_t \in \mathcal{S}, \; a_t \in \mathcal{A}
\]
其中 \( s_t \) 表示环境的潜在状态,\( a_t \) 表示导致转移的动作或事件。观测到的标记通过一个随机观测过程生成:
\[
x_t \sim P(x_t \mid s_t)
\]
如第3节所述,这个观测过程只提供对底层状态的部分访问,因为多个潜在配置可能对应相似的语言表达。在此视角下:
- • 标记对应于潜在状态的带噪且部分的观测。
- • 句子编码了局部化的转移或事件。
- • 话语和叙事捕捉了随时间扩展的轨迹。

考虑句子:
> “他打碎了玻璃杯,它碎了。”

这个语言观测可以映射到一个潜在的转移:
- • \( s_t \): 玻璃杯(完好),握住=True
- • \( a_t \): 松手/掉落
- • \( s_{t+1} \): 玻璃杯(破碎),在地板上=True

重要的是,这一视角意味着被建模的对象发生了转变。传统语言建模主要学习表征空间 \( \mathcal{X} \) 本身内部的关系,捕捉标记和序列之间的统计依赖性、语义关联和结构模式。在这种设置下,

相似文章

你认为World Models会通向AGI吗?

Reddit r/ArtificialInteligence

讨论World Models(通过学习内部环境表示来模拟物理和规划行动)是否能够克服类似LLMs的被动预测文本模型的局限性,从而通向AGI。