迈向基于信念的LLM智能体世界模型
摘要
本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。
arXiv:2609.00455v1 Announce Type: new
摘要:大型语言模型(LLMs)正被用作多个领域中自主决策和规划的策略。尽管其推理能力强,但LLMs在长时间任务上存在困难,尤其是在部分可观测性下。世界模型是一种提升策略性能的有希望方法,无论在训练还是推理阶段。在推理时,智能体目前使用世界模型在采取行动前模拟候选行动的后果,这可以改进决策。然而,我们论证,在部分可观测性下,仅模拟是决策的不完整接口:模拟无法充分捕捉当前状态的不确定性,而智能体可能需要这些不确定性来做出准确决策。我们通过基于信念的世界模型(BB-WMs)来解决这一限制,它建模并维护一个信念,LLMs可以查询该信念以获取关于当前状态已知和不确定的信息。在开发学习准确BB-WMs的方法之前,我们首先提出一个更基本的问题:将世界模型的信念直接暴露给LLM策略是否能改善决策?我们的结果显示,让LLM智能体访问世界模型的信念可以改善部分可观测性下的任务性能,同时与现有的基于模拟的世界模型互补。代码发布在 https://github.com/skumar-ml/belief-world-models。
查看缓存全文
缓存时间: 2026/09/02 06:03
# 面向大型语言模型智能体的基于信念的世界模型
来源:https://arxiv.org/html/2609.00455
\\workshoptitle 持续世界模型
Harshit Kumar
隶属机构:IBM
Narendra Ahuja
隶属机构:UIUC
Saurabh Jha
隶属机构:IBM
###### 摘要
大型语言模型(LLMs)正被用作许多领域中自主决策和规划的策略。尽管其推理能力强大,但LLMs在长期任务中仍面临挑战,尤其是在部分可观察环境中。世界模型是提升策略性能的一种有前途的方法,无论是在训练还是推理阶段。在推理过程中,智能体目前使用世界模型来模拟候选行动的结果,然后再执行行动,这可以改善决策。然而,我们论证,仅靠模拟在部分可观察环境下的决策中是不完整的:模拟无法充分捕捉关于当前状态的不确定性,而智能体可能需要这种信息以做出准确决策。我们通过基于信念的世界模型(BB-WMs)来解决这一局限性,它建模并维护一个信念,LLMs可以查询该信念以获取关于当前状态已知和不确定的信息。在开发学习准确BB-WMs的方法之前,我们首先提出一个更根本的问题:将世界模型的信念直接暴露给LLM策略是否能改善决策?我们的结果表明,让LLM智能体访问世界模型的信念可以在部分可观察环境中改善任务性能,同时与现有的基于模拟的世界模型互补。代码发布:https://github.com/skumar-ml/belief-world-models。
## 1 引言
“我早就告诉过你了。” 当我们早期的预测成真时,会这么说。但我们如何能够预测未来?假说[27 (https://arxiv.org/html/2609.00455#bib.bib1), 36 (https://arxiv.org/html/2609.00455#bib.bib2)]认为,人类使用一个内部世界模型(或世界模型)来预测可能行动的结果,这可能是一种进化优势(预测猎物位置有利于狩猎),并且可能对现代规划和探索很重要[23 (https://arxiv.org/html/2609.00455#bib.bib3), 36 (https://arxiv.org/html/2609.00455#bib.bib2)]。鉴于其对人类的益处,已有方法探索将世界模型与自主策略集成,该策略根据可用信息决定智能体应采取的行动。策略不必进行代价高昂的真实世界交互,而是可以在世界模型生成的想象未来轨迹上进行训练[8 (https://arxiv.org/html/2609.00455#bib.bib6), 7 (https://arxiv.org/html/2609.00455#bib.bib8)]。世界模型的训练目标也可以与强化学习结合使用,以改善策略本身[45 (https://arxiv.org/html/2609.00455#bib.bib10), 32 (https://arxiv.org/html/2609.00455#bib.bib11), 37 (https://arxiv.org/html/2609.00455#bib.bib12)]。在测试时,来自世界模型的模拟未来可以帮助策略评估候选行动,从而改善长期规划和向新情况的泛化[26 (https://arxiv.org/html/2609.00455#bib.bib7), 47 (https://arxiv.org/html/2609.00455#bib.bib5), 11 (https://arxiv.org/html/2609.00455#bib.bib14), 17 (https://arxiv.org/html/2609.00455#bib.bib15), 31 (https://arxiv.org/html/2609.00455#bib.bib16)]。
本工作研究世界模型在测试时的使用。在许多近期方法中,策略通过模拟接口与世界模型交互:给定当前状态和候选行动(或行动序列)的表示,会跟随怎样的未来轨迹?我们提出一个更广泛的问题:模拟是否是世界模型应向策略暴露的唯一接口?我们主张不是;不同类型的行动需要从世界模型获取不同类型的信息。考虑**务实行动**,主要推动智能体朝向其目标(例如,拿起杯子以喝咖啡)。模拟非常适合这些行动,因为它有助于评估行动的后果。相比之下,**认知行动**是信息收集行动,主要减少关于环境当前状态的不确定性[19 (https://arxiv.org/html/2609.00455#bib.bib17), 22 (https://arxiv.org/html/2609.00455#bib.bib18)]。在这种情况下,策略还受益于关于当前状态的**信念**——已知什么和不确定什么——以推理是否需要认知行动。模拟接口可能仅通过预测未来的变化间接传达当前状态的不确定性。这种变化可能将当前状态的不确定性与未来转换中的随机性混为一谈,让策略推断当前哪些方面仍然不确定。此外,通过预测未来恢复这种不确定性在规划范围增加时变得越来越样本低效。因此,我们主张当前状态的信念应直接暴露,而不是从未来模拟中间接重建(如图1 [https://arxiv.org/html/2609.00455#S1.F1]所示)。
图1:模拟与信念的认知行动对比。考虑一辆车尝试变道到左侧的**务实行动**,但盲点未知。在变道之前,基于模拟的世界模型可能采样变道安全的未来(即,盲点中没有车)。策略可能随后执行该行动,却遇到盲点中的车。通过基于信念的世界模型,策略可以查询关于盲点的当前信念,如果有不确定性,它可以在选择适当的务实行动之前采取适当的**认知行动**(例如,检查盲点)。
最近,大型语言模型(LLM)智能体已成为开放环境中的通用策略,涵盖软件工程和企业自动化[42 (https://arxiv.org/html/2609.00455#bib.bib35), 4 (https://arxiv.org/html/2609.00455#bib.bib36)],以及具身AI和机器人学[14 (https://arxiv.org/html/2609.00455#bib.bib19), 15 (https://arxiv.org/html/2609.00455#bib.bib20)]。这促成了一个模块化设置,其中预训练的LLM提供通用推理和行动选择,而环境特定知识则委托给LLM在测试时使用的分离世界模型。这种分解保留了预训练LLM智能体的能力,并允许世界模型(例如,通过持续学习)改进或替换,而无需重新训练智能体。然而,尽管推理能力强大,LLMs在复杂、长期、部分可观察任务中维护和更新信念方面已知存在困难[29 (https://arxiv.org/html/2609.00455#bib.bib21), 18 (https://arxiv.org/html/2609.00455#bib.bib22), 48 (https://arxiv.org/html/2609.00455#bib.bib23)]。最近为LLM智能体设计的世界模型主要暴露行动条件的远见,而将信念跟踪留给智能体。因此,智能体必须同时维护关于当前状态的**不确定性**并**推理行动选择**,这很可能是一种次优的责任分工。在部分可观察环境下的决策中,这种责任分离有悠久先例[19 (https://arxiv.org/html/2609.00455#bib.bib17)],随后在深度强化学习(RL)中进行了探索,有大量证据表明专门的信念估计可以改善决策[8 (https://arxiv.org/html/2609.00455#bib.bib6), 16 (https://arxiv.org/html/2609.00455#bib.bib24), 34 (https://arxiv.org/html/2609.00455#bib.bib25), 38 (https://arxiv.org/html/2609.00455#bib.bib27), 3 (https://arxiv.org/html/2609.00455#bib.bib26)]。然而,这些方法通常将信念表示与专门设计或训练以消费它的下游策略配对。这不同于本文考虑的模块化设置:任意学习到的潜在信念表示与预训练LLM的自然语言接口并非原生兼容。相反,LLMs提供了另一种可能性。如果世界模型可以通过自然语言暴露其信念,LLM智能体可以访问关于当前状态的信息,而无需围绕特定信念表示重新训练。我们主张当前为LLM智能体设计的世界模型的模拟接口应被增强,以显式暴露关于当前状态的信念。为此,我们引入了**基于信念的世界模型**(BB-WMs),它应维护关于当前状态的信念,随着新观测更新它,并在行动条件模拟期间向前传播。这为LLM智能体提供了两个互补的接口:自然语言查询在推理认知行动时询问世界模型的当前信念,而模拟评估务实行动的后果。在询问如何学习可扩展的基于信念的世界模型之前,我们首先提出一个更根本的问题:如果世界模型表示关于状态的信念,将该信念暴露给LLM智能体是否能改善决策?受部分可观察强化学习先前结果的启发,我们假设将信念建模卸载到世界建模并暴露信念给智能体,允许其专注于推理和行动选择,从而改善决策。
## 2 相关工作
面向LLMs的世界模型:已有努力为LLM智能体配备分离或独立的世界模型,以提供对候选行动后果的预见。WMA [2 (https://arxiv.org/html/2609.00455#bib.bib28)] 发现,开箱即用的LLMs无法准确模拟网络交互任务中行动的结果,因此他们学习一个单独、分离的世界模型来评估LLM智能体行动的后果,然后再行动。WALL-E [47 (https://arxiv.org/html/2609.00455#bib.bib5)] 用神经符号世界模型替代了生成世界模型,其中LLM规划器在行动前查询世界模型关于行动在环境中的有效性;如果预测行动无效,则要求LLM根据世界模型的反馈重新规划。DreamPhase [10 (https://arxiv.org/html/2609.00455#bib.bib13)] 学习一个潜在世界模型,通过将未来状态潜在变量解码为未来观测来生成想象未来,通过学习到的价值函数对其进行评分,并将反馈提炼为自然语言以条件化冻结的LLM策略。这些方法主要向策略暴露行动条件的模拟或预见接口。有趣的是,Qian等人[28 (https://arxiv.org/html/2609.00455#bib.bib29)] 的近期工作表明,仅向LLM智能体提供真实模拟器并不能转化为测试时的改善决策;智能体常常未能在有用时调用模拟,误用其输出,甚至在强制执行模拟时性能下降。他们的分析表明,关键挑战在于智能体何时决定查询世界模型以及如何将结果信息整合到其推理中。这些发现促使我们审视世界模型到智能体的接口,而不是专注于改善模拟保真度。
LLM智能体中的信念表示:一些工作试图通过维护当前环境状态的估计,而非仅依赖智能体对交互历史的推理能力,来改善LLM智能体。诸如Statler、QuBE、StateAct和ABBEL [44 (https://arxiv.org/html/2609.00455#bib.bib30), 21 (https://arxiv.org/html/2609.00455#bib.bib31), 30 (https://arxiv.org/html/2609.00455#bib.bib32), 25 (https://arxiv.org/html/2609.00455#bib.bib33)] 的方法维护任务相关状态的紧凑文本或结构化表示,并在新观测可用时更新这些表示。这些表示强调当前状态的单个估计或摘要,而非显式保留对多个可能状态的不确定性。一些近期工作开始直接建模这种不确定性。BeliefMem [24 (https://arxiv.org/html/2609.00455#bib.bib34)] 保留多个候选结论及其概率,允许对过去证据的竞争性解释共存,并在观察到更多证据时更新它们。Agent-BRACE [35 (https://arxiv.org/html/2609.00455#bib.bib37)] 更直接地采用POMDP的信念概念用于LLM智能体,以确定性级别表示当前状态,并基于这种结构化信念条件化策略。这些工作表明,人们对显式表示关于当前状态的不确定性并在决策期间将此信息提供给智能体的兴趣日益增长。然而,这些方法不是世界模型。它们专注于估计和维护环境的*当前*状态,但不提供用于推理未来的行动条件模拟接口。BB-WMs寻求弥合模拟与信念跟踪之间的鸿沟:策略在推理当前已知或不确定的内容时可以直接访问世界模型的信念,同时在推理未来时继续模拟候选行动的后果。
## 3 基于信念的世界模型
预备知识:在任何时间步t,智能体接收观测o_{t},在环境中采取行动a_{t},并接收后续观测o_{t+1}。世界模型根据智能体的交互历史维护环境真实潜在状态s_{t}的某种内部表示x_{t}。尽管现有方法之间细节差异显著,但大多数世界模型向策略暴露类似的接口。具体来说,策略使用K个候选行动{a_{t}^{(i)}}_{i=1}^{K}(实践中,策略可能使用行动序列)查询世界模型。世界模型预测(或采样)执行行动后未来状态的表示:\hat{x}_{t+1}^{(i)} = Predict(x_{t}, a_{t}^{(i)})。预测的内部状态本身不一定暴露给策略。我们用R(\hat{x}_{t+1}^{(i)})表示预测未来的读出,它可以采用多种形式,包括潜在表示、自然语言描述、符号状态或生成的观测。候选行动的读出由策略用于决定在真实环境中执行哪个行动。先前的方法可能在内部表示x_{t}和向策略给出的响应R(\hat{x}_{t+1})上有所不同,但这种模拟接口是许多世界模型家族的基础,我们在图2 [https://arxiv.org/html/2609.00455#S3.F2]中展示。
参考标题 参考标题 参考标题 参考标题 参考标题
图2:BB-WMs与先前世界模型的对比。先前世界模型使用模拟为策略提供未来的预见。循环状态空间模型(RSSM)世界模型[8 (https://arxiv.org/html/2609.00455#bib.bib6), 9 (https://arxiv.org/html/2609.00455#bib.bib40)] 将状态表示为学习到的潜在变量,并在模拟行动序列后以预测(累积)奖励响应策略。JEPA世界模型[46 (https://arxiv.org/html/2609.00455#bib.bib9), 26 (https://arxiv.org/html/2609.00455#bib.bib7)] 直接以预测的潜在状态响应策略。生成式世界模型[1 (https://arxiv.org/html/2609.00455#bib.bib41), 12 (https://arxiv.org/html/2609.00455#bib.bib42)] 则将预测的潜在变量解码为预测观测。自然语言世界模型[11 (https://arxiv.org/html/2609.00455#bib.bib14), 47 (https://相似文章
信念校准优化:一个明确的智能体优化世界模型
介绍了信念校准优化(BCO),这是一种通过显式跟踪和修正对编辑环境响应的信念来维护持久世界模型以提高LLM智能体性能的方法。
信念记忆:部分可观测性下的智能体记忆
本文介绍了 BeliefMem,一种专为大语言模型(LLM)智能体设计的新型记忆范式。该范式通过存储带有概率的多个候选结论来处理部分可观测性问题,并减少自我强化错误。在 LoCoMo 和 ALFWorld 基准测试中的实证评估显示,该方法优于确定性基线模型。
语义贝叶斯世界模型
本文提出了语义贝叶斯世界模型(SBWMs),旨在弥合知识图谱的精确断言与基础模型的概率推理之间的鸿沟,实现共享且不断演化的信念网络,以在不确定性下进行统一推理。
Agent-BRACE:通过语言化状态不确定性在长视距任务中分离信念与行动
本文介绍了 Agent-BRACE,该方法将大型语言模型(LLM)智能体解耦为信念状态模型和策略模型,以处理部分可观测环境中的长视距任务。通过语言化状态不确定性,该方法在保持上下文窗口大小恒定的同时,相比基线方法实现了显著的性能提升。
信念状态引擎:在部分可观测性下增强LLMs的原理性规划
本文提出了信念状态引擎(Belief-State Engine),一个在隐藏状态上维持贝叶斯后验的推理模块,用于增强LLM代理在部分可观测性下的原理性规划,展示了任务性能和决策一致性的提升。