信念状态引擎:在部分可观测性下增强LLMs的原理性规划
摘要
本文提出了信念状态引擎(Belief-State Engine),一个在隐藏状态上维持贝叶斯后验的推理模块,用于增强LLM代理在部分可观测性下的原理性规划,展示了任务性能和决策一致性的提升。
arXiv:2609.10036v1 公告类型:新
摘要:大型语言模型代理在广泛任务中能产生流畅的动作序列,但当环境变为部分可观测时,它们会以特征性的方式失败。模糊的反馈使它们过早承诺。一个信息丰富的观察可以使其不确定性坍缩到错误的假设上。策略随着历史增长而漂移。我们将这些症状追溯到一个共同的结构性原因。通常部署的LLM代理是一个历史条件策略,没有对隐藏状态的显式信念。
我们提出了一种架构修复方案。信念状态引擎(BSE)是一个放置在LLM外部的推理模块。它在一个给定的POMDP(部分可观测马尔可夫决策过程)模型的潜在状态上维持贝叶斯后验,并且在每个决策步骤只向LLM暴露该后验。原始的动作-观察日志不被显示。我们设定了信念一致内部状态必须满足的最小四公理规范,并证明了与BSE配对的LLM在基础POMDP诱导的信念MDP上是一个健全的马尔可夫策略。因此,它继承了经典POMDP理论的贝尔曼最优性保证,前提是LLM从不暴露于原始历史。
我们在Tiger POMDP和一个红队攻击图任务上评估了该架构,与六个基线进行比较:一个反应性LLM、Chain-of-Thought、ReAct、一个自然语言信念跟踪器、QMDP和POMCP。在两个领域中,BSE增强的代理提高了任务回报、信念校准和决策一致性。十次针对性消融隔离了每个架构选择的贡献,证实该效果并非特定于任何单一模型。代码、环境规范、提示模板和种子日志随本文附上。
查看缓存全文
缓存时间: 2026/09/11 08:43
# 信念状态引擎:增强大语言模型在部分可观测下的原则性规划能力 来源:https://arxiv.org/html/2609.10036 Arnab Chattopadhayay 与 Debdipta Halder††注:A. Chattopadhayay 为独立研究员(伦敦大学学院校友),位于印度班加罗尔(邮箱:[[email protected]](mailto:[email protected]))。††注:D. Halder 为独立研究员(印度理工学院卡拉格普尔分校校友),位于印度班加罗尔(邮箱:[[email protected]](mailto:[email protected]))。††注:稿件准备于2026年4月。代码、环境规格、提示模板及本预印本对应的成对种子日志可通过以下链接获取:https://github.com/debdipta-h/bse-llm。 ###### 摘要 大语言模型智能体能在广泛任务中生成流畅的动作序列,但当环境变为部分可观测时,其失效模式具有典型性。模糊的反馈会迫使其过早做出承诺;单次有信息量的观测可能使其不确定性错误地坍缩到某个假设上;随着历史增长,策略会发生漂移。我们将这些症状追溯至一个共同的结构性原因:当前部署的大语言模型智能体本质上是一种基于历史的策略,缺乏对隐藏状态的显式信念表示。我们提出一种架构层面的解决方案:信念状态引擎是置于大语言模型外部的推理模块,维护给定POMDP模型的潜在状态贝叶斯后验分布,并在每个决策步骤仅向大语言模型暴露该后验分布,而不展示原始的动作-观测日志。我们建立了信念一致性内部状态必须满足的最小四公理规范,并证明配对信念状态引擎的大语言模型是底层POMDP诱导的信念马尔可夫决策过程上的有效马尔可夫策略。因此,只要大语言模型不暴露于原始历史数据,它便继承经典POMDP理论的贝尔曼最优性保证。我们在“老虎POMDP”和“红队攻击图”任务上评估该架构,对比六种基线方法(反应式大语言模型、思维链、ReAct、自然语言信念跟踪器、QMDP和POMCP)。在两个领域中,增强信念状态引擎的智能体均提升了任务回报、信念校准度和决策一致性。十项针对性消融实验隔离了各架构选择的贡献,且在开源权重模型上的复现确认该效果不依赖于特定模型。代码、环境规格、提示模板及种子日志随本预印本一同发布。 ###### 关键词 大语言模型智能体、信念状态、部分可观测性、POMDP、不确定性下的规划、贝叶斯滤波、工具增强大语言模型。 ## 一、引言 大语言模型已成为日益庞大的自主智能体体系的核心。例如ReAct\[1\]、Reflexion\[2\]、思维树\[3\]、Voyager\[4\]及SWE-agent\[5\]等系统,通过将大语言模型封装在循环中,将文本级推理转化为多步动作序列,应用场景涵盖具身仿真、软件修复到网页导航。这类系统存在共同的失效特征:当可依据最新观测决定下一步动作时表现良好,但环境一旦变得部分可观测就会出现故障。延迟、模糊或具有欺骗性的反馈往往暴露出思维链提示无法解决的一类问题。我们认为这是架构缺陷而非推理深度问题。保持对隐藏状态的校准信念,并基于该信念选择动作——这正是贝叶斯滤波所实现的功能,而非思维链提示、更长的上下文窗口或反思循环赋予大语言模型的能力。这些机制累积的是文本而非概率质量。当两条本应产生相同贝叶斯后验的历史因表面文本差异引发大语言模型截然不同的动作分布时,便已破坏了信念可测策略最基本的相容性要求。由此产生的行为已被多次报告:证据模糊时过早承诺、单次有信息量观测后过度自信地坍缩到某个假设、以及随上下文增长出现的策略漂移。 我们的解决方案是停止让大语言模型在部分可观测下充当规划器,而是将其封装为双模块系统:外部推理组件(即信念状态引擎)承载认知状态,大语言模型仅限于基于该状态选择动作。具体而言,信念状态引擎针对环境的POMDP模型运行贝叶斯滤波器,每一步仅将归一化信念向量作为决策时的唯一上下文传递给大语言模型,原始的历史动作与观测轨迹不会显示给大语言模型。该设计具有精确的数学支撑:在满足信念一致性内部状态的最小四公理规范下,配对信念状态引擎的大语言模型是底层POMDP诱导的信念马尔可夫决策过程上的马尔可夫策略,因此继承经典POMDP理论的贝尔曼最优性定理。公理体系界定了信念一致性内部状态的标准,定理则将架构选择提升为具有明确失效模式的组合性保证:若大语言模型在决策时暴露于原始历史数据,则违反公理A4,保证随之失效。 #### 贡献 本文提出四项贡献: 1. 1. **架构**:引入信念状态引擎——一种与大语言模型无关、模型无关的推理模块,维护POMDP基础的信念状态,并与任何信念可测策略(包括大语言模型参数化策略)接口(第V节)。 2. 2. **理论**:建立信念一致性内部状态的最小四公理特征描述,并证明六项定理:规范后验的存在性与最小性、贝叶斯更新的唯一性、与信念马尔可夫决策过程的值等价性、双模拟下的歧义保持性、以及大语言模型-信念状态引擎组合的可靠性(第IV节;完整证明见附录A)。 3. 3. **实证研究**:在两种环境(老虎POMDP和红队攻击图任务)中评估信念状态引擎,对比六种基线方法(反应式、思维链、ReAct、自然语言信念跟踪器、QMDP、POMCP)。报告四类指标:任务回报、信念校准度、决策一致性和计算成本。主要结果辅以十项架构消融实验和开源权重模型的鲁棒性复现(第VI节和第VII节)。 4. 4. **产物发布**:代码、提示模板、环境规格、奖励矩阵及成对种子日志随本预印本公开发布。 #### 论文结构 第II节回顾POMDP理论、大语言模型智能体失效模式及相关混合方法;第III节固定符号表示;第IV节建立公理化基础;第V节描述信念状态引擎;第VI节详述实验方法;第VII节报告结果;第VIII节讨论局限性与近似信念表示;第IX节总结全文。 ## 二、背景与相关工作 ### II-A POMDP与信念状态理论 部分可观测马尔可夫决策过程将序列决策形式化于隐藏状态场景。POMDP模型M=(S,A,O,T,Z,R,γ,μ₀)通过有限观测空间O及观测核Z(o|s,a)扩展标准马尔可夫决策过程。其最优策略可表示为信念状态b_t∈Δ(S)的函数,即基于交互历史对潜在状态的后验分布。信念是决策最优性的充分统计量。通过贝叶斯滤波的递归更新(预测后接观测条件修正),可将POMDP转化为Δ(S)上的完全可观测马尔可夫决策过程(即信念马尔可夫决策过程)。信念马尔可夫决策过程的精确求解在有限时界内是PSPACE难问题,无限时界下则不可判定。数十年研究产生了可扩展至实用状态空间的近似求解器:基于点的价值迭代与SARSOP将值计算限制于可达信念的代表性子集;QMDP通过假设当前步后环境完全可观测来计算快速启发式;POMCP通过采样回溯在信念空间执行蒙特卡洛树搜索。这四种方法均假设可访问模型或至少其模拟器,我们的实验设置也作此假设。从数据学习信念状态模型是独立的研究方向,我们将在第VIII节讨论。 ### II-B 大语言模型智能体及其失效模式 从ReAct开始,经Reflexion、思维树、Voyager、SWE-agent到《语言智能体认知架构》综述,大语言模型智能体的工作范式一直是迭代地扩展包含历史动作、观测、推理轨迹、工具调用与检索的文本日志。当可基于当前观测决定下一步动作且长上下文推理成本可承受时,该范式表现良好。系统评估已揭示该范式的局限:Valmeekam等人表明即使使用思维链,大语言模型在经典规划问题上表现仍不佳;Liu等人报告在观测存在噪声或延迟时,智能体基准性能急剧下降。文献中标准解释是大语言模型缺乏世界模型或校准的不确定性估计。我们的观点更为具体:缺失的组件是历史的充分统计量,对原始文本的任何推理都无法恢复贝叶斯条件化自动提供的信息。 ### II-C 大语言模型-POMDP混合系统与信念跟踪 另一条增长中的研究脉络将大语言模型与某种显式状态表示耦合。《基于规划的推理》将大语言模型用作蒙特卡洛树搜索式搜索的世界模型,但生成的信念隐含于树中;Du等人让大语言模型跟踪符号任务状态以进行目标条件学习;Xie等人及相关工作将上下文学习本身解释为隐式贝叶斯推断,但后验从未显式呈现。在智能体场景中,类似方法要求大语言模型充当自身信念状态近似器,通常以自然语言叙述不确定性而非维护显式概率分布。信念状态引擎区别于该方向的三点特征:第一,信念是外部且显式的,存在于有限潜在状态空间的概率分布中,而非大语言模型激活值或自由文本段落中;第二,架构具有组合性——任何大语言模型均可插入策略位置,且根据定理9,任何信念可测策略均有效;第三,信念可审计——在每个决策点,完整后验向操作员开放,支持调试、监控与保证检查,这是隐式或自由文本表示无法比拟的。我们在实验中直接包含自然语言信念跟踪器作为基线,正是为了检验所报告的收益是源于任何认知状态,还是特指概率性状态。 ### II-D 大语言模型中的不确定性与校准 在智能体场景外,平行文献探讨大语言模型是否校准良好。Kadavath等人发现大型模型在事实问答中近似校准;Kuhn等人将其扩展至自由形式生成的语义不确定性;保形预测提供了对大语言模型单次输出的无分布覆盖保证。这些结果均关注大语言模型在单个问题上的自报告置信度,而非在多步轨迹中维护隐藏环境状态校准后验这一独特问题。这正是信念状态引擎要解决的问题。 ### II-E 差距 前述研究均未提供信念状态引擎的特性:与大语言模型外部、可审计、基于POMDP的信念,以封闭形式维护,可与任何大语言模型策略骨干组合,并有明确组合定理指定其继承经典POMDP保证的条件。本文后续部分发展该构造:第III节固定符号表示,第IV节提供公理化与理论基础,第V节规范引擎本身。 ## 三、问题设定与预备知识 本节固定符号表示,并陈述驱动全文的核心观察:部署为基于历史策略的大语言模型并非信念可测策略,而信念状态引擎正是弥补这一差距的方案。 ### III-A POMDP与信念马尔可夫决策过程 设M=(S,A,O,T,Z,R,γ,μ₀)为有限部分可观测马尔可夫决策过程。H
相似文章
信念引擎:多智能体LLM协商中可配置且可检查的立场动态
本文介绍了信念引擎(Belief Engine),这是一种为LLM智能体设计的可审计信念更新层,通过将信念视为具有显式更新规则的证据状态,使得多智能体协商中的立场变化变得可配置且可检查。
信念记忆:部分可观测性下的智能体记忆
本文介绍了 BeliefMem,一种专为大语言模型(LLM)智能体设计的新型记忆范式。该范式通过存储带有概率的多个候选结论来处理部分可观测性问题,并减少自我强化错误。在 LoCoMo 和 ALFWorld 基准测试中的实证评估显示,该方法优于确定性基线模型。
迈向基于信念的LLM智能体世界模型
本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。
Agent-BRACE:通过语言化状态不确定性在长视距任务中分离信念与行动
本文介绍了 Agent-BRACE,该方法将大型语言模型(LLM)智能体解耦为信念状态模型和策略模型,以处理部分可观测环境中的长视距任务。通过语言化状态不确定性,该方法在保持上下文窗口大小恒定的同时,相比基线方法实现了显著的性能提升。
如果你的智能体架构是 LLM → 工具 → 动作,那你就是用 API 密钥造了一门自信大炮。
一篇议论文,认为典型的基于 LLM 的智能体流水线(LLM → 工具 → 动作)缺乏适当的不确定性处理,并提出一种带有贝叶斯更新和信息价值策略的信念状态架构。LLM 应充当调查员/翻译者,而系统负责执行权限和校准信念。