世界模型的文本信念状态:严格中介下的可识别表示学习

arXiv cs.LG 论文

摘要

本文引入了文本潜在状态和分解式GRPO(fGRPO),以在基于文本的世界模型中强制实施严格中介,解决了可识别性问题,在表示质量上实现了高达57%的提升,在展开性能上实现了98%的改进。

arXiv:2606.27681v1 公告类型:新 摘要:在部分可观测环境中的世界模型依赖于总结交互历史的潜在表示,但在许多基于LLM的现代架构中,由于历史绕过,预测性能未能反映表示质量,导致潜在状态不可识别。严格潜在状态中介要求预测仅依赖于潜在状态和动作,这是一个解决此问题的经典原则,但在基于文本的设置中强制执行它是一个开放挑战:文本潜在状态是离散且不可微的,排除了变分训练,而表达性强的LLM解码器容易忽略瓶颈。我们展示了如何在文本领域使严格中介发挥作用。我们正式化了其必要性,表明严格中介使表示质量可经验测试,而历史泄漏架构则破坏了这种联系。然后,我们引入了文本潜在状态,这些状态是离散的、可解释的且可变长度的,以及分解式GRPO(fGRPO),一种树结构的强化学习方法,在训练期间强制执行严格中介。在TextWorld和ScienceWorld上的实验显示,一步预测准确性保持不变,同时表示质量提升高达57%,展开性能提升高达98%,并且随任务复杂性和时间范围增加而增加。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:24

# 世界模型的文本信念状态:严格中介下的可识别表示学习

来源:https://arxiv.org/html/2606.27681

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das  
Intuit AI Research  
{xiang_gao, kamalika_das}@intuit.com  

###### 摘要

部分可观测环境中的世界模型依赖于总结交互历史的潜在表示,但在许多现代基于LLM的架构中,预测性能由于历史绕过而无法反映表示质量,导致潜在状态不可识别。严格的潜在状态中介——要求预测仅依赖于潜在状态和动作——是一条可以解决此问题的经典原则,但在基于文本的环境中强制执行它仍是一个开放挑战:文本潜在状态是离散且不可微的,无法使用变分训练,且表达力强的LLM解码器容易忽略瓶颈。我们展示了如何在文本领域实现严格中介。我们形式化了其必要性,表明严格中介使表示质量在经验上可测试,而历史泄露架构则破坏了这种联系。接着,我们引入了文本潜在状态,它是离散、可解释且可变长度的,并提出了分解式GRPO(fGRPO),一种树状结构的强化学习方法,在训练中强制执行严格中介。在TextWorld和ScienceWorld上的实验表明,我们保持了单步预测准确性,同时表示质量提升了高达57%,轨迹展开性能提升了98%,且增益随任务复杂度和时间范围增加而增大。

## 1 引言

世界模型学习环境的动态,使智能体无需进一步交互即可进行预测、规划和推理 (Sutton,1991 (https://arxiv.org/html/2606.27681#bib.bib1); Ha and Schmidhuber,2018 (https://arxiv.org/html/2606.27681#bib.bib27))。在部分可观测设置中,观测仅揭示底层状态的片段,世界模型必须维护一个总结交互历史的潜在表示。这个潜在状态是轨迹展开操作的客体、反事实查询的分支点,以及替代不断增长的历史的压缩摘要。大量工作致力于构建更好的动态模型 (Hafner et al.,2019a (https://arxiv.org/html/2606.27681#bib.bib6),b (https://arxiv.org/html/2606.27681#bib.bib5),2023 (https://arxiv.org/html/2606.27681#bib.bib23); Schrittwieser et al.,2020 (https://arxiv.org/html/2606.27681#bib.bib20)),但动态模型的好坏取决于它所操作的表示。核心问题不仅是如何建模动态,更是如何知道学到的表示是否足够。由于架构原因,这个问题难以回答。在许多现有的世界模型架构中,潜在状态与其他可以替代它的信息共存。序列模型以完整观测历史为条件,不维护显式的潜在状态 (Yang et al.,2024 (https://arxiv.org/html/2606.27681#bib.bib17); Li et al.,2025 (https://arxiv.org/html/2606.27681#bib.bib25))。基于提示的方法将LLM上下文视为隐式状态,而不学习压缩表示 (Hao and others,2023 (https://arxiv.org/html/2606.27681#bib.bib18); Wang et al.,2024 (https://arxiv.org/html/2606.27681#bib.bib26))。那些引入潜在状态但允许解码器也能访问历史的架构可能会完全忽略它:模型可以实现强大的预测性能,而表示却不携带任何有用信息 (Xiang et al.,2025 (https://arxiv.org/html/2606.27681#bib.bib4); Ge and others,2024 (https://arxiv.org/html/2606.27681#bib.bib19))。我们称此为*可识别性问题*:当信息可以绕过潜在状态时,预测准确性并不约束表示质量。

我们提出严格的潜在状态中介来解决此问题:一旦生成潜在状态,所有后续的转移和预测仅依赖于该状态和动作。这反映了POMDP信念状态分解 (Kaelbling et al.,1998 (https://arxiv.org/html/2606.27681#bib.bib8); Murphy,2000 (https://arxiv.org/html/2606.27681#bib.bib9));具有连续潜在状态的经典世界模型通过构造强制执行此原则 (Hafner et al.,2019a (https://arxiv.org/html/2606.27681#bib.bib6),b (https://arxiv.org/html/2606.27681#bib.bib5))。然而,最近的基于LLM的方法经常通过大上下文或混合条件来放松此约束,使信息能够绕过潜在状态。虽然这种设计提高了预测灵活性,但它破坏了预测性能与表示质量之间的联系。一个关键的后果——也是我们方法的动机——是严格中介使表示质量变得*经验上可测试*。如果一个严格中介的模型准确预测,那么潜在状态必须包含所有任务相关信息;如果预测不佳,则表示不充分。我们将此原则形式化,并推导出三个激励我们方法的后果。在严格中介下,最优预测准确性意味着潜在状态是历史的充分统计量(命题1 (https://arxiv.org/html/2606.27681#Thmproposition1))。在泄露架构下,最优准确性与无信息潜在状态是兼容的(命题2 (https://arxiv.org/html/2606.27681#Thmproposition2))。严格中介还从结构上对齐了训练和轨迹展开条件,使得模型在训练时从不对轨迹展开时不可用的信息进行条件化,从而在动态为收缩性时实现有界误差传播,而基于历史和泄露的轨迹展开则遭受几何误差增长(命题3 (https://arxiv.org/html/2606.27681#Thmproposition3))。

核心技术挑战是在基于文本的世界模型中强制执行严格中介,其中观测和动作是自然语言。文本潜在状态与LLM主干对齐,支持检查,并提供自适应信息瓶颈 (Hafner et al.,2019a (https://arxiv.org/html/2606.27681#bib.bib6),b (https://arxiv.org/html/2606.27681#bib.bib5),2025 (https://arxiv.org/html/2606.27681#bib.bib24))。然而,它们是离散且不可微的,无法进行变分训练,并且表达力强的解码器使ELBO目标易于发生后验坍塌 (Bowman et al.,2016 (https://arxiv.org/html/2606.27681#bib.bib13); He et al.,2019 (https://arxiv.org/html/2606.27681#bib.bib14))。我们通过将潜在状态生成视为随机策略来解决此问题,并引入**分解式GRPO (fGRPO)**,一种树状结构的扩展,在训练中强制执行严格中介。我们在TextWorld (Côté et al.,2018 (https://arxiv.org/html/2606.27681#bib.bib29)) 和 ScienceWorld (Wang et al.,2022 (https://arxiv.org/html/2606.27681#bib.bib30)) 上进行评估。我们的方法保持了单步预测准确性(命题1 (https://arxiv.org/html/2606.27681#Thmproposition1)),在匹配预测下产生了更高的状态级F1值(命题2 (https://arxiv.org/html/2606.27681#Thmproposition2)),并改善了轨迹展开稳定性,增益从时间范围1时的5%增长到时间范围9时的80%(命题3 (https://arxiv.org/html/2606.27681#Thmproposition3))。

## 2 问题设置:基于文本的POMDP

图1:部分可观测设置中世界模型的三种形式:(a) 无状态,(b) 泄露状态,和 (c) 严格状态。严格状态旨在使用 (d) 分解式GRPO进行训练。

我们给定来自部分可观测环境的离线轨迹数据集 \(o_0, a_0, o_1, a_1, \ldots, o_T\),其中观测 \(o_t\) 和动作 \(a_t\) 是文本形式的。真实状态不可观测,单个观测通常不足以识别它,需要随时间聚合。我们的目标是学习一个模型,该模型使用总结历史的潜在信念状态来预测未来观测。

### 2.1 潜在信念状态与预测充分性

时刻 \(t\) 的交互历史为 \(h_t = (o_0, a_0, o_1, a_1, \ldots, a_{t-1}, o_t)\)。由于环境是部分可观测的,准确预测通常需要多步信息。潜在信念状态 \(\hat{s}_t \sim p_\theta(\cdot \mid h_t)\) 是 \(h_t\) 的一个学习到的摘要,表示为语言模型生成的文本字符串。其结构是学习得到的,不需要匹配预定义的变量。我们要求*预测充分性*。

###### 定义 2.1 (预测充分性)。潜在状态 \(\hat{s}_t\) 是充分的,如果对于所有 \(h_t, a_t\),有 \(p(o_{t+1} \mid h_t, a_t) = p(o_{t+1} \mid \hat{s}_t, a_t)\),即 \(o_{t+1} \perp h_t \mid \hat{s}_t, a_t\)。  
(1)

一个充分的潜在状态保留了与预测*立即下一个*观测相关的所有过去信息。这比完全POMDP信念状态充分性更弱,后者要求对所有未来观测都是充分的 (Kaelbling et al.,1998 (https://arxiv.org/html/2606.27681#bib.bib8));当转移模型也准确时,多步充分性随之而来,因为每一时刻的状态通过学到的动态重新推导。这是否成立取决于目标和架构约束。对于给定的预测问题,可能存在多个充分统计量;我们不要求最小性。严格中介保证了当预测最优时学习到的状态是充分的(命题1 (https://arxiv.org/html/2606.27681#Thmproposition1)),而我们的奖励设计(第4.4节 (https://arxiv.org/html/2606.27681#S4.SS4))通过惩罚冗余和不必要的事实来鼓励紧凑性。

### 2.2 观测预测的架构考量

我们研究 \(p(o_{t+1} \mid h_t, a_t)\) 的三种形式,它们在预测时可用的信息不同,如图1所示。

#### 无状态预测。
最简单的方法直接从历史预测:\(\hat{o}_{t+1} \sim p_\theta(\cdot \mid h_t, a_t)\)。这可能准确但不提供显式、紧凑的表示,并且随时间范围扩展性差。

#### 泄露潜在预测。
引入潜在状态但预测仍然访问历史:\(\hat{s}_t \sim p_\theta(\cdot \mid h_t)\),\(\hat{o}_{t+1} \sim p_\theta(\cdot \mid \hat{s}_t, h_t, a_t)\)。这种*泄露*设置允许模型绕过潜在状态,因此预测准确性不能保证 \(\hat{s}_t\) 是有信息的。

#### 严格潜在状态中介。
我们的公式要求所有预测都通过潜在状态:
\[\hat{s}_t \sim p_\theta(\cdot \mid h_t), \qquad \hat{s}_{t+1} \sim p_\theta(\cdot \mid \hat{s}_t, a_t), \qquad \hat{o}_{t+1} \sim p_\theta(\cdot \mid \hat{s}_{t+1}, a_t).\]
预测分布可以写为(\(s_t\) 表示真实(未观测)环境状态,与学习到的潜在状态 \(\hat{s}_t\) 不同):
\[p(o_{t+1} \mid h_t, a_t) = \sum_{\hat{s}_{t+1}} p(o_{t+1} \mid \hat{s}_{t+1}, a_t) \sum_{\hat{s}_t} p(\hat{s}_{t+1} \mid \hat{s}_t, a_t) p(\hat{s}_t \mid h_t).\]  
(2)

我们将 \(a_t\) 包含在观测模型中,因为在基于文本的环境中,步骤 \(t+1\) 呈现的观测通常取决于所采取的动作。严格中介反映了这种分解,确保所有预测信息通过潜在状态流动。在此约束下,潜在状态恰好足以在不访问历史的情况下支持准确预测。

这些公式仅在预测时可用的信息上有所不同;接下来我们检查其含义。

## 3 为什么严格中介是必要的

第2.2节 (https://arxiv.org/html/2606.27681#S2.SS2) 中的架构公式仅在于预测时可用的信息不同,但这种区别有一个根本后果:预测性能是否约束学习到的表示。

### 3.1 从预测中推断充分性

在严格中介下,所有预测信息必须通过潜在状态。这使得预测充分性成为预测准确性的直接后果。

###### 命题 1 (严格中介下的充分性)。在一个严格中介的模型中,有 \(p_\theta(o_{t+1} \mid \hat{s}_t, a_t)\) 和 \(\hat{s}_t \sim p_\theta(\cdot \mid h_t)\),如果 \(p_\theta(o_{t+1} \mid h_t, a_t) = p(o_{t+1} \mid h_t, a_t) \quad \forall h_t, a_t\),则 \(\hat{s}_t\) 是一个充分统计量:\(p(o_{t+1} \mid h_t, a_t) = p(o_{t+1} \mid \hat{s}_t, a_t)\)。

证明思路。在严格中介下,解码器无法访问 \(h_t\)。如果两个历史映射到相同的 \(\hat{s}_t\) 但需要不同的预测,模型无法同时匹配两者,与最优性矛盾。这个结果在结构上很简单,但很重要:它表明在严格中介下,预测准确性成为表示质量的*诊断*。形式上,最优预测意味着 \(I(o_{t+1}; h_t \mid \hat{s}_t, a_t) = 0\);完整的信息论处理以及次优预测的定量松弛在附录A (https://arxiv.org/html/2606.27681#A1) 中提供。

### 3.2 泄露绕过问题

这个保证是严格中介特有的。当解码器可以访问历史时,预测准确性对潜在状态没有约束。

###### 命题 2 (泄露架构下的不可识别性)。对于泄露模型 \(p_\theta(o_{t+1} \mid \hat{s}_t, a_t, h_t)\),存在参数实现最优预测,同时 \(I(\hat{s}_t; h_t) = 0\)。

证明思路。将 \(\hat{s}_t\) 设为常数,直接从 \((h_t, a_t)\) 进行预测。

含义。当历史绕过被允许时,预测准确性不能保证潜在状态是有信息的。严格中介消除了这种结构不匹配。完整证明见附录A (https://arxiv.org/html/2606.27681#A1)。

### 3.3 轨迹展开一致性与稳定性

严格中介也影响多步轨迹展开。关键区别在于训练时可用的信息是否与轨迹展开条件匹配。

###### 命题 3 (训练-推理一致性)。在严格中介模型中,轨迹展开和训练操作在相同的输入 \((\hat{s}_t, a_t)\) 上,因此单步误差匹配。在泄露模型中,训练时对 \(h_t\) 的依赖导致轨迹展开性能下降。

除了一致性,严格中介还改变了误差传播方式。在无状态和泄露模型中,误差通过不断扩展的历史累积,导致最坏情况下的几何增长。相比之下,严格中介模型通过单个潜在状态传播误差,在收缩假设下允许有界误差。

相似文章

心智世界建模

Hugging Face Daily Papers

本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。

迈向基于信念的LLM智能体世界模型

arXiv cs.AI

本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。

不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。