环境、智能体及智能体-环境联合系统的世界模型
摘要
本文提出了一种强化学习中世界模型的框架,通过区分环境、智能体和联合系统通道,使用计算力学定义规范预测模型,并分析耦合下的复杂性。
查看缓存全文
缓存时间: 2026/08/24 04:08
# 环境、智能体及联合智能体-环境系统的模型世界
来源:https://arxiv.org/abs/2608.20401
查看 PDF (https://arxiv.org/pdf/2608.20401)
> **摘要:**世界模型是基于模型的强化学习的核心组件。其讨论通常围绕它们预测的变量展开,例如观测、奖励、状态、潜在状态或信息状态。我们认为存在一个更基础的区分:即它们建模的是哪个信道。我们考虑三种情况:环境信道 $O\_{:\} \mid A\_{:\}$、智能体信道 $A\_{:\} \mid O\_{:\}$ 以及实现的联合过程 $(A, O)\_{:\}$,后者等效于一个无输入的信道。利用计算力学,我们将这三种情况的典型预测模型定义为 $\epsilon$-转换器或 $\epsilon$-机器。典型的环境模型恢复了标准的预测状态表示,而其他两种则给出了针对智能体和联合系统的类似典型模型概念。接着,我们通过闭环耦合构建了典型的、支持受限的环境与智能体模型,其预测等价性范围覆盖由已实现交互所支持的延续。关键的结构结果是:典型的支持受限环境状态通过典型联合因果状态进行因式分解,其转移结构直接由联合模型导出;智能体侧的构造具有对偶性。最后,我们给出了一个 POMDP/控制器示例,其中无限制的环境模型具有无限多状态,而由耦合诱导的典型支持受限模型却是有限的。该框架厘清了不同世界模型的建模对象,以及耦合与支持限制如何改变它们的典型预测结构与复杂度。
## 提交历史
来自:Manuel Baltieri [查看邮件 (https://arxiv.org/show-email/0fa2b818/2608.20401)]
**[版本 1]** 2026年7月23日 星期四 13:35:03 UTC (1,816 KB)相似文章
机器人学习中的世界模型:全面综述
本综述全面回顾了机器人学习中世界模型的文献,涵盖其在策略学习、规划和模拟中的作用。文章突出了预测建模在具身智能体中的关键范式、基准测试及未来发展方向。
世界模型的定义与路线图
这篇学术论文提供了世界模型的科学定义,讨论了关键技术方面,并提出了一个分阶段路线图,用于在人工智能子领域(如基于模型的强化学习、视频生成和具身机器人)中开发有效的世界模型。
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
超越下一观测预测:面向顺序决策的智能体自主世界建模
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。