心智世界建模

Hugging Face Daily Papers 论文

摘要

本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。

世界模型为规划和行动提供了预测基础,然而现有公式仅回答了一个物理问题:它是什么/在哪里,以及它将如何演变。然而,人类行为是由隐藏的心理状态(一个人的信念、欲望、意图、感受以及认为社会可接受的事情)驱动的,因此一个追踪物理场景但不追踪每个智能体对该场景知道什么、相信什么的模型,会在看起来正确的场景中预测出错误的行为。我们提出了心智世界建模(MWM),这是一个通用的理论框架,将心理变量作为世界模型的核心组成部分,而非事后理由:MWM 维护一个耦合的物理-心理世界状态,渲染特定目标的局部观察,并模拟候选行动如何共同更新这两个组成部分。我们以 MENTIS 实例化该框架,这是一个无需训练且完全可检查的基线,将过程分解为状态解析、目标观察生成、行动分解、耦合的物理与心理转移以及分支级价值评估。在一个手工构建、质量控制的、涵盖文本、图像和有声视频故事的情境化决策场景数据集上,使用8个现代基于LLM的世界模型进行的实验表明,显式地对心理状态建模对于预测人类决策至关重要。更深入的分析进一步揭示了当前心智世界建模的瓶颈。我们期望 MWM 成为世界建模的下一个阶段,从模拟物理场景到模拟在其中行动的思维。
查看原文
查看缓存全文

缓存时间: 2026/08/03 09:31

论文页面 - Mental World Modeling

来源:https://huggingface.co/papers/2607.27201

摘要

世界模型为规划和行动提供了可预测的基础,然而现有形式仅仅回答了一个物理问题:它是什么/在哪里,以及它将如何演变。然而,人类行为是由隐藏的心理状态(一个人相信什么、想要什么、打算做什么、感受到什么,以及认为什么在社会上可被允许)驱动的,因此一个追踪物理场景但不了解每个智能体对场景的所知所想所做出的预测,很可能是“场景看着对,行动却错了”。我们提出了心理世界建模(Mental World Modeling, MWM),一个通用的理论框架,将心理变量作为世界模型的核心组成部分,而非事后解释:MWM 维护一个耦合的物理-心理世界状态,渲染出目标特定的部分观测,并模拟候选行动如何共同更新这两个组成部分。我们将该框架实例化为 MENTIS,一个无需训练且完全可检查的基线,它将过程分解为状态解析、目标观测生成、动作分解、耦合的物理与心理转移,以及分支级价值评估。在一个手工构建、质量控制的情境决策场景数据集上(涵盖文本、图像和有声视频故事),使用 8 个现代基于 LLM 的世界模型进行的实验表明,显式建模心理状态对于预测人类决策至关重要。更深入的分析进一步揭示了当前心理世界建模的瓶颈。我们期待 MWM 成为世界建模的下一个阶段,从模拟物理场景到模拟在场景中行动的心灵。

查看 arXiv 页面 (https://arxiv.org/abs/2607.27201)查看 PDF (https://arxiv.org/pdf/2607.27201)项目页面 (https://mental-world.github.io/)GitHub1 (https://github.com/mental-world/Mentis)添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2607.27201)

在您的 agent 中获取此论文:

hf papers read 2607\.27201

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2607.27201,即可从此页面关联该模型。

引用此论文的数据集 0

暂无关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.27201,即可从此页面关联该数据集。

引用此论文的 Space 0

暂无关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2607.27201,即可从此页面关联该 Space。

收录此论文的集合 0

暂未收录此论文的集合

将这篇论文添加到集合 (https://huggingface.co/new-collection) 中,即可从此页面关联该集合。

相似文章

面向机器人控制的上下文世界建模

Hugging Face Daily Papers

本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。