从多智能体演示中学习隐式因果世界模型

arXiv cs.LG 论文

摘要

本文提出了一种从多智能体演示中学习隐式因果世界模型的方法,使智能体能够从观察到的行为中推断因果结构。

arXiv:2607.26336v1 公告类型:新 摘要:在基于模型的强化学习中,世界模型作为内部模拟器存在,但其训练常常混淆统计相关性与因果机制。这一问题在多智能体系统中尤为严重,因为物理转变与战略智能体的意图交织在一起,导致世界模型在分布偏移下失效。我们引入隐式因果世界模型,以从离线演示中恢复环境动态,而无需预定义的因果图。通过结合策略方差,我们使得世界模型通过序列后门条件变得可发现。在协调任务(Two-Door、Navigation 和 Giveway)上的评估表明,这些模型在完全和部分可观测性下提供了可解释的因果表示,模型精度与干预强度直接相关。
查看原文
查看缓存全文

缓存时间: 2026/07/30 09:57

# 从多智能体演示中学习隐式因果世界模型
来源:https://arxiv.org/abs/2607.26336
文献工具

## 文献与引用工具

文献浏览器切换

代码、数据与媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

IArxiv推荐器切换

关于arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织都认同并接受了我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有一个能为arXiv社区增加价值的项目想法?**了解关于arXivLabs的更多信息** (https://info.arxiv.org/labs/index.html)。

相似文章

代理时代的因果发现

Hugging Face Daily Papers

本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

多智能体系统中的策略表示学习

OpenAI Blog

OpenAI 研究人员提出了一个通用框架,用于在多智能体系统中使用最少的交互数据学习智能体策略的表示,将该问题视为表示学习,并应用于竞争控制和合作通信环境。