从多智能体演示中学习隐式因果世界模型
摘要
本文提出了一种从多智能体演示中学习隐式因果世界模型的方法,使智能体能够从观察到的行为中推断因果结构。
arXiv:2607.26336v1 公告类型:新
摘要:在基于模型的强化学习中,世界模型作为内部模拟器存在,但其训练常常混淆统计相关性与因果机制。这一问题在多智能体系统中尤为严重,因为物理转变与战略智能体的意图交织在一起,导致世界模型在分布偏移下失效。我们引入隐式因果世界模型,以从离线演示中恢复环境动态,而无需预定义的因果图。通过结合策略方差,我们使得世界模型通过序列后门条件变得可发现。在协调任务(Two-Door、Navigation 和 Giveway)上的评估表明,这些模型在完全和部分可观测性下提供了可解释的因果表示,模型精度与干预强度直接相关。
查看缓存全文
缓存时间: 2026/07/30 09:57
# 从多智能体演示中学习隐式因果世界模型 来源:https://arxiv.org/abs/2607.26336 文献工具 ## 文献与引用工具 文献浏览器切换 代码、数据与媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 IArxiv推荐器切换 关于arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织都认同并接受了我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有一个能为arXiv社区增加价值的项目想法?**了解关于arXivLabs的更多信息** (https://info.arxiv.org/labs/index.html)。
相似文章
代理时代的因果发现
本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。
通过世界模型从人类偏好和理由中学习安全智能体行为
本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。
CausalDS:在数据科学智能体中进行因果推理的基准测试
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
多智能体系统中的策略表示学习
OpenAI 研究人员提出了一个通用框架,用于在多智能体系统中使用最少的交互数据学习智能体策略的表示,将该问题视为表示学习,并应用于竞争控制和合作通信环境。