CaM-Wolf:用于社交推理游戏的多模态因果感知智能体
摘要
CaM-Wolf是首个面向狼人杀等社交推理游戏的多模态AI智能体,集成了视频感知与生成,并通过强化学习训练的因果感知推理器来处理隐藏角色和社交推理任务。实验和用户研究显示,它在游戏表现和人机交互质量上均有显著提升。
arXiv:2607.26393v1 公告类型:新论文
摘要:狼人杀等社交推理游戏(SDGs)已成为AI智能体面临的挑战性测试平台。这些游戏需要复杂的社交技能,如推理、欺骗和协作。尽管近期大语言模型(LLMs)的进展推动了SDG智能体的显著发展,但现有方法主要基于文本,忽视了人际社交互动中至关重要的多模态特性。为填补这一空白,我们提出了CaM-Wolf,这是首个整合多模态感知与生成的SDG智能体。CaM-Wolf能够处理其他玩家的视频输入,采用通过强化学习训练的因果感知推理器,在可观察行为与隐藏角色之间建立逻辑链条,并通过动画化身展现自身。我们的实验和用户研究表明,CaM-Wolf在智能体游戏表现上更为出色,并提升了人机交互的质量。这项工作在构建更具人类特质、能够参与微妙社交动态的AI智能体方面迈出了重要一步。我们的代码可在 https://3dagentworld.github.io/avatar_wolf 获取。
查看缓存全文
缓存时间: 2026/07/31 04:00
# CaM-Wolf:面向社交推理游戏的多模态因果感知智能体 来源:https://arxiv.org/html/2607.26393 \(2026\) ###### 摘要。社交推理游戏(SDGs)如《狼人杀》已成为AI智能体具有挑战性的试验场。这些游戏需要复杂的社交技能,如推理、欺骗和协作。尽管大语言模型(LLMs)的最新进展推动了SDG智能体的显著进步,但当前方法主要基于文本,忽视了作为人类社交互动基础的多模态特性。为弥合这一差距,我们提出了CaM-Wolf,这是首个整合多模态感知与生成的SDG智能体。CaM-Wolf处理来自其他玩家的视频输入,采用通过强化学习训练的因果感知推理器(Reasoner),在可观察行为与隐藏角色之间建立逻辑链条,并通过动画虚拟形象呈现自身。我们的实验和用户研究表明,CaM-Wolf在智能体对局表现上更为出色,并提升了人机交互质量。这项工作朝着创造更具类人特质的、能够参与细腻社交动态的AI智能体迈出了重要一步。我们的代码可在https://3dagentworld.github.io/avatar_wolf获取。 社交推理游戏、大语言模型、多模态推理、视频识别、视频生成 ††journalyear:2026††copyright:cc††conference:Proceedings of the 34th ACM International Conference on Multimedia; November 10–14, 2026; Rio de Janeiro, Brazil††booktitle:Proceedings of the 34th ACM International Conference on Multimedia \(MM ’26\), November 10–14, 2026, Rio de Janeiro, Brazil††doi:10.1145/3767308.3836043††isbn:979-8-4007-2213-4/2026/11††ccs:Computing methodologies Natural language generation††ccs:Computing methodologies Information extraction††ccs:Computing methodologies Computer vision tasks## 1.引言 参见图注图1.不同SDG智能体的交互范式。当与现有SDG智能体交互时,人类玩家必须通过键盘文本输入来陈述内容,而智能体则以文本形式生成回复。相比之下,我们提出的多模态SDG智能体在玩家发言时捕捉其视频输入,并以视频形式生成回复。大语言模型(LLMs)的快速发展推动了能够模拟类人决策和社交行为的智能体的重大进展。这些基于LLM的智能体在多个领域表现出强大性能,从控制计算机桌面(Nayak等人,2025(https://arxiv.org/html/2607.26393#bib.bib1);Wang和Liu,2025(https://arxiv.org/html/2607.26393#bib.bib2);Wang等人,2025(https://arxiv.org/html/2607.26393#bib.bib4))和网页浏览(Luo等人,2025(https://arxiv.org/html/2607.26393#bib.bib3);Zheng等人,2024(https://arxiv.org/html/2607.26393#bib.bib5)),到玩《星际争霸》(Ma等人,2024(https://arxiv.org/html/2607.26393#bib.bib6);Shao等人,2024a(https://arxiv.org/html/2607.26393#bib.bib7))和《我的世界》(Wang等人,2024a(https://arxiv.org/html/2607.26393#bib.bib8);Fu等人,2025(https://arxiv.org/html/2607.26393#bib.bib9);Chai等人,2025(https://arxiv.org/html/2607.26393#bib.bib10);He等人,2025(https://arxiv.org/html/2607.26393#bib.bib58);Zhou等人,2026(https://arxiv.org/html/2607.26393#bib.bib59);Dai等人,2024(https://arxiv.org/html/2607.26393#bib.bib60))。虽然这些任务展示了令人印象深刻的能力,但它们往往主要依赖可观察信息和预定义动作空间。为了评估智能体处理隐藏信息和社交推理的能力,社交推理游戏(SDGs)已被用作更具挑战性的试验场,以更好地反映人类社交互动的复杂性。在诸如《狼人杀》(Zhang等人,2025(https://arxiv.org/html/2607.26393#bib.bib11);Xu等人,2023(https://arxiv.org/html/2607.26393#bib.bib12),2024(https://arxiv.org/html/2607.26393#bib.bib13);Wu等人,2024c(https://arxiv.org/html/2607.26393#bib.bib14))、《阿瓦隆》(Light等人,2023(https://arxiv.org/html/2607.26393#bib.bib15);Wang等人,2023(https://arxiv.org/html/2607.26393#bib.bib16);Shi等人,2023(https://arxiv.org/html/2607.26393#bib.bib17);Lan等人,2024(https://arxiv.org/html/2607.26393#bib.bib18))和《剧本杀》(Liang等人,2025(https://arxiv.org/html/2607.26393#bib.bib19);Wu等人,2024a(https://arxiv.org/html/2607.26393#bib.bib20))等SDG中,玩家被秘密分配不同角色,这些角色具有相互冲突的目标,玩家必须通过讨论来识别彼此隐藏的身份。与许多其他从有限选项集合中选择动作的游戏不同,SDG高度依赖自由形式的自然语言交互,玩家通过对话进行说服、欺骗和协作。尽管在开发用于SDG的LLM智能体方面取得了显著进展,但当前方法仍表现出明显局限。如图1(https://arxiv.org/html/2607.26393#S1.F1)所示,大多数现有智能体(Zhang等人,2025(https://arxiv.org/html/2607.26393#bib.bib11);Xu等人,2023(https://arxiv.org/html/2607.26393#bib.bib12),2024(https://arxiv.org/html/2607.26393#bib.bib13);Wu等人,2024c(https://arxiv.org/html/2607.26393#bib.bib14);Jin等人,2024(https://arxiv.org/html/2607.26393#bib.bib30);Lan等人,2024(https://arxiv.org/html/2607.26393#bib.bib18);Zheng等人,2026(https://arxiv.org/html/2607.26393#bib.bib61))仅限于处理纯文本信息。当这些基于文本的智能体与人类玩家交互时,用户只能看到以文本形式显示的智能体陈述,并且必须通过文本输入来给出自己的回复,这种交互范式与自然的人类交流方式存在显著差异。这种纯文本界面限制了人机交互研究的有效性,也无法捕捉真实社交推理场景中丰富的多模态信息交流。虽然已有一些研究开始将多模态数据引入SDG(Lai等人,2023(https://arxiv.org/html/2607.26393#bib.bib21);Lee等人,2024(https://arxiv.org/html/2607.26393#bib.bib22)),但这些方法主要关注回溯性分析,而非主动参与游戏。此外,现有方法通常集中于沟通策略选择,忽视了关于隐藏角色推理这一关键方面,而这正是SDG的核心挑战之一。同时,当前LLM智能体常常基于内部偏见进行推断(Huang等人,2025(https://arxiv.org/html/2607.26393#bib.bib45);Xu等人,2025c(https://arxiv.org/html/2607.26393#bib.bib48)),导致缺乏明确支持证据的不可靠推理。鉴于SDG中每个玩家的行为本质上都受其隐藏角色塑造,我们认为在玩家的可观察行为与其隐藏身份之间应存在因果关系。通过建立这些因果连接,我们可以构建从具体观察行为到角色预测的显式逻辑链,确保每个推断都有具体证据支持,而非任意猜测。这一假设使我们能够利用因果发现(Yuan等人,2023(https://arxiv.org/html/2607.26393#bib.bib24);Wu等人,2024b(https://arxiv.org/html/2607.26393#bib.bib25))来指导更准确的社交推理。本文聚焦于《狼人杀》游戏。在《狼人杀》中,玩家分为村庄阵营和狼人阵营。游戏在夜间阶段(狼人秘密淘汰一名玩家)和白天阶段(所有幸存玩家讨论并投票淘汰一名可疑狼人)之间交替进行。这种动态机制为探索复杂社交推理和多模态交互提供了理想的试验场。为此,我们提出了CaM-Wolf,一种通过整合多模态感知与生成来增强LLM智能体在《狼人杀》中表现的新框架。CaM-Wolf接收用户的视频输入,并生成其发言内容的转录文本以及面部表情和手势的描述。在输出生成阶段,CaM-Wolf通过结合语音合成和视频生成的数字虚拟形象来呈现自身,增强了人机交互的自然性和沉浸感。我们进一步开发了一个通过强化学习训练的因果感知推理器。我们设计了一种反事实前提干预机制来验证智能体推理的忠实性,并设计了因果奖励,使用组相对策略优化(GRPO)(Shao等人,2024b(https://arxiv.org/html/2607.26393#bib.bib54))来优化模型。这种训练范式使CaM-Wolf能够内在地生成忠实且有证据支持的推理,在后续沟通策略选择和回复生成中做出更明智的决策,从而实现更具上下文感知能力的游戏表现。我们的主要贡献可总结如下: - •据我们所知,我们是首个将多模态感知与生成整合到SDG智能体中的框架,实现了更自然、更沉浸的人机交互。 - •我们提出了一种通过强化学习并结合因果干预奖励训练的因果感知推理器,使智能体能够内在地生成关于其他玩家真实身份的忠实且有证据支持的推理。 - •我们通过智能体对智能体模拟和人类玩家研究中的综合评估,证明了我们方法的有效性,展示了在游戏表现和人机交互方面的提升。 参见图注图2.CaM-Wolf的总体框架。感知器(Perceiver)处理来自人类玩家的视频输入,提取转录的语音文本和视觉描述。推理器(Reasoner)进行因果感知的角色识别并生成回复。表演器(Performer)通过动画虚拟形象呈现回复。 ## 2.相关工作 ### 2.1.社交推理游戏智能体 面向社交推理游戏(SDGs)的AI智能体发展经历了两个阶段。早期对SDG智能体的研究(Hirata等人,2016(https://arxiv.org/html/2607.26393#bib.bib26);Nakamura等人,2016(https://arxiv.org/html/2607.26393#bib.bib27);Wang和Kaneko,2018(https://arxiv.org/html/2607.26393#bib.bib28);Serrino等人,2019(https://arxiv.org/html/2607.26393#bib.bib29))依赖于确定性规则框架或传统机器学习技术进行决策。这些框架通过刚性通信协议而非灵活的自然语言交互来运作,限制了其进行细腻社交推理的能力。LLM的出现促进了各类SDG中更复杂智能体的开发。对于《阿瓦隆》,Lan等人(2024(https://arxiv.org/html/2607.26393#bib.bib18))利用人工设计的系统提示词来指导游戏过程中的LLM行为,DeepRole(Serrino等人,2019(https://arxiv.org/html/2607.26393#bib.bib29))则将反事实后悔最小化算法与通过迭代自博弈训练优化的神经价值网络相结合。对于传统《狼人杀》,Xu等人(2023(https://arxiv.org/html/2607.26393#bib.bib12))通过演绎推理生成多个策略动作候选,并采用强化学习来增强动作选择。在此基础上,Wu等人(2024c(https://arxiv.org/html/2607.26393#bib.bib14))引入了一个思考者(Thinker)模块,以增强复杂逻辑分析的推理能力。对于《一夜终极狼人》(ONUW),Jin等人(2024(https://arxiv.org/html/2607.26393#bib.bib30))使用强化学习训练智能体从预定义沟通策略中选择。然而,现有SDG智能体仅依赖文本信息。这一限制与真实的人类社交互动存在显著差异。当前智能体缺乏多模态感知和生成能力,在人工体验与智能体游戏体验之间造成了巨大鸿沟,限制了其在现实场景中的适用性。 ### 2.2.多模态社交互动 多模态分析与社交动态的交叉领域日益受到研究关注。例如,Ego4D(Grauman等人,2022(https://arxiv.org/html/2607.26393#bib.bib31))提供了一个通过整合视频和音频模态分析社交注意力模式的框架。在SDG场景中,Lee等人(2024(https://arxiv.org/html/2607.26393#bib.bib22))通过开发密集对齐的语言-视觉表示来捕捉细粒度行为动态,探索建模挑战;而Lai等人(2023(https://arxiv.org/html/2607.26393#bib.bib21))则对ONUW游戏录像进行了全面分析,识别出非语言行为模式与欺骗策略之间的相关性。这些工作主要关注对社交互动的回溯性分析,而非主动参与游戏。它们通常检查已记录的游戏日志以提取行为模式或识别欺骗指标,而不会将这类洞察用于实时游戏场景中的决策。相比之下,我们的工作从根本上区别于这种范式,将多模态感知与生成同时整合到智能体的流程中,从而实现更真实的游戏体验。 ### 2.3.因果发现 因果发现大致可分为两种范式:传统统计方法和基于LLM的技术。传统统计方法主要使用算法和计算框架来识别数据结构中的因果关系。许多方法(Chickering和Meek,2015(https://arxiv.org/html/2607.26393#bib.bib32);Ramsey,2015(https://arxiv.org/html/2607.26393#bib.bib33);Xiang和Kim,2013(https://arxiv.org/html/2607.26393#bib.bib34))评估潜在边配置上的评分指标,寻求最大化数据拟合的最优图结构。此外,一些方法(Spirtes等人,2001(https://arxiv.org/html/2607.26393#bib.bib35),2013(https://arxiv.org/html/2607.26393#bib.bib36))利用条件独立性检验,通过检查变量间的相互依赖关系来检测因果结构。LLM的出现为因果发现应用带来了新的可能性。Cohrs等人(2024(https://arxiv.org/html/2607.26393#bib.bib37))探索将LLM作为既定因果发现流程中传统条件独立性检验的替代品,Long等人(2023(https://arxiv.org/html/2607.26393#bib.bib38))则聚焦于构建超越马尔可夫等价类限制的因果图。此外,无数据方法(Kıcıman等人,2023(https://arxiv.org/html/2607.26393#bib.bib39);Zečević等人,2023(https://arxiv.org/html/2607.26393#bib.bib40);Zhang等人,2024(https://arxiv.org/html/2607.26393#bib.bib41))表明,LLM可以通过元数据解释和自然语言处理来提取因果结构,如同在因果模型构建中应用专家领域知识一样。SDG的固有结构在玩家隐藏角色与其可观察行为之间形成了自然的因果关系,因为每个角色都以可预测的方式约束和影响玩家行为。通过将因果发现整合到强化学习框架中,我们的智能体可以内在地学习识别这些因果连接,并发展更系统的社交推理方法,从而更深入地理解底层游戏动态。 ## 3.方法 ### 3.1.概述 CaM-Wolf由三个模块组成,可实现多模态社交推理游戏。如图所
相似文章
更多欺骗:混合动机LLM多智能体系统中的目标错位
本文提出了一个框架,利用社交推理游戏《狼人杀》来评估LLM多智能体系统中的目标错位,发现细微的目标错位可能深刻影响集体决策。
MoCA:隐式社会情境分析
介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。
MafiaScope:社交推理游戏中LLM智能体的非侵入式时间分辨信念探测
MafiaScope是一个开放测试平台,利用社交推理游戏Mafia非侵入式地实时探测LLM智能体的信念,通过结构化探测问题、交互式可视化和反事实回放,实现对机器心智理论的细粒度分析。
从多智能体演示中学习隐式因果世界模型
本文提出了一种从多智能体演示中学习隐式因果世界模型的方法,使智能体能够从观察到的行为中推断因果结构。
MODF-SIR:面向社会智能推理的多智能体全能模态蒸馏框架
本文提出MODF-SIR,一个基于轻量级多模态大语言模型的多智能体协作框架,用于社会智能推理。它采用知识蒸馏、长尾事件提取和测试时自适应,以更少的训练数据实现了最先进的结果。