MafiaScope:社交推理游戏中LLM智能体的非侵入式时间分辨信念探测

arXiv cs.CL 论文

摘要

MafiaScope是一个开放测试平台,利用社交推理游戏Mafia非侵入式地实时探测LLM智能体的信念,通过结构化探测问题、交互式可视化和反事实回放,实现对机器心智理论的细粒度分析。

arXiv:2607.10645v1 公告类型:new 摘要:一个LLM智能体的公开行为几乎无法揭示其社交推理过程:一个正确投票的智能体可能是在猜测,而一个善于撒谎的智能体不会留下它真实信念的任何痕迹。我们提出了MafiaScope,这是一个开放测试平台,将社交推理游戏Mafia转化为机器心智理论的测量工具。每次公开发言后,每个智能体私下回答一组可配置的结构化探测问题;答案不会重新进入游戏,而是根据引擎已知的真实情况自动评分。交互式可视化工具呈现信念轨迹:伪装模式展示单个智能体视角下的游戏,面板绘制时间线对齐的准确性和校准度,反事实回放则对任何记录步骤进行分叉。在包含13,815个已解析探测答案的32局DeepSeek案例研究中,声明的置信度校准不佳,期望校准误差为0.17,智能体被怀疑的预测次数高出1.5倍,一个30分叉的回放实验完整走通了反事实回放工作流。引擎、查看器以及包含200多个跨模型游戏的语料库以开放许可证发布;在线演示:https://karpovilia.github.io/mafiascope/;录屏:https://vimeo.com/1208920221。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:22

# 非侵入式、时间分辨的LLM智能体在社交推理游戏中的信念探针 论文已提交至EMNLP 2026系统演示轨道。来源:https://arxiv.org/html/2607.10645 ###### 摘要 LLM智能体的公开行为很少揭示其社交推理过程:一个投票正确的智能体可能只是在猜测,而一个善于撒谎的智能体不会留下其真实信念的痕迹。我们提出了**MafiaScope**,一个开放测试平台,将社交推理游戏“黑手党”转变为衡量机器心智理论的工具。每次公开发言后,每个智能体私下回答一组可配置的结构化探针问题;答案永远不会重新进入游戏,并根据引擎已知的真实值自动评分。交互式可视化工具渲染信念轨迹:角色扮演模式展示游戏如同一个智能体所见,面板显示时间线对齐的准确性和校准度,反事实重放可分支到任何已记录的步骤。在包含32局游戏、13815个已解析探针答案的DeepSeek案例研究中,陈述的置信度校准不良,预期校准误差0.17,智能体过度预测被怀疑的次数为1.5倍,而30分支重放实验完整走通了反事实重放工作流程。引擎、查看器以及包含200多局跨模型游戏的语料库以开放许可证发布;实时演示:https://karpovilia.github.io/mafiascope/;截屏视频:https://vimeo.com/1208920221。 MafiaScope:非侵入式、时间分辨的LLM智能体信念探针在社交推理游戏中的应用††感谢:论文已提交至EMNLP 2026系统演示轨道。 Ilia Karpov 高等经济大学 [email protected] ## 1 引言 参考标题 图1:英语演示游戏中的查看器:中间是真实标注图和日志,侧面板是每个智能体的私人信念;节点颜色=分配的角色,边=怀疑。活着的黑手党成员身上的环,“hidNN%”,是知情人群未发现的比例。带有模式冗余的Okabe-Ito调色板。

多智能体LLM系统越来越多地运行在成功取决于对其他心智建模的任务中:谈判、协作、多方对话 (Tan et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib44); Wei et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib45))。静态心智理论(ToM)基准通过独立的小故事或脚本化的多方对话来探测这些能力 (Lee et al., 2019 (https://arxiv.org/html/2607.10645#bib.bib18); Kim et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib20)),但无法展示智能体对其他智能体的模型如何在其部分引发的对抗性交互中演变 (Ma et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib57); Riemer et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib58))。相反,将LLM置于社交推理游戏中的工作 (Xu et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib1); O’Gara, 2023 (https://arxiv.org/html/2607.10645#bib.bib10))通常只评估结果,如获胜率和投票准确性,将智能体的信念视为黑盒,或者在游戏上下文中引出推理,而提问本身会改变后续行为。 Mafia^1(黑手党游戏)提炼了这一挑战:一个知情少数派——黑手党(相互认识),每晚秘密杀死一名玩家;不知情多数派必须通过公开讨论和白天的投票揭露他们。双方的成功都依赖于对他人信念的建模(对黑手党而言还有管理)。我们展示了**MafiaScope**,一个基于核心思想构建的测试平台:**非侵入式、时间分辨的信念探针**:每次公开发言后,私下向每个智能体提出结构化问题,其答案永远不会重新进入游戏,并对照引擎已知的真实值对每个答案进行评分。因此测量在时间上是密集的:每个智能体在每条公开消息后都被探测,每局游戏产生数百个信念快照,将信念修正定位到单个话语层面。它在一个可验证的意义上是非侵入式的:探针答案永远不会进入任何智能体的持久上下文;§4 (https://arxiv.org/html/2607.10645#S4)阐述了这一保证及其局限性。并且是自评分的:黑手党的隐藏角色是引擎已知的,因此一阶信念(“Casey是黑手党”)可直接评分,二阶信念(“Casey怀疑我”)可针对目标自身相同步骤的一阶报告进行评分。

**贡献。** (1) 一个可配置的探针引擎,带有小型yaml DSL(条件触发、探针链、每个探针预算),生成完全索引的JSONL信念日志;(2) 一个交互式可视化工具,用于纵向信念检查,包含指标、校准与欺骗视图、跨游戏仪表板以及反事实重放;(3) 一个32局游戏的修订工具案例研究和30分支重放实验,展示了仅在结果评估中不可见的分析,包括一个二阶负结果。 ## 2 相关工作 **LLMs 在社交推理游戏中。** 对隐藏角色的信念追踪早于LLM智能体:DeepRole (Serino et al., 2019 (https://arxiv.org/html/2607.10645#bib.bib15))在Avalon游戏中,在专用规划器内维护角色分配的后验信念;MafiaScope探测并评分封闭、现成的LLM的信念。LLM智能体已在狼人杀 (Xu et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib1), 2024b (https://arxiv.org/html/2607.10645#bib.bib2); Bailis et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib4))、Avalon (Light et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib6); Wang et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib7))、Among Us (Chi et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib8); Golechha and Garriga-Alonso, 2025 (https://arxiv.org/html/2607.10645#bib.bib9))、Hoodwinked (O’Gara, 2023 (https://arxiv.org/html/2607.10645#bib.bib10))和Diplomacy (Meta Fundamental AI Research Diplomacy Team (FAIR) et al., 2022 (https://arxiv.org/html/2607.10645#bib.bib14))中得到研究;黑手党游戏本身已作为检测欺骗行为者的测试平台 (Ibraheem et al., 2022 (https://arxiv.org/html/2607.10645#bib.bib11); Yoo and Kim, 2024 (https://arxiv.org/html/2607.10645#bib.bib13); Costa and Vicente, 2025 (https://arxiv.org/html/2607.10645#bib.bib12))。这些系统主要通过结果评估欺骗,或者在行动上下文中引出推理,从而塑造后续游戏:递归思考 (Wang et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib7))、纸牌游戏中的对手建模 (Guo et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib17)),以及MultiMind中对每个玩家针对智能体所持有怀疑的上下文模型 (Zhang et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib16)),后者是我们社交地图探针(角色互换)最接近的对应物。Sarkar et al. (2025 (https://arxiv.org/html/2607.10645#bib.bib55))通过多智能体RL训练Among Us智能体,以每个智能体自身对冒充者的每条消息信念作为奖励信号:每条消息的信念读数用于训练,而非测量。并行工作扩展了空间,包括狼人杀中每条陈述的欺骗注释 (Agarwal et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib59))、社交推理智能体沟通内容与内部表示之间的审计 (Yuan et al., 2026 (https://arxiv.org/html/2607.10645#bib.bib60))以及基于图论的贝叶斯信念推断隐藏角色 (Rahimirad et al., 2026 (https://arxiv.org/html/2607.10645#bib.bib61))。MafiaScope的研究对象是私下探测的信念轨迹,而非胜率。

**心智理论评估。** ToMi (Lee et al., 2019 (https://arxiv.org/html/2607.10645#bib.bib18))、FANToM (Kim et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib20))、Hi-ToM (Wu et al., 2023a (https://arxiv.org/html/2607.10645#bib.bib19))、OpenToM (Xu et al., 2024a (https://arxiv.org/html/2607.10645#bib.bib21))和BigToM (Gandhi et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib22))使用静态故事、脚本化对话或模板化小故事测试ToM;这种能力是脆弱的 (Ullman, 2023 (https://arxiv.org/html/2607.10645#bib.bib24); Sap et al., 2022 (https://arxiv.org/html/2607.10645#bib.bib25)),且研究结果仍有争议 (Kosinski, 2024 (https://arxiv.org/html/2607.10645#bib.bib26); van Duijn et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib27))。ToMATO (Shinoda et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib54))是最接近的探测设计:角色扮演的LLM在生成的对话中每次发言都口头表达其心理状态,但结果被冻结成静态的QA基准。在交互式环境中,InterIntent (Liu et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib35))在Avalon游戏中评估意图理解,SOTOPIA (Zhou et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib36))使用LLM法官评估社交目标完成情况;而MafiaScope则根据引擎真实值对私下探测的信念进行评分,在由智能体自身塑造的游戏中,每次发言后重复相同的探测,其中利益和信息不对称是自然产生的。

**信念探测与自我报告。** 语言模型是否持有信念尚存争议 (Hase et al., 2021 (https://arxiv.org/html/2607.10645#bib.bib33));通过提问探测信念并不完美 (Kadavath et al., 2022 (https://arxiv.org/html/2607.10645#bib.bib28); Turpin et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib29)),而模型能否内省是一个活跃的研究问题 (Binder et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib30); Lindsey, 2025 (https://arxiv.org/html/2607.10645#bib.bib31))。激活级别的探测直接从隐藏表示中解码自我和他人的信念状态 (Zhu et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib56));MafiaScope有意保持行为学层面,因此该工具也适用于无法访问激活的封闭API模型。我们不将探针答案视为哲学上的信念表示 (Herrmann and Levinstein, 2025 (https://arxiv.org/html/2607.10645#bib.bib32)),而是将其视为具有可检验预测结构的操作性信念报告 (§7 (https://arxiv.org/html/2607.10645#S7)),引擎会记录原始和解析后的答案,以便研究信念本身的可信度。

**多智能体观察界面。** 观察界面存在于生成式智能体社会 (Park et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib37))和多智能体框架 (Wu et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib40); Chen et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib38); Wu et al., 2023b (https://arxiv.org/html/2607.10645#bib.bib39))中;近期人机交互工作添加了智能体对话上的调试和目标跟踪视图 (Epperson et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib41); Coscia et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib43))。表1 (https://arxiv.org/html/2607.10645#S2.T1)对比了与信念测量最相关的各种能力,针对我们可以从公开文档验证其工具的一系列已发布系统。因此,各个组成成分在先前工作中是分离存在的;我们在其他地方未发现的是它们在单一发布工具中的组合:带外探测保证、每条话语的密度、针对引擎真实值的自动评分、交互式查看器以及反事实重放。

表1:MafiaScope (MS) 与 ChatArena (CA) (Wu et al., 2023b (https://arxiv.org/html/2607.10645#bib.bib39))、AutoGen with AGDebugger (AG) (Wu et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib40); Epperson et al., 2025 (https://arxiv.org/html/2607.10645#bib.bib41))、Werewolf Arena (WA) (Bailis et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib4))、SOTOPIA (ST) (Zhou et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib36)) 和 InterIntent (II) (Liu et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib35)) 的界面能力比较,基于每个系统的论文、文档和仓库评估。括号内的符号是部分能力:WA 暴露了上下文内的私有推理,但没有带外探测或评分;II 根据玩家自身陈述的意图对意图猜测进行评分,但在上下文内没有查看器(仅有日志);AG 编辑和重置消息,并从中间状态重新运行,在该维度上严格强于我们仅重新掷骰子的分支,但产生的是单次重运行,而非 N 折结果分布;ST 显示每集法官评分,而非时间线对齐的指标。 ## 3 系统概述 MafiaScope 由三个解耦层组成,通过 gt 日志连接(图1 (https://arxiv.org/html/2607.10645#S1.F1) 显示了查看器): 1. 1. **游戏引擎** (`game.py`):一个经典的 Mafia 循环(夜晚杀戮 / 医生救人 → 白天讨论 → 公开投票),用于 n 个玩家,角色包括黑手党、医生、村民(引擎也实现了警长,但在语料库中未使用)。玩家是由后端、语言(英语/俄语提示包)以及一个 Big-Five 人格向量(渲染到系统提示中)参数化的 LLM 智能体 (Jiang et al., 2024 (https://arxiv.org/html/2607.10645#bib.bib48); Serapio-García et al., 2023 (https://arxiv.org/html/2607.10645#bib.bib49))。后端形成一个命名的注册表,在每个玩家槽位引用,因此一场游戏可以部署异构阵容(ChatGPT 黑手党对抗本地 Qwen 村民):OpenAI 兼容 API(托管或本地 vLLM/Ollama)、本地 HuggingFace 模型(带有批处理 GPU 后端),或一个纯 HTTP 消息总线,外部进程可以通过该总线以任何语言玩游戏;一个捆绑的 Arena 面板将后端分配到座位并启动批次。每个公开事件带有一个复合键 `(round, public_msg_seq)`;每个探针记录通过 `(player_idx, probe_seq)` 扩展该键,因此任何答案背后的确切信息状态都是可重建的。 2. 2. **内省探针引擎** (`introspection.py`):在 §4 (https://arxiv.org/html/2607.10645#S4) 中描述。 3. 3. **数据管道和可视化工具**:`prepare_viewer.py` 将游戏和探针日志合并为每个步骤的查看器状态;`serve_viewer.py` 提供单页 D3 应用程序。 ## 4 探针引擎 在每次公开发言和私人夜行动作之后,以及每轮一次,引擎暂停游戏并私下审问每个存活的智能体。每个探针在智能体消息列表的一个一次性副本上运行:问题和答案只存在于探针传递的持续时间内,并且永远不会写回,因此探针文本永远不会进入任何面向游戏的 LLM 调用。对于无状态 API 后端,由此产生的被探测游戏与未被探测的游戏分布相同(在我们无法观察到的提供方副作用之外);对于本地后端,探针调用在分支的 RNG 状态下采样,并且永远不与游戏调用批处理,尽管批处理调度可能仍然不同。探针在 YAML 中声明:

```yaml
- id: social_map
  question: |
    You are {player}. Here is your current role assessment: {prev_role_assessment}
    Estimate how each alive player ({players}) feels about YOU. ...
    JSON: {"toward_me": [...]}
```

DSL 支持**条件触发** (`when: own_turn` vs. `after every message`)、**探针链**(`{prev_}/ {last_}` 将较早探针的已解析、重新序列化的答案拼接到后来的问题中;原始文本回退会被标记),以及**每个探针的 token 预算**。答案被解析为 JSON,容忍 markdown 围栏和截断;原始和解析后的形式都会被记录。默认提供六个探针:`role_beliefs` 和 `role_assessment`(一阶角色归属,带有置信度和理由)、`suspicion_ranking`、`planned_action`(回合后意图)、`social_map`(二阶:每个玩家对“我”的态度)以及 `personality_profile`(Big-Five 归属,可针对目标的生成向量评分);案例研究语料库运行了其中五个(除了 `role_beliefs` 之外的所有探针)。测量密度是通过

相似文章

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

行动中的心智理论:动态人-智能体协作中的指令推理任务

arXiv cs.CL

本文引入指令推理任务,用于评估LLM智能体在处理不完整或模糊指令的人-智能体协作中的心智理论能力。作者呈现了Tomcat(一个LLM智能体),在GPT-4o、DeepSeek-R1和Gemma-3-27B上进行测试,展现出与人类参与者相当的推理未言明意图的性能。