social-deduction

标签

Cards List
#social-deduction

我们能看见的谎言:VLM智能体在具身社会交互中的联合言语和非言语欺骗

Hugging Face Daily Papers · 2026-08-31 缓存

本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。

0 人收藏 0 人点赞
#social-deduction

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗

arXiv cs.CL · 2026-07-31 缓存

本文介绍了ParliamentBench,一个基于社交推理游戏《秘密希特勒》的开源基准,用于评估LLM在信息不对称条件下的欺骗、说服和推理能力。对约1600场比赛中16个LLM的实验显示,前沿模型形成了一个强大的顶尖集群,而大多数模型难以维持一致的欺骗性人格。

0 人收藏 0 人点赞
#social-deduction

MafiaScope:社交推理游戏中LLM智能体的非侵入式时间分辨信念探测

arXiv cs.CL · 2026-07-14 缓存

MafiaScope是一个开放测试平台,利用社交推理游戏Mafia非侵入式地实时探测LLM智能体的信念,通过结构化探测问题、交互式可视化和反事实回放,实现对机器心智理论的细粒度分析。

0 人收藏 0 人点赞
#social-deduction

我的多智能体语音游戏中,轮流发言是可以解决的。但给智能体共享且准确的记忆才是真正的挑战——我大约完成了80%

Reddit r/AI_Agents · 2026-07-02

一位开发者描述了构建一个多智能体语音社交推理游戏的过程,通过一个中央指挥解决了轮流发言问题,但在共享记忆以及在将对话历史压缩为结构化状态时保留社交潜台词方面遇到了困难。

0 人收藏 0 人点赞
#social-deduction

三方狼人杀:大语言模型多跳心智理论中的小丑角色

arXiv cs.CL · 2026-06-29 缓存

介绍了一种包含小丑角色的三方狼人杀社交推理游戏变体,用于评估大语言模型的多跳心智理论。实验表明,当前模型难以应对反向激励机制,暴露了其在对手效用推理方面的局限性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈