标签
本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。
本文介绍了ParliamentBench,一个基于社交推理游戏《秘密希特勒》的开源基准,用于评估LLM在信息不对称条件下的欺骗、说服和推理能力。对约1600场比赛中16个LLM的实验显示,前沿模型形成了一个强大的顶尖集群,而大多数模型难以维持一致的欺骗性人格。
MafiaScope是一个开放测试平台,利用社交推理游戏Mafia非侵入式地实时探测LLM智能体的信念,通过结构化探测问题、交互式可视化和反事实回放,实现对机器心智理论的细粒度分析。
一位开发者描述了构建一个多智能体语音社交推理游戏的过程,通过一个中央指挥解决了轮流发言问题,但在共享记忆以及在将对话历史压缩为结构化状态时保留社交潜台词方面遇到了困难。
介绍了一种包含小丑角色的三方狼人杀社交推理游戏变体,用于评估大语言模型的多跳心智理论。实验表明,当前模型难以应对反向激励机制,暴露了其在对手效用推理方面的局限性。