我们能看见的谎言:VLM智能体在具身社会交互中的联合言语和非言语欺骗
摘要
本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。
查看缓存全文
缓存时间: 2026/09/01 11:46
论文页面 - 可见的谎言:具身社交互动中VLM智能体的言语与非言语联合欺骗
来源:https://huggingface.co/papers/2608.30428
摘要
MineAmongUs引入了一个3D多模态《Among Us》环境及ARIA评测框架,用于研究通过言语与非言语动作实施欺骗的具身VLM智能体。研究揭示非言语通道是赢得欺骗的关键。
大型语言模型(LLM)和视觉语言模型(VLM)智能体的策略性欺骗(https://huggingface.co/papers?q=VLM%20agents)已成为AI对齐与安全的核心议题。社交推理游戏(https://huggingface.co/papers?q=Social-deduction%20games)(玩家持有隐藏身份并通过交流推断他人角色)因其多智能体特性,成为该领域的经典测试平台。然而现有测试平台仅限文本模式且采用固定智能体配置,既缺失欺骗分类法(https://huggingface.co/papers?q=deception%20taxonomies)中视为核心的非言语感知运动通道,也未能厘清观测行为究竟源于底层模型还是实验框架。我们推出MineAmongUs(https://huggingface.co/papers?q=MineAmongUs)——一个3D多模态《Among Us》沙盒环境,冒充者智能体必须通过联合言语与非言语动作(https://huggingface.co/papers?q=non-verbal%20action)欺骗船员。同时提出可配置的VLM智能体评测框架ARIA,包含五个认知组件消融(https://huggingface.co/papers?q=cognitive-component%20ablation)轴向;以及基于欺骗分类法(https://huggingface.co/papers?q=deception%20taxonomies)构建、通过LLM即法官(https://huggingface.co/papers?q=LLM-as-a-Judge)大规模标注的原子级与弧级标注方案,其原子标签标注一致性接近人类水平。实证结果表明VLM智能体(https://huggingface.co/papers?q=VLM%20agents)通过联合言语与非言语欺骗实现冒充者获胜,且非言语通道在框架消融测试与跨VLM评估中均表现为更关键的获胜贡献因素。综上,本研究为具身VLM智能体对齐研究开辟了新路径。
查看arXiv页面(https://arxiv.org/abs/2608.30428)查看PDF(https://arxiv.org/pdf/2608.30428)项目主页(https://junseokim0103.github.io/Lies-We-Can-See/)GitHub1(https://github.com/JunseoKim0103/Lies-We-Can-See)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.30428)
获取论文至您的智能体:
hf papers read 2608\.30428
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。
引用此论文的空间0
暂无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加至收藏集(https://huggingface.co/new-collection)以从本页建立链接。
相似文章
更多欺骗:混合动机LLM多智能体系统中的目标错位
本文提出了一个框架,利用社交推理游戏《狼人杀》来评估LLM多智能体系统中的目标错位,发现细微的目标错位可能深刻影响集体决策。
AgentViSS:多模态仿真中的视觉社交智能基准测试
本文介绍了AgentViSS基准,用于评估多模态社交模拟中的视觉社交智能,包含240个场景及对齐的视觉文本证据。评估七个近期MLLM发现局部角色扮演与基于视觉的交互管理之间存在差距。
在冲突激励下LLM智能体中知识验证的涌现欺骗
本文介绍了KnownLieBench,这是一个通过验证知识来评估在冲突激励下LLM智能体中涌现欺骗的基准。
DECOR:基于信息操纵理论审计LLM欺骗行为
介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。
超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。