我们能看见的谎言:VLM智能体在具身社会交互中的联合言语和非言语欺骗

Hugging Face Daily Papers 论文

摘要

本文介绍了MineAmongUs,一个3D多模态Among Us环境,以及ARIA框架,用于研究VLM智能体中的欺骗行为,发现非言语行为是社会交互中成功欺骗的关键。

LLM和VLM智能体的战略性欺骗已成为人工智能对齐和安全的核心关注点。社会推理游戏(每个玩家持有隐藏角色并与他人交流以推断身份)作为典型的测试平台,尤其在多智能体设置中。然而,现有的测试平台仅限文本,并在单一固定智能体配置上运行,忽略了欺骗分类法中视为核心的非言语感觉运动通道,使得观察到的行为是反映底层模型还是周边框架存在模糊性。我们引入MineAmongUs,一个3D多模态Among Us沙盒,其中冒充者智能体必须通过联合言语和非言语行动欺骗船员。我们还提出ARIA,一个可配置的VLM智能体框架,暴露了五个认知组件消融轴;以及一种基于欺骗分类法、通过LLM-as-a-Judge大规模操作、达到近人类原子标签一致性的原子和弧级标注方案。实证结果表明,VLM智能体通过联合言语和非言语欺骗追求冒充者胜利,非言语通道在框架消融和跨VLM评估中成为更决定性的胜利贡献者。总而言之,我们的工作为具身VLM智能体对齐研究开辟了新路径。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:46

论文页面 - 可见的谎言:具身社交互动中VLM智能体的言语与非言语联合欺骗

来源:https://huggingface.co/papers/2608.30428

摘要

MineAmongUs引入了一个3D多模态《Among Us》环境及ARIA评测框架,用于研究通过言语与非言语动作实施欺骗的具身VLM智能体。研究揭示非言语通道是赢得欺骗的关键。

大型语言模型(LLM)和视觉语言模型(VLM)智能体的策略性欺骗(https://huggingface.co/papers?q=VLM%20agents)已成为AI对齐与安全的核心议题。社交推理游戏(https://huggingface.co/papers?q=Social-deduction%20games)(玩家持有隐藏身份并通过交流推断他人角色)因其多智能体特性,成为该领域的经典测试平台。然而现有测试平台仅限文本模式且采用固定智能体配置,既缺失欺骗分类法(https://huggingface.co/papers?q=deception%20taxonomies)中视为核心的非言语感知运动通道,也未能厘清观测行为究竟源于底层模型还是实验框架。我们推出MineAmongUs(https://huggingface.co/papers?q=MineAmongUs)——一个3D多模态《Among Us》沙盒环境,冒充者智能体必须通过联合言语与非言语动作(https://huggingface.co/papers?q=non-verbal%20action)欺骗船员。同时提出可配置的VLM智能体评测框架ARIA,包含五个认知组件消融(https://huggingface.co/papers?q=cognitive-component%20ablation)轴向;以及基于欺骗分类法(https://huggingface.co/papers?q=deception%20taxonomies)构建、通过LLM即法官(https://huggingface.co/papers?q=LLM-as-a-Judge)大规模标注的原子级与弧级标注方案,其原子标签标注一致性接近人类水平。实证结果表明VLM智能体(https://huggingface.co/papers?q=VLM%20agents)通过联合言语与非言语欺骗实现冒充者获胜,且非言语通道在框架消融测试与跨VLM评估中均表现为更关键的获胜贡献因素。综上,本研究为具身VLM智能体对齐研究开辟了新路径。

查看arXiv页面(https://arxiv.org/abs/2608.30428)查看PDF(https://arxiv.org/pdf/2608.30428)项目主页(https://junseokim0103.github.io/Lies-We-Can-See/)GitHub1(https://github.com/JunseoKim0103/Lies-We-Can-See)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.30428)

获取论文至您的智能体:

hf papers read 2608\.30428

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。

引用此论文的空间0

暂无空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.30428以从本页建立链接。

包含此论文的收藏集0

暂无收藏集包含此论文

将此论文添加至收藏集(https://huggingface.co/new-collection)以从本页建立链接。

相似文章

AgentViSS:多模态仿真中的视觉社交智能基准测试

arXiv cs.CL

本文介绍了AgentViSS基准,用于评估多模态社交模拟中的视觉社交智能,包含240个场景及对齐的视觉文本证据。评估七个近期MLLM发现局部角色扮演与基于视觉的交互管理之间存在差距。

DECOR:基于信息操纵理论审计LLM欺骗行为

arXiv cs.CL

介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。