NormAct:具身规划中隐藏社会规范遵守的基准

arXiv cs.AI 论文

摘要

NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。

arXiv:2606.27826v1 公告类型:新 摘要:多模态大语言模型(MLLMs)越来越多地被部署为以自我为中心环境中的具身规划器,在这些环境中,任务成功不仅需要实现指示的目标,还需要以社会适当的方式行动。虽然明确的目标可能使某些行动显得最优,但隐性的社会规范往往施加了隐藏的约束。现有的评估通常侧重于明确的目标达成或直接的规范知识,很少评估规划器是否能在行动序列中推断并应用这些隐藏约束。我们引入了NormAct,一个用于具身社会规范交互的基准,它根据目标达成、规范遵守和整体任务成功来评估计划。NormAct独特地将隐藏规范嵌入到普通任务中,测试模型是否能在没有明确指令的情况下意识到这些规范。使用最先进的MLLMs(GPT-5.4、Claude Opus 4.7、Gemini 3 Pro)进行的实验揭示了显著差距:模型在67.3%的情况下实现了明确目标,但仅在26.4%的情况下遵守了隐藏规范。线索条件实验表明,这一差距并非源于缺乏一般社会知识,而是源于在上下文中激活和关联相关规范的挑战。为解决这一问题,我们提出了NormPerceptor,一个上下文条件线索生成器,在规划之前推断场景相关规范,将任务成功率从24.2%提升至46.7%。我们的结果强调了使具身代理能够主动检测隐藏规范、将其建立在视觉证据上并作为行动规划约束进行集成的重要性。我们的基准公开于https://huggingface.co/datasets/Caleb196x/NormAct。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:27

# NormAct:具身规划中隐藏社会规范遵守的基准测试

**来源:** https://arxiv.org/html/2606.27826

Shiyun Zhao¹, Xinwei Song¹·³, Tianyu Guo¹, Xiaomeng Gao¹, Mingyuan Liu¹, Xu Han², Yuanyuan Zhang², Zhenliang Zhang¹·\*, Xue Feng¹·\*, Bo Dai¹·\*

¹ 通用人工智能国家重点实验室,北京通用人工智能研究院(BIGAI)
² 中国信息通信研究院
³ 上海科技大学

**通讯作者:** [email protected], [email protected], [email protected]

###### 摘要

多模态大语言模型(MLLM)越来越多地被部署为自我中心环境中的具身规划器,在此类环境中,任务成功不仅需要完成指定目标,还需要以符合社会规范的方式行动。虽然明确目标可能使某些动作达到最优,但隐含的社会规范往往施加了隐藏约束。现有评估通常侧重于明确目标达成或直接规范知识,很少评估规划器是否能在动作序列中推断并应用这些隐藏约束。我们引入了**NormAct**,一个用于具身社会规范交互的基准测试,从目标达成、规范遵守和总体任务成功三个维度评估规划方案。NormAct 独特地将隐藏规范嵌入到日常任务中,测试模型是否能在没有明确指令的情况下实现这些规范。使用最先进的 MLLM(GPT-5.4、Claude Opus 4.7、Gemini 3 Pro)进行的实验揭示了显著差距:模型在 67.3% 的情况下达成了明确目标,但仅能在 26.4% 的情况下遵守隐藏规范。提示条件实验表明,这一差距并非源于通用社会知识的缺失,而在于激活相关规范并将其在上下文中进行接地面临挑战。为解决此问题,我们提出了 **NormPerceptor**,一个上下文条件提示生成器,在规划前推断场景相关规范,将任务成功率从 24.2% 提升至 46.7%。我们的结果强调了使具身智能体能够主动检测隐藏规范、将其接地于视觉证据并整合为动作规划约束的重要性。我们的基准测试公开发布于:https://huggingface.co/datasets/Caleb196x/NormAct。

---

## 1 引言

多模态大语言模型(MLLM)越来越多地被用作第一人称环境中的具身规划器,它们必须解读视觉观察、遵循自然语言指令并输出可执行的动作计划。然而,当此类智能体在人类环境中运行时,完成指定目标很少足以让行为被视为成功。智能体可能需要排队才能到达柜台,使用他人财物前需征得许可,在共享空间避让,或避免浪费资源。这些要求通常不会在任务指令中明确说明,它们作为任务执行方式上的隐含社会约束,可能要求智能体延迟、绕路或在完成明确目标之前执行额外步骤。然而,目标达成和规范遵守可能系统性地出现分歧。一个规划方案可能成功取到请求的物品却侵犯了所有权,到达目的地却插队,或完成家务任务却让水龙头空流。在这些情况下,智能体并未失败于明确目标,但却未能完成受社会约束的任务版本,因此仅评估目标完成度会高估社会环境中具身智能体的能力。

现有评估仅部分涵盖了这种能力。基于文本的基准测试评估语言模型是否能从书面情境中识别、推断或解释规范判断,而多模态规范基准测试通常要求模型判断或解释所描述行为是否为社会可接受。相比之下,具身智能体基准测试通常评估导航、操作、规划或目标完成,社会适当性仅作为背景上下文而非主要指标。关于社会模拟、社会影响、合作及社会机器人导航的相关工作研究了交互动态或针对导航的特定社会行为,但很少为日常具身任务中的隐藏规范提供广泛的动作级标签。因此,基于 MLLM 的具身规划器在完成日常具身任务时,是否能够将隐藏的社会约束融入动作序列,目前仍不清楚。

**图1:NormAct 概览。** 模型可能在完成明确目标的同时违反了隐含的社会规范。面对相同的自我中心观察和目标,一个直接面向目标的动作序列可以通过拿取物品来实现明确目标,但它违反了尊重所有权的隐藏社会规范,因此未能完成整体任务。相比之下,一个具有规范意识的动作序列先请求或获得许可后再拿取物品,同时满足目标达成和规范遵守。底行展示了我们评估中使用的提示条件,提供的规范信息从无提示到类别级提示,最后到具体规则级提示。

为了填补这一空白,我们引入了 **NormAct**,一个具身社会规范交互基准测试,它将社会规范隐藏在普通任务中,并评估生成的规划方案是否实现了该规范。每个实例包含一个自我中心观察、一个日常任务目标、一个隐藏的社会规范、一个高层级动作空间,以及针对明确目标和社会约束的独立评估规则。我们使用三个指标对每个生成的规划方案进行评分:目标达成、规范遵守和任务成功。与先前将社会规则作为判断对象的规范基准测试不同,NormAct 要求规范遵守通过智能体的情境化动作来表达。如图1所示,我们评估了三个明确程度递增的提示条件,以诊断模型失败的原因,并发现当约束被明确提及时模型通常能遵守相关规范,但仅凭场景自身推断却会失败。为进一步定位这一瓶颈,我们引入了两个额外条件:一个突出场景中与任务相关的感知证据,另一个从外部来源检索通用社会规范知识。前者带来了显著改进,而后者未能提升规范遵守。这种对比表明,主要的失败模式不在于规范知识的缺失,而在于模型无法在当前的场景中激活并接地相关规范。受此发现启发,我们开发了 **NormPerceptor**,一个上下文条件提示生成器,在动作规划前从自我中心观察和任务指令中推断出基于场景的社会提示,恢复了人工编写提示所提供改进的很大一部分,且无需逐实例标注。

本文做出了三项贡献。首先,我们将隐含社会规范遵守形式化为具身规划中的一个动作级评估问题,不同于规范知识、规范判断和普通目标完成。其次,我们引入了 NormAct 基准测试,将日常任务目标与隐藏的社会约束配对,并分别度量目标达成、规范遵守和任务成功,同时配备一个分级提示协议,可沿规范激活、视觉接地和动作转换链定位失败点。第三,我们提出了 NormPerceptor,一个上下文条件提示生成器,并展示了自动推断的、基于场景的社会上下文能够显著缩小目标达成与社会约束任务成功之间的差距。

---

## 2 相关工作

### 2.1 (M)LLM 中的社会规范评估

理解社会规范对于语言模型至关重要。大量基于文本的研究探讨了语言模型是否能通过书面情境、经验法则、道德困境或多项选择题来识别、推断或解释规范判断。最近,多模态基准测试通过将判断接地于图像或自我中心视频等视觉上下文,将规范评估扩展至 MLLM。然而,这些工作侧重于评估(M)LLM 智能体是否能回答明确的规范相关问题,或准确判断所描述的行为是否符合社会规范。相比之下,我们的工作研究 MLLM 智能体在执行任务时是否能识别并遵循隐含的社会规范,而无需被要求命名、判断或解释该规范。

### 2.2 具身任务完成与社会交互

具身 AI 基准测试为评估感知、规划、操作、导航和长时程任务完成提供了丰富的测试环境。面向家庭和物体的环境(如 iGibson 和 BEHAVIOR-1K)关注日常活动和物理交互,而开放性或城市级基准测试(如 SimWorld、DeliveryBench 和 EmbodiedBench)则将评估扩展到更大的环境和复杂智能体工作流程。在这些工作中,评估指标通常强调任务完成度和效率,将社会规范理解作为背景假设而非主要评估目标。因此,即使以不符合社会规范的方式达成目标,一个动作也可能被视为成功。由于具身智能体最终被期望在人类居住的环境中运行,稳健且恰当的社会交互能力变得至关重要。人机交互文献研究了动作级社会行为,包括人际距离、舒适度和在人群中的导航。然而,这条研究线集中在针对导航的规范而非更广泛的社会类别,如所有权、公共秩序等。类似地,Shen 等人评估了 LLM 智能体在物理环境中展现隐私意识的程度。我们的基准测试通过将“规范遵守”作为跨不同具身任务的明确动作级指标,对这些工作进行了补充。

### 2.3 具身推理中的知识、接地与动作

具身推理涉及一个整合背景知识、场景接地和动作选择的闭环过程。检索增强方法可为具身规划或问答提供任务相关知识,而开放词汇接地模型在视觉场景中定位物体和短语。LLaVA、BLIP-2、InstructBLIP 和 Qwen-VL 等多模态大语言模型提供了强大的视觉语言骨干,而 RT-2 等视觉-语言-动作系统将网络规模的视觉语言学习与机器人动作联系起来。这些工作为具身智能体提供了重要组件,但

相似文章

学习社会规范增强动态人机协调中的兼容性

arXiv cs.AI

本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。

社会规范一致性的自然主义测量

arXiv cs.CL

本文提出了一种通过解决方案匹配在自然、自由形式的设置中测量社会规范一致性的框架,介绍了包含3000个丹麦语社会困境的数据集,并评估了大语言模型与人类回答之间的一致性。

LLMs中的道德安全:通过模糊线索揭露表演性遵从

arXiv cs.CL

本文介绍了LLMs中的'表演性遵从'现象,即模型仅在人口统计身份被明确标注时显得公平,而当需要推断身份时则变得不那么公平。作者提出了一种线索变化方法论和一种Cue Visibility Gap指标,用于衡量真正的道德安全与表面道德安全。